跳到正文

#Agent

今日 2 条
今天10月1日周四
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 4 Argon 前沿大模型

    Google DeepMind 正式公布新一代前沿模型 Gemini 4 Argon,单次输出 token 上限提升至 1M tokens,主打真实软件工程、企业知识工作与网络安全防御等复杂长流程任务。

    推荐理由:模型将单次输出上限拓展至 1M tokens 并主打深度推理与网络防御,读者可据此评估长流程任务与企业级自动化的落地潜力。

  2. AWS Machine Learning Blog70

    xAI Grok 4.7 正式上线 Amazon Bedrock

    xAI 旗下前沿模型 Grok 4.7 正式上线 Amazon Bedrock,支持 500K context window、图像输入以及 low、medium、high 和 xhigh 四档推理力度配置。

    推荐理由:文章详细梳理了该模型在云端的推理配置与调用路径,开发者可以据此评估长流程智能体开发与推理成本控制。

9月30日周三
  1. AWS Machine Learning Blog60

    如何用 Amazon Bedrock Knowledge Bases 通过自然语言查询理赔记录

    AWS 的教程演示如何用 Amazon Bedrock Knowledge Bases 和合成理赔文档构建可通过自然语言查询、返回引用答案的理赔助手。流程涵盖从 Amazon S3 摄取文档、使用 AgenticRetrieveStream 检索、进行多轮追问和元数据过滤,并通过 grounding 检查约束回答。

    推荐理由:教程将文档摄取、AgenticRetrieveStream 检索、元数据过滤和引用与 grounding 检查串成实现流程,并以合成语料提供评估基线。

  2. AWS Machine Learning Blog70

    Amazon Bedrock AgentCore Runtime Instances 多智能体音乐制作流水线搭建教程

    Amazon Bedrock AgentCore Runtime Instances 教程展示如何部署由三个智能体组成的音乐制作流水线,让它们通过同一 runtimeSessionId 在单台 GPU 实例上协作。

    推荐理由:示例把共享会话、持久卷与独立运行时部署串成一套流程,展示多智能体如何跨阶段交接文件,并在长任务中恢复执行。

  3. AWS Machine Learning Blog65

    GPT-6.1 Sol 在 Amazon Bedrock 上正式可用

    GPT-6.1 Sol 已在 Amazon Bedrock 正式可用,为智能体编码、计算机操作和专业工作负载带来更强推理能力。OpenAI 称,该模型在 DeepSWE v1.1 上匹配 GPT-6 Astra,单任务成本约为其五分之一;它还以低于 GPT-6 Sol 对应结果的推理力度,高出 6.4 个百分点。

    推荐理由:文章将智能体任务成本与交互 token 价格、推理质量联系起来,并以 DeepSWE v1.1 的对比数据展示 GPT-6.1 Sol 的任务成本表现。

  4. AWS Machine Learning Blog46

    Amazon Quick 各组件的提示词工程:模式与误区

    AWS 分享 Amazon Quick 各组件的提示词编写方法,帮助用户获得更具体、可执行的结果。Quick Research 建议明确研究目标、受众和问题,并筛选信息来源;Quick Flows 应写清触发条件、执行步骤和输出要求,也可通过后续对话逐步调整;Quick Sight 查询则应说明业务问题、指标、维度和可视化偏好。

9月29日周二
  1. Microsoft Research32

    成立一周年:Microsoft Research Asia – Singapore 如何推进研究、合作与人才培养,创造现实影响

    成立一年来,Microsoft Research Asia – Singapore通过前沿AI研究、深化本地合作与人才培养,推动研究成果走向现实应用。该实验室与新加坡医疗体系合作,探索多模态医疗AI和自进化诊断智能体,支持临床决策及疾病诊断、风险评估和个性化护理研究。其研究还覆盖金融、教育和科技领域,并聚焦东南亚情境下可靠、可信的AI系统。

9月28日周一
9月26日周六
  1. GitHub Blog · AI & ML61

    GitHub Copilot app 如何用 canvases 构建自定义工作流

    GitHub Copilot app 的 canvases 可按自然语言描述生成自定义工作流界面,并由用户与智能体共同操作和更新。用户在智能体会话中运行 `/create-canvas`,描述工作流、界面操作和智能体操作即可创建;生成的 canvas 可保存为扩展,也可从 Awesome Copilot 使用社区分享的扩展。

    推荐理由:文章把创建 canvas 的提示词拆成工作流、界面可执行操作和智能体操作三部分,并说明共享状态如何支持双方同步修改,提供了可迁移的设计思路。

9月25日周五
  1. GitHub Blog · AI & ML67

    GitHub Copilot 的 Canvas:聊天界面为何常常不适合 AI 任务

    GitHub Copilot 应用中的 Canvas 可提供自定义交互界面,让用户与智能体双向协作;作者据此主张,聊天并非许多任务的合适界面。Canvas 是运行在应用内的全栈应用,可连接第三方 API,也能在本机执行代码。文中演示了 Connect 4、Winget 本地软件包管理、SQLite 操作界面,以及用 Canvas 自动化开发工作流。

    推荐理由:文章以 Connect 4、Winget 和 SQLite 等例子说明,Canvas 可把重复的智能体交互转成可复用界面,呈现了聊天之外的工作流设计思路。

  2. GitHub Blog · AI & ML70

    GitHub Security Lab 开源 Fuzzing Taskflow 自动化模糊测试工具

    GitHub Security Lab 推出开源 Fuzzing Taskflow,为 C/C++ 项目提供由 LLM Agent 驱动的自动化模糊测试流程。它会迭代改进 harness、追踪覆盖率缺口,并自动分诊崩溃、生成漏洞报告。该工具会在宿主机运行 AFL++、clang 和 LLM 选择的构建命令,作者建议仅在临时环境中运行;报告和建议补丁仍需人工复核。

    推荐理由:文章拆解了覆盖率反馈如何驱动 harness、输入字典和种子迭代,并说明自动化崩溃分诊仍需人工复核,可借此理解流程设计与边界。

9月23日周三
9月22日周二
  1. NVIDIA Blog63

    NVIDIA发布 Isaac ROS 5.0,新增智能体机器人开发工作流

    NVIDIA发布 Isaac ROS 5.0,新增面向机器人开发的智能体工作流,并扩展 ROS 平台与 Jetson 设备支持。该版本支持 ROS Lyrical 和 Ubuntu 24.04,提供可复用的智能体技能;FoundationPose 的 agent-ready 推理库可将物体位置与方向的感知和跟踪速度提升至 5.5x。

    推荐理由:Isaac ROS 5.0把智能体技能、ROS平台适配与GPU加速组件纳入同一开发栈,并展示了从开发到Jetson端部署的生态案例。

9月21日周一
  1. NVIDIA Blog56

    NVIDIA:AI 安全是一个工程问题,如何在 Agent 栈各层构建防御

    NVIDIA 撰文指出 AI 安全是一个具备明确控制与责任主体的工程问题,需要贯穿模型、工作流线束与运行时的整个 Agent 栈建立强制边界。文章提出安全策略必须独立于智能体推理逻辑由运行环境强行约束,并介绍了用于沙箱隔离与资源管控的开源安全运行时 NVIDIA OpenShell 以及行业联盟的协同防御实践。

9月18日周五
9月17日周四
  1. GitHub Blog · AI & ML78

    GitHub 借助 Copilot 将 Copilot agent runtime 迁移至 Rust

    GitHub 将 Copilot agent runtime 从 TypeScript 迁移为 Rust,最终包含 832,378 行生产 Rust;作者称 AI agents 编写了大部分代码,运行时性能提升了数个数量级。

    推荐理由:文章把迁移策略、跨语言 FFI 设计与测试发布节奏串联起来,展示逐组件替换如何在持续开发中控制回归风险。

9月16日周三
  1. NVIDIA Blog61

    黄仁勋在 Dreamforce 谈智能体企业与 AI 安全,Salesforce 发布基于 Nemotron 的推理模型 Koa

    Salesforce 在 Dreamforce 大会上宣布推出首个 CRM 推理模型 Koa,该模型基于 NVIDIA Nemotron 3 Super 构建并在企业基础设施内完全私有化运行。

    推荐理由:原文展现了开源模型在企业垂直领域的落地路径,读者可据此了解专用推理模型与企业智能体的构建方式。

  2. Google DeepMind82

    Google DeepMind 推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking 实时对话模型

    Google DeepMind 正式推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,支持在语音交互的同时执行多步深度推理和后台工具调用。

    推荐理由:模型在保持实时语音交互流的同时引入并行深度推理与工具调用,为复杂业务流程中的语音智能体落地提供了参考。

9月14日周一
9月12日周六
  1. GitHub Blog · AI & ML60

    GitHub 如何将活动运营写成代码,实现从策划到会后跟进的自动化

    GitHub 日本和韩国市场营销负责人用 GitHub Copilot、GitHub Issues 和 GitHub Actions 自动化活动流程,使活动可从单个 GitHub Issue 建立,并自动筛查报名者、处理会后工作。

    推荐理由:文章把活动运营拆成 Issue 表单、标签触发的 Actions 与 Markdown 技能,并加入 DRY_RUN 和审查流程,提供了可迁移的自动化搭建思路。

9月11日周五
  1. GitHub Blog · AI & ML54

    GitHub Copilot app 入门:使用差异面板、终端和浏览器

    GitHub Copilot app 的内置差异、终端和浏览器面板,让用户无需离开应用即可审查智能体的代码变更、运行代码并测试界面。网站示例中,用户可以运行 `npm run dev`,再用 Pick & Polish 选择界面元素并让智能体调整。确认功能可用后,用户可以在 Copilot app 中接受修改并创建 pull request。

9月10日周四
  1. OpenAI News70

    OpenAI 在 ChatGPT Work 中推出 Data agent

    OpenAI 在 ChatGPT Work 中推出 Data agent。该智能体支持用户使用自然语言连接企业数据、挖掘业务洞察,并通过 AI 构建交互式仪表盘。

    推荐理由:原文简要说明了企业数据分析智能体的能力定位,读者可以据此了解其在报表与洞察工作流中的落地方式。

  2. OpenAI News74

    OpenAI 推出 Agents API

    OpenAI 推出 Agents API,这是一项基于 Codex harness 的托管服务,用于构建和运行云端智能体。该 API 提供了工作流编排、长会话管理以及工具调用等核心能力。

    推荐理由:OpenAI 推出托管式 Agents API,为开发者构建具备编排、长会话与工具调用能力的云端智能体提供了官方基础设施。

9月9日周三
9月5日周六
9月4日周五
  1. GitHub Blog · AI & ML65

    GitHub Copilot app 初学者指南:如何同时运行多个智能体

    GitHub Copilot app 支持通过并行智能体会话同时执行多个开发任务。每个会话运行在独立的 Git worktree 上并保留各自上下文,彼此互不干扰且无需等待上一个任务完成。开发者可以在统一的会话视图中跟踪各项任务进度并集中审查结果,降低多任务切换成本。

    推荐理由:原文介绍了利用 Git worktree 隔离机制实现多智能体并行执行的具体机制,有助于开发者优化多任务协同工作流。

7月26日周日
7月7日周二
  1. Berkeley AI Research53

    智能近乎免费后怎么办?面向、支撑与由智能体构建的数据系统

    Berkeley AI Research 的研究者提出,推理成本快速下降将推动数据系统围绕智能体重新设计,重点涵盖服务智能体、支撑智能体群体运行,以及由智能体合成数据系统。文中称,GPT-4 级能力的成本从 2023 年初约 $30 per million tokens 降至如今低于 $1,部分供应商已低于 $0.10。文章还讨论了查询复用、结构化记忆、并发协调及验证智能体合成系统等挑战。