Google DeepMind 发布 Gemini 4 Argon 前沿大模型
Google DeepMind 正式公布新一代前沿模型 Gemini 4 Argon,单次输出 token 上限提升至 1M tokens,主打真实软件工程、企业知识工作与网络安全防御等复杂长流程任务。
推荐理由:模型将单次输出上限拓展至 1M tokens 并主打深度推理与网络防御,读者可据此评估长流程任务与企业级自动化的落地潜力。
Google DeepMind 正式公布新一代前沿模型 Gemini 4 Argon,单次输出 token 上限提升至 1M tokens,主打真实软件工程、企业知识工作与网络安全防御等复杂长流程任务。
推荐理由:模型将单次输出上限拓展至 1M tokens 并主打深度推理与网络防御,读者可据此评估长流程任务与企业级自动化的落地潜力。
xAI 旗下前沿模型 Grok 4.7 正式上线 Amazon Bedrock,支持 500K context window、图像输入以及 low、medium、high 和 xhigh 四档推理力度配置。
推荐理由:文章详细梳理了该模型在云端的推理配置与调用路径,开发者可以据此评估长流程智能体开发与推理成本控制。
AWS 的教程演示如何用 Amazon Bedrock Knowledge Bases 和合成理赔文档构建可通过自然语言查询、返回引用答案的理赔助手。流程涵盖从 Amazon S3 摄取文档、使用 AgenticRetrieveStream 检索、进行多轮追问和元数据过滤,并通过 grounding 检查约束回答。
推荐理由:教程将文档摄取、AgenticRetrieveStream 检索、元数据过滤和引用与 grounding 检查串成实现流程,并以合成语料提供评估基线。
Amazon Bedrock AgentCore Runtime Instances 教程展示如何部署由三个智能体组成的音乐制作流水线,让它们通过同一 runtimeSessionId 在单台 GPU 实例上协作。
推荐理由:示例把共享会话、持久卷与独立运行时部署串成一套流程,展示多智能体如何跨阶段交接文件,并在长任务中恢复执行。
CoreWeave宣布在CoreWeave Cloud提供NVIDIA Vera Rubin NVL72,并推出用于训练、评估和改进模型与智能体的CoreWeave Forge。
推荐理由:文章将Vera Rubin NVL72的云端可用性与Cognition实测、Forge训练至生产闭环结合,呈现智能体工作负载从算力部署到持续改进的具体路径。
GPT-6.1 Sol 已在 Amazon Bedrock 正式可用,为智能体编码、计算机操作和专业工作负载带来更强推理能力。OpenAI 称,该模型在 DeepSWE v1.1 上匹配 GPT-6 Astra,单任务成本约为其五分之一;它还以低于 GPT-6 Sol 对应结果的推理力度,高出 6.4 个百分点。
推荐理由:文章将智能体任务成本与交互 token 价格、推理质量联系起来,并以 DeepSWE v1.1 的对比数据展示 GPT-6.1 Sol 的任务成本表现。
AWS 分享 Amazon Quick 各组件的提示词编写方法,帮助用户获得更具体、可执行的结果。Quick Research 建议明确研究目标、受众和问题,并筛选信息来源;Quick Flows 应写清触发条件、执行步骤和输出要求,也可通过后续对话逐步调整;Quick Sight 查询则应说明业务问题、指标、维度和可视化偏好。
AWS 展示了一个用 Amazon Quick 和 Amazon Bedrock AgentCore 构建的合同智能平台,将合同 PDF 中的信息抽取为结构化数据,以支持跨合同汇总和单份合同查询。
OpenAI 推出名为 Dots 的主动型智能体助手,可在复杂项目与日常任务中持续协同推进工作。官方表示该助手旨在帮助用户在任务推进过程中保持全程掌控。
成立一年来,Microsoft Research Asia – Singapore通过前沿AI研究、深化本地合作与人才培养,推动研究成果走向现实应用。该实验室与新加坡医疗体系合作,探索多模态医疗AI和自进化诊断智能体,支持临床决策及疾病诊断、风险评估和个性化护理研究。其研究还覆盖金融、教育和科技领域,并聚焦东南亚情境下可靠、可信的AI系统。
AWS 介绍了结合 Amazon Nova Act 和 Amazon Bedrock AgentCore 构建智能体驱动合成监控的方案,以解决传统 Selenium 或 Playwright 依赖 DOM 选择器容易因前端 UI 改动而失效的问题。
GitHub Copilot app 的 canvases 可按自然语言描述生成自定义工作流界面,并由用户与智能体共同操作和更新。用户在智能体会话中运行 `/create-canvas`,描述工作流、界面操作和智能体操作即可创建;生成的 canvas 可保存为扩展,也可从 Awesome Copilot 使用社区分享的扩展。
推荐理由:文章把创建 canvas 的提示词拆成工作流、界面可执行操作和智能体操作三部分,并说明共享状态如何支持双方同步修改,提供了可迁移的设计思路。
GitHub Copilot 应用中的 Canvas 可提供自定义交互界面,让用户与智能体双向协作;作者据此主张,聊天并非许多任务的合适界面。Canvas 是运行在应用内的全栈应用,可连接第三方 API,也能在本机执行代码。文中演示了 Connect 4、Winget 本地软件包管理、SQLite 操作界面,以及用 Canvas 自动化开发工作流。
推荐理由:文章以 Connect 4、Winget 和 SQLite 等例子说明,Canvas 可把重复的智能体交互转成可复用界面,呈现了聊天之外的工作流设计思路。
GitHub Security Lab 推出开源 Fuzzing Taskflow,为 C/C++ 项目提供由 LLM Agent 驱动的自动化模糊测试流程。它会迭代改进 harness、追踪覆盖率缺口,并自动分诊崩溃、生成漏洞报告。该工具会在宿主机运行 AFL++、clang 和 LLM 选择的构建命令,作者建议仅在临时环境中运行;报告和建议补丁仍需人工复核。
推荐理由:文章拆解了覆盖率反馈如何驱动 harness、输入字典和种子迭代,并说明自动化崩溃分诊仍需人工复核,可借此理解流程设计与边界。
Ringg 借助 OpenAI 的 GPT-5.6 驱动多语言 AI 智能体,可解决高达 65% 的客户通话。该方案覆盖语音、聊天、WhatsApp 和 Web 渠道,相比 GPT-4.1 成本降低了 90%。
NVIDIA与合作伙伴在新加坡 AI Day 展示东南亚 AI 进展,涵盖公共部门应用、区域化模型和产业场景。泰国 iApp Technology 基于 Nemotron 3 Nano 微调 OpenThai 2.0 Legal,并将模型开源,作为已服务约 43,000 名用户的 Thanoy 法律助手引擎。
NVIDIA发布 Isaac ROS 5.0,新增面向机器人开发的智能体工作流,并扩展 ROS 平台与 Jetson 设备支持。该版本支持 ROS Lyrical 和 Ubuntu 24.04,提供可复用的智能体技能;FoundationPose 的 agent-ready 推理库可将物体位置与方向的感知和跟踪速度提升至 5.5x。
推荐理由:Isaac ROS 5.0把智能体技能、ROS平台适配与GPU加速组件纳入同一开发栈,并展示了从开发到Jetson端部署的生态案例。
Parallel 借助 GPT-6 Astra 将其 AI 智能体研究和综合劳动力市场数据的时间与成本相比以往模型缩减了一半。
NVIDIA 撰文指出 AI 安全是一个具备明确控制与责任主体的工程问题,需要贯穿模型、工作流线束与运行时的整个 Agent 栈建立强制边界。文章提出安全策略必须独立于智能体推理逻辑由运行环境强行约束,并介绍了用于沙箱隔离与资源管控的开源安全运行时 NVIDIA OpenShell 以及行业联盟的协同防御实践。
V7 借助 GPT-5.6 Luna 将成本降低了 78%,同时提升了准确率。通过使用 GPT-5.6,V7 将零散的企业文件转化为上下文,使 AI 智能体能够完成复杂的、附带来源链接的工作任务。
GitHub Podcast 最新一期拆解 AI 开发中的热门观点,讨论代码审查、求职者使用 AI、Skills 与 MCP、RAG,以及为代码库微调模型。节目指出,审查应聚焦风险;Skills 与 MCP 解决不同问题,RAG 也能与智能体、Skills 和 MCP 协同使用。
GitHub 将 Copilot agent runtime 从 TypeScript 迁移为 Rust,最终包含 832,378 行生产 Rust;作者称 AI agents 编写了大部分代码,运行时性能提升了数个数量级。
推荐理由:文章把迁移策略、跨语言 FFI 设计与测试发布节奏串联起来,展示逐组件替换如何在持续开发中控制回归风险。
OpenAI 推出由 AI 驱动的新广告体验,包括赞助智能体 Sponsored Agents 以及面向营销人员的专用工具。该方案还涵盖了与 HubSpot 和 Shopify 的平台集成。
推荐理由:原文介绍了 OpenAI 在 AI 广告形态上的新探索,涉及赞助智能体以及与现有营销电商平台的整合方式。
Hex 采用 GPT-6 Astra 赋能其数据智能体,将复杂的数据分析答案直接转化为交互式可视化图表与报告,便于员工在企业内部进行展示与分享。
Salesforce 在 Dreamforce 大会上宣布推出首个 CRM 推理模型 Koa,该模型基于 NVIDIA Nemotron 3 Super 构建并在企业基础设施内完全私有化运行。
推荐理由:原文展现了开源模型在企业垂直领域的落地路径,读者可据此了解专用推理模型与企业智能体的构建方式。
Google DeepMind 正式推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,支持在语音交互的同时执行多步深度推理和后台工具调用。
推荐理由:模型在保持实时语音交互流的同时引入并行深度推理与工具调用,为复杂业务流程中的语音智能体落地提供了参考。
Fyxer 结合 OpenAI 模型、微调、记忆能力与真实用户反馈,打造受人信赖的 AI 高管助理。该系统主要用于整理收件箱,并以符合每位用户自身语气与风格的方式代写电子邮件草稿。
Perplexity 已在端到端系统中采用 GPT-6 Astra,主要用于撰写沟通内容、修改软件以及监控生产系统。相比早期模型,团队对其运行过程的人工介入与检查频率大幅降低。
GitHub 日本和韩国市场营销负责人用 GitHub Copilot、GitHub Issues 和 GitHub Actions 自动化活动流程,使活动可从单个 GitHub Issue 建立,并自动筛查报名者、处理会后工作。
推荐理由:文章把活动运营拆成 Issue 表单、标签触发的 Actions 与 Markdown 技能,并加入 DRY_RUN 和审查流程,提供了可迁移的自动化搭建思路。
GPT-6 Astra 提升了 Devin 测试软件并验证其正常运行的能力。该改进旨在帮助工程师减少代码审查的工作量,从而加快交付更多代码与功能。
GitHub Copilot app 的内置差异、终端和浏览器面板,让用户无需离开应用即可审查智能体的代码变更、运行代码并测试界面。网站示例中,用户可以运行 `npm run dev`,再用 Pick & Polish 选择界面元素并让智能体调整。确认功能可用后,用户可以在 Copilot app 中接受修改并创建 pull request。
OpenAI 在 ChatGPT Work 中推出 Data agent。该智能体支持用户使用自然语言连接企业数据、挖掘业务洞察,并通过 AI 构建交互式仪表盘。
推荐理由:原文简要说明了企业数据分析智能体的能力定位,读者可以据此了解其在报表与洞察工作流中的落地方式。
OpenAI 推出 Agents API,这是一项基于 Codex harness 的托管服务,用于构建和运行云端智能体。该 API 提供了工作流编排、长会话管理以及工具调用等核心能力。
推荐理由:OpenAI 推出托管式 Agents API,为开发者构建具备编排、长会话与工具调用能力的云端智能体提供了官方基础设施。
OpenAI 推出面向商业办公的模型 GPT-6 Astra。该模型具备高级推理能力与电脑操作功能,并增强了写作与设计判断表现。
推荐理由:原文给出了新模型面向办公场景在推理、电脑操作及设计判断方面的核心能力定位。
麻省理工学院(MIT)研究人员利用 GPT-5.6 Sol 结合 Codex,实现了自主运行量子计算实验、分析实验结果以及校准量子比特(qubits)。该工作展示了大模型在量子计算实验流程自动化中的具体应用。
GitHub 宣布推出 Project HydraFusion 研究预览版,通过运行时多模型编排在不同供应商的模型间构建执行计划。
推荐理由:GitHub 详细拆解了在编码 Agent 中通过单模型、级联与交叉审查三种执行模式优化质量与成本权衡的工程方案。
GitHub Copilot app 支持通过并行智能体会话同时执行多个开发任务。每个会话运行在独立的 Git worktree 上并保留各自上下文,彼此互不干扰且无需等待上一个任务完成。开发者可以在统一的会话视图中跟踪各项任务进度并集中审查结果,降低多任务切换成本。
推荐理由:原文介绍了利用 Git worktree 隔离机制实现多智能体并行执行的具体机制,有助于开发者优化多任务协同工作流。
ABBEL 将交互摘要建模为自然语言信念状态,并通过信念评分监督其信息内容,帮助 LLM 更高效地处理长时任务。在 CollabBench 上,ABBEL 将与 full context 模型的性能差距缩小约 50%,相比不使用信念评分的训练方案少用 50%训练步数。
Berkeley AI Research 的研究者提出,推理成本快速下降将推动数据系统围绕智能体重新设计,重点涵盖服务智能体、支撑智能体群体运行,以及由智能体合成数据系统。文中称,GPT-4 级能力的成本从 2023 年初约 $30 per million tokens 降至如今低于 $1,部分供应商已低于 $0.10。文章还讨论了查询复用、结构化记忆、并发协调及验证智能体合成系统等挑战。