Google DeepMind 发布 Gemini 4 Argon 前沿大模型
Google DeepMind 正式公布新一代前沿模型 Gemini 4 Argon,单次输出 token 上限提升至 1M tokens,主打真实软件工程、企业知识工作与网络安全防御等复杂长流程任务。
推荐理由:模型将单次输出上限拓展至 1M tokens 并主打深度推理与网络防御,读者可据此评估长流程任务与企业级自动化的落地潜力。
Google DeepMind 正式公布新一代前沿模型 Gemini 4 Argon,单次输出 token 上限提升至 1M tokens,主打真实软件工程、企业知识工作与网络安全防御等复杂长流程任务。
推荐理由:模型将单次输出上限拓展至 1M tokens 并主打深度推理与网络防御,读者可据此评估长流程任务与企业级自动化的落地潜力。
xAI 旗下前沿模型 Grok 4.7 正式上线 Amazon Bedrock,支持 500K context window、图像输入以及 low、medium、high 和 xhigh 四档推理力度配置。
推荐理由:文章详细梳理了该模型在云端的推理配置与调用路径,开发者可以据此评估长流程智能体开发与推理成本控制。
OpenAI 阻断了一起旨在提取受保护模型推理过程的协同模型蒸馏活动。官方表示正在进一步强化防御措施,以应对针对模型的对抗性蒸馏攻击。
NVIDIA 公布 MLPerf Inference v6.1 评测结果,Vera Rubin NVL72 系统在 Qwen3-VL 上吞吐量最高达到 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上吞吐量提升最高达 2.5 倍。
推荐理由:原文给出了新一代机架在主流推理模型上的基准吞吐数据,读者可以据此评估大规模算力集群的推理能效与扩展收益。
Salesforce 在 Dreamforce 大会上宣布推出首个 CRM 推理模型 Koa,该模型基于 NVIDIA Nemotron 3 Super 构建并在企业基础设施内完全私有化运行。
推荐理由:原文展现了开源模型在企业垂直领域的落地路径,读者可据此了解专用推理模型与企业智能体的构建方式。
Google DeepMind 正式推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,支持在语音交互的同时执行多步深度推理和后台工具调用。
推荐理由:模型在保持实时语音交互流的同时引入并行深度推理与工具调用,为复杂业务流程中的语音智能体落地提供了参考。
OpenAI 推出面向商业办公的模型 GPT-6 Astra。该模型具备高级推理能力与电脑操作功能,并增强了写作与设计判断表现。
推荐理由:原文给出了新模型面向办公场景在推理、电脑操作及设计判断方面的核心能力定位。
OpenAI 宣布分享一份由 AI 生成的纳维-斯托克斯(Navier–Stokes)千禧年大奖难题解决方案。该成果包含了详细的研究说明报告以及在 Lean 语言中构建的形式化证明。
推荐理由:原文给出了 AI 求解数学难题的说明与形式化证明形式,读者可据此了解形式化验证在复杂前沿研究中的结合方式。
ABBEL 将交互摘要建模为自然语言信念状态,并通过信念评分监督其信息内容,帮助 LLM 更高效地处理长时任务。在 CollabBench 上,ABBEL 将与 full context 模型的性能差距缩小约 50%,相比不使用信念评分的训练方案少用 50%训练步数。
一篇综述与观点文章梳理并行推理的最新进展,聚焦模型如何根据问题自主决定是否拆解任务、并行线程数量及协调方式。现有方法多由模型外部设定并行结构,可能造成重复计算,也难以适应不同问题的需求。文章指出,并行推理旨在缓解顺序推理带来的延迟增长、上下文压力和计算开销。