Google DeepMind 发布 Gemini 4 Argon 前沿大模型
Google DeepMind 正式公布新一代前沿模型 Gemini 4 Argon,单次输出 token 上限提升至 1M tokens,主打真实软件工程、企业知识工作与网络安全防御等复杂长流程任务。
推荐理由:模型将单次输出上限拓展至 1M tokens 并主打深度推理与网络防御,读者可据此评估长流程任务与企业级自动化的落地潜力。
Google DeepMind 正式公布新一代前沿模型 Gemini 4 Argon,单次输出 token 上限提升至 1M tokens,主打真实软件工程、企业知识工作与网络安全防御等复杂长流程任务。
推荐理由:模型将单次输出上限拓展至 1M tokens 并主打深度推理与网络防御,读者可据此评估长流程任务与企业级自动化的落地潜力。
xAI 旗下前沿模型 Grok 4.7 正式上线 Amazon Bedrock,支持 500K context window、图像输入以及 low、medium、high 和 xhigh 四档推理力度配置。
推荐理由:文章详细梳理了该模型在云端的推理配置与调用路径,开发者可以据此评估长流程智能体开发与推理成本控制。
OpenAI 阻断了一起旨在提取受保护模型推理过程的协同模型蒸馏活动。官方表示正在进一步强化防御措施,以应对针对模型的对抗性蒸馏攻击。
Radical Numerics 联合创始人兼 CEO Eric Nguyen 在访谈中指出,基因组语言模型(GLM)正借助长上下文与链式推理提升生物智能,生物安全已演变为攻防能力的军备竞赛。团队此前参与研发的 Evo 与 Evo 2 已实现从头设计功能性病毒基因组,新实验进一步表明模型能像思维链一样依据评分轨迹自主外推并自优化 RNA 序列性能。
Anthropic 与 OpenAI 分别推出 Claude Opus 5.5 以及 GPT-6 Sol 和 Luna,带动前沿与高性价比模型迎来大幅降价。GPT-6 系列定价相比 GPT-5.6 对标型号直接减半,Opus 5.5 定价降低 20% 且缓存读取价格下调 60%。
推荐理由:原文对比了新一代模型的定价降幅与实测表现,并指出 Opus 5.5 在极高思考配置下可能因推理过长触发输出上限。
NVIDIA 公布 MLPerf Inference v6.1 评测结果,Vera Rubin NVL72 系统在 Qwen3-VL 上吞吐量最高达到 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上吞吐量提升最高达 2.5 倍。
推荐理由:原文给出了新一代机架在主流推理模型上的基准吞吐数据,读者可以据此评估大规模算力集群的推理能效与扩展收益。
TypeSafe 推出基于 RLCD 训练的决策模型 Jev,专用于分类、评分和路由等结构化决策,而非生成自由文本。该模型相比传统 LLM 提速 20-200 倍、成本降低 40-400 倍且输出 token 免费,具备并行采样与无幻觉等特性。同期动态还包括 Periodic Labs 发布材料科学模型 Neon 以及 Google 上线 Gemini 3.8 Live。
Salesforce 在 Dreamforce 大会上宣布推出首个 CRM 推理模型 Koa,该模型基于 NVIDIA Nemotron 3 Super 构建并在企业基础设施内完全私有化运行。
推荐理由:原文展现了开源模型在企业垂直领域的落地路径,读者可据此了解专用推理模型与企业智能体的构建方式。
Good Start Labs 探索将策略游戏作为强化学习环境训练大模型,其实验表明在《1830》与《外交》等游戏中训练的多轮 Agent 决策与规划能力可以迁移到金融研究和客户支持等真实基准任务中。
Google DeepMind 正式推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,支持在语音交互的同时执行多步深度推理和后台工具调用。
推荐理由:模型在保持实时语音交互流的同时引入并行深度推理与工具调用,为复杂业务流程中的语音智能体落地提供了参考。
OpenAI 推出面向商业办公的模型 GPT-6 Astra。该模型具备高级推理能力与电脑操作功能,并增强了写作与设计判断表现。
推荐理由:原文给出了新模型面向办公场景在推理、电脑操作及设计判断方面的核心能力定位。
OpenAI 宣布分享一份由 AI 生成的纳维-斯托克斯(Navier–Stokes)千禧年大奖难题解决方案。该成果包含了详细的研究说明报告以及在 Lean 语言中构建的形式化证明。
推荐理由:原文给出了 AI 求解数学难题的说明与形式化证明形式,读者可据此了解形式化验证在复杂前沿研究中的结合方式。
ABBEL 将交互摘要建模为自然语言信念状态,并通过信念评分监督其信息内容,帮助 LLM 更高效地处理长时任务。在 CollabBench 上,ABBEL 将与 full context 模型的性能差距缩小约 50%,相比不使用信念评分的训练方案少用 50%训练步数。
一篇综述与观点文章梳理并行推理的最新进展,聚焦模型如何根据问题自主决定是否拆解任务、并行线程数量及协调方式。现有方法多由模型外部设定并行结构,可能造成重复计算,也难以适应不同问题的需求。文章指出,并行推理旨在缓解顺序推理带来的延迟增长、上下文压力和计算开销。