Google 发布前沿模型 Gemini 4 Argon,初期仅对受信任网络防御者开放
Google 正式公布下一代前沿 AI 模型 Gemini 4 Argon,在软件工程、法律财务等企业知识工作以及网络安全防御方面具备前沿性能。出于安全考量,Google 初期仅向受信任的网络防御者开放访问,并参与美国政府的模型发布前自愿审查流程。该模型目前已在 Google 内部用于大规模代码库迁移等工作流,在基准测试中优于 OpenAI 和 Anthropic 的同类模型。
Google 正式公布下一代前沿 AI 模型 Gemini 4 Argon,在软件工程、法律财务等企业知识工作以及网络安全防御方面具备前沿性能。出于安全考量,Google 初期仅向受信任的网络防御者开放访问,并参与美国政府的模型发布前自愿审查流程。该模型目前已在 Google 内部用于大规模代码库迁移等工作流,在基准测试中优于 OpenAI 和 Anthropic 的同类模型。
Google 宣布推出 Gemini 4 Argon AI 模型,但目前该模型尚未开放给用户使用。相关消息同时也提及了此前的 Gemini 3.5 Pro。
Google DeepMind 正式公布新一代前沿模型 Gemini 4 Argon,单次输出 token 上限提升至 1M tokens,主打真实软件工程、企业知识工作与网络安全防御等复杂长流程任务。
推荐理由:模型将单次输出上限拓展至 1M tokens 并主打深度推理与网络防御,读者可据此评估长流程任务与企业级自动化的落地潜力。
GPT-6.1 Sol 已在 Amazon Bedrock 正式可用,为智能体编码、计算机操作和专业工作负载带来更强推理能力。OpenAI 称,该模型在 DeepSWE v1.1 上匹配 GPT-6 Astra,单任务成本约为其五分之一;它还以低于 GPT-6 Sol 对应结果的推理力度,高出 6.4 个百分点。
推荐理由:文章将智能体任务成本与交互 token 价格、推理质量联系起来,并以 DeepSWE v1.1 的对比数据展示 GPT-6.1 Sol 的任务成本表现。
GPT 6.1 Sol 被描述为具备接近 Astra 的智能水平,价格仅为其五分之一。页面未提供更多性能对比数据。
OpenAI 在 DevDay 2026 发布 Dots 智能体,并推出 GPT-6.1 Sol、Ultrafast 等模型与服务更新。ChatGPT Pro 和 Enterprise 用户当天可使用 Dots;Ultrafast 提供最高 300 tokens/second 的速度,Codex Security Cloud 也推出升级版并计划当天普遍开放。
推荐理由:这份现场记录将 Dots、模型与 API 更新、开发者工具发布串联起来,呈现 OpenAI 面向个人智能体和开发者的产品布局。
OpenAI 发布 GPT-6.1 Sol,称其在编码、电脑操作和专业工作方面具备接近 Astra 的智能水平,标准 API 输入和输出 token 价格为 Astra 的五分之一。
推荐理由:材料将 GPT-6.1 Sol 定位为面向编码、电脑操作和专业工作的模型,并以 Astra 标准 API 输入与输出 token 价格的五分之一作为核心成本比较。
Anthropic 发布 Claude Sonnet 5.5,并称其运行速度提升 30% 以上,多数工作成本最高降低 30%。该模型定价与 Sonnet 5 相同,作者称它在各项基准上似乎都胜过前代,并指出它已用于 claude.ai 免费层。作者用 WebGL 提示词测试免费层,获得了一个渲染 3D 骑车鹈鹕的 HTML 页面。
Google DeepMind 正式推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音合成模型,支持通过自然语言提示词从零定制角色声音并进行逐行台词导演。
推荐理由:原文详细展示了双角色剧本编排、自然语言声音定制与安全水印机制,读者可以据此评估语音合成在播客与配音场景的落地可行性。
Anthropic 正式发布新一代旗舰模型 Claude Opus 5.5,OpenAI 随后推出价格降低约 50% 的 GPT-6 Sol 与 Luna。Opus 5.5 在 Agent 编码、计算机使用和写作能力上显著提升,默认设置下单任务运行成本较 Opus 5 降低约 40%,但高推理强度下 Token 消耗会有所增加。
推荐理由:两家厂商在同一天密集更新模型并大幅下调价格,读者可以据此对比多任务评测与真实调用成本的变化。
OpenAI 推出 GPT-6 Sol 和 Luna 两款新模型,旨在将前沿智能引入日常工作。两款模型在能力和成本之间提供了不同的平衡选择。
TypeSafe 推出基于 RLCD 训练的决策模型 Jev,专用于分类、评分和路由等结构化决策,而非生成自由文本。该模型相比传统 LLM 提速 20-200 倍、成本降低 40-400 倍且输出 token 免费,具备并行采样与无幻觉等特性。同期动态还包括 Periodic Labs 发布材料科学模型 Neon 以及 Google 上线 Gemini 3.8 Live。
Google DeepMind 正式推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,支持在语音交互的同时执行多步深度推理和后台工具调用。
推荐理由:模型在保持实时语音交互流的同时引入并行深度推理与工具调用,为复杂业务流程中的语音智能体落地提供了参考。
OpenAI 在 API 中上线 GPT-Live-1 模型,提供自然的全双工语音对话交互。该模型具备更强的指令遵循能力,并支持自定义声音和电话通信集成。
推荐理由:原文给出了新模型的全双工语音与电话支持能力,开发者可以据此评估语音交互方案的集成路径。
OpenAI 推出面向商业办公的模型 GPT-6 Astra。该模型具备高级推理能力与电脑操作功能,并增强了写作与设计判断表现。
推荐理由:原文给出了新模型面向办公场景在推理、电脑操作及设计判断方面的核心能力定位。
OpenAI 推出 ChatGPT Images 2.5,可将用户的想法、草图和参考照片转化为更个性化、更精致且更贴合创意的图像。
Google DeepMind 与 Google Research 正式发布全球气象 AI 模型 WeatherNext 3,引入实时卫星数据并支持按小时生成最高 5 公里分辨率的全球天气预报。
推荐理由:模型直接引入实时卫星观测与稀疏气象站数据,为全球高分辨率气象预报和清洁能源调度提供了端到端预测范式。
Microsoft Research 发布开放权重模型 GigaPath-Flash 和 GigaTIME-Flash,旨在降低病理基础模型用于大规模研究的计算成本。
Microsoft Research 发布 Skala-1.1,并扩大 Skala 在计算化学软件中的可用范围。Skala-1.1 使用比首个公开版本多 2.5 倍的数据训练,在 GMTKN55 的 55 个类别中有 32 个排名第一,加权平均误差为 2.8 kcal/mol。