Anthropic称智谱开源权重GLM-5.3在漏洞利用构建上接近Claude Mythos Preview
Anthropic称,智谱开源权重模型GLM-5.3在漏洞利用测试中接近Claude Mythos Preview。ExploitBench上,GLM-5.3在410次尝试中成功构建50次漏洞利用,Mythos Preview为56次;另一项二进制利用测试的成功率分别为4%和6%。
Anthropic称,智谱开源权重模型GLM-5.3在漏洞利用测试中接近Claude Mythos Preview。ExploitBench上,GLM-5.3在410次尝试中成功构建50次漏洞利用,Mythos Preview为56次;另一项二进制利用测试的成功率分别为4%和6%。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准随机抽取的 100 项任务中评测多个模型,GLM-5.3 有 4% 的试验形成完整控制流劫持,Claude Mythos Preview 为 6%。Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功。
Claude Opus 5.5 本周发布后获得积极评价,凭借讲解视频表现迅速成为社交平台讨论焦点。它在 SimpleBench 取得 88.4%,并被评价为 Anthropic 迄今最佳视觉模型;视觉表现优于 Fable 5 和 GPT-6 Sol,但不及 GPT-6 Astra。
Anthropic 发布 Claude Sonnet 5.5,并称其运行速度提升 30% 以上,多数工作成本最高降低 30%。该模型定价与 Sonnet 5 相同,作者称它在各项基准上似乎都胜过前代,并指出它已用于 claude.ai 免费层。作者用 WebGL 提示词测试免费层,获得了一个渲染 3D 骑车鹈鹕的 HTML 页面。
Anthropic 正式发布新一代旗舰模型 Claude Opus 5.5,OpenAI 随后推出价格降低约 50% 的 GPT-6 Sol 与 Luna。Opus 5.5 在 Agent 编码、计算机使用和写作能力上显著提升,默认设置下单任务运行成本较 Opus 5 降低约 40%,但高推理强度下 Token 消耗会有所增加。
推荐理由:两家厂商在同一天密集更新模型并大幅下调价格,读者可以据此对比多任务评测与真实调用成本的变化。
Anthropic 与 OpenAI 分别推出 Claude Opus 5.5 以及 GPT-6 Sol 和 Luna,带动前沿与高性价比模型迎来大幅降价。GPT-6 系列定价相比 GPT-5.6 对标型号直接减半,Opus 5.5 定价降低 20% 且缓存读取价格下调 60%。
推荐理由:原文对比了新一代模型的定价降幅与实测表现,并指出 Opus 5.5 在极高思考配置下可能因推理过长触发输出上限。