跳到正文
原文
Simon Willison·· 1 天前AI 评分65

Simon Willison 引述 Anthropic Frontier Red Team 的模型评测结果

Quoting Anthropic Frontier Red Team

AI 导读

Anthropic Frontier Red Team 在内部 Binary Exploitation 基准随机抽取的 100 项任务中评测多个模型,GLM-5.3 有 4% 的试验形成完整控制流劫持,Claude Mythos Preview 为 6%。Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功。

来源:Simon Willison · simonwillison.net