跳到正文

#评测/基准

今日 0 条
9月29日周二
9月28日周一
9月23日周三
  1. Simon Willison86

    Claude Opus 5.5 与 GPT-6 Sol/Luna 实测:新模型定价对比与推理表现分析

    Anthropic 与 OpenAI 分别推出 Claude Opus 5.5 以及 GPT-6 Sol 和 Luna,带动前沿与高性价比模型迎来大幅降价。GPT-6 系列定价相比 GPT-5.6 对标型号直接减半,Opus 5.5 定价降低 20% 且缓存读取价格下调 60%。

    推荐理由:原文对比了新一代模型的定价降幅与实测表现,并指出 Opus 5.5 在极高思考配置下可能因推理过长触发输出上限。

9月16日周三
8月21日周五
8月13日周四
  1. Microsoft Research49

    MindTopo揭示视觉语言模型的空间推理能力

    Microsoft Research推出MindTopo基准,评估多模态大语言模型对拓扑关系的静态推理和交互规划能力。测试涵盖连续性、分离、顺序、包围和打结,结果显示模型在静态识别任务中的表现明显强于交互规划。规划失误常发生在感知之后,模型会在多步操作中丢失结构关系或提出违反环境规则的动作。