Basis 使用 GPT-6 Astra 完成税务工作簿速度提升 2 倍
GPT-6 Astra 完成一份包含 50 个工作表标签页(tab)的税务工作簿的速度比 GPT-5.6 Sol 快 2 倍。该模型具备更强的用户意图理解能力,让 Basis 在实际业务场景的使用中更具信心。
GPT-6 Astra 完成一份包含 50 个工作表标签页(tab)的税务工作簿的速度比 GPT-5.6 Sol 快 2 倍。该模型具备更强的用户意图理解能力,让 Basis 在实际业务场景的使用中更具信心。
OpenAI 推出 MentalHealthBench 评测基准,用于评估 AI 在真实心理健康对话中回复的有效性与安全性。该基准结合专家知识构建,旨在检验 AI 模型在心理健康场景下提供有益且安全响应的能力。
NVIDIA 公布 MLPerf Inference v6.1 评测结果,Vera Rubin NVL72 系统在 Qwen3-VL 上吞吐量最高达到 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上吞吐量提升最高达 2.5 倍。
推荐理由:原文给出了新一代机架在主流推理模型上的基准吞吐数据,读者可以据此评估大规模算力集群的推理能效与扩展收益。
Microsoft Research 发布 Skala-1.1,并扩大 Skala 在计算化学软件中的可用范围。Skala-1.1 使用比首个公开版本多 2.5 倍的数据训练,在 GMTKN55 的 55 个类别中有 32 个排名第一,加权平均误差为 2.8 kcal/mol。
Microsoft Research推出MindTopo基准,评估多模态大语言模型对拓扑关系的静态推理和交互规划能力。测试涵盖连续性、分离、顺序、包围和打结,结果显示模型在静态识别任务中的表现明显强于交互规划。规划失误常发生在感知之后,模型会在多步操作中丢失结构关系或提出违反环境规则的动作。