OpenAI 推出 MentalHealthBench 评测基准
OpenAI 推出 MentalHealthBench 评测基准,用于评估 AI 在真实心理健康对话中回复的有效性与安全性。该基准结合专家知识构建,旨在检验 AI 模型在心理健康场景下提供有益且安全响应的能力。
OpenAI 推出 MentalHealthBench 评测基准,用于评估 AI 在真实心理健康对话中回复的有效性与安全性。该基准结合专家知识构建,旨在检验 AI 模型在心理健康场景下提供有益且安全响应的能力。
Microsoft Research推出MindTopo基准,评估多模态大语言模型对拓扑关系的静态推理和交互规划能力。测试涵盖连续性、分离、顺序、包围和打结,结果显示模型在静态识别任务中的表现明显强于交互规划。规划失误常发生在感知之后,模型会在多步操作中丢失结构关系或提出违反环境规则的动作。