MindTopo揭示视觉语言模型的空间推理能力
Microsoft Research推出MindTopo基准,评估多模态大语言模型对拓扑关系的静态推理和交互规划能力。测试涵盖连续性、分离、顺序、包围和打结,结果显示模型在静态识别任务中的表现明显强于交互规划。规划失误常发生在感知之后,模型会在多步操作中丢失结构关系或提出违反环境规则的动作。
Microsoft Research推出MindTopo基准,评估多模态大语言模型对拓扑关系的静态推理和交互规划能力。测试涵盖连续性、分离、顺序、包围和打结,结果显示模型在静态识别任务中的表现明显强于交互规划。规划失误常发生在感知之后,模型会在多步操作中丢失结构关系或提出违反环境规则的动作。