Microsoft Research· Yunfei Ge, Anbang Liu, Qineng Wang, Johnalbert Garnica, Zihan Wang, Reuben Tan, Jianfeng Gao, Ruohan Zhang, Yining Hong, Jiajun Wu, Manling Li·· 2026-08-13AI 评分54
MindTopo 基准揭示多模态大语言模型的空间推理能力
MindTopo reveals VLMs’ spatial reasoning abilities
AI 导读
微软研究院推出 MindTopo 基准,评估多模态大语言模型对连通、封闭、排序、分离和打结等拓扑关系的理解,发现模型在静态识别上远优于交互规划。基准在五个拓扑类别上分别测试推理与规划,并在可控模拟器中提供精确真值以分离感知与规划两类失败。当前模型常在规划多步后失去结构关系或提出违反物理约束的动作,静态识别也会因漏看墙或开口而失败。
来源:Microsoft Research · microsoft.com