跳到正文

#评测/基准

今日 1 条
今天10月2日周五
9月11日周五
8月17日周一
8月13日周四
  1. Microsoft Research32

    MindTopo 基准揭示 VLM 的空间推理能力短板

    Microsoft Research 推出 MindTopo 基准,用于评测多模态大语言模型的拓扑推理能力,涵盖连续性、分离、顺序、包围与打结五类任务,并区分静态推理与交互规划两个层级。测试显示,当前闭源与开源模型在静态识别上表现明显优于交互规划,且均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧保留结构约束时才有帮助。