从视频到认知地图Thinking in Space如何搭建MLLM与3D重建的桥梁【免费下载链接】thinking-in-spaceOfficial repo and evaluation implementation of VSI-Bench项目地址: https://gitcode.com/gh_mirrors/th/thinking-in-space想象一下给一个多模态大模型MLLM一段在公寓里边走边拍的视频然后问它客厅的沙发离冰箱有多远——它能答对吗这正是 Thinking in Space 项目想要回答的核心问题。作为 CVPR 2025 Oral 论文的官方开源仓库Thinking in Space 发布了 VSI-Bench 空间智能基准测试与完整评估代码首次系统性地检验多模态大模型能否像人类一样看空间、记布局、答问题搭建起 MLLM 与 3D 重建之间的桥梁。为什么需要会思考空间的多模态大模型现有的视频多模态大模型擅长描述画面、识别物体、甚至总结剧情但面对物体之间的相对距离房间有多大这类需要空间推理的问题时往往只能靠猜。人类之所以能轻松回答是因为大脑在观看过程中自动构建了一张隐式的认知地图cognitive map——记住物体的位置、大小与空间关系。Thinking in Space 团队认为如果 MLLM 要成为真正的空间智能体例如未来进入家庭、仓库、医院的机器人就必须具备这种能力。于是他们用室内 3D 重建数据集ScanNet、ScanNet、ARKitScenes中的第一视角视频作为考题看模型能否在观看视频后重建空间认知。VSI-Bench5000 问答对的空间智能基准测试VSI-Bench 空间智能基准测试的数据来自三大公开室内 3D 重建数据集的验证集共288 个第一视角egocentric视频覆盖公寓、实验室、工厂等真实环境。团队从中精心标注了超过 5,000 个问答对并且经过多轮人工迭代精修确保题目质量。为了让评估足够严谨每个问题都配有视频帧、相机轨迹信息与标准答案。无论是数值型回答如凳子高度是多少厘米还是选择题如哪个物体离打印机最近都有统一的评分标准。三大类八小项从数数到路线规划的完整能力图谱VSI-Bench 将 8 个任务划分为三个维度几乎覆盖了空间智能的全部核心能力构型类任务Configurational占 47.6%物体相对方向、相对距离、物体数量统计、路线规划测量估计类任务Measurement占 40.3%物体大小估计、房间大小估计、绝对距离估计时空类任务Spatiotemporal占 12.1%物体出现顺序、时空属性判断从房间里有多少把椅子到从马桶出发怎么导航到锅题目由易到难全面考察模型的计数、测距、方向判断和路径规划能力。15 个模型同场竞技空间智能现状报告VSI-Bench 用零样本zero-shot方式评估了 15 个支持视频输入的 MLLM覆盖闭源与开源两大阵营闭源模型Gemini-1.5、GPT-4o开源模型InternVL2、VILA、LongVILA、LongVA、LLaVA-OneVision、LLaVA-NeXT-Video 等评分采用双指标选择题任务用准确率Accuracy数值题任务用团队提出的平均相对准确率MRAMean Relative Accuracy后者能更公平地衡量答得有多接近。结果令人深思人类水平平均得分79.2而表现最好的专有模型 Gemini-1.5 Pro 仅45.4开源模型中 LLaVA-NeXT-Video-72B 达到48.6——差距一目了然也说明空间智能仍是 MLLM 亟待突破的短板。从零复现VSI-Bench 评估环境搭建步骤想亲自验证模型的空间脑力项目提供了清晰的安装流程只需几步即可完成评估环境搭建创建 Python 3.10 的 conda 环境并激活克隆仓库需同步初始化子模块git clone https://gitcode.com/gh_mirrors/th/thinking-in-space安装依赖的 transformers 分支cd transformers pip install -e .安装项目本体pip install -e .安装 s2wrapper 与 deepspeed 等评估所需组件一键跑通最简单的 VSI-Bench 评估方法环境就绪后评估过程被封装为一条命令。项目根目录的 evaluate_all_in_one.sh 脚本内置了 8 个常见开源模型的配置支持 GPU 数量自动探测bash evaluate_all_in_one.sh --model all --num_processes 8 --benchmark vsibench如果想只测某一个模型比如 LLaVA-OneVision只需把all换成对应的模型名如llava_one_vision_qwen2_7b_ov_32f--limit参数还能用来小规模试跑验证流程。任务与指标的定义集中在 vsibench.yaml问答模板与 MCA/MRA 评分逻辑则在同目录的 utils.py 中方便按需定制提示词prompt。项目仓库结构速览lmms_eval/tasks/vsibench/VSI-Bench 任务定义、提示词模板与评分实现evaluate_all_in_one.sh全模型一键评估入口脚本docs/resources/论文配图与基准测试可视化data/meta_info/ScanNet 等数据集的元信息供复现使用lmms_eval/models/内置的 30 视频/图像模型适配器含 gemini_api、gpt4v、llava 等小结让模型真正看懂空间Thinking in Space 的价值不仅在于发布了一个严谨的 VSI-Bench 空间智能基准测试更在于它把评估这件事做到了开箱即用数据、代码、指标、脚本全部开源。无论你是想评估自家视频模型的 3D 空间理解能力还是想研究 MLLM 与 3D 重建的融合方向这个仓库都是绝佳的起点。下一个能拿满分的模型或许就诞生在你的实验中。【免费下载链接】thinking-in-spaceOfficial repo and evaluation implementation of VSI-Bench项目地址: https://gitcode.com/gh_mirrors/th/thinking-in-space创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考