EmbodiedScan与MMScan分层接地语言标注如何推动3D场景理解新高度【免费下载链接】EmbodiedScan[CVPR 2024 NeurIPS 2024] EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI项目地址: https://gitcode.com/gh_mirrors/em/EmbodiedScanEmbodiedScan 是一个面向具身智能Embodied AI的多模态3D感知数据集与开源基准配套了统一的 Embodied Perceptron 感知框架其后续工作 MMScan 则带来了目前规模最大的分层接地语言标注。两者一起回答了一个核心问题3D场景理解如何从认出物体升级为听懂语言、理解关系。本文将从数据集、标注体系、模型框架与上手实践四个角度带你快速看懂这套 CVPR 2024 NeurIPS 2024 的多模态3D感知全家桶。为什么接地语言标注是3D场景理解的关键一步传统 3D 数据集通常只提供物体类别标签模型能看见椅子、桌子却无法理解把离柜台最近的那把椅子递给我这种自然语言指令。接地Grounding就是把自然语言描述与三维空间中的具体物体一一对应起来这正是机器人、智能体与真实环境交互的前提。EmbodiedScan 的进阶之处在于它不仅提供 5 千余次真实扫描还包含 100 万条自中心视角的 RGB-D 图像、100 万条语言提示language prompts与 16 万 个 3D 定向框覆盖 760 个物体类别并额外提供 80 个常见类别的稠密语义占用标注。如此规模让看图识字式的 3D 感知第一次有了通向按指令行事的可能。MMScan最大规模的分层接地语言标注是如何设计的如果说 EmbodiedScan 解决了数据多不多那么 MMScan 解决的是标注深不深。MMScan 在 1039 个真实扫描场景上构建了约 310 万个接地语义掩码和 140 万条分层锚点anchor标注其分层标注体系分为三个层级实例级Instance定位单个物体如沙发冰箱训练模型的基础识别能力属性级Attribute描述外观与状态如颜色、材质、形状、新旧程度让模型学会细节观察关系级Relationship刻画物体间联系如在……旁边比……更靠近窗户考验空间推理能力。这套由浅入深的标注设计让模型可以像人类一样先看是什么再看长什么样最后看怎么摆放对提升 3D 视觉定位与场景问答的泛化能力至关重要。Embodied Perceptron一个统一的多模态3D感知框架为了让这些多模态数据真正被用起来项目配套了统一的基线框架Embodied Perceptron。它可同时接收任意视角数量的 RGB-D 序列、点云与文本指令2D 图像与 3D 点云各自经过编码器提取特征再通过稠密与稀疏融合最终由三个解码头分别输出3D目标检测、视觉定位与占用预测结果实现了一个框架、多种任务。三大开源任务基线检测、视觉定位与占用预测项目在configs/下开放了多套可直接运行的基线配置覆盖三大方向多视图/连续 3D 检测如configs/detection/mv-det3d_8xb4_embodiedscan-3d-284class-9dof.pyAP0.25 可达 15.22多视图 3D 视觉定位Grounding如configs/grounding/mv-grounding_8xb12_embodiedscan-vg-9dof-full.pyAP0.25 约 36.78在加入复杂提示complex prompts训练后还能进一步提升占用预测Occupancy如configs/occupancy/mv-occ_8xb1_embodiedscan-occ-80class.pymIoU 约 21~23。数据集的读取与评测代码集中在embodiedscan/datasets/如embodiedscan_dataset.py、mv_3dvg_dataset.py模型实现则分布在embodiedscan/models/detectors/下方便你按需修改与扩展。快速上手从安装到跑通第一个3D场景理解实验想要亲自体验整个过程并不复杂git clone https://gitcode.com/gh_mirrors/em/EmbodiedScan cd EmbodiedScan conda create -n embodiedscan python3.8 -y conda activate embodiedscan python install.py all # 一键安装全部依赖数据准备请参考data/README.md涉及 ScanNet、3RScan、Matterport3D、ARKitScenes 等原始数据的下载与组织。训练一个多视图 3D 检测模型只需一条命令python tools/train.py configs/detection/mv-det3d_8xb4_embodiedscan-3d-284class-9dof.py --work-dirwork_dirs/mv-3ddet此外demo/demo.ipynb提供了示例数据的推理演示embodiedscan/tutorial.ipynb则带你完成数据集的基本分析与可视化非常适合新手入门。结语从数据到智能3D场景理解的下一站EmbodiedScan 与 MMScan 的组合拳把多模态数据和分层语言标注两件事都做到了开源社区的前列前者提供了大规模、自中心视角的 3D 感知数据底座后者让标注粒度深入属性与关系层面。对研究者而言这是一套可以放心起步的基准与工具箱对想入门 3D 场景理解的开发者来说更是难得的教科书级开源项目。未来的具身智能正需要这样看得见、听得懂、分得清的感知能力作为地基。希望这篇文章能帮你快速建立起对 EmbodiedScan 与 MMScan 的整体认知。如果你正在研究多模态3D感知或准备搭建自己的场景理解实验不妨现在就动手跑起来吧【免费下载链接】EmbodiedScan[CVPR 2024 NeurIPS 2024] EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI项目地址: https://gitcode.com/gh_mirrors/em/EmbodiedScan创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考