SmartMage:面向3D场景理解的动态模态编排
原标题:SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding
理解三维场景是具身智能的基础,这要求对来自多种模态的异构信息(包括视觉和几何线索)进行联合推理。然而,这些模态与查询的相关性往往各不相同。现有的多模态大语言模型(MLLM)通常依赖固定的模态组合,忽视了查询相关的模态需求。这种僵化的设计可能会引入来自无关模态的语义噪声,同时未能充分利用信息量更高的模态,从而导致计算资源浪费和推理能力削弱。为应对这些挑战,本文提出了 SmartMage,这是一种统一的 MLLM,能够动态协调异构模态,以实现语义感知的三维场景理解。具体而言,SmartMage 包含:(1)语义引导的模态自适应路由(Semantic-guided Modality Adaptive RouTng,SMART)模块,该模块利用语义先验、文本-模态对齐关系和模态质量,选择与任务相关的模态;(2)模态感知门控专家(Modality-Aware Gating Expert,MAGE)模块,该模块利用模态先验指导专家激活,促进多模态推理中的自适应专业化。实验结果表明,SmartMage 在五个三维场景理解基准上均取得了最先进的性能,并在仅使用 RGB 的视频理解基准上取得了具有竞争力的结果。在我们的诊断基准 ScanFacet 中,任务被划分为细粒度的语义类别,从而能够分析每种语义类型偏好的模态组合。观察到的模态-语义模式进一步证明了 SmartMage 的有效性。项目主页:https://yuecheong.github.io/SmartMage/。
为什么值得读
3D具身系统正从固定输入走向按任务调度感知资源,这项工作同时给出路由机制和细粒度模态偏好的诊断框架,值得及时关注。