SmartMage提出一种面向3D场景理解的统一多模态大模型,根据查询语义、文本对齐程度和模态质量动态选择视觉与几何信息,并通过MAGE门控专家模块调整专家激活。论文报告其在五项3D场景理解基准上达到当时最佳表现,并在RGB视频理解基准上取得有竞争力结果;ScanFacet进一步分析不同语义任务偏好的模态组合。
最近 24 小时暂无可用热度快照。