SpatialCLI提出三阶段框架,让视觉语言模型先调用定位、分割、深度和姿态等专家视觉工具,再通过冷启动SFT、智能体强化学习和轨迹 verbalization 将能力内化。其516例SpatialCLI-Bench覆盖组合式感知;在MindCube上,Qwen3-VL-8B-Instruct借助工具由29.3%升至84.6%,内化后无工具仍达73.8%。
最近 24 小时暂无可用热度快照。