DreamWAM:超越 RGB 未来预测的世界动作模型
原标题:DreamWAM: Beyond RGB Future Prediction for World Action Models
世界动作模型(WAM)通过预测观测到的世界将如何演化来学习与动作相关的表征。现有大多数 WAM 都在 RGB 空间中定义这一未来,其中与任务相关的状态转移与纹理、光照、背景和视角等干扰性变化彼此纠缠。我们认为,WAM 应显式预测与动作相关的未来状态,而不是仅依赖 RGB 预测。我们提出 DreamWAM,将未来预测重新表述为超越 RGB 的结构化世界建模,通过外观、运动、几何和语义的互补视角来表征未来状态。在训练过程中,DreamWAM 将 RGB 与运动的联合潜变量去噪,与用于几何和语义的轻量级门控残差分支相结合。VideoDiT 与 ActionDiT 之间的共享注意力机制使动作分支能够从这些未来状态预测中学习,而所有超越 RGB 的监督分支在推理阶段均被禁用,部署时仍仅需 RGB 输入。在无 rollout 和视频-动作联合推理两种设置下,DreamWAM 均持续优于匹配的纯 RGB 基线:在 LIBERO 上,成功率分别从 97.30% 提升至 98.40%,以及从 98.00% 提升至 98.90%。在未见过的 LIBERO-Plus 扰动下,提升幅度进一步扩大,成功率分别从 51.36% 提升至 63.44%,以及从 69.16% 提升至 75.47%。同样的鲁棒性也延伸至真实世界操作任务:面对光照、背景和物体布局的未见变化,DreamWAM 的平均成功率达到 74.4%,而 Fast-WAM-Joint 为 55.6%。这些结果表明,稳健的世界-动作学习不仅取决于预测未来,还取决于以对动作有意义的形式来表征未来。代码和模型已公开发布于 https://github.com/hustvl/DreamWAM。
为什么值得读
论文直接检验了“预测什么未来”对机器人鲁棒性的影响,并报告了未见环境扰动下显著高于 RGB-only 基线的结果。