论文指出,依赖像素生成未来的世界动作模型可能把动作相关状态与无关外观混在一起,并在视觉分布偏移时出现“训练分布幻觉”。ST-WAM以DINOv3作为共享语义表示,结合Wan-VAE的细粒度动态,通过DSFE预测未来、CAIR检索近期历史,以提升机器人操作鲁棒性。
最近 24 小时暂无可用热度快照。