论文提出轻量级世界-动作模型 LiLa-WAM,在由未来状态预测与动作生成共同塑造的紧凑潜空间中推理,并可在单张 24GB GPU 上端到端训练。其视觉转移令牌 VTT 以视觉特征空间中的方向表达任务,无需语言指令。作者报告模型在 RoboTwin 2.0 的 50 项任务上取得 90.48% 成功率,并在 LIBERO 与真实机器人任务中进行验证。
最近 24 小时暂无可用热度快照。