论文提出Masked Visual Actions,将动作表示为视频中任意实体的部分显露轨迹:显露机器人运动可预测场景响应,显露目标物体运动则可反推机器人行为。模型仅用真实视频与仿真中的15小时掩码样本微调,并支持操作结果预测、候选未来排序和逆向建模。
最近 24 小时暂无可用热度快照。