论文提出WMBench,用真实机器人遥操作数据与匹配的策略执行构建评测基准,比较7个视频世界模型、4种动作表示和超过32.4万次模拟策略 rollout。研究指出,长时域且动作忠实的预测一致性比短期视觉逼真度更能决定评估可靠性,并据此发布面向策略评估的GigaWorld-1及代码、模型、数据集和工具包。
最近 24 小时暂无可用热度快照。