论文指出,机器人和自动驾驶中用于评估策略的生成式世界模型不能被默认视为可信测试预言机。作者借鉴VV&A、SOTIF与场景测试标准,提出L0-L4可采纳性阶梯,要求模型先证明视觉真实性、动作跟随能力及闭环可靠性。对两个驾驶世界模型的分析显示,L0视觉质量排名更高者,在L1-L2动作响应上反而更低。
最近 24 小时暂无可用热度快照。