当人类用稍有差异的同义句描述同一任务时,作为机器人奖励函数的视觉语言模型常常给出截然相反的判定。基准 ROBORMBENCH 汇总了 2390 条真实机器人轨迹与两万余条改写指令,测试显示无论开源还是闭源模型,换个说法就会导致进度评分剧烈波动甚至成败倒置,模型规模与显式推理均未能弥合这一裂缝。
最近 24 小时暂无可用热度快照。