arXiv 预印本Wonje Jeung
同一轨迹却给出矛盾奖励:ROBORMBENCH 揭示视觉语言奖励模型的改写脆弱性
原标题:Same Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models
论文78
视觉语言模型越来越多地被用作机器人学习的奖励函数,但这一角色要求具备复述不变性:在语义等价的目标描述下,同一轨迹应获得相同的奖励。我们发现,当前的 VLM 奖励模型往往违背了这一性质。仅对指令进行同义复述,就可能显著改变预测的进度分数,甚至会让完全相同的机器人行为在失败与成功之间反转。为了衡量这种失效模式,我们提出了 ROBORMBENCH,这是一个包含 2,390 条真实机器人轨迹、真实进度标注,以及 21,673 条涵盖词汇、句法和动作目标重写且经过验证的复述指令的基准。在专有模型和开源 VLM 中,由复述引起的不稳定性普遍且严重,随着重写差异的增大而进一步加剧,并且无法通过扩大模型规模或引入显式推理来可靠地缓解。相比之下,采用基于轨迹的真实监督训练出的专用奖励模型则明显更加稳定。这些结果表明,复述鲁棒性是机器人领域中基于 VLM 构建可靠奖励模型的核心要求。
为什么值得读
研究量化了视觉语言奖励模型在同义改写下的不可靠性,提醒具身智能在引入通用多模态模型作评判时需防范语义漂移。
标签
RoboticsReward ModelsVLMReinforcement LearningROBORMBENCHRobustnessarXiv