Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
arXiv 预印本·Wonje Jeung·2026年9月4日 17:47

同一轨迹却给出矛盾奖励:ROBORMBENCH 揭示视觉语言奖励模型的改写脆弱性

原标题:Same Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models

论文78

视觉语言模型越来越多地被用作机器人学习的奖励函数,但这一角色要求具备复述不变性:在语义等价的目标描述下,同一轨迹应获得相同的奖励。我们发现,当前的 VLM 奖励模型往往违背了这一性质。仅对指令进行同义复述,就可能显著改变预测的进度分数,甚至会让完全相同的机器人行为在失败与成功之间反转。为了衡量这种失效模式,我们提出了 ROBORMBENCH,这是一个包含 2,390 条真实机器人轨迹、真实进度标注,以及 21,673 条涵盖词汇、句法和动作目标重写且经过验证的复述指令的基准。在专有模型和开源 VLM 中,由复述引起的不稳定性普遍且严重,随着重写差异的增大而进一步加剧,并且无法通过扩大模型规模或引入显式推理来可靠地缓解。相比之下,采用基于轨迹的真实监督训练出的专用奖励模型则明显更加稳定。这些结果表明,复述鲁棒性是机器人领域中基于 VLM 构建可靠奖励模型的核心要求。

为什么值得读

研究量化了视觉语言奖励模型在同义改写下的不可靠性,提醒具身智能在引入通用多模态模型作评判时需防范语义漂移。

标签

RoboticsReward ModelsVLMReinforcement LearningROBORMBENCHRobustnessarXiv

评分依据

  • 新颖性82
  • 影响力76
  • 实践价值78
  • 可信度80
  • 时效性74