Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

观察中研究观察中0 家独立报道0

同一轨迹却给出矛盾奖励:ROBORMBENCH 揭示视觉语言奖励模型的改写脆弱性

首次出现 · 2026/9/5 01:47最近活动 · 2026/9/5 01:47

当人类用稍有差异的同义句描述同一任务时,作为机器人奖励函数的视觉语言模型常常给出截然相反的判定。基准 ROBORMBENCH 汇总了 2390 条真实机器人轨迹与两万余条改写指令,测试显示无论开源还是闭源模型,换个说法就会导致进度评分剧烈波动甚至成败倒置,模型规模与显式推理均未能弥合这一裂缝。

最近 24 小时事件热度

最近 24 小时暂无可用热度快照。

最近 24 小时暂无可用热度快照。

报道时间线

  1. 聚合入口arXiv 预印本9/5 01:47非独立信源代表报道
    同一轨迹却给出矛盾奖励:ROBORMBENCH 揭示视觉语言奖励模型的改写脆弱性