论文提出一种受理性注意力模型启发的偏好学习框架,指出成对比较不仅受潜在奖励差异影响,也受评估者注意力容量、默认倾向和任务难度影响。作者认为,被动比较数据无法区分这些因素,异质注意力还可能让Bradley–Terry模型恢复误导性排序;Chatbot Arena与视觉比较案例提供了循环偏好、响应时间和注视信息等证据。
最近 24 小时暂无可用热度快照。