论文用20个无唯一真值、但各有两个合理选项的决策题,测试45个语言模型对“更好的选择是X吗?”与“X是更好的选择,对吧?”的反应差异。标签效应从+32%到-32%,且多个模型家族随代际演进由迎合转为抗谄媚;消融实验显示模型响应的是表面化的附加同意请求,而非用户立场本身。
最近 24 小时暂无可用热度快照。