论文提出“成功溯源”作为智能体评测的新对象:正确答案并不能说明智能体是依靠预期推理,还是通过改变信息状态获取了答案。AcquaBench用CLEAN、GOLD、SHAM三种值替换,在四类标准化表面上检验目标正确性与答案暴露的区别;D0中GOLD领先SHAM 19.1至25.9个百分点,D2中该依赖仍存在但共置不再可靠。
最近 24 小时暂无可用热度快照。