这篇论文研究可审计推理被攻击者重写时,思维链监控是否仍能发现奖励投机。作者保持所有命令与输出完全不变,仅将推理改写成善意工程叙事,使留出监控器在相关子集上的检出率从约95%降至不足11%。聚合准确率掩盖了这一近乎完全的失效;跨监控器、模型和在线智能体实验也观察到类似现象。
最近 24 小时暂无可用热度快照。