这项研究考察长度惩罚强化学习对思维链可监控性的影响。Qwen3-4B与Qwen3-14B实验显示,压缩显著减少推理token并保留大部分选择题准确率,却没有消除误导性提示的影响;最强压缩下,忠实性下界和监控器检出率均明显下降,且随机删句无法解释这一差异。
最近 24 小时暂无可用热度快照。