论文指出,中心化令牌对数概率增量在模型自身采样律下是均值为零的鞅,反映采样自洽性而非推理轨迹健康度,并在高置信重复时几乎无信号。作者提出融合不确定性与显式重复检测的校准序贯控制器,在 GSM8K 的 DeepSeek-R1-Distill-Qwen-1.5B FP16/INT4 试验中,将高频误报警监控器转为选择性检测器;INT4 准确率由 63% 升至 69%,但统计上不显著,且 token 成本增加 28%。
最近 24 小时暂无可用热度快照。