Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

观察中研究观察中0 家独立报道0

答案条件化思维链会削弱大语言模型的可验证推理蒸馏

首次出现 · 2026/7/16 12:28最近活动 · 2026/7/16 12:28

论文研究一种常见的推理蒸馏补救方法:向生成器展示标准答案,再要求其生成抵达该答案的思维链。受控实验显示,这些链条会从答案反向合理化,而非独立推导;即使通过最终答案正确性筛选,训练后模型在最难竞赛题上的可验证推理准确率仍最多下降约27个百分点。损害可在训练前从无标签生成中识别,并跨教师家族迁移。

最近 24 小时事件热度

最近 24 小时暂无可用热度快照。

最近 24 小时暂无可用热度快照。

报道时间线

  1. 聚合入口arXiv 预印本7/16 12:28非独立信源代表报道
    答案条件化思维链会削弱大语言模型的可验证推理蒸馏