该工作提出 Structured Thoughts,将长推理交替组织为 <try> 探索与 <outcome> 结论,并据此构建重格式化训练数据。作者报告,微调基础模型后推理基准最高提升 8.08%;裁剪每轮已总结的 <try> 后,数学任务平均节省 85% 上下文或内存,但性能下降 8.67%。
最近 24 小时暂无可用热度快照。