arXiv 预印本Damien Sileo论文83
Reasoning Core:面向完成监督推理训练的广谱程序化数据设计
原标题:Reasoning Core: Designing Broad Procedural Data for Completion-Supervised Reasoning Training
程序生成器能够大规模地产生有用且可验证的推理问题,但作为完成监督微调数据所受到的关注相对较少。我们推出了 Reasoning Core,这是一个包含 50 个生成器的集合,涵盖数学、逻辑、规划、状态跟踪、形式语言、结构化数据、游戏、因果关系和代码,并配备语义评分器、难度控制机制和任务评估器。在匹配的完成监督协议下,我们在四种基础模型设置和多种训练时长中,将 Reasoning Core 与 Procedural Warmup、Reasoning Gym 和 SynLogic 进行了比较。在主要的 3B 模型对比中,Reasoning Core 在 DROP、LogiQA 和 ARC-Challenge 上取得了最高的平均分,超过了不使用程序生成数据的基线,以及其他三个程序生成数据集。任务级分析表明,仅有语义有效性并不能确保训练效用,凸显了紧凑目标和经过校准的难度等设计因素的重要性。我们开展了结合模型辅助审查、人工裁定和回归测试的审计。审计贯穿 Reasoning Core 的开发过程,并应用于其他数据集,揭示了生成、渲染、目标和评分之间存在的细微不匹配,也提醒我们,单靠程序生成并不能保证正确性。该库、生成的数据集及审计材料均已公开。
为什么值得读
程序化推理数据正成为低成本训练路径,而这项工作以对照实验和系统审计指出:覆盖面之外,目标长度、难度校准与评分一致性同样决定训练收益。
标签
Reasoning Coreprocedural datareasoning trainingcompletion supervisiondata quality3B modelsbenchmarkingopen source