该研究考察合成教材数据的收益是否来自书级组织,而不只是内容或局部改写。作者构建了从预训练语料检索、聚类、目录规划到章节组装的流水线,生成686K本教材、约32B tokens。实验显示,完整书籍组织相较拆分章节平均提升1.02,优于随机拼接与单文档改写。
最近 24 小时暂无可用热度快照。