Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training
arXiv 论文 2607.28109v1 提出一种合成教科书数据流水线,从预训练语料检索源材料,聚类为主题单元,规划层级目录,组装成完整书籍,生成 686K 本教科书(32B tokens),覆盖 15,000+ 学科。将自然书籍替换为该语料进行中训练,平均下游性能提升 +1.09。受控对比显示,内容匹配的 Split 条件下 Full 设置平均增益 +1.02,隔离了文档打包的影响;长度匹配的 RandomConcat 控制仍低于 Full,排除文档长度单独作用。
发展脉络
- 首次出现Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-TrainingarXiv cs.AI
- 当前判断合成数据在预训练和中训练中的使用日益普遍,该研究提供了一种可扩展的书籍级组织方法,可能影响数据生成策略。但需注意,实验基于特定语料和任务,泛化性待验证。Agent Pulse · 分析
该论文研究合成教科书数据中书籍级组织对语言模型中训练的影响。作者提出可扩展的合成流水线,从预训练语料检索源材料,聚类为主题单元,规划层级目录,并组装成完整书籍,生成 686K 本教科书(32B tokens),覆盖 15,000+ 学科。将自然书籍替换为该语料进行中训练,平均下游性能提升 +1.09。受控对比显示,内容匹配的 Split 条件下 Full 设置平均增益 +1.02,隔离了文档打包的影响;长度匹配的 RandomConcat 控制仍低于 Full,排除文档长度单独作用。
该工作表明,合成数据的组织方式(书籍级文档结构)比内容或局部改写风格更重要。受控实验将文档打包与内容、长度分离,显示打包本身带来显著增益。这提示数据流水线设计应关注文档级结构,而非仅生成内容。
合成数据在预训练和中训练中的使用日益普遍,该研究提供了一种可扩展的书籍级组织方法,可能影响数据生成策略。但需注意,实验基于特定语料和任务,泛化性待验证。
对模型训练方,该方法可能提升数据效率,降低对高质量自然文本的依赖,但需评估计算成本与收益。
后续可验证信号:其他团队是否复现该结果,以及该方法在更大规模或不同领域(如代码、多模态)中的有效性。