Reasoning Core: Designing Broad Procedural Data for Completion-Supervised Reasoning Training
Reasoning Core 是一个包含 50 个生成器的程序化数据集合,覆盖数学、逻辑、规划、状态跟踪、形式语言、结构化数据、游戏、因果和代码,并配有语义评分器、难度控制和任务评估器。在匹配的完成监督协议下,与 Procedural Warmup、Reasoning Gym 和 SynLogic 在四种基础模型设置和多种训练时长下进行比较。在主要的 3B 比较中,Reasoning Core 在 DROP、LogiQA 和 ARC-Challenge 上取得了最高平均分,超过了无程序化数据的基线和所有三个替代程序化集合。任务级分析表明,语义有效性本身并不能确保训练效用,紧凑的目标和校准的难度是重要的设计因素。
发展脉络
- 首次出现Reasoning Core: Designing Broad Procedural Data for Completion-Supervised Reasoning TrainingarXiv cs.CL
- 当前判断程序化数据生成正成为推理训练数据的重要来源,但设计需关注目标紧凑性和难度校准。Reasoning Core 的审计流程揭示了生成、渲染和评分之间的不匹配,提示数据质量验证的重要性。Agent Pulse · 分析
Reasoning Core 论文提出了一种程序化数据生成方法,用于完成监督的推理训练。作者引入了 50 个生成器,涵盖多种推理类型,并配备了语义评分器、难度控制和任务评估器。在匹配的完成监督协议下,他们比较了 Reasoning Core 与 Procedural Warmup、Reasoning Gym 和 SynLogic,在四种基础模型设置和多种训练时长下进行。在主要的 3B 比较中,Reasoning Core 在 DROP、LogiQA 和 ARC-Challenge 上取得了最高平均分,超过了无程序化数据的基线和所有三个替代程序化集合。任务级分析表明,语义有效性本身并不能确保训练效用,紧凑的目标和校准的难度是重要的设计因素。作者还进行了结合模型辅助审查、人工裁决和回归测试的审计,揭示了生成、渲染和评分之间的细微不匹配。
程序化数据生成器可以大规模产生可验证的推理问题,但作为完成监督微调的数据,其效用取决于目标紧凑性和难度校准,而非仅语义有效性。Reasoning Core 在 3B 模型上优于其他程序化集合,表明精心设计的程序化数据能提升推理基准性能。
程序化数据生成正成为推理训练数据的重要来源,但设计需关注目标紧凑性和难度校准。Reasoning Core 的审计流程揭示了生成、渲染和评分之间的不匹配,提示数据质量验证的重要性。
程序化数据生成可降低人工标注成本,提供可扩展的训练数据,提升模型推理能力,对 AI 训练数据供应商和模型开发者具有商业价值。
未来可验证程序化数据在更大模型和更多任务上的扩展性,以及自动化审计流程的改进。