AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Jul 27, 2026 · DataOrchestra

DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data

What Happened

DataOrchestra 是一个统一不同处理操作并为每个预训练数据示例编排特定管线的框架。它通过一个编排器决定是否丢弃、保留或清洗每个数据块;对于需要清洗的块,选择从程序化编辑到基于 LLM 重写的下游操作,并为每个重写步骤生成具体指令。从零开始使用 DataOrchestra 处理网络数据预训练 0.5B 到 7B 模型,在 11 个基准上观察到相对于单个数据处理方法的稳定平均增益。DataOrchestra 在数学继续预训练中也有效,并减少了处理计算量。

EVENT STORY

Development

  1. First ReportDataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining DataarXiv cs.AI
  2. Current AssessmentDataOrchestra 代表了数据预处理从粗粒度(语料库级)向细粒度(示例级)的演进趋势。当前业界主流方法如 C4、RefinedWeb 等采用固定规则或简单过滤,而 DataOrchestra 证明了动态编排的可行性。这可能会推动数据工程团队重新设计预处理管线,从规则驱动转向模型驱动。下一可验证信号:是否有主流预训练团队(如 Meta、Google)采用类似方法或发布相关工具。Agent Pulse · analysis
What Changed

DataOrchestra 提出了一种为每个预训练数据示例动态编排处理管线的方法。与现有方法在语料库或领域级别应用固定处理策略不同,DataOrchestra 的编排器针对每个数据块决定丢弃、保留或清洗。对于需要清洗的块,它选择程序化编辑或基于 LLM 的重写等下游操作,并为每个重写步骤生成具体指令。实验表明,使用 DataOrchestra 从零预训练的 0.5B 到 7B 模型在 11 个基准上平均优于单个处理方法,且在数学继续预训练中表现更好,同时通过跳过不必要的下游操作降低了处理计算成本。

How the Capability Boundary Shifted

DataOrchestra 的核心创新在于将数据清洗从固定流水线转变为示例级别的动态编排。其编排器是一个可学习的模型,能够根据数据块内容决定操作序列,这类似于在数据预处理中引入 Mixture of Experts 思想。关键设计包括:1) 统一了丢弃、保留、清洗三类操作;2) 清洗操作可组合程序化编辑和 LLM 重写;3) 为 LLM 重写步骤生成具体指令。这种动态编排在 0.5B-7B 模型上均带来稳定收益,表明示例级自适应预处理可能成为未来预训练流程的标准组件。下一可验证信号:是否有更大规模模型(如 13B+)或更多领域(如代码、多模态)的复现结果。

Why It Matters

DataOrchestra 代表了数据预处理从粗粒度(语料库级)向细粒度(示例级)的演进趋势。当前业界主流方法如 C4、RefinedWeb 等采用固定规则或简单过滤,而 DataOrchestra 证明了动态编排的可行性。这可能会推动数据工程团队重新设计预处理管线,从规则驱动转向模型驱动。下一可验证信号:是否有主流预训练团队(如 Meta、Google)采用类似方法或发布相关工具。

Who It Affects

DataOrchestra 通过减少不必要的下游操作降低了预处理计算成本,同时提升了模型性能。对于预训练成本高昂的大模型团队,这意味着在相同预算下可以获得更好的模型质量,或通过减少计算量节省成本。此外,动态编排的灵活性可能降低数据清洗的人工干预需求,加速数据迭代周期。下一可验证信号:是否有第三方复现或将其集成到开源数据预处理工具中。

What to Watch Next

DataOrchestra 为数据预处理提供了一个可学习的编排框架,未来可能的发展方向包括:1) 编排器与预训练模型联合训练,实现端到端优化;2) 扩展到多模态数据(图像、视频)的预处理;3) 结合数据质量评估模型,实现更精细的丢弃/保留决策。下一可验证信号:是否有后续工作将编排器扩展到多模态或联合训练场景。