Scaling Laws for Mixture Pretraining Under Data Constraints
Apple 机器学习研究团队发布论文《Scaling Laws for Mixture Pretraining Under Data Constraints》,研究在数据受限条件下混合稀缺目标数据与丰富通用数据的预训练权衡,基于超过 2000 次语言模型训练实验。
Development
- First ReportScaling Laws for Mixture Pretraining Under Data ConstraintsApple Machine Learning Research
- Current Assessment该研究对低资源语言和专业领域模型训练具有指导意义,可能影响数据配比策略。可验证的下一信号:是否有其他实验室复现或扩展该规律,以及是否被应用于实际模型训练。Agent Pulse · analysis
Apple 机器学习研究团队发布论文《Scaling Laws for Mixture Pretraining Under Data Constraints》,研究在数据受限条件下混合稀缺目标数据与丰富通用数据的预训练权衡。论文指出,随着模型规模扩大,数据需求增长,但低资源语言或专业领域等目标数据源规模有限。常见策略是将稀缺但有价值的目标数据与丰富的通用数据混合,但存在根本权衡:目标数据过少导致模型对目标领域暴露不足,过多则导致重复示例过多,收益递减甚至过拟合。研究基于超过 2000 次语言模型训练实验,揭示了混合比例与模型性能之间的缩放规律。
该研究为数据混合比例提供了经验缩放规律,可能指导训练时如何根据目标数据稀缺程度选择最优混合比例。可验证的下一信号:论文是否公开具体缩放公式或代码,以及是否在更大规模模型上验证规律。
该研究对低资源语言和专业领域模型训练具有指导意义,可能影响数据配比策略。可验证的下一信号:是否有其他实验室复现或扩展该规律,以及是否被应用于实际模型训练。
对于依赖特定领域数据的 AI 产品,该研究可能降低数据收集成本,提升模型在目标领域的表现。可验证的下一信号:是否有企业采用该规律优化训练数据配比并报告效果。
未来可能出现更精细的数据混合策略,平衡数据稀缺与模型性能。可验证的下一信号:后续研究是否提出动态混合比例或自适应数据选择方法。