Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
Frontis-MA1 (35B) 是一个后训练的元进化智能体,用于机器学习工程(MLE),基于 OpenMLE 全栈系统(包括 OpenMLE-Gym、OpenMLE-RL、OpenMLE-Evo)进行训练。在 MLE-Bench Lite 上,使用单张 RTX 4090(12 GB VRAM)和 12 小时预算,Frontis-MA1 将 Medal Average 从 39.39% 提升到 60.61%(使用 OpenMLE-Evo),并达到 71.21%(使用 OpenMLE-Evo-Max),超过 GPT-5.5 + Codex,接近 GPT-5.6 Sol。
发展脉络
- 首次出现Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning EngineeringarXiv cs.CL
- 当前判断该工作表明,针对特定领域(如 MLE)的自我改进模型可能成为提升 AI 系统能力的重要方向。通过开放全栈系统(OpenMLE)和基准(MLE-Bench Lite),研究社区可以复现和比较不同方法,这可能加速 AI4AI 领域的发展。同时,Frontis-MA1 在单张消费级 GPU 上达到的性能表明,递归自我改进可能不需要超大规模计算资源,这降低了研究门槛。Agent Pulse · 分析
该论文介绍了 OpenMLE,一个用于递归自我改进(RSI)研究的开放全栈系统,涵盖可验证任务环境(OpenMLE-Gym)、操作符学习(OpenMLE-RL)和长时程搜索(OpenMLE-Evo)。在此之上,作者后训练了 Frontis-MA1(35B)作为 MLE 的元进化智能体,围绕四个原子程序进化操作符(Draft、Improve、Debug、Crossover)对齐后训练和推理。这些操作符通过执行接地 SFT 和 RL 进行训练,数据针对所有评估基准去重,然后组合成长时程搜索,将学习和进化耦合在单一循环中。在 MLE-Bench Lite 上,Frontis-MA1 在单张 RTX 4090(12 GB VRAM)上以 12 小时预算将 Medal Average 从 39.39% 提升到 60.61%(使用 OpenMLE-Evo),并达到 71.21%(使用 OpenMLE-Evo-Max),超过 GPT-5.5 + Codex,接近 GPT-5.6 Sol。
Frontis-MA1 展示了将程序进化操作符(Draft、Improve、Debug、Crossover)作为训练目标,并通过执行反馈进行强化学习,能够显著提升模型在机器学习工程任务上的表现。其关键设计在于将学习和进化耦合在单一循环中,使得模型在推理时能够进行长时程搜索,从而在有限资源下实现性能提升。这暗示了将进化算法与语言模型后训练结合可能是一种有效的递归自我改进路径。
该工作表明,针对特定领域(如 MLE)的自我改进模型可能成为提升 AI 系统能力的重要方向。通过开放全栈系统(OpenMLE)和基准(MLE-Bench Lite),研究社区可以复现和比较不同方法,这可能加速 AI4AI 领域的发展。同时,Frontis-MA1 在单张消费级 GPU 上达到的性能表明,递归自我改进可能不需要超大规模计算资源,这降低了研究门槛。
对于 AI 公司,Frontis-MA1 展示了在有限硬件上通过自我改进提升模型能力的可能性,这可能降低模型迭代成本。OpenMLE 作为开放系统,可能成为 MLE 任务的标准测试平台,影响相关工具链和评估基准的生态。对于提供 AI 开发工具或平台的企业,关注此类自我改进模型可能带来新的产品机会。
下一步可验证的信号包括:OpenMLE 系统是否被其他研究团队采用并复现结果;Frontis-MA1 在更广泛的任务(如完整 MLE-Bench)上的表现;以及该训练方法是否扩展到其他领域(如代码生成或数据分析)。此外,观察是否出现基于该方法的商业产品或开源社区。