AI消息速览

面向机器学习工程的AI4AI递归自我改进系统Frontis-MA1与OpenMLE

事件日期 2026-07-30 · 学术前沿 · 已接受

事件日期2026-07-30
信息日期2026-07-30
入库日期2026-08-01
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:面向机器学习工程的AI4AI递归自我改进系统Frontis-MA1与OpenMLE

英文标题:Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

英文关键词:recursive self-improvement; AI4AI; machine learning engineering; OpenMLE; Frontis-MA1

一句话结论:该论文提出了开源全栈系统OpenMLE,并后训练出Frontis-MA1(35B)作为机器学习工程中的“元演化智能体”,将Draft、Improve、Debug、Crossover四个程序演化操作符与长程搜索结合,在MLE-Bench Lite上显著提升Medal Average,并发布模型权重与代码,为可复现的AI4AI/RSI研究提供了可执行测试床。

事件概述或研究问题:递归自我改进(RSI)要求AI系统改进构建AI的过程(即AI4AI);机器学习工程(MLE)为此提供了可验证、可执行的测试床。该工作尝试将RSI从概念讨论推进到可运行的系统层面,构建了OpenMLE全栈系统,并训练Frontis-MA1作为MLE领域的元演化智能体。

方法/产品要点

  • OpenMLE由三部分组成:OpenMLE-Gym(带执行反馈的可验证任务环境)、OpenMLE-RL(操作符学习)、OpenMLE-Evo(长程搜索)。
  • Frontis-MA1(35B)在OpenMLE上后训练,将后训练与推理统一到四个原子程序演化操作符上:Draft(草稿)、Improve(改进)、Debug(调试)、Crossover(交叉)。
  • 四个操作符通过基于执行结果的SFT(监督微调)和RL(强化学习)训练;训练数据与所有评估基准进行去重(原文声明)。
  • 这些操作符进一步组合为长程搜索,在单一循环中耦合“学习”与“演化”。
  • OpenMLE-Evo-Max引入了与基准无关的经验先验和异步搜索机制(具体实现细节原文未展开)。

主要结果或产业意义

  • 在MLE-Bench Lite上,每任务12小时预算、单张RTX 4090且显存上限12 GB的条件下:使用OpenMLE-Evo时,Frontis-MA1(35B)相对其基础模型将Medal Average从39.39%提升到60.61%;使用OpenMLE-Evo-Max达到71.21%。
  • 上述配置超过了GPT-5.5 + Codex,接近GPT-5.6 Sol和2.8T Kimi K3(对比条件细节待核实)。
  • 在留出的NatureBench Lite上,两个组件均表现出可迁移性:固定框架,仅将基础模型换成训练后的模型,Match-SOTA从50%提高到70%;固定模型,仅将框架换为OpenMLE-Evo,Match-SOTA从20%提高到50%。
  • 该论文发布了模型权重和完整OpenMLE栈,便于其他研究者复现和继续推进可执行的AI4AI研究。

为什么重要:该工作是RSI研究从分类学/概念框架走向可执行开放系统的一个重要实证步骤。与已有相关卡片中“有界自我精炼 vs 开放式递归自我改进”的分类学相比,本条提供了具体的系统实现、训练流程和量化评估,展示了“学习+演化”闭环在机器学习工程任务上可落地并带来显著提升。

局限与不确定性

  • 基础模型(base model)的具体身份原文未说明,待核实。
  • OpenMLE-Evo-Max中“与基准无关的经验先验”和“异步搜索”的具体机制原文未展开,待核实。
  • NatureBench Lite的任务构成和“Match-SOTA”指标的具体定义待核实。
  • 与GPT-5.5/Codex、GPT-5.6 Sol、2.8T Kimi K3的比较条件(如是否相同预算、推理开销等)待核实。
  • 论文未提及基线是否使用相同推理预算、训练数据规模,以及模型在其他基准上的泛化表现,待核实。
  • 原文未说明是否经过同行评议。

可用于图书/PPT/简报的角度

  • 以“AI如何改进AI”为主题,介绍一个开源AI4AI系统的完整设计:环境、操作符学习、长程搜索。
  • 作为“递归自我改进从概念到工程”的案例,说明如何用可验证的机器学习任务测试RSI能力。
  • 在智能体/自动化ML的讲解中,可引用其“操作符化”思路(Draft/Improve/Debug/Crossover)作为智能体设计的替代范式。
  • 在图表制作中,可对比39.39%→60.61%→71.21%的阶梯式提升,并注明资源约束(12小时、单RTX 4090、12 GB显存)。

与既有脉络的关系:该卡片是对“AI中的递归自我改进:从有界自我精炼到自主研究循环”一文的延续和更新:前文从文献分析中提炼出RSI分类学与验证层级,本条则给出一个可下载、可复现的系统实现,将“自我评估/执行反馈”落地为带执行反馈的AI4AI测试床,并用基准分数验证了训练后模型与搜索框架各自的贡献。

原始材料

  • 英文标题:Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
  • 作者:Junlin Yang, Che Jiang, Yu Fu, Tianwei Luo, Can Ren, Weizhi Wang, Kaikai Zhao, Hongyi Liu, Yuxin Zuo, Yuru Wang, Yuchen Fan, Kai Tian, Zhenzhao Yuan, Xiaojian Lin, Li Sheng, Rushi Qiang, Guoli Jia, Xingtai Lv, Ermo Hua, Dianqiao Lei, Youbang Sun, Ning Ding, Bowen Zhou, Kaiyan Zhang
  • 发布/更新:2026-07-30
  • arXiv: https://arxiv.org/abs/2607.28568v1
  • PDF: https://arxiv.org/pdf/2607.28568v1
  • 代码:https://github.com/FrontisAI/OpenRSI