AI消息速览

自动化发现没有普遍优越的harness

事件日期 2026-07-20 · 学术前沿 · 已接受

事件日期2026-07-20
信息日期2026-07-20
入库日期2026-07-22
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:自动化发现没有普遍优越的harness

一句话结论

现有的自主发现系统(如OpenEvolve和TTT-Discover)不存在在所有模型-问题对上普遍优越的固定harness;应将其视为超参数,并根据任务进行在线自适应选择。

事件概述或研究问题

自主发现系统(automated discovery systems)常被当作通用harness(如OpenEvolve和TTT-Discover),但它们实际上是组合了存档策略、父代选择、探索方式和预算分配等多个设计选择的复合系统。由于发现实验成本高且随机性强,现有比较往往使用过少的独立重复试验,难以区分方法改进与运行间方差。本研究系统性地分解了这些harness的组件,并通过大规模重复试验统计检验harness的泛化能力。

方法/产品要点

  • 将OpenEvolve风格演化搜索和TTT-Discover搜索harness分解为构成组件(存档、父代选择、探索、预算分配等)。
  • 构建了30种预算匹配(budget-matched)的harness变体,在12个模型-问题对上评估。
  • 总计使用超过310万次LLM rollout,并进行重复试验统计分析。
  • 发现早期发现进展(early discovery progress)可预测最终性能,据此设计自适应分配实验:同时启动多个harness,剪枝表现差的部分运行,将计算资源重新分配给更强的幸存者。
  • 发布了所有运行池(包括每个模型-问题对的基线零分布)作为可复用的统计基础设施。

主要结果或产业意义

  • 没有固定harness在所有评估的模型-问题对上表现可靠优越(generalization problem)。
  • OpenEvolve的各种变体通常表现不如更简单的替代方案。
  • 自适应分配实验(基于早期性能在线调整)优于:①随机采样固定harness并坚持到底;②非自适应harness集成(ensemble)。
  • 结论:应转向基于早期性能的在线自适应,而非固定harness选择。

为什么重要

  • 揭示了当前自主发现系统评估中的方法论缺陷:使用过少重复试验可能导致虚假结论。
  • 提供了大规模统计基准和可复用基础设施,有助于未来harness提案的公平比较。
  • 推动从“寻找通用recipe”转向“根据具体问题与基础模型定制harness”的研究范式。
  • 与已有相关卡片(如“评估自主AI自主模型发现的实验设计方法”)相比,本卡片提供了具体的组件分解、大规模实验验证和自适应分配方案,是对该领域实验规范的实质性推进。

局限与不确定性

  • 实验仅覆盖12个模型-问题对,泛化到更多模型和任务类型需进一步验证。
  • 自适应分配的具体阈值和剪枝策略可能未充分优化,不同设置下的表现待核实。
  • 论文未详细说明各harness组件的具体实现细节(如存档大小、父代选择算法等),读者需参考原始代码或未来出版物。
  • 自主发现系统的随机性仍然很强,尽管使用了重复试验统计,但极端情况下的表现仍需谨慎解释。

可用于图书/PPT/简报的角度

  • 方法论批判:展示现有AI研究中的统计陷阱——实验重复次数不足导致的“假阳性”结论。
  • 实践指导:开发者应避免盲目套用流行harness(如OpenEvolve),而应根据自身模型和问题进行小型预实验,选择或自适应调整harness。
  • 研究趋势:从固定配方到超参数化组装,再到在线自适应——AI系统设计思路演变的一个案例。
  • 数据驱动:310万次LLM rollout构成的大规模实证,可作为教学中统计检验与方差分析的示例。

原始材料

  • 论文标题:Automated Discovery Has No Universally Superior Harness
  • arXiv ID: 2607.18235v1
  • 作者:Akshat Gupta, Jermaine Lei, Alexander Lu, Gopala Anumanchipalli, Leshem Choshen
  • 发布时间:2026-07-20
  • 类别:cs.CL, cs.AI
  • 英文关键词:Automated discovery, Harness, Generalization, Evolutionary search, LLM rollouts, Foundation model
  • 摘要URL:https://arxiv.org/abs/2607.18235v1
  • PDF URL:https://arxiv.org/pdf/2607.18235v1