AI消息速览

PACE-Bench:动态环境中基于代码演化的物理适配评测基准

事件日期 2026-08-14 · 学术前沿 · 已接受

事件日期2026-08-14
信息日期2026-08-14
入库日期2026-08-18
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:PACE-Bench:动态环境中基于代码演化的物理适配评测基准

一句话结论

PACE-Bench 是一个基于模拟器的物理适配评测基准,通过 144 个“源环境→突变目标环境”的代码演化任务检验自进化智能体在物理规则变化后的恢复能力;当前最强方法也只能解决约三分之一的全量任务,表明该基准远未饱和,且机制重设计是核心瓶颈。

事件概述或研究问题

自进化智能体能够从交互经验中改进未来行为,但现有评测通常假设执行条件固定,未测试条件变化后的恢复能力。为填补这一空白,研究者提出 PACE-Bench,要求智能体在源环境中成功的代码设计失效后,利用诊断性沙箱反馈在有限尝试预算内将代码迭代适配到新的目标物理环境。

方法/产品要点

  • 基准结构:包含 6 个物理域、144 个源到目标适配对;每个适配对连接一个源环境和一个被“突变”的目标环境,二者拥有相同的目标和接口。
  • 任务形式:在源环境中表现良好的代码驱动设计会在目标环境中失败,智能体需要迭代修改代码,使其在目标环境中重新工作,过程中只能依赖模拟器提供的诊断性沙箱反馈。
  • 评测范围:比较了来自 4 个范式的 10 种自进化方法。
  • 资源开放:数据和代码发布于 https://github.com/thunlp/PACE-Bench。

主要结果或产业意义

  • 基准远未饱和:Reflexion + Qwen3-14B 仅在全量基准的 35.9% 适配对上成功;GPT-5.5 在完整预算下也只能解决 Statics 子集的 66.7%。
  • 方法学发现:基于模拟器验证的反思(simulator-grounded reflection)比未经验证的自我修正更可靠;记忆机制容易把智能体锚定在早期设计上,而宽泛的树搜索虽然探索充分但难以收敛。
  • 瓶颈判断:即使向智能体揭示确切的物理变化,性能上限仍未提高,说明主要困难在于“机制重设计”而非“参数推断”。

为什么重要

与已有基准(如 PAST-Bench 关注个人智能体经验保留)不同,PACE-Bench 首次将评测重心放在“物理规则动态变化后的代码级自适应”上,为自进化智能体在真实世界条件漂移场景下的可靠性提供了可量化测试。其“机制重设计才是瓶颈”的结论,有助于引导后续研究从参数微调转向结构化因果机制理解。

局限与不确定性

  • 本卡片仅基于 arXiv 摘要生成,完整的任务构造细节、基线实现、评估指标定义和计算成本尚未核实。
  • “GPT-5.5”等模型名称的具体版本、可用性与评测条件需以原文为准。
  • 摘要未提供与 PAST-Bench 等既有基准的直接对比数据,增量价值需进一步阅读全文确认。

可用于图书/PPT/简报的角度

  • 用“源环境成功→目标环境失败”的迁移场景,直观展示智能体在物理规律变化下的脆弱性。
  • 对比“自我反思 vs 记忆锚定 vs 树搜索”三种典型策略的失败模式,可作为 AI Agent 可靠性设计案例。
  • 引用“即使知道物理变化仍无法提高上限”这一反直觉发现,讨论大模型在因果机制推理上的深层局限。

原始材料

  • 英文标题:PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments
  • 英文关键词:self-evolving agents; physics adaptation; code evolution; simulator-grounded benchmark; dynamic environments
  • 来源:arXiv:2608.14441v1 [cs.AI]
  • URL: https://arxiv.org/abs/2608.14441v1
  • 数据与代码: https://github.com/thunlp/PACE-Bench