AI消息速览

EarthVerse——面向动态地球系统与自然灾害的科学智能体基准测试

事件日期 2026-08-24 · 学术前沿 · 已接受

事件日期2026-08-24
信息日期2026-08-24
入库日期2026-08-25
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:EarthVerse——面向动态地球系统与自然灾害的科学智能体基准测试

英文标题:EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards

英文关键词

EarthVerse; scientific agents; benchmark; dynamic Earth systems; natural hazards; provenance

一句话结论

EarthVerse 是一个用于评估科学智能体在动态地球系统与自然灾害场景中端到端可靠性的基准测试。它包含 405 个可复现任务,基于 199 个有记录事件和 19 类灾害;在受控工具使用协议下,25 个模型/智能体系统的最佳平均答案单元准确率达到 84.65%,但最高 Strict@95 只有 34.81%。这一差距说明当前智能体常常能完成单个步骤,却难以在证据、尺度、单位、计算和物理解释之间维持一致链条。

事件概述或研究问题

地球系统分析需要从来源、尺度、时间和模态各不相同的观测数据中重建不断变化的物理过程。自然灾害使这类分析更具现实后果:不完整的证据可能改变对灾害严重性、暴露程度和发生机制的估计。

源文没有以问句形式列出研究问题,其隐含问题是:如何评估科学智能体在动态地球系统和自然灾害场景中完成端到端科学研究的可靠性,而不只是检验最终答案是否正确。

方法/产品要点

  • 事件包级调查:EarthVerse 通过“package-scoped investigations”评估科学智能体,即每个任务围绕一个事件包展开。
  • 任务规模:405 个可复现任务,对应 199 个有记录事件、19 个灾害类别。
  • 任务要求:智能体需要检查异质事件包、选择兼容证据、执行透明计算、协调来源差异,并在最终答案中保留出处信息。
  • 可执行的基准真值:将每个任务分解为细粒度答案单元,并提供任务专属评分规则,既评估支持性研究过程,也允许多种有效路径。
  • 受控评测:在受控工具使用协议下评估 25 个模型/智能体系统,并通过受控研究定位证据获取、工具选择、记忆、推理、交互和科学执行中的失败点。

主要结果或产业意义

主要结果:在所有系统中,最佳平均答案单元准确率为 84.65%,但最高 Strict@95 仅为 34.81%。源文认为,这一差距表明当前智能体往往能完成独立步骤,却无法保持跨证据、尺度、单位、计算和物理解释的一致链。EarthVerse 为动态地球系统中的端到端科学可靠性提供了可复现的测量基础。

产业意义:原文摘要未直接讨论产业应用。从基准设计看,它对灾害风险评估、应急响应、地球观测分析等需要可追溯证据链的场景具有潜在参考价值;但该延伸判断原文未明确说明,待核实。

为什么重要

EarthVerse 把科学智能体的评估从“最终答案是否正确”扩展到“研究过程是否可审计、证据链是否一致”。它强调出处保留和透明计算,并用量化结果暴露了当前系统在端到端科学可靠性上的明显短板。

与既有脉络的关系

已有相关卡片分别关注科学思想谱系推理、企业 AI 智能体权限、多智能体辩论中的潜在目标;本条不是这些卡片的直接延续,而是新增了“动态地球系统与自然灾害”场景下的科学智能体基准。增量信息在于:以事件包为任务单位、用细粒度答案单元和 rubrics 评估过程、并在受控工具协议下量化了 84.65% 与 34.81% 之间的可靠性缺口。

局限与不确定性

  • 本卡片仅基于 arXiv 摘要 v1 生成,未涉及全文、附录或代码仓库。
  • Strict@95 的具体计算方式(例如是否要求在 95% 答案单元阈值下的严格通过率)无法从摘要确认,待核实。
  • “25 个模型/智能体系统”的具体名单、任务示例、事件包来源和评分程序细节待核实。
  • 摘要未报告各系统的分解分数、误差分布或与已有基准的对比,因此无法进一步判断性能排序的稳定性。
  • “产业意义”中的下游应用场景为延伸推断,原文未明确说明,待核实。

可用于图书/PPT/简报的角度

  • 用数字讲差距:84.65% 对 34.81%——“步骤都会,链条全断”是当前科学智能体的典型问题。
  • 把“出处”变成刚需:EarthVerse 将 provenance 保留作为任务要求,而非附加项。
  • 自然灾害是 AI 可靠性的压力测试:不完整证据会改变对严重性、暴露程度和机制估计,适合讨论真实世界中的不确定性。
  • 基准测试设计亮点:事件包、可执行基准真值、细粒度答案单元、任务专属 rubrics、受控工具使用协议。

原始材料

  • 英文标题:EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards
  • 作者:Zhiqing Cui, Xinxiang Yin, Yihong Tang, Xinglang Zhang, Yuanzhe Hu, Siru Zhong, Weidong Tang, Yuxuan Liang, Weijia Li, Ming Jin, Shirui Pan, Yuhao Kang, Dingyi Zhuang, Jinhua Zhao
  • arXiv ID:2608.23525v1
  • Primary category:cs.AI
  • Published:2026-08-24
  • 原始来源:https://arxiv.org/abs/2608.23525v1