知识卡片:onepot-Bench 0——迈向实验室感知的计算机化学基准
英文标题:onepot-Bench 0: towards lab-aware in silico chemistry benchmarks
英文关键词:onepot-Bench 0; lab-aware in silico chemistry benchmarks; language models; synthetic chemistry; wet-lab execution
原始来源:arXiv:2608.02595v1;https://arxiv.org/abs/2608.02595v1
一句话结论
本文提出了 onepot-Bench 0,一个面向湿实验室执行的合成化学能力评估基准套件,由 ChemAbacus、SynthRefusal 和 SynthBench 三项互补评估组成;材料中未报告具体量化结果,模型表现待核实。
事件概述或研究问题
语言模型在实验室科学中正发挥越来越重要的作用,涉及实验规划、执行和事后分析等任务。但作者指出,精确衡量模型能力是困难的,因为科学能力同时需要问题求解技能和领域直觉。现有评估很少针对在物理实验室中做出可靠决策所需的能力,并且常常依赖可能已经出现在模型训练语料中的公共数据。为此,本文提出 onepot-Bench 0,尝试构建“实验室感知”的计算机化学基准。
方法/产品要点
onepot-Bench 0 是一个专有基准套件,包含三个互补的评估:
- ChemAbacus:测量无工具化学信息学素养和数值推理能力。
- SynthRefusal:刻画模型在面对良性、管制类及设计药物目标时的安全性和拒绝行为。
- SynthBench:使用实验室生成的私有实验数据,评估反应结果预测和催化剂选择能力。
作者表示,这些评估共同探测基本能力、可靠性和更深层知识,均为实验室可靠表现所需。
主要结果或产业意义
摘要未报告具体分数或模型排名。从设计意图看,其产业意义可能在于为湿实验室合成化学中的语言模型评估提供私有数据基准,减少公共数据污染的影响,并覆盖安全拒绝等实际场景;但具体结论待核实。
为什么重要
现有基准较多依赖公共数据,可能已被模型在训练阶段见过。onepot-Bench 0 使用实验室私有实验数据,并同时考察数值推理、安全拒绝行为和反应结果预测,有助于推动评估更贴近真实湿实验室执行需求。
与既有脉络的关系
已有相关卡片中,URSA 侧重实用逆合成评估。本文的增量在于:从逆合成扩展到更广泛的“实验室感知”能力评估,涵盖化学信息学素养、安全拒绝行为以及基于私有实验数据的反应预测,并明确针对训练数据泄漏风险。
局限与不确定性
- 基准为专有(proprietary)数据,具体数据规模、任务细节和可获取性待核实。
- 本文未报告任何定量结果,模型表现未知。
- 评估聚焦合成化学,未覆盖更广泛的实验室科学任务。
- 三个子评估的评分方式、基线和具体任务设计待核实。
可用于图书/PPT/简报的角度
- 介绍“实验室感知”的语言模型评估新思路。
- 讨论公共数据基准的污染问题,以及私有数据在评估中的价值。
- 以安全拒绝行为为例,说明实验室场景下模型可靠性评估的多维度设计。
原始材料
- 标题:onepot-Bench 0: towards lab-aware in silico chemistry benchmarks
- arXiv ID:2608.02595v1
- 作者:Brandon Wang, Andrei S. Tyrin, Daniil A. Boiko
- 发布时间:2026-08-03
- 摘要来源:https://arxiv.org/abs/2608.02595v1
- PDF 链接:https://arxiv.org/pdf/2608.02595v1