知识卡片:大语言模型作为不确定性校准的优化器用于实验发现
一句话结论
本研究提出 GOLLuM(Gaussian Process Optimized LLMs)——通过高斯过程的边际似然目标训练大语言模型,使其具备校准的不确定性估计,从而能够在自然语言指导下进行跨领域实验优化;仅从 10 个低性能实验出发,即可在 23 个任务上平均排名第一。
事件概述或研究问题
实验发现(从反应优化到分子设计)面临一个共同的高成本问题:在时间和资源约束下,下一个候选应该测试什么?贝叶斯优化(BO)提供了原则性答案,但严重依赖领域专家构造的特征表示,且这些表示难以跨领域迁移。大语言模型(LLM)包含丰富的科学知识,但缺乏高利害决策所必需的不确定性校准能力。本文试图将两者结合,使 LLM 成为可靠且易用的实验优化器。
方法/产品要点
- GOLLuM 架构:将 LLM 与高斯过程(GP)联合训练,并通过 GP 的边际似然梯度微调 LLM。
- 不确定性作为学习信号:将 LLM 过度自信的缺陷转化为精确的学习信号,重塑其嵌入空间,使实验结果相近的实验在 latent space 中聚簇,从而揭示设计空间中的结构。
- 自然语言接口:先前的实验结果以自然语言描述输入,无需人工构造领域特征。
- 固定超参数、无任务特定调参:在全部 23 个任务中使用同一组超参数,从 10 个低性能(低于中位数)的实验开始。
主要结果或产业意义
- 在覆盖有机合成、材料科学、过程化学和分子设计的 23 个优化任务上,GOLLuM 平均排名第一,超越领域专用描述符、领域预训练模型和现有最先进 LLM。
- 在 Buchwald–Hartwig 反应基准上,发现高性能条件的比率达到 43%,而专家量子化学描述符和最先进 LLM 仅为 24–25%,接近翻倍。
- 与传统贝叶斯优化相比,达到相当性能所需的实验数减少超过 40%。
- 在过程化学中,相比传统 BO 有 90% 的相对改进,是提升幅度最大的领域。
- 模型自动发现了可解释的化学模式:例如在 Buchwald–Hartwig 反应中,碘化物试剂聚集在高产区域,低性能的氯化物被分离;在材料科学中识别出 Mn–Na–W 高性能催化剂区域,均无需显式领域指令。
为什么重要
本研究提出了一种新的基础模型专门化范式:不是通过更多数据,而是通过更丰富、不确定性引导的信息来训练模型。与已有相关卡片中的检索增强知识图谱、水印或测试时模型选择不同,本条目的增量在于:首次将 LLM 直接通过贝叶斯优化目标进行训练,把不确定性从 LLM 的“致命缺陷”转变为可用的学习信号,从而在实验科学中融合自然语言的易用性与概率优化的可靠性。
局限与不确定性
- 原文摘要未明确讨论方法的局限性;具体计算成本、对模型规模或超参数的敏感性、在更广泛实验场景中的泛化边界等信息待核实。
- 文中提到“从 10 个低性能实验开始”,但这是否是所有任务统一设定以及极端样本条件下的表现,需要进一步查阅正文与补充信息。
可用于图书/PPT/简报的角度
- 范式转变:用“不确定性校准”替代“更多数据”来专门化基础模型。
- 实验自动化中的可靠 AI 决策:自然语言界面 + 校准的概率判断。
- 样本效率:如何用少量失败实验启动优化并超越传统方法。
- 跨领域可迁移性:一个架构、一套超参数,覆盖反应、材料、分子、过程。
英文关键词
Large language models; uncertainty calibration; Bayesian optimization; experimental discovery; Gaussian process; GOLLuM
原始材料
- 英文标题:Large language models as uncertainty-calibrated optimizers for experimental discovery
- 来源:Nature Machine Intelligence, published online 28 August 2026
- DOI:10.1038/s42256-026-01283-z
- URL:https://www.nature.com/articles/s42256-026-01283-z