知识卡片:RxnCLF——对比变换感知的反应基础模型
英文标题:RxnCLF: Contrastive Transformation-Aware Reaction Foundation Model for Improved Reactivity Prediction
英文关键词:reaction foundation model; contrastive learning; condensed reaction graph; yield prediction; reactivity prediction
原始来源:https://arxiv.org/abs/2608.06259v1
一句话结论
RxnCLF 是一个基于“浓缩反应图”(Condensed Reaction Graph, CRG)的自监督对比学习反应基础模型,在 170 万条 Pistachio 反应数据上预训练,能够在多个反应产率预测基准上优于图基与序列基线,并学习到具有变换感知性和化学可解释性的反应表示。
事件概述或研究问题
反应产率预测仍然面临两个主要困难:标注数据稀缺,以及反应空间组合规模巨大且分布稀疏。现有的字符串、指纹和图基反应编码只能部分捕捉化学变换,对于复杂底物的反应,预测准确率受限。RxnCLF 旨在通过自监督对比学习框架,让模型学习更完整的“化学变换”结构,从而改进反应性的预测。
方法/产品要点
- 提出 RxnCLF,一种用于反应表示学习的自监督对比学习框架。
- 核心是浓缩反应图(CRG),将反应物和产物信息统一到单个图中,使模型学习显式且丰富的变换结构,而非将反应物与产物视为断开图。
- 在 170 万条 Pistachio 反应上进行预训练,学习紧凑且连续的潜在表示空间。
- 学到的表示同时捕捉反应中心特征和更广泛的侧链上下文,具有“变换感知”特性,并保持化学可解释性。
- 在下游产率预测任务上,针对多个基准数据集进行微调。
主要结果或产业意义
在多个产率预测基准上,包括 Buchwald-Hartwig 偶联、Pd 催化的 BH 偶联,以及专有的 HTE C-N 偶联和酰胺形成数据集,RxnCLF 一致优于图和序列基线,并在 R² 指标上实现提升,整体达到最佳性能。摘要指出,CRG-based RxnCLF 有望成为可扩展的反应基础模型,并可能推广到更广泛的反应空间,支持区域选择性预测、对映选择性预测和反应条件优化等下游反应信息学任务。
为什么重要
RxnCLF 的直接价值在于改善了反应表示学习:它不像传统编码那样把反应物和产物分割开,而是用单一图结构表达“从反应物到产物”的变换本身。该方法利用自监督学习从大量无标注反应数据中获取表示,缓解了标注数据稀缺的问题。与已有的三张相关卡片相比,本卡片聚焦于化学和反应基础模型,不涉及大语言模型预算分配、人形机器人行为基础模型或多模态图基础模型的零样本迁移,属于基础模型在科学领域的新应用。
局限与不确定性
- 摘要未给出具体的 R² 数值提升幅度,也未列出所有基线模型名称,具体性能对比细节待核实。
- 预训练所用 Pistachio 反应数据集的具体版本、清洗和去重方式待核实。
- 对“更广泛反应空间”的泛化能力在摘要中为期望性表述,尚未有完全公开的大规模验证证据。
- 专有 HTE 数据集细节未公开,外部复现和横向比较存在不确定性。
- CRG 构建方式、对比学习损失函数等实现细节在摘要中未展开,需查阅全文确认。
可用于图书/PPT/简报的角度
- 化学反应产率预测的瓶颈:标注稀缺 vs. 反应空间巨大。
- 为什么传统反应表示不够“变换感知”。
- 用统一图结构表达反应:浓缩反应图 CRG 的思路。
- 自监督对比学习如何帮助构建化学基础模型。
- 从 Buchwald-Hartwig 等基准看 RxnCLF 的性能提升。
- 反应基础模型对下游化学信息学任务的潜在支撑。
与既有脉络的关系
本条与已有相关卡片没有重复陈述同一事实。已有卡片分别涉及大语言模型预算分配、人形机器人行为基础模型、多模态图基础模型零样本迁移;本条新增的内容是:将自监督对比学习与浓缩反应图结合,构建面向反应性预测的化学基础模型。
原始材料
- 标题:RxnCLF: Contrastive Transformation-Aware Reaction Foundation Model for Improved Reactivity Prediction
- arXiv ID:2608.06259v1
- 作者:Yiting Zheng, Cheng Fang, Anthony Donofrio, Haote Li
- 提交时间:2026-08-06T16:51:23Z
- 主分类:cs.LG
- URL:https://arxiv.org/abs/2608.06259v1