知识卡片:用 ProteinDPO 将蛋白质生成模型对齐到实验适应度
英文标题:Aligning protein-generative models to experimental fitness with ProteinDPO
英文关键词:ProteinDPO; direct preference optimization; structure-conditioned protein language model; protein stability; ESM-IF1; Megascale; hemagglutinin trimer
一句话结论
直接偏好优化(DPO)可以把一个无监督的结构条件蛋白语言模型(ESM-IF1)对齐到实验稳定性数据,得到 ProteinDPO。它在稳定性打分上优于无监督原版和监督微调(SFT)版,且能推广到大型复合物结合亲和力预测及流感血凝素三聚体稳定化。
事件概述或研究问题
无监督蛋白质生成模型可以在没有任务特定标签的情况下预测功能,但通常不如任务专用模型。作者将这种现象归因于“对齐差距”(alignment gap):无监督训练学到的规则与用户关心的功能不一致。
一个常见解法是监督微调(SFT),但 SFT 只在正样本上最大化似然,容易过拟合微调数据,丢失预训练时学到的通用知识。本文尝试用 DPO 将实验适应度信息注入生成模型,同时尽量保留模型的通用生成能力。
方法/产品要点
- 基座模型:ESM-IF1,一个结构条件的“逆折叠”语言模型,以蛋白质骨架为条件生成氨基酸序列。
- 训练数据:来自 Megascale 稳定性数据集。原始约 184 万序列变异、479 个蛋白结构域;过滤不可靠的 ΔΔG 测量,并用 FoldSeek 以 0.5 相似度阈值做结构聚类以减轻训练/评估数据泄漏后,最终约 66 万条测量、403 个结构域。
- DPO 适配方式:把蛋白质骨架当作 prompt,序列生成当作 response,实验稳定性测量当作 preference。
- 训练目标:使用已有的 paired 和 ranked DPO 目标,并新提出一种直接利用标量标签的 weighted DPO 目标。
- 对照模型:无监督的 ESM-IF1、在稳定变异(ΔΔG < 0)上 SFT 的 ESM-IF1、ProteinDPO。
主要结果或产业意义
- 稳定性打分提升:ProteinDPO 的 ΔΔG 打分相关性强于无监督和 SFT 版本。Pearson R 为 0.72–0.73,Spearman ρ 为 0.69–0.72;无监督 ESM-IF1 为 0.55/0.53,SFT 版为 0.59/0.57。AUROC 也呈现同样趋势,但 ProteinDPO 的具体 AUROC 数值因正文摘录截断,待核实。
- 泛化能力:尽管只在小型单体蛋白的一两个替换的相对稳定性变化上训练,ProteinDPO 可以推广到大型多链蛋白复合物的结合亲和力打分、高度多样且长度可变的抗体热稳定性预测。
- 流感疫苗相关应用:将 ProteinDPO 用于 H5N1 流感血凝素(HA)预融合构象的稳定化。仅设计 45 个变异,就找到 27 个稳定化变体,最高熔解温度提升 17°C,并保留广谱中和抗体结合能力。
- 对新发毒株的响应:对 2024 年出现的哺乳动物相关毒株,最高可实现 32°C 的熔解温度提升。摘要还提到约 80% 的设计达到与天然 HA 相似或更高的稳定性。
- 产业意义:HA 预融合构象不稳定、难三聚化,是疫苗开发的重要瓶颈。ProteinDPO 提供了一种快速响应新发禽流感/哺乳动物传播毒株的抗原稳定化路径。
为什么重要
DPO 为蛋白质生成模型提供了一种相对轻量的对齐方案:不需要为每个任务从头训练专用监督模型,也不像 SFT 那样容易丢失预训练知识。通过把实验测量到的“适应度”作为偏好信号,可以将生物物理信息直接注入生成模型。作者提出,这不只是针对稳定性,而是为生物基础模型的对齐提供了一个通用框架。
与既有脉络的关系:已有相关卡片分别涉及晶体材料生成(强化学习/GRPO)、人形机器人世界模型、文本到图像模型的稠密预测。本条在“给生成模型注入外部偏好或奖励”这一脉络上,提供了蛋白质设计领域的 DPO 实例。增量信息在于:以结构为 prompt、序列为 response、实验稳定性为 preference 的适配方式,以及在 H5N1 血凝素上 45 个设计中有 27 个稳定化变体等可量化结果。
局限与不确定性
- ProteinDPO 在 AUROC 对比中的具体数值因摘录截断,待核实。
- 新提出的 weighted DPO 目标的具体公式、超参数和训练细节需核对原文 Methods,当前材料中未完整展开,待核实。
- 对大型复合物结合亲和力、抗体热稳定性的提升,材料只给出方向性结论,未提供完整数值,待核实。
- HA 稳定化中的“27/45 个稳定化变体”“17°C/32°C 提升”来自论文正文/摘要,但实验验证流程的完整细节未在摘录中展开,如需引用建议核对全文。
可用于图书/PPT/简报的角度
- 类比:如同用人类偏好让大语言模型变得有用,ProteinDPO 用实验稳定性偏好让蛋白质生成模型变得有用。
- 简洁链条:约 66 万条高质量变异数据 → 45 个 HA 设计 → 27 个稳定化变体 → 最高 17°C/32°C 熔解温度提升。
- 概念图:骨架结构(prompt)→ 序列生成(response)→ ΔΔG 实验测量(preference)。
- 公卫叙事:AI 生成模型可以快速响应新出现病原体,用于疫苗抗原稳定化。
原始材料
- 英文标题:Aligning protein-generative models to experimental fitness with ProteinDPO
- 来源:Widatalla, T. et al. Nature Methods (2026). Published online 14 August 2026.
- DOI:10.1038/s41592-026-03137-3
- URL:https://www.nature.com/articles/s41592-026-03137-3
- 开放获取:该文章为 Open access。