AI消息速览

用NVIDIA BioNeMo Agent Toolkit加速端到端共折叠性能

事件日期 2026-07-11 · 产业观察 · 已接受

事件日期2026-07-11
信息日期2026-07-11
入库日期2026-07-11
通道产业观察
状态已接受
来源NVIDIA 博客

知识卡片:用NVIDIA BioNeMo Agent Toolkit加速端到端共折叠性能

一句话结论

NVIDIA 推出了集成 GPU MSA、cuEquivariance 加速推理、OpenFold3 NIM 和 Fold-CP 多GPU扩展的端到端加速方案,并通过 BioNeMo Agent Toolkit 以智能体工作流的形式编排,显著提升了生物分子结构预测管道(特别是共折叠模型)的速度和规模。

事件概述或研究问题

生物分子结构预测和共折叠模型(如 OpenFold3)已成为药物发现和蛋白质设计的主流大规模工作负载。其端到端流程包括:多序列比对生成、共折叠推理、模型服务和多GPU扩展。传统的CPU处理MSA和单GPU内存限制成为性能瓶颈,阻碍了虚拟筛选和大分子复合物(如核糖体级别)预测等应用。

方法/产品要点

  1. GPU MSA(MMseqs2-GPU):将同源搜索从 CPU 移至 GPU,在 NVIDIA Hopper 和 Blackwell 架构上实现比 CPU JackHMMER 快 177 倍的 MSA 生成速度。优化已贡献至开源 MMseqs2 仓库。
  2. cuEquivariance + OpenFold3 NIM
    • cuEquivariance 库优化了共折叠中的三角注意力、三角乘法和注意力对偏置内核,在 B300 GPU 上实现最多 3.1 倍的前向传播加速,并将单GPU最大序列长度从约 1.5-2.5k tokens 扩展到约 5.9k tokens。
    • OpenFold3 NIM 在此基础上应用进一步推理优化,在单张 B300 GPU 上达到约 6,400 tokens 的序列长度。
  3. Fold-CP (上下文并行):一种新的并行化技术,使每GPU内存需求降至 O(N²/P),在 64 张 B300 GPU 上使用 Boltz-2 模型可达 32,000 tokens(约单GPU限制的 12 倍),使核糖体规模复合物的预测变得可行。
  4. BioNeMo Agent Toolkit:通过智能体(如 Claude Code)无缝编排上述工具,允许用户通过自然语言指令(如“为 target.fasta 序列构建 MSA”、“折叠 target.fasta”)触发整个流程。

主要结果或产业意义

  • 速度提升:MMseqs2-GPU 实现 177 倍 MSA 加速;cuEquivariance 实现最高 3.1 倍推理加速;完整优化的 OpenFold3 NIM 在 B300 上实现 4 倍以上的端到端折叠加速。
  • 规模突破:Fold-CP 将可预测复合物大小从单GPU的数千残基扩展到 64 GPU 上的 32,000 tokens,解锁了之前难以处理的结构生物学问题(如核糖体、剪接体)。
  • 应用变革:使原本仅用于药物发现后期的高精度结构预测方法可以更早、更大规模地应用于虚拟筛选,提升命中物的质量和多样性。

为什么重要

这些加速将结构预测从吞吐量改进转变为质的飞跃,使研究人员能够提出并解答过去因计算成本或内存限制而无法触及的结构生物学问题。通过开源集成和智能体 API,加速了计算预测转化为生物学洞察和新药发现的进程。

局限与不确定性

  • AI 生成的内容可能不完整地总结信息(来源声明)。
  • build.nvidia.com 的 API 端点不适合处理大规模请求,会超时;大规模工作负载推荐自托管 NIM。
  • 文章中提到的 B300 GPU(Blackwell Ultra)及其具体性能数据(如 6,400 tokens、32,000 tokens)为特定硬件与软件组合下的测试结果,实际效果可能因工作负载、软件版本和集群配置而异。
  • Fold-CP 目前以 Boltz-2 模型为例,在其他模型(如 OpenFold3)上的集成和性能有待进一步确认。

可用于图书/PPT/简报的角度

  1. AI智能体驱动科学工作流:展示 BioNeMo Agent Toolkit 如何将复杂的多步骤生物信息学管道(MSA→推理→扩展)简化成对智能体的自然语言指令。
  2. GPU加速的“不可能三角”解决:在速度(177x MSA, 3-4x 推理)、规模(32k tokens)和易用性(智能体编排)三个维度上同时取得突破。
  3. 药物发现新范式:强调从“后期验证”到“早期/大规模筛选”的结构预测应用模式转变。
  4. 硬件+软件+系统的全栈优化:从 GPU 指令(DPX)、CUDA 库(cuEquivariance)、模型优化(NIM)到系统级并行(Fold-CP),整体展示 NVIDIA 的全栈能力。

原始材料

URL: https://developer.nvidia.com/blog/accelerating-end-to-end-co-folding-performance-with-nvidia-bionemo-agent-toolkit

英文关键词: Agent, BioNeMo, OpenFold3, MSA, cuEquivariance, Fold-CP, Co-folding, Drug Discovery