AI消息速览

NVIDIA Vera CPU提升AI工厂吞吐量以加速智能体工作负载

事件日期 2026-07-08 · 产业观察 · 已接受

事件日期2026-07-08
信息日期2026-07-08
入库日期2026-07-08
通道产业观察
状态已接受
来源NVIDIA 博客

知识卡片:NVIDIA Vera CPU提升AI工厂吞吐量以加速智能体工作负载

英文标题(保留):Excerpt from NVIDIA Vera CPU Boosts AI Factory Throughput to Accelerate Agentic Workloads

英文关键词(保留):Agentic AI, RL (Reinforcement Learning), Vera CPU, AI Factory, Throughput, Per-core Performance


一句话结论

NVIDIA Vera CPU通过提升全负载下的持续单核性能(1.8倍于基线CPU),解决了智能体(Agentic)工作流中CPU侧的瓶颈,从而显著提高强化学习训练效率、减少推理延迟并最大化GPU利用率,直接加速了整个AI工厂的吞吐量。

事件概述

本文探讨了在智能体AI系统中,CPU性能对端到端AI工厂吞吐量的关键影响。随着多步骤推理、工具调用、代码执行等CPU侧工作成为智能体工作流的关键路径,传统的CPU成为瓶颈。NVIDIA推出了Vera CPU架构,旨在通过优化的单核性能和能效,提升智能体训练和部署的效率。

方法/产品要点

  • 核心架构:采用带有88个Olympus核心的单片计算芯片,配备统一缓存和可扩展一致性结构(SCF)。
  • 性能优势
    • 1.8倍更快的持续单核性能:在全插座负载下,相比基线CPU,能完成更多顺序性、分支密集的CPU任务(如环境模拟、奖励逻辑)。
    • 40%更低的峰值加载延迟:避免了多芯片设计中常见的性能下降问题,确保延迟可预测。
    • 超过3倍的每核内存带宽:采用LPDDR5x内存,提供高达1.2 TB/s的总内存带宽,功耗不到传统数据中心CPU的一半。
  • 关键特性:包括神经分支预测器、10宽解码前端、深度乱序执行和NVIDIA空间多线程技术,专门针对RL和代理执行的复杂控制流进行了优化。

主要结果

  • 强化学习训练:Vera CPU使85%的环境评估能在训练窗口内完成(基线CPU仅为45%),提供了更丰富、更高质量的RL训练信号,从而加速模型收敛。
  • 推理与部署:更快的CPU处理速度缩短了代理在GPU步骤之间的等待时间,减少了KV-Cache被逐出的风险,从而提升了GPU执行有用token生成的效率。
  • 能效:在提供更高性能的同时,功耗不到传统x86数据中心CPU的一半。

为什么重要

智能体AI的核心是将模型推理转化为行动,这依赖于大量CPU侧的顺序计算。Vera CPU直接解决了在此类工作负载中CPU成为瓶颈的问题。它表明,在AI工厂中,CPU已不再是背景基础设施,而是决定GPU利用率、系统响应速度和用户服务等级协议(SLA)的关键驱动因素。

局限与不确定性

  • 性能数据来源:文章提到“Relative performance based on measured data, and subject to change.”(性能基于测量数据,可能变更)。具体性能对比(1.8倍、40%等)是基于与最新x86 CPU的基线测试得出,但未详述测试环境和配置细节。
  • 待核实:文中引用的Phoronix基准测试结果的具体分数和对比环境需进一步核实。
  • AI生成内容警告:文章开头声明“AI-generated content may summarize information incompletely. Verify important information.”,表明摘要部分可能不完整,重要信息需核实原文。

可用于图书/PPT/简报的角度

  • “硬件瓶颈转移”:用此案例说明,在AI工作负载从纯训练转向多步骤推理与代理时,性能瓶颈从GPU转到了CPU。
  • “系统级思维”:强调AI系统的端到端优化,不能只看GPU算力,CPU、内存、互连等子系统的协同同样决定了实际吞吐量。
  • “功耗墙下的性能突破”:以Vera CPU在更小功耗下实现更高带宽和更低延迟为例,讨论高性能计算领域的能效创新。

原始材料

  • URL: https://developer.nvidia.com/blog/nvidia-vera-cpu-boosts-ai-factory-throughput-to-accelerate-agentic-workloads
  • 标题: NVIDIA Vera CPU Boosts AI Factory Throughput to Accelerate Agentic Workloads | NVIDIA Technical Blog
  • 作者: Praveen Menon, Eduardo Alvarez, Farshad Ghodsian
  • 发布日期: Jul 07, 2026
  • 来源: NVIDIA Technical Blog