AI消息速览

NVIDIA Vera CPU:面向智能体AI的Olympus核心,专为最大化单线程性能设计

事件日期 2026-07-22 · 产业观察 · 已接受

事件日期2026-07-22
信息日期2026-07-22
入库日期2026-07-22
通道产业观察
状态已接受
来源NVIDIA 博客

知识卡片:NVIDIA Vera CPU:面向智能体AI的Olympus核心,专为最大化单线程性能设计

一句话结论

NVIDIA Vera CPU 的 Olympus 核心通过深度乱序执行、神经分支预测、空间多线程等创新,将单线程性能提升至 AI 工厂级,从而加速智能体 AI 中不规则、分支重、延迟敏感的软件路径。

事件概述 / 研究问题

智能体 AI 将关键执行路径转移到 CPU 上:代理在沙盒中执行代码、调用工具、检索上下文、访问数据库并分析结果。这些循环在 AI 工厂中并发运行,要求 CPU 提供强单线程性能、每核足够内存带宽、可预测延迟以及高效处理不规则控制流和长依赖链。传统云 CPU 注重核心密度和均匀负载的吞吐量,而智能体 AI 更需要持续的单线程进展。NVIDIA Vera CPU 为此设计,核心是 Olympus 核心。

方法 / 产品要点

  • Olympus 核心架构:前端(10 宽解码引擎 + 神经分支预测器,每周期支持两个已采用分支)、中核(宽重命名/分配、大重排序缓冲、物理寄存器、内存重命名、值预测、关键路径加速)、执行引擎(宽后端、深度乱序,覆盖整数/分支/向量/浮点/加密/加载/存储)、缓存子系统(深度层次、内存消歧、多个硬件预取器,包括图预取器)。
  • NVIDIA 空间多线程 (SMT):不同于传统 SMT 共享资源导致噪声邻居效应,SMT 可分区资源,使一个核心在需要时以高吞吐量单线程运行,或作为两个隔离的执行上下文;88 个 Olympus 核心提供 176 线程。
  • 可扩展一致性互连 (SCF):芯片级通信骨干,提供高达 3.4 TB/s 对分带宽,集成 164 MB 统一 L3 缓存,避免小芯片设计的跳变延迟。
  • 内存子系统:SOCAMM2 LPDDR5X 内存模块,聚合带宽达 1.2 TB/s,高 RAS 和能效。
  • 安全可扩展连接:相干 NVLink-C2C、单 NUMA 双插槽架构、PCIe 6.4、CXL 3.1、机密计算,支持可预测代理吞吐量和安全 VM 隔离。

主要结果 / 产业意义

Vera CPU 将单线程 IPC 提升至新高度,特别针对智能体 AI、强化学习、图分析、数据密集型工作负载。SMT 技术减少了线程间干扰,使尾延迟更稳定。整体平台(SCF + 高带宽内存)确保了核心不会因互连或内存而饥饿,从而在 AI 工厂中提供可预测的每代理响应速度和总吞吐量。

为什么重要

智能体 AI 和多代理工作负载正成为 AI 工厂的核心模式,而 CPU 端的性能瓶颈日益凸显。Vera CPU 展示了为这类工作负载从头设计的 CPU 应具备的特性——强调单线程强度、延迟可预测性以及不规则访问模式的处理,而非仅靠核心数量或频率。这为未来数据中心 CPU 设计指明了方向。

局限与不确定性

  • 博客未提供具体 IPC 提升百分比或与竞品(如英特尔、AMD)的对比数据,实际性能有待第三方评测验证。
  • 神经分支预测器、图预取器等技术的实际收益在真实智能体工作负载中的量化结果待核实。
  • SMT 在密集多线程场景下的分区策略(如如何动态调整资源分配)细节尚不明确。
  • Vera CPU 的功耗和散热需求未提及,可能影响部署密度。

可用于图书/PPT/简报的角度

  • 标题建议:“当 CPU 遇上智能体:NVIDIA Vera 如何重塑单线程性能”
  • 对比图:传统云 CPU 与智能体 AI CPU 的设计侧重点差异(核心密度 vs. 单线程/延迟可预测性)
  • 架构亮点:从神经分支预测到图预取器,展示针对不规则控制流和指针遍历的硬件创新
  • 产业趋势:AI 工作负载从 GPU 主导转向 CPU-GPU 协同,CPU 架构需重新定义

原始材料

URL: https://developer.nvidia.com/blog/inside-nvidia-vera-cpu-olympus-cores-built-for-maximum-single-threaded-performance-in-agentic-ai
Track: industry
Topics: agent
英文标题: NVIDIA Vera CPU: Olympus Cores Built for Maximum Single-Thread Performance in Agentic AI
英文关键词: NVIDIA Vera CPU, Olympus core, agentic AI, single-thread performance, spatial multithreading, scalable coherency fabric, SOCAMM2, out-of-order execution, branch prediction, graph prefetcher, AI factory

与既有脉络的关系

已有卡片“NVIDIA Vera CPU提升AI工厂吞吐量以加速智能体工作负载”概述了整体目标和吞吐量提升。本卡片深入解析了支撑该性能的微架构细节(Olympus核心各模块、SMT、SCF等),提供了从“为何快”到“如何实现”的增量信息。