知识卡片:NVIDIA Vera存储基准:加密、压缩、完整性检查与恢复加速
一句话结论
NVIDIA Vera CPU在存储原语微基准中,相比对比用的x86 CPU,实现了最高1.29x至3.67x的吞吐提升,覆盖加密/解密、Reed-Solomon恢复、CRC32C完整性检查、压缩/解压及多阶段流水线。
事件概述或研究问题
- 2026年8月3日,NVIDIA技术博客发布文章,介绍NVIDIA Vera BlueField-4 STX存储处理器在AI原生存储中的基准表现。
- 研究问题:CPU侧存储处理(加密、完整性校验、纠删码、压缩等)能否跟上SSD和网络速度,以及Vera CPU在此类存储原语上的性能优势。
方法/产品要点
- 产品:NVIDIA Vera BlueField-4 STX存储处理器,是NVIDIA STX基础架构的一部分,将Vera CPU性能引入存储数据路径。
- 架构:88个NVIDIA设计的Olympus Armv9.2核心,支持176个NVIDIA Spatial Multithreading线程;配备NVIDIA Scalable Coherency Fabric(SCF),最高3.4 TB/s二分带宽,164 MB统一L3缓存;采用SOCAMM2 LPDDR5X内存,聚合内存带宽最高1.2 TB/s(每核心最高14 GB/s),支持模块化可现场更换。
- 基准方法:在单个进程内使用内存中数据运行,排除文件I/O、磁盘、网络等外部瓶颈;使用OpenSSL、Zstandard、LZ4等常用库及针对Arm/x86原生指令优化的实现;采用专有测试框架在Vera和x86上应用一致的工作负载定义和控制,结果可复现,但完整基准集不是现成的公开基准。
主要结果或产业意义
- AES-128加密吞吐最高提升1.43倍;AES-128解密最高提升1.29倍。
- Reed-Solomon恢复工作负载吞吐最高提升3.26倍。
- CRC32C完整性检查吞吐最高提升3.67倍。
- 压缩吞吐最高提升3.29倍;解压最高提升1.72倍。
- 多阶段存储流水线操作最高提升3.21倍。
- 产业意义:更高吞吐使存储系统在相同CPU/功耗/散热范围内处理更多数据、应用更多企业服务,支持更高服务密度和更多并发数据流,有利于agentic AI工作负载;更高的压缩吞吐还有助于降低存储容量和带宽需求。
为什么重要
- Agentic AI工作流中,存储是活跃部分,每个代理步骤触发多次存储操作,CPU侧处理的性能决定数据流动速度。
- 传统CPU扩展需要更多核心、功耗和散热,且受最慢步骤限制;Vera通过统一架构将AI基础设施的代理执行和存储处理在更小CPU/功耗/散热包络内扩展。
- 本条提供Vera在存储原语层面的具体基准数据,补充了关于NVIDIA Vera/STX生态的量化信息。
局限与不确定性
- 对比用的x86 CPU具体型号未在材料中说明(待核实)。
- 完整基准集不是现成公开基准;端到端整体存储系统或GPU性能效果仍需测试。
- 材料中部分内容来自AI生成摘要,可能不完整,重要信息需核实。
- 未提供具体测试配置、功耗、延迟等细节(待核实)。
可用于图书/PPT/简报的角度
- 展示AI-native存储中CPU侧处理瓶颈,以及专用CPU架构(Vera)如何通过高带宽、多线程、大缓存提升存储原语性能。
- 用倍数图表对比Vera与x86在加密、完整性检查、压缩、纠删码等方面的吞吐优势。
- 以“存储是agentic AI的隐藏瓶颈”为切入点,分析Vera如何降低基础设施成本并提高并发处理能力。
原始材料
- 英文标题:NVIDIA Vera Storage Benchmarks: Faster Encryption, Compression, Integrity Checking, and Recovery for AI-Native Storage
- 英文关键词:NVIDIA Vera; BlueField-4 STX; storage benchmarks; encryption; compression; CRC32C; Reed-Solomon; AI-native storage
- 来源:NVIDIA Technical Blog
- URL: https://developer.nvidia.com/blog/nvidia-vera-storage-benchmarks-faster-encryption-compression-integrity-checking-and-recovery-for-ai-native-storage