AI消息速览

硬件根基的AI安全——不牺牲性能的机密计算

事件日期 2026-07-07 · 产业观察 · 已接受

事件日期2026-07-07
信息日期2026-07-07
入库日期2026-07-07
通道产业观察
状态已接受
来源NVIDIA 博客

知识卡片:硬件根基的AI安全——不牺牲性能的机密计算

一句话结论

NVIDIA Confidential Computing(CC)在Blackwell GPU上实现硬件级安全,通过融合私钥、NVLink加密和远程证明保护AI推理中的数据和模型,性能开销极小(通常低于8%),可达到未启用安全方案的98%性能。

事件概述或研究问题

AI在带来生产力和创新的同时,也引发了数据隐私、主权以及使用中数据(尤其是在推理和模型交互期间)安全性的担忧。NVIDIA致力于解决“如何在确保性能的前提下,为生产级AI推理提供硬件级安全保护”这一核心问题。其Confidential Computing技术将安全层嵌入Blackwell GPU的芯片、互连与系统软件中,在保护数据、代码和模型权重的完整性及机密性的同时,力求性能损失最小化。

方法/产品要点

  • 硬件根信任:Blackwell GPU(包括RTX PRO 6000、HGX B200、HGX B300)在制造时芯片内融合了私有签名密钥,该密钥从不暴露给软件、固件或宿主机,构成证明链基础。HGX B200和B300支持跨最多8个GPU的NVLink加密。
  • 远程证明:机密工作负载运行前,通过NVIDIA Remote Attestation Service (NRAS) 验证GPU硬件报告与CPU TEE度量(AMD SEV-SNP或Intel TDX)是否匹配已知的参考完整性清单。证明是一次性启动事件,不影响推理请求延迟。
  • 性能优化措施
    • CC安全自动调优定时:FlashInfer在CC模式下用GPU全局定时器寄存器替代事件定时器,准确比较内核候选。
    • 异步D2H复制工作者:SGLang将每步令牌读回移出调度器关键路径,恢复计算/复制重叠。
    • 分段CUDA图支持:SGLang在预填充和混合批次中启用CUDA图重放,减少CC模式下被放大的内核启动开销。

主要结果或产业意义

在HGX B300(Blackwell Ultra)上使用Qwen 3.5-397B-A17B-FP8模型进行基准测试,覆盖不同并发度(4-256)、输入/输出长度(1024/1024和8192/1024):

  • 吞吐量(tokens/s/GPU)和中间TPOT(每输出令牌时间)的额外开销通常在2%至8%之间,多数场景小于6%。
  • 性能可达未启用CC方案的98%或更高。
  • 证明企业可在不牺牲性能的前提下保护AI工作负载和数据,满足监管合规要求。

为什么重要

随着AI在金融、医疗、政府等敏感领域部署,数据在使用中(推理阶段)的防护成为关键缺口。NVIDIA CC将安全根植于硬件,避免了纯软件方案带来的性能大幅下降,使机密计算成为生产级AI的可行默认模式,推动了可信AI基础设施建设。

局限与不确定性

  • 测试仅基于Qwen 3.5 397B-A17B-FP8模型和SGLang框架,其他模型和框架的性能表现需进一步验证。
  • 测试环境是Intel TDX虚拟机配置,不同CPU TEE平台(如AMD SEV-SNP)的开销可能不同。
  • 安全假设依赖于硬件信任根(融合密钥)和远程证明服务的正确实现,任何硬件或证明服务漏洞都可能影响安全性。
  • 文中未给出绝对性能数值(如tokens/s),仅给出相对差异百分比;绝对性能依赖于具体硬件、网络和存储配置,需自行测试。
  • 对于小批量(如batch=4),短序列时开销接近8%,在延迟敏感场景下可能需额外关注。

可用于图书/PPT/简报的角度

  • 标题示例:“AI推理安全:如何做到加密99%性能不降”、“硬件安全与性能兼得:NVIDIA机密计算实战”
  • 核心对比:传统加密方案(如全同态加密)性能损失可达90%以上,而硬件辅助的CC仅损失2-8%。
  • 行业应用:面向金融(客户数据推理)、医疗(患者隐私)、跨境AI服务(数据主权)的安全合规技术方案。
  • 技术亮点:GPU融合密钥、NVLink跨卡加密、远程证明的零启动延迟、社区协作(FlashInfer/SGLang)的优化。

原始材料

URL: https://developer.nvidia.com/blog/hardware-rooted-ai-security-that-wont-slow-you-down
Title: Hardware-Rooted AI Security That Won’t Slow You Down | NVIDIA Technical Blog
Authors: Sheel Pethe, Vidhya Krishnan, Aruna Manjunatha, Matheen Raza, Jamie Li
Date: Jul 02, 2026
Tags: Agentic AI / Generative AI, Data Center / Cloud, Trustworthy AI / Cybersecurity, Blackwell, Dynamo, NVLink, TensorRT, AI Inference, Security for AI