知识卡片:NVIDIA Groq 3 LPX 在 Vera Rubin 上实现长上下文超快交互
一句话结论
NVIDIA 的交互式 AI 推理加速器 Groq 3 LPX 与 NVIDIA Vera Rubin NVL72 平台结合,在 Artificial Analysis 的 100K 上下文基准上,对 Gemma 4 31B 模型实现了 3,431 output tokens/second 的中位生成速度,展示了长上下文、小批量场景下的高交互性推理能力。
事件概述或研究问题
Agentic AI 的多轮交互中,上下文会随会话不断增长,长期会话可能达到数十万 token。要求模型在保留长上下文的同时,以极高的速度(每用户每秒数千 token)生成输出,这对推理系统提出了独特的工程挑战:高交互性需要很小的 batch size,而 tensor parallelism(TP)在这种规模下可能因通信协调开销而失效。
方法/产品要点
- Groq 3 LPX 是 NVIDIA Vera Rubin 平台上的交互式 AI 推理加速器,与 Vera Rubin NVL72 搭配使用。
- 核心机制:编译器确定性调度(compiler-scheduled workload planning),在运行前预先规划每个数据块在 C2C 链路上的传输时钟周期。
- 硬件细节:256 个 LP30 本地处理单元(LPU),共 128 GB SRAM,每芯片 96 条 C2C 链路,每条 112 Gbps。
- 细粒度计算-通信重叠:编译器以 320 字节向量为粒度,利用矩阵乘法可拆分为点积序列的特性,在部分结果就绪后立即开始传输,减少通信尾部。
- 通过预规划避免实时仲裁,降低“首比特延迟”(first bit latency),使小 batch 下的 TP 依然高效。
- 支持多种 co-execution 配置:prefill-decode 分离、attention-FFN 分离、外部草稿模型推测解码等,可扩展至多万亿参数模型。
主要结果或产业意义
- Artificial Analysis 使用 100K 上下文基准测试 Gemma 4 31B 模型(2026年4月发布),测得的 Groq 3 LPX 中位速度为 3,431 output tokens/second。
- 同一系统在 10K 上下文下中位速度为 3,382 output tokens/second,显示速度随上下文长度变化很小。
- 以 3,431 tokens/s 生成 5,000 token 约需 1.5 秒,而以 100 tokens/s 则需 50 秒;目前主流 agentic 工具实际速度接近 60 tokens/s。
- 这项性能面向 AI 工厂中最高交互性服务层,可能显著改善多智能体系统、长上下文编码助手等应用体验。
为什么重要
- 本文是 NVIDIA 首次公开 Groq 3 LPX 系统上的第三方基准测试结果,展示的是“长上下文 + 高交互性”这一此前难以兼顾的组合。
- 与已有“GB300 NVL72 创 MoE 预训练世界纪录”卡片不同,本条聚焦推理/服务端,而非训练端;与 TensorRT 工具链卡片无关,也与 OpenAI 关于 AI 扩大工作边界的讨论无关。
- 增量信息:Vera Rubin 平台的推理能力不仅来自大模型训练或通用引擎优化,还来自对 C2C 通信的编译器级确定性调度,这为理解 NVIDIA 下一代推理架构提供了具体技术路径。
局限与不确定性
- “无精度或模型质量损失”来自页面 AI 生成摘要,正文未给出具体精度评测细节,待核实。
- 3,431 tokens/second 是 NVIDIA 自建数据中心内系统的测量结果,由 Artificial Analysis 执行,但具体测试配置、模型版本、批量大小等细节未在摘录中完整给出,待核实。
- 是否能稳定扩展到“多十万级”(multi-hundred thousands)上下文,文中为预期表述,尚待第三方验证。
- 能耗、成本、部署规模等未在材料中提及,待核实。
可用于图书/PPT/简报的角度
- 从“智能体会话的上下文增长”出发,解释为什么长上下文 + 低延迟是 Agentic AI 的刚需。
- 以“红绿灯 vs 预规划时刻表”的比喻,说明确定性编译器调度如何消除通信仲裁延迟。
- 对比 100 tokens/s 与 3,431 tokens/s 生成 5,000 token 的时间差异,直观展示“交互性”的数量级变化。
与既有脉络的关系
- 本卡片补充了 NVIDIA Vera Rubin 平台在推理侧的高交互性能数据,与 GB300 NVL72 在预训练侧的世界纪录形成对照;两者共同展示 NVIDIA 全栈软硬件协同设计在不同阶段的能力。
原始材料
- 英文标题:How NVIDIA Groq 3 LPX Unlocks Ultrafast Interactivity at Long Context on NVIDIA Vera Rubin
- 英文关键词:Groq 3 LPX, Vera Rubin, long context, interactivity, tensor parallelism, compiler scheduling, C2C, inference
- 来源:NVIDIA Technical Blog,2026年8月24日,Seth Weidman, Kirthi Devleker, Andrew Ling
- URL: https://developer.nvidia.com/blog/how-nvidia-groq-3-lpx-unlocks-ultrafast-interactivity-at-long-context-on-nvidia-vera-rubin