AI消息速览

NVIDIA Nemotron 3 Ultra 在 Agentic RTL 编码中引领开源模型的准确性与效率

事件日期 2026-07-26 · 产业观察 · 已接受

事件日期2026-07-26
信息日期2026-07-26
入库日期2026-07-27
通道产业观察
状态已接受
来源NVIDIA 博客

知识卡片:NVIDIA Nemotron 3 Ultra 在 Agentic RTL 编码中引领开源模型的准确性与效率

一句话结论

将 NVIDIA Nemotron 3 Ultra 模型与 ACE-RTL 智能体工作流结合,在 RTL 编码任务上实现了 97.1% 的平均通过率,同时每次迭代的 token 消耗比对比的开源模型低 28%–71%,在准确性和效率上均领先其他开源模型。

事件概述

NVIDIA 于 2026 年 7 月 26 日发布技术博文,公布其开源模型 Nemotron 3 Ultra 在 Agentic RTL(寄存器传输级)编码中的表现。通过与 ACE-RTL 智能体(采用生成-测试-反思的迭代工作流)结合,该模型在 Comprehensive Verilog Design Problems (CVDP) 基准测试的九个任务类别中取得了领先的通过率,并显著降低了推理成本。该模型已与 Cadence、Siemens、Synopsys 等主流 EDA 工具集成。

方法/产品要点

  • 模型架构:Nemotron 3 Ultra 是一个总参数量 550B、活跃参数量 55B 的混合专家模型(MoE),采用混合 Mamba-Attention 架构,专为长上下文智能体任务设计。
  • 长上下文能力:预训练于 20 万亿文本 token,上下文长度扩展至 100 万 token。
  • 效率优势:混合 Mamba-Attention 架构降低了注意力计算成本和 KV 缓存占用,相比其他开源模型吞吐量提升高达 5 倍,成本降低 30%。
  • RTL 专项训练:使用 ACE-RTL 论文提出的合成数据生成(SDG)流水线。该流水线从高质量 RTL 种子设计出发,通过开源 LLM 生成指令式训练样本,覆盖三大任务类型:
    • 规格到 RTL 生成:从自然语言描述生成对应的 Verilog 代码。
    • RTL 代码编辑:基于现有代码和特征扩展需求进行修改。
    • RTL 调试:注入常见硬件设计错误(如 FSM 转换错误、握手时序违规),训练模型利用代码上下文和工具反馈进行修复。
  • 数据过滤:所有生成样本经过语法检查、基准去污染和基于 LLM-as-judge 的评分过滤,确保语义对齐。

主要结果

  • CVDP 基准测试平均通过率
    • ACE-RTL + Nemotron 3 Ultra:97.1%
    • ACE-RTL + Kimi K2.6:95.2%
    • ACE-RTL + GLM 5.2:92.1%
  • 调试任务(cid016)通过率:Nemotron 3 Ultra 单独模型为 65.7%,搭配 ACE-RTL 智能体后提升至 100.0%
  • Token 效率:每次迭代平均使用 6,629 个 token,比 GLM 5.2(9,156 token)少 28%,比 Kimi K2.6(22,579 token)少 71%。
  • 综合效益:更少的 token 消耗叠加更高的通过率,意味着在相同算力预算下可完成更多 RTL 任务。

为什么重要

  • 开源模型的新高度:Nemotron 3 Ultra 证明开源模型在专业、高复杂度的 Agentic RTL 编码领域能够达到甚至超越当前最强的专有模型的水平。
  • 效率是关键突破:在通过率领先的同时,token 消耗大幅降低,使 AI 辅助的 RTL 开发更具经济可行性,降低了实际部署的门槛。
  • 与 EDA 生态深度融合:已获 Cadence、Siemens、Synopsys 三巨头官方集成,表明该模型不仅仅是研究实验,而是具备工业级应用价值。
  • 与既有脉络的关系:本卡片补充了之前关于为 Nemotron 3 Ultra 创建 LangChain Deep Agents 夹具配置的卡片。先前的卡片关注如何通过工程适配(无需微调)提升模型在特定代理任务上的表现,而本卡片则展示了 Nemotron 3 Ultra 本身在 经过 RTL-specific 合成数据训练后,作为基础模型在专业领域达到领先表现的完整成果与基准数据。

局限与不确定性

  • 基准测试结果来自于 NVIDIA 自身发布的技术博文,可能无法完全代表第三方独立复现的结果。待核实是否有独立的第三方验证。
  • 博文未提供 CVDP 基准的具体问题数量、难度分布以及每个任务类别的样本量。待核实。
  • 尽管模型是开源的,但其 RTL 专项训练所依赖的合成数据生成流水线和过滤方法较为复杂,其他团队复现该结果的门槛可能较高。
  • AI 生成内容摘要可能不完整,用户需验证重要信息。

可用于图书/PPT/简报的角度

  • 案例:AI Agent 在芯片设计中的实践:详细介绍从规格说明到 RTL 代码生成、调试、验证的全流程代理任务。
  • 趋势:开源大模型在垂直专业领域的突破:以半导体 EDA 为例,阐述开源模型通过专项训练和特定架构优化,在性能和成本上挑战闭源模型的路径。
  • 技术:高效长上下文推理架构:介绍 Mamba-Attention 混合架构如何平衡推理质量和计算效率。
  • 数据:合成数据在模型训练中的价值:展示如何通过自动化流水线生成高质量的专用训练数据(编辑、调试任务)来提升模型在代理工作流中的表现。

原始材料

  • 英文标题:NVIDIA Nemotron 3 Ultra Leads Open Models on Accuracy and Efficiency in Agentic RTL Coding
  • 英文关键词:Agentic AI, Generative AI, RTL Coding, Hardware/ Semiconductor, Nemotron, Benchmark, Developer Tools & Techniques
  • 原始来源:https://developer.nvidia.com/blog/nvidia-nemotron-3-ultra-leads-open-models-on-accuracy-and-efficiency-in-agentic-rtl-coding