NVIDIA Rubin GPU通过晶体管架构、内存子系统(HBM4)和计算效率的全面提升,为智能体AI工作负载提供了相比Blackwell高达10倍的每单位能源吞吐量,该GPU是Vera Rubin平台的核心,旨在将数据中心重塑为单一计算单元,以应对智能体推理对低延迟、高吞吐和长上下文处理的需求。
随着AI应用从离散的模型训练和面向人类的聊天界面转向“始终在线”的AI工厂,这些工厂正承担起驱动智能体工作流的任务。智能体工作流需要推理、规划、使用工具、验证中间结果,并在庞大的上下文中执行复杂的多步骤任务。这些工作负载不是由单一的提示和响应定义的,而是需要跨多个推理步骤的持续推理,对每一步的延迟、解码吞吐量、长上下文注意力机制、KV缓存容量以及跨紧密耦合…