Vera Rubin NVL72 — 7芯片极限协同设计堆栈
系统架构
Vera Rubin NVL72 — 7芯片极限协同设计堆栈
单个集成机架 · 从控制平面到存储的数据流
控制平面
Vera CPU
88个Olympus核心 · 空间多线程 · LPDDR5X 1.2 TB/s
NVLink-C2C ↓ 1.8 TB/s (7× PCIe Gen 6)
预填充计算
Rubin GPU ×72
台积电 3nm · 3360亿晶体管 · 288 GB HBM4 · 22 TB/s 带宽 · 50 PFLOPS/芯片
预填充完成后移交至LPU
解码加速器
Groq 3 LPU
~500 MB 片上SRAM · 80 TB/s 内存带宽 · 确定性执行 — 无分支预测开销
峰值吞吐量下的顺序Token生成
存储 & 网络控制
BlueField-4 DPU + ConnectX-9 SuperNIC
CMX上下文内存卸载 · NVLink 6交换机 · Spectrum-6以太网 · NIXL预暂存至HBM
KV缓存生命周期管理
三步推理流水线
01
预填充
Rubin GPU通过并行矩阵运算处理完整提示词
›
02
解码移交
上下文传输至Groq LPU进行顺序生成
›
03
KV卸载
BlueField-4将缓存移至CMX;Grove路由下一个请求
35×
每瓦性能提升
相比Blackwell在万亿参数模型推理上的提升。
并非代际升级 —— 而是品类重塑。