Vera Rubin NVL72 — 7芯片极限协同设计堆栈
系统架构

Vera Rubin NVL72 — 7芯片极限协同设计堆栈

单个集成机架 · 从控制平面到存储的数据流
控制平面
Vera CPU
88个Olympus核心 · 空间多线程 · LPDDR5X 1.2 TB/s
NVLink-C2C ↓ 1.8 TB/s (7× PCIe Gen 6)
预填充计算
Rubin GPU ×72
台积电 3nm · 3360亿晶体管 · 288 GB HBM4 · 22 TB/s 带宽 · 50 PFLOPS/芯片
预填充完成后移交至LPU
解码加速器
Groq 3 LPU
~500 MB 片上SRAM · 80 TB/s 内存带宽 · 确定性执行 — 无分支预测开销
峰值吞吐量下的顺序Token生成
存储 & 网络控制
BlueField-4 DPU + ConnectX-9 SuperNIC
CMX上下文内存卸载 · NVLink 6交换机 · Spectrum-6以太网 · NIXL预暂存至HBM
KV缓存生命周期管理
三步推理流水线
01 预填充 Rubin GPU通过并行矩阵运算处理完整提示词
02 解码移交 上下文传输至Groq LPU进行顺序生成
03 KV卸载 BlueField-4将缓存移至CMX;Grove路由下一个请求
35×
每瓦性能提升 相比Blackwell在万亿参数模型推理上的提升。
并非代际升级 —— 而是品类重塑。