Vera Rubin NVL72 — 7-Silicon Extreme Co-Design Stack
システムアーキテクチャ

Vera Rubin NVL72 — 7-Silicon Extreme Co-Design Stack

単一統合ラック · コントロールプレーンからストレージへのデータフロー
コントロールプレーン
Vera CPU
88 Olympusコア · 空間マルチスレッディング · LPDDR5X 1.2 TB/s
NVLink-C2C ↓ 1.8 TB/s (7× PCIe Gen 6)
プリフィルコンピュート
Rubin GPU ×72
TSMC 3nm · 336B トランジスタ · 288 GB HBM4 · 22 TB/s 帯域幅 · 50 PFLOPS/チップ
プリフィル完了後にLPUへハンドオフ
デコードアクセラレータ
Groq 3 LPU
~500 MB オンチップSRAM · 80 TB/s メモリ帯域幅 · 決定論的実行 — 分岐予測オーバーヘッドなし
ピークスループットでの順次トークン生成
ストレージ & ネットワーク制御
BlueField-4 DPU + ConnectX-9 SuperNIC
CMXコンテキストメモリオフロード · NVLink 6スイッチ · Spectrum-6 Ethernet · HBMへのNIXLプレステージング
KVキャッシュライフサイクル管理
3段階推論パイプライン
01 プリフィル Rubin GPUが並列行列演算でプロンプト全体を処理
02 デコードハンドオフ 順次生成のためにコンテキストをGroq LPUへ転送
03 KVオフロード BlueField-4がキャッシュをCMXへ移動、Groveが次のリクエストをルーティング
35×
ワットあたりの性能向上 (1兆パラメータモデルの推論におけるBlackwell比)
世代のアップグレードではない — カテゴリの再定義。