CMX G3.5 — メモリ階層の新しいレイヤー
メモリアーキテクチャ
CMX G3.5 — メモリ階層の新しいレイヤー
NVIDIAのContext Memory eXtensionは、KVキャッシュ管理のためにDRAMとNVMeの間に挿入されます
メモリ階層 — 速度 vs 容量
T0
GPU HBMレジスタ
オンチップ · Rubin 22 TB/s
<1 ns
最速
T1
GPU HBM4メモリ
288 GB · 22 TB/s
~10 ns
T2
CPU LPDDR5X DRAM
SOCAMM2 · 1.2 TB/s
~70 ns
NEW
G3.5
CMXフラッシュメモリ
イーサネット接続NVMe
μsオーダー
T3
ローカルNVMe SSD
標準サーバーストレージ
~100 μs
T4
エンタープライズストレージ
オブジェクト / ブロック / テープ
msオーダー
最遅
KVキャッシュのライフサイクル — 4ステップフロー
1
推論完了
Rubin GPUがトークン生成を完了。KVキャッシュがHBMを満たす。次のリクエストを受信。
2
BlueField-4がCMXへオフロード
DPUが完了したKVキャッシュをHBMからG3.5 CMXストレージへ自動的に移動し、次のタスクのためにGPUメモリを解放。
3
Groveが次のリクエストをルーティング
ロードバランサーがユーザーのキャッシュされたコンテキストを保持する物理ノードを特定し、新しいリクエストをそこへルーティング。
4
NIXLがキャッシュをHBMに事前配置
NVIDIA Inference Transfer Libraryが推論開始前にKVキャッシュをCMXからGPU HBMへプリフェッチ — コールドスタートペナルティゼロ。
5×
リアルタイムトークン生成スループットの向上
(従来のインフラに対するCMX + NIXL + Groveの比較)
ロングコンテキストのエージェントセッションが、KVキャッシュのエビクションによるペナルティを受けることはなくなります。