CMX G3.5 — 内存层级结构中的新层
内存架构
CMX G3.5 — 内存层级结构中的新层
NVIDIA 的 Context Memory eXtension 插入在 DRAM 和 NVMe 之间用于 KV 缓存管理
内存层级结构 — 速度与容量
T0
GPU HBM 寄存器
片上 · Rubin 22 TB/s
<1 ns
最快
T1
GPU HBM4 内存
288 GB · 22 TB/s
~10 ns
T2
CPU LPDDR5X DRAM
SOCAMM2 · 1.2 TB/s
~70 ns
全新
G3.5
CMX 闪存
以太网连接的 NVMe
微秒级
T3
本地 NVMe SSD
标准服务器存储
~100 μs
T4
企业级存储
对象 / 块 / 磁带
毫秒级
最慢
KV 缓存生命周期 — 四步流程
1
推理完成
Rubin GPU 完成 token 生成。KV 缓存占满 HBM。下一个请求到来。
2
BlueField-4 卸载至 CMX
DPU 自动将完成的 KV 缓存从 HBM 转移到 G3.5 CMX 存储,为下一个任务释放 GPU 内存。
3
Grove 路由下一个请求
负载均衡器识别保存用户缓存上下文的物理节点,并将新请求路由到该处。
4
NIXL 预暂存缓存至 HBM
NVIDIA 推理传输库在推理开始前将 KV 缓存从 CMX 预取回 GPU HBM — 零冷启动开销。
5×
实时 token 生成吞吐量提升
来自 CMX + NIXL + Grove 相比传统基础设施。
长上下文智能体(Agent)会话不再受到 KV 缓存逐出的惩罚。