```html CMX G3.5 — New Layer in the Memory Hierarchy
内存架构

CMX G3.5 — 内存层级结构中的新层

NVIDIA的上下文内存扩展(CMX)插入DRAM和NVMe之间,用于KV缓存管理
内存层级 — 速度 vs 容量
T0
GPU HBM寄存器
片上 · Rubin 22 TB/s
<1 纳秒
最快
T1
GPU HBM4 内存
288 GB · 22 TB/s
~10 纳秒
T2
CPU LPDDR5X DRAM
SOCAMM2 · 1.2 TB/s
~70 纳秒
G3.5
CMX 闪存
以太网连接的NVMe
微秒级
T3
本地 NVMe SSD
标准服务器存储
~100 微秒
T4
企业级存储
对象/块/磁带
毫秒级
最慢
KV 缓存生命周期 — 四步流程
1
推理完成
Rubin GPU 完成令牌生成。KV 缓存填满 HBM。下一个请求即将到来。
2
BlueField-4 卸载到 CMX
DPU 自动将已完成的 KV 缓存从 HBM 移动到 G3.5 CMX 存储,释放 GPU 内存以处理下一个任务。
3
Grove 路由下一个请求
负载均衡器识别哪个物理节点保存了用户的缓存上下文,并将新请求路由到该节点。
4
NIXL 将缓存预加载到 HBM
NVIDIA 推理传输库在推理开始前将 KV 缓存从 CMX 预取回 GPU HBM — 无冷启动延迟。
与传统基础设施相比,CMX + NIXL + Grove 实现了实时令牌生成吞吐量提升
长上下文的代理会话不再因 KV 缓存逐出而受到惩罚。
```