HBM 与标准 DRAM 带宽
内存带宽:HBM 与标准 DRAM
为什么 AI 推理瓶颈是内存问题而非算力问题
峰值带宽(每模块 GB/s)
DDR5
~80
标准笔记本电脑 / 台式机 —— 基准参考
LPDDR5X
~120
移动 / 边缘 AI 设备
HBM3
~1,200 GB/s
H100 GPU —— 当前数据中心标准
HBM4
~2,000+ GB/s
下一代 AI 加速器 —— SK 海力士 / 三星目标
堆叠架构对比
DDR5 / LPDDR5
单芯片,平面布局。数据通过 PCB 总线横向传输。信号路径长 = 延迟高。总线位宽:64–128 位。
HBM3 / HBM4
8–16 个 DRAM 裸片垂直堆叠。硅通孔 (TSV) 连接各层。总线位宽:1,024 位。直接放置在逻辑芯片旁的中介层上。
16×
在相近功耗预算下,HBM4 相较于 DDR5 的带宽优势
<50%
内存带宽成为瓶颈时的 GPU 利用率 —— 浪费的算力开销
5–8
每张 H100 加速卡搭载的 HBM3 堆栈数量 —— 需求随 AI 集群规模扩大
来源:IEEE 固态电路期刊;SEMI 2026 年 HBM 技术路线图;SK 海力士 HBM4 产品简介(初步规格)。