一篇读懂 HBM:AI 算力的「内存墙」是怎么被摞高的

**一句话结论:HBM(High Bandwidth Memory,高带宽内存)不是更快的内存条,而是把 DRAM 芯片垂直摞起来、再用一条超宽接口怼到计算芯片旁边的内存子系统。**它用「立体堆叠换距离、并行换速度」两个动作,把带宽做到同代 DDR 的十几倍,代价是价格数倍于普通内存、产能常年紧张——今天买 AI 加速卡,花在 HBM 上的钱可能占整机物料成本的三分之一以上,这也是为什么每一条 HBM 新闻都能影响整个 AI 产业链。

先说问题:算力涨得快,喂饭的管子跟不上

GPU 的算力(FLOPS)这些年是指数级增长,但内存带宽的增速远远落后——1995 年 Wulf 和 McKee 就提出过「内存墙」(memory wall)这个说法:处理器性能每 年涨 50% 以上,而内存延迟和带宽的改善慢得多,迟早会变成瓶颈。

大模型把这个老问题变成了生死问题。推理时每生成一个 token,都要把模型权重(动辄上百 GB)和不断增长的 KV Cache 从显存里搬进计算单元。算子的算术强度很低——读几百字节权重,只做几次乘加——所以大部分时间计算单元在等数据。这就是为什么 H100 跑大模型推理,实测利用率常常只有三到五成:不是算不动,是喂不饱。

上一篇文章 《一篇读懂 KV Cache》讲过显存里的账怎么算;这篇讲的是那根「喂饭的管子」本身。

HBM 的两个关键动作

动作一:把内存摞起来

传统内存条是平铺的:DRAM 颗粒躺在 PCB 上,距离计算芯片几厘米,信号要走长长的走线。HBM 的做法是把 4 到 16 片 DRAM 裸片(die)垂直堆叠,片与片之间用 TSV(硅通孔,Through-Silicon Via)——也就是在硅片上打穿垂直导电的「隧道」——直接连接,整个堆叠再通过硅中介层(interposer)贴在 GPU 旁边,距离从「几厘米」缩到「毫米级」。

flowchart TB
    subgraph HBM 堆叠
    D4[DRAM 裸片 ×N] --- D3[DRAM 裸片] --- D2[DRAM 裸片] --- D1[逻辑裸片 base die]
    end
    D1 == TSV 垂直互联 ==> I[硅中介层 Interposer]
    subgraph GPU
    C[计算裸片]
    end
    I --- C
    I === 超宽并行接口 1024/2048-bit === C

距离短了,信号又宽又并行,每个引脚就不用跑太高频率——这意味着更低延迟、更低功耗。DDR5 单根跑 6400 MT/s 要靠高时钟硬顶,HBM 每个引脚只要 6.4~9.6 Gb/s,但引脚数量是它的成百上千倍。

动作二:把接口加宽

HBM1/HBM2/HBM3 用的都是 1024-bit 超宽接口(对比:DDR5 单通道 64-bit、GDDR6X 显存接口 384-bit)。带宽的账很简单:

带宽 = 接口位宽 × 每引脚速率。位宽 16 倍于 GDDR,每引脚速率只需要它的四分之一左右,总带宽就能反超数倍。

到 HBM4,JEDEC 干脆把接口再翻倍到 2048-bit、32 个独立通道,配合每引脚 8 Gb/s,单堆叠带宽达到 2 TB/s。

四代演进:十年,单堆叠带宽 16 倍

代际 JEDEC 规范 / 时间 每堆叠带宽 关键变化
HBM JESD229,2013-10 ~128 GB/s 奠定 TSV 堆叠 + 1024-bit 接口;2015 年首用于 AMD Radeon Fury X
HBM2 JESD235A,2016-01 ~256 GB/s 堆叠容量翻倍(8-high),带宽翻倍
HBM3 JESD238,2022-01 819 GB/s 独立通道 8→16,速率 6.4 Gb/s,支持 12 层堆叠
HBM3E HBM3 的增强版,2023 起 ~1.15 TB/s 12 层 36GB 产品 2024-09 由 SK hynix 率先量产,引脚速率 9.6 Gb/s
HBM4 JESD270-4,2025-04 2 TB/s 接口 1024→2048-bit(32 通道),每引脚 8 Gb/s,支持 16 层堆叠

(来源:JEDEC 官方公告与 SK hynix 量产新闻稿,见文末参考资料。)

规律很清楚:HBM1→HBM3 主要靠提频率和加通道,HBM4 开始直接把接口位宽翻倍——因为单纯提频已经撞上功耗和信号完整性的墙,「加宽」比「加速」更可持续。

旗舰加速卡对照:一半身价在内存上

加速卡 显存 显存带宽 备注
NVIDIA A100 (80GB) 80 GB HBM2E ~2 TB/s 2020 年,训练卡标配的起点
NVIDIA H100 (SXM) 80 GB HBM3 3.35 TB/s 2022 年,首代用上 HBM3
NVIDIA H200 141 GB HBM3E 4.8 TB/s 2024 年,首款 HBM3E 卡
NVIDIA B200 192 GB HBM3E 8 TB/s Blackwell,双裸片设计
AMD MI300X 192 GB HBM3 5.3 TB/s AMD 以「堆显存」对抗 CUDA 生态的卖点

(容量与带宽均以各厂商官方规格页为准,截至 2026-10-08。)

看这张表能理解两件事:

  1. 两代 GPU 之间带宽涨 2~4 倍,跟 FLOPS 的涨幅同一量级——HBM 没有掉队,是因为它自己也在快速迭代。
  2. AMD MI300X 的竞争策略就是显存:算力生态打不过 CUDA,就给你 192GB 大显存 + 5.3TB/s 带宽,让 70B 级模型一张卡装下。内存容量成了差异化武器。

为什么难:贵和缺的根源

良率账:一个 12 层 HBM 堆叠要 12 片 DRAM 全部合格才能出厂。假设单片良率 90%,十二片全好的概率只有 28%。虽然实际生产中会修复和分档(这也是为什么同代 HBM 会有不同规格的 bin),但堆叠层数越高,良率越敏感。SK hynix 做 12 层 HBM3E 时专门把 DRAM 裸片削薄了 40%,才能在 8 层的厚度里塞进 12 层。

封装账:HBM 和 GPU 之间要靠硅中介层(如台积电 CoWoS 这类 2.5D 封装)连接,中介层面积大、工艺复杂,2023 年以来 CoWoS 产能一直是 NVIDIA 出货节奏的卡点。一片 GPU 周围贴 6~8 个 HBM 堆叠,对封装良率是双重考验。

散热账:堆叠让发热密度暴涨,DRAM 对温度又敏感(高温漏电、刷新变频繁)。SK hynix 用 MR-MUF(液态热固材料 + 底部填充)、三星用 TC-NCF(热压缩非导电薄膜)等不同封装工艺解决层间散热——这也是三家的核心工艺差异。

格局账:HBM 是个典型的三强市场——SK hynix、三星、美光。SK hynix 凭借在 HBM3/HBM3E 上先发卡位 H100/H200 供应链,处于领先位置;三星高管近期公开预计 HBM 将占到 DRAM 行业总产能的近 30%(截至 2026-10 的行业预期)——传统 DRAM 产线向 HBM 转产,本身就在改变整个存储行业的供给结构。

争议与边界:HBM 不是终点

  • 太贵:每比特成本是普通 DDR 的数倍。推理服务商会算另一笔账:同样的预算,用更多便宜的内存换更低的带宽行不行?这就是 CXL 内存扩展、甚至 LPDDR 方案存在的原因——用容量换带宽,适合对延迟不敏感的批量任务。
  • 另一个极端是干脆不用 DRAM:Groq 的 LPU 用几百 MB 的超大片上 SRAM 装整个模型,把带宽问题从「墙」变成「不存在」,代价是模型一大就要几百颗芯片组网。SRAM 快但贵、密度低,这条路目前只在特定推理场景成立。
  • HBM4 引入新变量:接口翻倍后,base die(堆叠底部的逻辑裸片)的职责加重,行业出现了「base die 定制化」的动向——不同客户要求不同的基底逻辑(更好的纠错、缓存或直连 I/O),存储厂商和晶圆代工厂开始在这一层分工协作。这会让 HBM 从「标准品」慢慢长出「半定制」属性,也是各家拉开差距的新战场(截至 2026-10 的行业动向)。

小结

回到开头的问题:AI 加速卡的规格表应该先看哪一行?**先看显存带宽,再看容量,最后才是 FLOPS。**大模型推理是带宽受限的负载,带宽决定每秒能生成多少 token,容量决定能装多大的模型和上下文,而 FLOPS 只决定你花电费等数据的时候芯片空转得多体面。

HBM 的本质是把「内存离计算太远」这个四十年的老问题,用立体堆叠和超宽接口硬摞矮了。它贵、缺、被三家公司卡着脖子,但至少今天,它仍是喂饱大模型最经济的那根管子。

参考资料

← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?