这两年,AI 芯片火了一个词:HBM。
而最近 Sandisk 又提出了一个很像的新概念:HBF,High Bandwidth Flash,高带宽闪存。
名字只差一个字母,但两者其实不是一类东西。
如果用一句话概括:HBM 是把 DRAM 做到极高带宽,HBF 是想把 NAND Flash 做到足够高的带宽。
它们解决的,也不是完全相同的问题。
HBM:GPU 身边的“高速工作台”
HBM,全称 High Bandwidth Memory,高带宽内存。
它本质上还是 DRAM,只是通过 3D 堆叠、TSV 等方式,把多层 DRAM 堆起来,并用非常宽的接口和 GPU 连接。
它最大的特点就是一个字:快。
对于 GPU 来说,HBM 很像摆在手边的高速工作台。
GPU 需要数据时,可以快速拿到,因此特别适合:
- AI 训练高频访问的数据激活值KV Cache各种需要低延迟读写的计算任务
但 HBM 也有缺点:容量贵。
想把几百 GB、甚至 TB 级模型全部塞进 HBM,成本、功耗和封装难度都会快速上升。
HBF:给 GPU 加一个“超大高速仓库”
HBF 则完全不同。
它不是 DRAM,而是基于 NAND Flash。
大家平时用的 SSD,底层也是 NAND。
问题是,NAND 虽然便宜、容量大,但访问速度和延迟远不如 DRAM。
Sandisk 的思路是:单颗 NAND 不够快,那就让大量 NAND 同时工作。
通过大量 die 并行、CBA 技术和 3D 堆叠,HBF 希望把 NAND 的总读取带宽提升到 TB/s 级别。
Sandisk 公布的第一代 HBF 目标是:16 层 die 堆叠单 stack 容量 512GB读取带宽 1.6TB/s
Sandisk 希望在接近 HBM 封装尺寸和功耗水平的情况下,获得远高于 HBM 的容量。
这就是 HBF 最吸引人的地方:
它不一定比 HBM 更快,但可能比 HBM 大得多。
HBM 和 HBF,最大的区别是什么?
可以直接看这张表:
| 对比 | HBM | HBF |
|---|---|---|
| 底层介质 | DRAM | NAND Flash |
| 最大优势 | 低延迟、高带宽 | 大容量、高带宽 |
| 容量 | 相对较小 | 很大 |
| 延迟 | 低 | 明显高于 HBM |
| 写入能力 | 强 | NAND 天生不占优势 |
| 成本/bit | 高 | 理论上更低 |
| 适合场景 | Training、频繁读写 | AI Inference、模型权重 |
| 技术成熟度 | 已大规模应用 | 新技术,仍需验证 |
这里最容易误解的一点是:高带宽不等于低延迟。
Sandisk 自己也明确指出,HBF 相比 HBM 仍然有更高的延迟和更大的 page size。
所以即使 HBF 标称 1.6TB/s,也不能理解成:“HBF 就是一块 1.6TB/s 的 HBM。”
两者的访问方式还是不同的。
为什么 HBF 特别适合大模型权重?
因为 AI 推理中的模型权重有一个特点:
特别大,而且主要是读取。
比如一个 405B 参数模型,如果采用 8-bit 权重,仅模型权重就大约需要 405GB。
这时候,512GB 的 HBF 就很有吸引力。
模型可以长期放在 HBF 里,GPU 需要的时候高速读取,不一定要全部塞进昂贵的 HBM。
这也是为什么 Sandisk 把 HBF 主要定位在 AI inference,而不是 AI training。
Sandisk 的内部 simulation 显示,在 Llama 3.1 405B、8-bit 权重读取场景下,HBF 模型性能与“无限容量 HBM”的差距约为 2.2%。不过需要注意,这只是内部测试和模拟结果,并不是量产产品的完整实测。
所以 HBF 会取代 HBM 吗?
现阶段来看,更可能的答案是:不会。
更合理的架构可能是:
text
GPU
│
HBM ← 最快、最常用的数据
│
HBF ← 大模型权重、大容量数据
│
SSD ← 更大规模的存储
可以把它理解成:HBM 是 GPU 的“高速工作台”,HBF 是工作台旁边的“超大高速仓库”。
工作台依然需要,因为有些数据必须随手就能拿到。
但如果仓库足够近、搬运速度足够快,就没有必要把所有东西都堆在昂贵的工作台上。
HBF 真正值得关注的,不是“打败 HBM”
Sandisk 给出的目标是,HBF 可以达到 HBM 8~16 倍的容量,同时保持很高的读取带宽。
如果这个思路最终成立,那么 HBF 最大的意义可能不是“替代 HBM”,而是:在 HBM 和 SSD 之间创造一个新的 memory tier。
未来的 AI 芯片,很可能不是“HBM 还是 HBF”二选一,而是:HBM + HBF + SSD 一起使用。
HBM 负责最快的数据,HBF 负责超大模型,SSD 负责真正的大规模存储。
对于越来越大的 AI 模型来说,这可能比单纯追求更快的 HBM,更值得关注。
242