HBF不是更便宜的HBM
HBF,是在hbm和ssd之间插入一个新的层。
解决的是hbm不够,和ssd太“慢”的问题
但 HBF 仍然是 NAND Flash,这一点决定了其适合存模型权重存储。
Weights 基本属于 Write Once, Read Many,很少修改。这几乎是 NAND 最理想的 workload。未来数 TB 甚至十几 TB 的模型,可以大量驻留 HBF,HBM 只保存真正需要高速访问的 hot working set。
但KV Cache 会随着 token 生成不断写入,Session 结束后又被释放。NAND 不像 DRAM 可以任意覆盖,它存在 page/block、erase-before-write 和有限 P/E cycle。如果简单把 HBF 当成 DRAM 使用,很容易经常移动、擦除并重写大量数据,最终浪费带宽、增加功耗并缩短寿命。
这也是 HBF 规范开始强调 Weights 与 KV Cache 分 Channel 的原因。两者读写模式和生命周期完全不同,不能再粗暴地混在一个资源池里。
但 KV Cache 未必因此不适合 HBF。它有一个重要特点:很多情况下并不是反复覆盖,而是 Append → Read Many → Bulk Release。如果 Runtime 能进行连续写入、批量回收,再结合 wear leveling、ov