HBF 不是更便宜的 HBM
HBF 是在 HBM 和 SSD 之間插入一個新的層。
解決的是 HBM 不夠,以及 SSD 太「慢」的問題
但 HBF 仍然是 NAND Flash,這一點決定了其適合模型權重儲存。
Weights 基本屬於 Write Once, Read Many,很少修改。這幾乎是 NAND 最理想的工作負載。未來數 TB 甚至十幾 TB 的模型,可以大量駐留 HBF,HBM 只保存真正需要高速存取的 hot working set。
但 KV Cache 會隨著 token 生成不斷寫入,Session 結束後又被釋放。NAND 不像 DRAM 可以任意覆寫,它存在 page/block、erase-before-write 和有限的 P/E cycle。如果簡單把 HBF 當成 DRAM 使用,很容易經常移動、擦除並重寫大量資料,最終浪費頻寬、增加功耗並縮短壽命。
這也是 HBF 規範開始強調 Weights 與 KV Cache 分 Channel 的原因。兩者讀寫模式和生命週期完全不同,不能再粗暴地混在一個資源池裡。
但 KV Cache 未必因此不適合 HBF。它有一個重要特點:很多情況下並不是反覆覆寫,而是 Append → Read Many → Bulk Release。如果 Runtime 能進行連續寫入、批量回收,再結合 wear leve
查看原文