HBFはHBMより安価なHBMではない
HBFは、HBMとSSDの間に新たな層を挿入するものだ。
解決するのは、HBMが不足していることと、SSDがあまりにも「遅い」ことだ。
しかしHBFも依然としてNAND Flashであり、この点がモデル重みの保存に適していることを決めている。
重みは基本的にWrite Once, Read Manyであり、変更されることは少ない。これはほぼNANDにとって理想的なワークロードだ。将来的には、数TB、さらには十数TBに及ぶモデルをHBFに大量に常駐させ、HBMには本当に高速アクセスが必要なhot working setだけを保存することができる。
しかしKV Cacheは、トークンの生成に伴って絶えず書き込まれ、Sessionの終了後には解放される。NANDはDRAMのように任意の場所を上書きできず、page/block、erase-before-write、有限のP/E cycleという制約が存在する。HBFを単純にDRAMとして使用すると、大量のデータを頻繁に移動、消去、再書き込みすることになりやすく、最終的には帯域幅を浪費し、消費電力を増加させ、寿命を縮める。
これが、HBFの仕様でWeightsとKV CacheをChannel単位で分離することが強調され始めた理由でもある。両者は読み書きのパターンとライフサイクルが完全に異なるため、も
原文表示