讓大型 AI 模型更容易在家用電腦上使用
超過三個月以來,我一直默默研究降低運行非常大型 AI 模型所需的硬體與記憶體負擔的方法——特別是像 GLM-5.2 這類普通家用電腦上的混合專家(mixture-of-experts)模型。
這項工作是我電腦科學碩士學位的一部分,而早期結果令人鼓舞。
我現在已經有一個可運作的原型,並計畫很快分享更多細節。
目標並不只是製作模型的更小版本,或宣稱數以百億計的參數能神奇地塞進消費級 GPU。
完整模型仍然可用,但系統會嘗試只載入、保留並傳遞目前推論階段所需的元件。
我的研究包含以下面向:
動態專家常駐(Dynamic expert residency)
預測式專家預取(Predictive expert prefetching)
跨 VRAM、系統 RAM 與 NVMe 儲存的階層式載入(Hierarchical loading)
具快取意識的路由(Cache-aware routing)
減少不必要的參數移動
根據可用硬體調整執行路徑(Adapting the execution path)
我最近看到另一個朝類似方向探索的專案,這也鼓勵我把自己的研究公開。
不過,我認為目前一些做法可能低估了真實的推論負載。
僅計算分配給作用中專家的參數,並不能代表完整的推論成本。共享層、注意力狀態
查看原文