让大型 AI 模型更易于家庭电脑使用
超过三个月以来,我一直在低调研究降低运行超大型 AI 模型所需的硬件与内存负载的方法——尤其是诸如 GLM-5.2 这类的混合专家(mixture-of-experts)模型,在普通家用电脑上运行。
这项工作是我计算机科学硕士学位的一部分,早期结果令人鼓舞。
我现在已经有了一个可运行的原型,计划很快分享更多细节。
目标并不仅仅是创建模型的更小版本,或者声称数千亿参数能够神奇地塞进消费级 GPU。
完整模型仍然可用,但系统会尝试只加载、保留并传输推理当前阶段所需的组件。
我的研究涉及以下领域:
动态专家驻留
预测性专家预取
在 VRAM、系统内存和 NVMe 存储之间进行分层加载
具备缓存感知的路由
减少不必要的参数移动
根据可用硬件调整执行路径
我最近看到另一个项目在探索类似方向,这也促使我把自己的工作公开出来。
不过,我认为一些当前做法可能低估了真实的推理负载。
仅计算分配给活动专家的参数,并不能代表推理的完整成本。共享层、注意力状态、KV cache、路由决策、专家切换、内存带宽、页故障以及 CPU 到 GPU 的同步,都可能成为主要瓶颈。
当只用活动参数来衡量时,一个系统可能看起来很高效,但在真实的端到端推理中仍可能表现很差,因为它会反复在存储、RAM 和 VRAM 之间传输数据。
因此,我的方法并不仅仅聚焦于选择更少的专家。
它还会考虑
查看原文