$AMD 已發布一款最先進、完全開放的模型,使用 ROCm,並且完全在 MI300X 與 MI325X GPU 上進行訓練
Instella-MoE 是一款 160 億參數的混合專家(mixture-of-experts)模型,每個 token 只啟用 28 億參數,能在保持與同等或更高啟用參數數量的稠密模型與 MoE 模型競爭力的同時,降低推論成本
它支援 64K 的內容視窗,並透過六個階段訓練完成,從預訓練到強化學習
AMD 也同時提出兩項新的效率技術:
- 受閘多頭潛在注意力(Gated Multi-head Latent Attention),會過濾低價值的注意力輸出。
- FarSkip-Collective,能讓通訊與運算重疊,使預訓練速度提升 12.7%,且「首個 token」時間最多降低 39.2%。