BlockBeats 消息,7 月 25 日,AMD 宣布推出全開源混合專家模型(MoE)Instella-MoE;該模型擁有 160 億總參數,每個 Token 啟動 28 億參數,號稱在同規模開源語言模型中具備領先效能。
AMD 表示,Instella-MoE 完全基於自家 AMD Instinct MI300X 和 MI325X GPU,以及 ROCm 軟體堆疊,從零訓練完成,並採用 Gated Multi-head Latent Attention(Gated MLA)和 FarSkip-Collective 等架構創新,以提升訓練和推理效率。
效能測試顯示,Instella-MoE-16B-A3B 基礎模型平均得分達到 76.7 分,在全開源模型中排名領先,超過 SmolLM3-3B、OLMo-3-7B 等模型,並在僅啟動 28 億參數的情況下,與更大規模模型競爭。
此外,該模型支援 64K Token 長上下文處理,並完成預訓練、中期訓練、長上下文擴展、監督微調(SFT)、直接偏好最佳化(DPO)以及強化學習(RL)等完整訓練流程。
AMD 此次同步公開 Instella-MoE 全部模型權重、訓練配置、資料配比、中間檢查點及推理程式碼,推動開放 AI 模型研究與復現。
AMD 表示,Instella-MoE 展示了基於 AMD 硬體和開放軟體生態進行大規模 MoE 模型訓練的能力,未來將持續推進更大規模、更強推理能力和更高效率的開源語言模型研發。
175.41萬 熱度
144.9萬 熱度
8.48萬 熱度
184.25萬 熱度
13.54萬 熱度
AMD 發布全開源 MoE 大模型 Instella-MoE,16B 參數規模挑戰主流開源模型
BlockBeats 消息,7 月 25 日,AMD 宣布推出全開源混合專家模型(MoE)Instella-MoE;該模型擁有 160 億總參數,每個 Token 啟動 28 億參數,號稱在同規模開源語言模型中具備領先效能。
AMD 表示,Instella-MoE 完全基於自家 AMD Instinct MI300X 和 MI325X GPU,以及 ROCm 軟體堆疊,從零訓練完成,並採用 Gated Multi-head Latent Attention(Gated MLA)和 FarSkip-Collective 等架構創新,以提升訓練和推理效率。
效能測試顯示,Instella-MoE-16B-A3B 基礎模型平均得分達到 76.7 分,在全開源模型中排名領先,超過 SmolLM3-3B、OLMo-3-7B 等模型,並在僅啟動 28 億參數的情況下,與更大規模模型競爭。
此外,該模型支援 64K Token 長上下文處理,並完成預訓練、中期訓練、長上下文擴展、監督微調(SFT)、直接偏好最佳化(DPO)以及強化學習(RL)等完整訓練流程。
AMD 此次同步公開 Instella-MoE 全部模型權重、訓練配置、資料配比、中間檢查點及推理程式碼,推動開放 AI 模型研究與復現。
AMD 表示,Instella-MoE 展示了基於 AMD 硬體和開放軟體生態進行大規模 MoE 模型訓練的能力,未來將持續推進更大規模、更強推理能力和更高效率的開源語言模型研發。