廣場
最新
熱門
新聞
我的主頁
發布
Daniel Romero
2026-07-27 08:30:11
關注
$AMD
已發布一款最先進、完全開放的模型,使用 ROCm,並且完全在 MI300X 與 MI325X GPU 上進行訓練
Instella-MoE 是一款 160 億參數的混合專家(mixture-of-experts)模型,每個 token 只啟用 28 億參數,能在保持與同等或更高啟用參數數量的稠密模型與 MoE 模型競爭力的同時,降低推論成本
它支援 64K 的內容視窗,並透過六個階段訓練完成,從預訓練到強化學習
AMD 也同時提出兩項新的效率技術:
- 受閘多頭潛在注意力(Gated Multi-head Latent Attention),會過濾低價值的注意力輸出。
- FarSkip-Collective,能讓通訊與運算重疊,使預訓練速度提升 12.7%,且「首個 token」時間最多降低 39.2%。
AMD
-3.29%
查看原文
此頁面可能包含第三方內容,僅供參考(非陳述或保證),不應被視為 Gate 認可其觀點表述,也不得被視為財務或專業建議。詳見
聲明
。
4人按讚了這條動態
打賞
4
2
轉發
分享
回覆
請輸入回覆內容
請輸入回覆內容
回覆
GateUser-17ba047d
· 55分鐘前
區塊鏈技術如何運作
查看原文
回復
0
mehedi667
· 1小時前
😉🔥
回復
0
熱門話題
查看更多
#
直通IPO第二期JerseyMikes
190.22萬 熱度
#
長鑫今日上市成交901億
4.45萬 熱度
#
ETH重返1900美元
1.31億 熱度
#
夏日創作營
76.27萬 熱度
#
CLARITY法案進入最後關鍵階段
11.73萬 熱度
已置頂
網站地圖
$AMD 已發布一款最先進、完全開放的模型,使用 ROCm,並且完全在 MI300X 與 MI325X GPU 上進行訓練
Instella-MoE 是一款 160 億參數的混合專家(mixture-of-experts)模型,每個 token 只啟用 28 億參數,能在保持與同等或更高啟用參數數量的稠密模型與 MoE 模型競爭力的同時,降低推論成本
它支援 64K 的內容視窗,並透過六個階段訓練完成,從預訓練到強化學習
AMD 也同時提出兩項新的效率技術:
- 受閘多頭潛在注意力(Gated Multi-head Latent Attention),會過濾低價值的注意力輸出。
- FarSkip-Collective,能讓通訊與運算重疊,使預訓練速度提升 12.7%,且「首個 token」時間最多降低 39.2%。