# Moonshot AI 發布了最大型的開放式 AI 模型 Kimi K3
中國 AI 新創 Moonshot AI 發表了 Kimi K3—全球首個 3T 級別的開放式模型,具備 2,8 兆(trillion)參數、原生視覺與 100 萬 token 的上下文。根據該專案自評的綜合成績,它只輸給了專有的 Claude Fable 5 以及 GPT 5.6 Sol。
Kimi K3 建立在全新的 Kimi Delta Attention(KDA)與 Attention Residuals(AttnRes)架構之上。KDA 讓處理長序列資料更有效率,而 AttnRes 並非在所有層以相同方式擷取所需資訊,而是進行選擇性擷取。因而模型能更深入理解上下文,即使在處理複雜文本時也能保留意義。
稀疏性由 Stable LatentMoE 框架負責:896 位專家同時僅有 16 位運作。再加上新的資料與訓練設定,整體使效率相較 K2 提升到 2.5 倍。
依據開發者說法,在過去 12 個月的最後 12 個月裡,有 9 個月 Kimi 模型都創下開放式模型中規模最大的紀錄。
來源:Kimi 部落格。Moonshot AI 的新模型已在網站、Kimi Work、Code 與 API 提供。預設啟用最大推理模式,其他模式將稍後推出。完整權重與報告將於 7 月 27 日發布。
在部分測試中,K3 的表現優於 Fable 5 與 GPT-5.6 Sol,但在其他測試中明顯落後。它在 SWE Marathon(42 對 35 與 39)、BrowseComp(91,2 對 88 與 90,4)以及 Program Bench(77,8 對 76,8 與 77,6)中位居領先。至於 Terminal Bench 2.1,K3 得分為 88,3:比 Fable 5(84,6)更高,且僅比 Sol(88,8)低 0,5 分。
同時,在 FrontierSWE 上 K3 為 81,2,而 Fable 5 為 86,6;在 HLE-Full 上 K3 為 43,5,而 Fable 5 為 53,3。測試方法也有所不同:部分模型透過 Claude Code 評估,其他則透過 Codex 或自家 KimiCode 評估。
K3 能在幾乎不需人工介入的情況下,進行長時間的工程作業,能夠在大型程式庫中進行定位,並能管理終端工具。
在 GPU 核心最佳化測試中,模型的核心可在不相互依賴的情況下各自獨立運行長達 24 小時,針對四項任務—包括維持 AttnRes、KDA 與 MLA(頭部維度 512)—在 NVIDIA H200 以及其他廠牌的 GPU 上完成。K3 的結果達到 Fable 5 等級,並明顯超越 Opus 4.8、GPT-5.6 Sol 與 GPT-5.5。在開發後期階段,K3 的早期版本已能在 Moonshot 團隊內部自行完成此類大量最佳化的大部分工作。
來源:Kimi 部落格。另有一個從零開始的模型獨立編寫了 MiniTriton—一款用於 GPU 核心的緊湊型編譯器,具備自有 IR 層並直接建立在 MLIR 之上,且可生成 PTX 程式碼。
作為示範,K3 可在自家架構上自行為神經網路設計晶片。
全自主啟動耗時 48 小時:模型使用開源 EDA 工具與 Nangate 45 nm 程式庫。晶片面積為 4 平方毫米(mm²),工作頻率保持在 100 MHz,且在模擬中可輸出每秒超過 8700 個 token。該晶片包含 140 萬(1,46 百萬)個標準單元、0,277 MB SRAM 與內建去量化的 INT4 MAC 陣列。
K3 也把 3D 推理、程式碼與視覺結合起來,用概念、影像與影片來建立遊戲與互動式原型。
在一個案例中,K3 重現了計算天體物理中的通用 I-Love-Q 關係。這花費約兩小時,而不是資深研究員原本需要的一到兩週。模型檢查了超過 20 篇科學論文、評估了超過 300 個狀態方程,找出已發表公式中的不一致,並編寫了超過 3000 行 Python 程式碼,將結果整理成互動式 HTML 儀表板。
在另一個案例中,K3 準備了關於 ASIC 晶片產業 42 年歷史的互動式報告,透過 120 輪遞迴式自我改善進行,處理了來自 87 份季度報告的超過 11,000 頁資料,以及 99 份原始 PDF。
來源:Kimi 部落格。透過原生的影片處理能力,K3 會剪輯影片:在一個範例中,模型製作了以 3Blue1Brown 風格呈現的自家架構解說動畫;在另一個範例中,K3 自行剪輯了關於自家啟動的預告片,使用 56 個原始剪輯素材,包含挑選鏡頭、與音樂同步以及聲音處理。依 Moonshot 的評估,這種工作對資深剪輯師需要一到兩天,對新手則是三到五天。
專案團隊強調,K3 在代理環境於會話中途切換時,對推理歷史的遺失很敏感,並且可能在不明確情況下表現過度主動。就易用性而言,模型目前仍明顯落後於 Fable 5 與 GPT-5.6 Sol。
提醒一下,於 2025 年 7 月,Moonshot AI 發布了 Kimi K2—該系列首個具備 1 兆(trillion)參數的模型,並很快成為領先的開放式代理任務系統之一。
13萬 熱度
20.45萬 熱度
111.43萬 熱度
5.88萬 熱度
166.44萬 熱度
Moonshot AI 發布了最大的開源 AI 模型 Kimi K3 - ForkLog
中國 AI 新創 Moonshot AI 發表了 Kimi K3—全球首個 3T 級別的開放式模型,具備 2,8 兆(trillion)參數、原生視覺與 100 萬 token 的上下文。根據該專案自評的綜合成績,它只輸給了專有的 Claude Fable 5 以及 GPT 5.6 Sol。
Kimi K3 建立在全新的 Kimi Delta Attention(KDA)與 Attention Residuals(AttnRes)架構之上。KDA 讓處理長序列資料更有效率,而 AttnRes 並非在所有層以相同方式擷取所需資訊,而是進行選擇性擷取。因而模型能更深入理解上下文,即使在處理複雜文本時也能保留意義。
稀疏性由 Stable LatentMoE 框架負責:896 位專家同時僅有 16 位運作。再加上新的資料與訓練設定,整體使效率相較 K2 提升到 2.5 倍。
依據開發者說法,在過去 12 個月的最後 12 個月裡,有 9 個月 Kimi 模型都創下開放式模型中規模最大的紀錄。
基準測試結果
在部分測試中,K3 的表現優於 Fable 5 與 GPT-5.6 Sol,但在其他測試中明顯落後。它在 SWE Marathon(42 對 35 與 39)、BrowseComp(91,2 對 88 與 90,4)以及 Program Bench(77,8 對 76,8 與 77,6)中位居領先。至於 Terminal Bench 2.1,K3 得分為 88,3:比 Fable 5(84,6)更高,且僅比 Sol(88,8)低 0,5 分。
同時,在 FrontierSWE 上 K3 為 81,2,而 Fable 5 為 86,6;在 HLE-Full 上 K3 為 43,5,而 Fable 5 為 53,3。測試方法也有所不同:部分模型透過 Claude Code 評估,其他則透過 Codex 或自家 KimiCode 評估。
程式編寫與代理任務
K3 能在幾乎不需人工介入的情況下,進行長時間的工程作業,能夠在大型程式庫中進行定位,並能管理終端工具。
在 GPU 核心最佳化測試中,模型的核心可在不相互依賴的情況下各自獨立運行長達 24 小時,針對四項任務—包括維持 AttnRes、KDA 與 MLA(頭部維度 512)—在 NVIDIA H200 以及其他廠牌的 GPU 上完成。K3 的結果達到 Fable 5 等級,並明顯超越 Opus 4.8、GPT-5.6 Sol 與 GPT-5.5。在開發後期階段,K3 的早期版本已能在 Moonshot 團隊內部自行完成此類大量最佳化的大部分工作。
晶片設計與遊戲開發
作為示範,K3 可在自家架構上自行為神經網路設計晶片。
全自主啟動耗時 48 小時:模型使用開源 EDA 工具與 Nangate 45 nm 程式庫。晶片面積為 4 平方毫米(mm²),工作頻率保持在 100 MHz,且在模擬中可輸出每秒超過 8700 個 token。該晶片包含 140 萬(1,46 百萬)個標準單元、0,277 MB SRAM 與內建去量化的 INT4 MAC 陣列。
K3 也把 3D 推理、程式碼與視覺結合起來,用概念、影像與影片來建立遊戲與互動式原型。
知識與影片處理
在一個案例中,K3 重現了計算天體物理中的通用 I-Love-Q 關係。這花費約兩小時,而不是資深研究員原本需要的一到兩週。模型檢查了超過 20 篇科學論文、評估了超過 300 個狀態方程,找出已發表公式中的不一致,並編寫了超過 3000 行 Python 程式碼,將結果整理成互動式 HTML 儀表板。
在另一個案例中,K3 準備了關於 ASIC 晶片產業 42 年歷史的互動式報告,透過 120 輪遞迴式自我改善進行,處理了來自 87 份季度報告的超過 11,000 頁資料,以及 99 份原始 PDF。
限制
專案團隊強調,K3 在代理環境於會話中途切換時,對推理歷史的遺失很敏感,並且可能在不明確情況下表現過度主動。就易用性而言,模型目前仍明顯落後於 Fable 5 與 GPT-5.6 Sol。
提醒一下,於 2025 年 7 月,Moonshot AI 發布了 Kimi K2—該系列首個具備 1 兆(trillion)參數的模型,並很快成為領先的開放式代理任務系統之一。