月の暗黒面が今週発表したKimi K3は、2.8兆の総パラメータにより史上最大のオープンソース重みモデルとなり、完全な重みは7月27日までに公開予定。公式のデプロイ手順では、自前で構築する場合は少なくとも64枚のアクセラレータが必要と明記されており、シングルユーザーはK2ファミリーか、公式APIの2ルート。 (前情報:月の暗黒面 Moonshot AIがKimi K3をまもなくリリース!2.8兆のパラメータと100万長文テキストを備え、性能はAnthropic Opus 4.8に迫る) (背景補足:私のPCでAIモデルをローカル実行できますか?CanIRun.aiがすぐに分析します)
目次
Toggle
今週少し前に、月の暗黒面(Moonshot AI)がKimi K3を発表しました。総パラメータは2.8兆で、史上最大のオープンソース重みモデルです。この2.8兆個のパラメータをハードディスクに保存するだけでも、公式のネイティブ4bit形式(MXFP4)で1.4TB〜1.5TBの容量が必要で、まだ推論の実行は始まっていません。一般の人にとっての敷居は非常に非常に高いです。
月の暗黒面によると、完全なオープンソース重みは7月27日までに公開予定で、Modified-MITライセンスを採用し、自分での立ち上げを許可します。締切時点では、完全な重みとコミュニティ量子化版(たとえばGGUF)はまだ登場していません。
Kimi K3はMoE(混合エキスパート)アーキテクチャを採用しています。簡単に言うと、モデル内部に896個の「エキスパート」サブネットワークを持ち、1つのtokenを処理するときに、そのうち16個のルーティングするエキスパートと共有エキスパートの計算だけを選び、全部を計算するわけではありません。これが、実際に「起きて」働いているパラメータが500億〜600億にとどまる理由です。
さらにモデルは新アーキテクチャKimi Delta Attention(KDA)とAttention Residualsを組み合わせています。公式評価では、100万tokenの長いコンテキストでのデコード速度が最大6.3倍向上し、コンテキストウィンドウは100万tokenにも対応しており、視覚入力もネイティブでサポートします。
月の暗黒面の公式デプロイガイドには、自前でK3を構築するには少なくとも64枚以上のアクセラレータが必要だと書かれています。ネイティブMXFP4の重みは約1.5TBで、DeepSeek-R1 671B(Q4量子化で約407GB)の3.7倍です。単純に重みを載せるだけで必要なGPU枚数は次のとおり:
なお、これはKVキャッシュの計算を含んでいません。KVキャッシュとは、モデルが会話のコンテキストを記憶するために使うメモリです。100万tokenの長いコンテキストにおけるKVキャッシュ需要は公式からまだ公開されていませんが、減ることはなく、むしろ増えるだけです。
価格面では、H100 80GBの1枚あたりはPCIe版で約2.5万〜3.3万ドル、SXM版は3.5万〜4万ドル以上です。8枚構成のH100サーバー1台は30万ドルを超えます。公式の64枚という敷居に従うと、8台の8枚構成サーバーに相当し、ハードウェア購入だけで240万ドル超、約新台湾ドル7,000万以上です。
消費電力面では、H100は1枚あたり約700Wで、64枚のGPUだけで約45kW。一般家庭の電源容量を大きく超え、データセンター級の電力が必要です。
前世代のK2ファミリー(1兆パラメータ、約320億有効パラメータ)と比べると、その差がよりはっきりします。コミュニティがK2向けに作った1.8bitの極限量子化では、約247GBで実行でき、24GBのコンシューマー向けグラフィックスカード1枚に加えて、システムメモリのオフロード構成でも動かせます。K2.5は380GBを超える統一メモリが必要で、K2.6のQ2版は約350GBです。
前世代は512GBのMac Studioならぎりぎり動きますが、K3はその敷居をデータセンター級へと一気に引き上げています。一般の個人ユーザーが使いたいなら、素直にK2ファミリーへダウングレードするか、公式APIを直接呼び出すのがよいでしょう。
9.07M 人気度
770.49K 人気度
72.53K 人気度
275.5K 人気度
1.08M 人気度
ローカルでKimi K3を動かすためのハード要件?64枚のGPUから開始、45kWの電力、プレイヤーが自作して組み上げる
月の暗黒面が今週発表したKimi K3は、2.8兆の総パラメータにより史上最大のオープンソース重みモデルとなり、完全な重みは7月27日までに公開予定。公式のデプロイ手順では、自前で構築する場合は少なくとも64枚のアクセラレータが必要と明記されており、シングルユーザーはK2ファミリーか、公式APIの2ルート。
(前情報:月の暗黒面 Moonshot AIがKimi K3をまもなくリリース!2.8兆のパラメータと100万長文テキストを備え、性能はAnthropic Opus 4.8に迫る)
(背景補足:私のPCでAIモデルをローカル実行できますか?CanIRun.aiがすぐに分析します)
目次
Toggle
今週少し前に、月の暗黒面(Moonshot AI)がKimi K3を発表しました。総パラメータは2.8兆で、史上最大のオープンソース重みモデルです。この2.8兆個のパラメータをハードディスクに保存するだけでも、公式のネイティブ4bit形式(MXFP4)で1.4TB〜1.5TBの容量が必要で、まだ推論の実行は始まっていません。一般の人にとっての敷居は非常に非常に高いです。
月の暗黒面によると、完全なオープンソース重みは7月27日までに公開予定で、Modified-MITライセンスを採用し、自分での立ち上げを許可します。締切時点では、完全な重みとコミュニティ量子化版(たとえばGGUF)はまだ登場していません。
MoEとは何?
Kimi K3はMoE(混合エキスパート)アーキテクチャを採用しています。簡単に言うと、モデル内部に896個の「エキスパート」サブネットワークを持ち、1つのtokenを処理するときに、そのうち16個のルーティングするエキスパートと共有エキスパートの計算だけを選び、全部を計算するわけではありません。これが、実際に「起きて」働いているパラメータが500億〜600億にとどまる理由です。
さらにモデルは新アーキテクチャKimi Delta Attention(KDA)とAttention Residualsを組み合わせています。公式評価では、100万tokenの長いコンテキストでのデコード速度が最大6.3倍向上し、コンテキストウィンドウは100万tokenにも対応しており、視覚入力もネイティブでサポートします。
公式の敷居:64枚のGPUから
月の暗黒面の公式デプロイガイドには、自前でK3を構築するには少なくとも64枚以上のアクセラレータが必要だと書かれています。ネイティブMXFP4の重みは約1.5TBで、DeepSeek-R1 671B(Q4量子化で約407GB)の3.7倍です。単純に重みを載せるだけで必要なGPU枚数は次のとおり:
なお、これはKVキャッシュの計算を含んでいません。KVキャッシュとは、モデルが会話のコンテキストを記憶するために使うメモリです。100万tokenの長いコンテキストにおけるKVキャッシュ需要は公式からまだ公開されていませんが、減ることはなく、むしろ増えるだけです。
価格面では、H100 80GBの1枚あたりはPCIe版で約2.5万〜3.3万ドル、SXM版は3.5万〜4万ドル以上です。8枚構成のH100サーバー1台は30万ドルを超えます。公式の64枚という敷居に従うと、8台の8枚構成サーバーに相当し、ハードウェア購入だけで240万ドル超、約新台湾ドル7,000万以上です。
消費電力面では、H100は1枚あたり約700Wで、64枚のGPUだけで約45kW。一般家庭の電源容量を大きく超え、データセンター級の電力が必要です。
前世代なら1台のPCに収まる
前世代のK2ファミリー(1兆パラメータ、約320億有効パラメータ)と比べると、その差がよりはっきりします。コミュニティがK2向けに作った1.8bitの極限量子化では、約247GBで実行でき、24GBのコンシューマー向けグラフィックスカード1枚に加えて、システムメモリのオフロード構成でも動かせます。K2.5は380GBを超える統一メモリが必要で、K2.6のQ2版は約350GBです。
前世代は512GBのMac Studioならぎりぎり動きますが、K3はその敷居をデータセンター級へと一気に引き上げています。一般の個人ユーザーが使いたいなら、素直にK2ファミリーへダウングレードするか、公式APIを直接呼び出すのがよいでしょう。