Moonshot AI が最大級のオープンな AI モデル「Kimi K3」をリリース - ForkLog

AI-agents ИИ агенты 3# Moonshot AI、最大規模のオープン型AIモデル「Kimi K3」を発表

中国のAIスタートアップMoonshot AIは「Kimi K3」を発表しました。世界初となる、2.8兆パラメータ、ネイティブ視覚、コンテキスト長100万トークンを備えたクラス3Tのオープンモデルです。プロジェクト自身の評価によれば、総合順位では専有モデルのClaude Fable 5とGPT-5.6 Solにのみ劣りました。

Kimi K3は新しいアーキテクチャ「Kimi Delta Attention(KDA)」と「Attention Residuals(AttnRes)」に基づいています。KDAはデータの長い系列をより効率的に処理することを可能にし、AttnResは必要な情報をすべての層から同じように引き出すのではなく、選択的に取り出します。その結果、モデルはより深くコンテキストを理解し、複雑な文章を処理する場合でも意味を保ちます。

疎(スパース)化には「Stable LatentMoE」フレームワークが使われます。896のエキスパートのうち、同時に動作するのは16のみです。これにより、新しいデータと学習設定を組み合わせた結果、効率はK2に比べて2.5倍の向上を達成しました。

開発者によれば、過去12か月のうち直近の9か月で、Kimiモデルはオープンモデルの中でサイズ面の記録を維持してきました。

出典:Kimiのブログ。新しいMoonshot AIのモデルはすでに公式サイト、Kimi Work、Code、APIで利用可能です。デフォルトでは最大の推論モードが有効で、その他は後日提供されます。完全な重みとレポートは7月27日に公開されます。

ベンチマーク結果

一部のテストではK3がFable 5やGPT-5.6 Solより高い結果を示しましたが、他では明確に劣りました。SWE Marathonではトップ(42対35、39)、BrowseCompではトップ(91.2対88、90.4)、Program Benchでもトップ(77.8対76.8、77.6)です。Terminal Bench 2.1ではK3のスコアは88.3で、Fable 5(84.6)を上回り、Sol(88.8)とは0.5点差です。

一方でFrontierSWEではK3が81.2で、Fable 5の86.6に及ばず、HLE-Fullでは43.5対53.3でした。テスト手法も異なっており、一部のモデルはClaude Codeで評価され、別のモデルはCodexまたは独自のKimiCodeで評価されました。

コーディングとエージェント型タスク

K3は、人の介入をほぼ必要とせずに長時間のエンジニアリングセッションを進め、大規模リポジトリを把握し、ターミナルツールを管理できます。

GPUコア最適化のテストでは、モデルの核となるAttnRes、KDA、MLA(ヘッド次元512を含む)の4つのタスクについて、NVIDIA H200と別メーカーのGPU上で、核となる作業が最大24時間にわたって独立に実行されました。K3はFable 5と同水準の結果を示し、Opus 4.8、GPT-5.6 Sol、GPT-5.5を大きく上回りました。開発の後半段階では、Kimiの初期版K3がMoonshotチーム内で行うこうした最適化の大部分を、単独で自走して実施しました。

出典:Kimiのブログ。別途、モデル単体でゼロから「MiniTriton」を作成しました。これはGPUコア向けのコンパクトなコンパイラで、自前のIR層をMLIRの上に持ち、PTXコードを生成します。

チップ設計とゲーム開発

デモとしてK3は、自身のアーキテクチャ上でニューラルネット用のチップを自動設計しました。

自律実行には48時間かかり、モデルはオープンソースのEDAツールと「Nangate 45nm」ライブラリを使用しました。チップは4mm²に収まり、100MHzの周波数を維持し、シミュレーションでは1秒あたり8700トークン超を出力します。1.46百万の標準セル、0.277MBのSRAM、内蔵デクアンタイゼーションを備えたINT4のMACアレイを含みます。

またK3は、3D推論、コード、視覚を組み合わせて、コンセプト、画像、動画からゲームやインタラクティブなプロトタイプを作成します。

知識と動画の扱い

あるケースでK3は、計算天体物理学の分野にある普遍的なI-Love-Qの関係を再現しました。これには、熟練した研究者が1〜2週間かけて行う作業の代わりに、約2時間しかかかりませんでした。モデルは20以上の科学論文を検証し、300を超える状態方程式を評価し、公開された式の不整合を見つけ、Pythonで3000行以上のコードを書いて、その結果をインタラクティブなHTMLダッシュボードとしてまとめました。

別のケースではK3が、再帰的自己改善による120ラウンドを通じて「ASICチップ業界の42年の歴史」を対象に、インタラクティブなレポートを準備しました。87の四半期レポートと99のオリジナルPDFから、11,000ページ以上を処理しました。

出典:Kimiのブログ。動画をネイティブに扱えるため、K3は動画編集ができます。ある例では、モデルが3Blue1Brown風のスタイルで自身のアーキテクチャを説明するアニメーションを制作し、別の例では、56本の元クリップから自身の起動(ローンチ)に関するティザーを単独で編集しました。フレームの選定、音楽との同期、音声処理を含みます。Moonshotの見積もりでは、この作業は熟練した編集者なら1〜2日、新人なら3〜5日かかるとのことです。

制限

プロジェクトチームは、K3はセッションの途中でエージェント環境を切り替えると「推論履歴」を失いやすく、その結果としてあいまいな状況で過度に主導的な行動をとることがあると強調しました。使いやすさの面では、現時点でモデルはFable 5やGPT-5.6 Solに比べてまだ明確に劣っています。

改めて、2025年7月にMoonshot AIはKimi K2をリリースしました。これは1兆パラメータを備えた最初のシリーズモデルで、エージェント型タスク向けの主要なオープンシステムの1つとして急速に成長しました。

NVDA0.11%
原文表示
このページには第三者のコンテンツが含まれている場合があり、情報提供のみを目的としております(表明・保証をするものではありません)。Gateによる見解の支持や、金融・専門的な助言とみなされるべきものではありません。詳細については免責事項をご覧ください。
  • 報酬
  • コメント
  • リポスト
  • 共有
コメント
コメントを追加
コメントを追加
コメントなし
  • ピン留め