世界モデル(World Model)は、AI が「世界がどのように機能しているか」を内部で表すモデルを構築し、空間・物理・因果関係を理解できるようにするものです。予測するのは、次の文字ではなく世界の次の状態です。自動運転車、ロボット、ゲームのシーンなどで実際に導入が進んでいますが、画面のリアルさは物理的な正確さとは同じではありません。LLM と世界モデル、どちらが AGI への正しい道なのか——これは、いまも業界最大級の論争の一つです。
(前情提要:李飛飛が語る LLM の次の一手:AI には「空間知能」が必要で、現実世界を理解できる。Marble モデルはどう実現する?)
(背景補足:Serenity:世界モデルは AI 圏で最大の共通認識。中国資金が基礎モデルを捨て、物理 AI へ転換)
目次
Toggle
世界モデルは何?
世界モデルと大型言語モデル(LLM)の違いは?
世界モデルはどう運用される?潜在空間と「次の瞬間の予測」
2026 世界モデルの戦局:四大巨頭は何に賭けている?
世界モデルで何ができる?自動運転、ロボット、ゲームの実例
世界モデルの論争と制限:本当に LLM より強いのか?
世界モデルの未来:AGI へのもう一つの道?
世界モデル(World Model)は、現在 AI 業界で最も頻繁に話題にされる一方で、最も誤解されやすい名詞の一つです。端的に言うと、世界モデルとは、AI に「世界がどのように運用されているか」を内部で表すモデルを構築させ、それにより空間・物理・因果関係を理解し、そのうえでこれから何が起きるかを予測するためのシステムです。
ChatGPT や Claude のような人々に馴染みのある大型言語モデル(LLM)とは、技術の路線がまったく違います。LLM は「次の文字」を予測し、世界モデルは「世界の次の状態」を予測します。
世界モデル(World Model)とは何?世界を覆す方法、運用原理、4大企業の覇権争いと論争
世界モデル(World Model)は、AI が「世界がどのように機能しているか」を内部で表すモデルを構築し、空間・物理・因果関係を理解できるようにするものです。予測するのは、次の文字ではなく世界の次の状態です。自動運転車、ロボット、ゲームのシーンなどで実際に導入が進んでいますが、画面のリアルさは物理的な正確さとは同じではありません。LLM と世界モデル、どちらが AGI への正しい道なのか——これは、いまも業界最大級の論争の一つです。
(前情提要:李飛飛が語る LLM の次の一手:AI には「空間知能」が必要で、現実世界を理解できる。Marble モデルはどう実現する?)
(背景補足:Serenity:世界モデルは AI 圏で最大の共通認識。中国資金が基礎モデルを捨て、物理 AI へ転換)
目次
Toggle
世界モデル(World Model)は、現在 AI 業界で最も頻繁に話題にされる一方で、最も誤解されやすい名詞の一つです。端的に言うと、世界モデルとは、AI に「世界がどのように運用されているか」を内部で表すモデルを構築させ、それにより空間・物理・因果関係を理解し、そのうえでこれから何が起きるかを予測するためのシステムです。
ChatGPT や Claude のような人々に馴染みのある大型言語モデル(LLM)とは、技術の路線がまったく違います。LLM は「次の文字」を予測し、世界モデルは「世界の次の状態」を予測します。
世界モデルは何?
世界モデル(World Model)を簡単に言えば、AI に「頭の中で擬似的にシミュレーションする」能力を学ばせる技術です。例を挙げると、人間が横断歩道を渡る前には、脳内で「いま足を踏み出したら、あの車はあと何秒で自分の前に来るか」を自動で事前に予演します。この予演は、実際に車の前まで行って一度試してみないと結果が分からない、ということにはなりません。
世界モデルは、AI にもこの能力を持たせます。内部でさまざまな可能性をシミュレーションしてから次の行動を決めるのであって、毎回リアルな世界で試行錯誤する必要がありません。
スタンフォード大学のコンピュータサイエンス教授で、AI 分野の指標となる人物である李飛飛は、世界モデルの機能を 3 つに分解しています。
彼女が創業した World Labs が手がけるプロダクト Marble は、まさにこの 3 つ目の「シミュレーションとインタラクション」を主軸にしており、技術チェーン全体の中でも最も重要で、かつ最も難しい部分だと見なされています。「きれいな絵を 1 枚生成する」だけなら難しくありません。難しいのは、「入って歩けて、操作できて、物理ロジックも妥当な」空間を生成することです。
この潮流が 2026 年に集中して爆発した理由の一つは、業界で LLM の天井が見えてきたことへの強い焦りがあるからです。「文字でつなぐ」路線の限界がますます明確になるにつれ、研究者の一部は賭け先を別の道に切り替え、「世界」そのものを理解するよう AI に直接学ばせ、人間が世界をどう描写するかの模倣だけにとどめないようにしようと考え始めました。
まず、よくある誤解をはっきりさせておきます。世界モデルは、LLM の対話や文章作成を置き換えるためのものではありません。解決しようとしている問題がまったく別です。空間推論、物理シミュレーション、行動計画です。だからこそ、物理世界の理解が必要な自動運転車、ロボット、ゲームのような領域で先に実装が進み、チャットボットではないのです。
世界モデルと大型言語モデル(LLM)の違いは?
大型言語モデル(LLM)は Transformer アーキテクチャに基づいており、動作は「系列中の次の token(トークン)」を予測することです。簡単に言えば、LLM は非常に大量の文字を読み込むことで、「この文章の次に最も起こりそうな文字」を学習します。演算の全過程は「文字空間」の中で行われます。
LLM はそもそも物理世界を実際に「見た」り「シミュレーションした」ことはありません。内部には重力も衝突も空間座標もなく、あるのは文字同士の統計的な関係だけです。
世界モデルは別の道を行きます。Yann LeCun が提案した JEPA が代表例で、元画像の各ピクセルを予測したり、文字 token を予測したりはしません。代わりに「潜在空間」で、未来状態の抽象表現を予測します。
平たく言うと、重要でない雑音の細部(たとえば背景の壁に映り込んでいる反射)を能動的に捨て、世界を理解するのに必要なコア情報だけを残します。ボールがどの方向に転がっているのか、車はあと何秒で交差点に着くのか——そういった情報です。出力が、明確で検証可能な内部状態に基づいているため、モデルが「内部で考えたもの」と「出力」が一致しない場合、その不一致は比較的検出しやすくなります。これは LLM では難しいことです。
両者の違いは、次の表で素早く比較できます。
| 比較項目 | | --- | 大型言語モデル(LLM) | 世界モデル(World Model) | | --- | --- | | 予測目標 | 次の token(文字) | 世界の次の状態 | | 運用空間 | 文字 / 言語空間 | 潜在空間(latent space) | | コアアーキテクチャ | Transformer | JEPA、拡散モデル、自回帰 Transformer など | | 物理の理解 | 物理をシミュレーションせず、内部世界モデルなし | 物体の移動、衝突、重力などの物理法則を学習 | | 典型的な誤り | 幻覚(多くのモデルで 15% 以上) | 画面は逼真でも物理が正しいとは限らない | | 代表的な応用 | 対話、文章作成、コード生成 | 自動運転シミュレーション、ロボット訓練、探索可能な 3D 世界 |
一つ注意点として、「画面が見た目にリアル」=「物理的に正しい」ではありません。動画生成をベースにした世界モデルは、訓練目標が「見た目が本物っぽいか」により直接的に向けられるため、「物理的に不合理かどうか」を必ずしも同等に最適化するわけではありません。自動運転車やロボットのように許容誤差が極めて小さい場面では、これは決定的な違いであり、今後の論争の核心の一つでもあります。
世界モデルはどう運用される?潜在空間と「次の瞬間の予測」
世界モデルの運用ロジックを理解するには、まず「潜在空間」と「次の瞬間の予測」という 2 つの用語を押さえる必要があります。
潜在空間を簡単に言えば、AI が目の前の映像を「圧縮」して一連の抽象的な数値に変換し、この世界を理解するのに役立つ情報だけを残し、余計な視覚ノイズを捨てるということです。
例を挙げると、ドライブレコーダーの映像の中で、潜在空間には「前方に車がいる、距離は縮まっている、速度は中程度」といった抽象的な説明だけが残り、映像に写る細かな葉の色まで逐一記録はしないかもしれません。そうする利点は、計算量を大幅に削減できること、そしてモデルが学ぶのは「規則」であって「映像の丸暗記」ではないことです。
潜在空間ができたら、次は「次の瞬間の予測」です。現在の状態に、ある行動(たとえばハンドルを左に切る)を加えたうえで、次の状態がどのようになるかをモデルが予測します。
この過程を繰り返すことで、「未来を前に押し進めていく」ことができる内部シミュレーターになります。AI は、ある時点で、頭の中でいくつかの未来の可能性を先に走らせてから、どの行動を取るべきかを決められます。実際の世界で一度衝突して結果を知る必要はありません。
JEPA(Joint Embedding Predictive Architecture、共同埋め込み予測アーキテクチャ)は、このロジックを現時点で最も代表的に示している枠組みで、Yang LeCun が 2022 年の論文『A Path Towards Autonomous Machine Intelligence』で提案しました。
JEPA の中核的な主張は、あらゆるピクセルの細部を生成させようとするのではなく(それは計算資源を浪費し、関係のないノイズに引っ張られやすいためです)、抽象レベルで「予測した未来」と「実際の未来」が一致しているかどうかを直接照合することです。
これが、LeCun が「世界モデルは誤りを『検出可能』にする」と言う理由でもあります。出力は、明確な内部表現に整合しなければなりません。ずれていればそれはシグナルです。LLM のように誤りが、見た目は流暢な一連の文章に静かに混ざり込んでしまうのとは違います。
ただし、潜在空間も万能ではありません。モデルはどの細部を捨て、どの細部を残すべきか——それは標準解のないエンジニアリング判断です。多く捨てすぎるとシミュレーションが歪み、捨てるべきでないものまで捨てないと計算効率が落ちます。これは現時点で、各社の世界モデルのアーキテクチャ設計における最大の分岐点の一つでもあります。
2026 世界モデルの戦局:四大巨頭は何に賭けている?
2026 年の世界モデルのレースには、産業界でも存在感の大きい主要プレイヤーが集まり、資金規模も「一時的な技術オモチャ」ではないことを示すほどの大きさになっています。
李飛飛が創業した World Labs は、この波の最初期に注目を集めた企業です。2024 年 9 月、World Labs は 2.3 億ドルの資金調達と 10 億ドルのバリュエーションで市場に出てきました。2026 年 1 月には、約 50 億ドルのバリュエーションで次のラウンドを交渉中だと伝えられます。そして 2026 年 2 月 18 日、World Labs は正式に 10 億ドルの調達を発表しました。投資家には AMD、Autodesk、Emerson Collective、Fidelity、NVIDIA、Sea が含まれています。そのうち Autodesk が 2 億ドルをリード投資しており、Autodesk にとって新興企業への投資としては史上最大額だとされています。
累計で見ると、World Labs はこれまでに約 12.3 億ドルを調達しています。旗艦プロダクト Marble は 2025 年 11 月に限定ベータのテストを開始し、2026 年 2 月に正式に商用提供が始まりました。入力はテキスト、写真、動画、パノラマ画像、あるいはラフな 3D モデルで、出力はナビゲーション可能で、持続的に保存でき、編集できる 3D 環境です。さらに 1 回の生成で同時に 2 種類のメッシュが生成されます。高精度なジオメトリ用の triangle mesh と、物理エンジン向けに衝突判定を行うための collider mesh です。
Google DeepMind の Genie 3 は、現時点で唯一「即時インタラクション」を実現している世界モデルです。2025 年 8 月に研究プレビュー形式で登場し、2026 年 1 月 29 日に正式公開。米国地域の Google AI Ultra のサブスクユーザーが利用でき、同時に Project Genie のオンラインデモも提供され、ユーザーが直接世界を生成して探索でき、さらには remix(編集)も可能になっています。
技術仕様として、Genie 3 は 11B パラメータの自回帰(autoregressive)Transformer で、自由にナビゲートできる世界を即時に生成できます。解像度は 720p、毎秒 24 フレーム(24fps)。一貫性も数分間は破綻しない状態を維持できます。
NVIDIA はプラットフォーム戦略を取っています。2025 年 1 月に Cosmos の世界基盤モデル・プラットフォームを発表し、2026 年 6 月 1 日には Cosmos 3 を再び投入。完全にオープンな omnimodel の「初」だと宣伝しています。混合エキスパート式 Transformer アーキテクチャを採用し、視覚推論、世界生成、動作予測の 3 つを単一のシステムに統合。テキスト、画像、動画、環境音、動作など多様なモダリティに対応します。
学習データ規模は驚異的です。約 20 兆 tokens のマルチモーダルデータで、約 10 億枚の画像と、4 億本の実在および合成動画を含みます。NVIDIA は、このシステムによって physical AI(実体 AI)の訓練・評価のサイクルを、従来の数か月から数日へ大幅に短縮できたと述べています。Cosmos 3 にはさらに Super(ロボットや自動運転向けの高精度版)、Nano(極限まで高速化を追求)、Edge の 3 つのバリエーションがあります。NVIDIA は Runway、Black Forest Labs、Skild AI などの企業も集め、Cosmos Coalition という連合も組成しました。
Yann LeCun の動きは最もドラマチックです。2025 年 11 月、彼は 12 年在籍し FAIR の所長を務めていた Meta を離れ、Alexandre LeBrun とともに AMI Labs を共同創業。拠点はパリで、ほかにニューヨーク、モントリオール、シンガポールにも拠点があります。
2026 年 3 月 10 日、AMI Labs はシードラウンドで 10.3 億ドル(約 8.9 億ユーロ)を調達したと発表しました。事前評価額(投前バリュエーション)は 35 億ドルで、これは欧州の新興企業史上最大のシードラウンド資金調達額です。投資家には Bezos Expeditions、NVIDIA、Samsung、Temasek、Toyota Ventures といった有名企業のほか、Mark Cuban、Eric Schmidt などの著名な個人投資家も名を連ねています。LeCun は長年にわたり「LLM では汎用人工知能に到達できない」と公に主張してきました。いま彼は Meta を離れた後のキャリア全体と、10.3 億ドルを、世界モデルの路線に全額賭ける形になっています。
四社の位置づけを簡単に対照すると以下の通りです。
| 会社 / チーム | | --- | 主要人物 | 代表プロダクト | 最新の調達 / 規模 | 技術的な位置づけ | | --- | --- | --- | --- | --- | | World Labs | 李飛飛 | Marble | 累計 約 12.3 億ドル(2026/2 の単一ラウンドで 10 億ドル) | ナビゲーション可能で持続的な 3D 空間生成 | | Google DeepMind | DeepMind チーム | Genie 3 | Google の社内リソース支援 | 11B パラメータ、即時インタラクションの世界生成 | | NVIDIA | NVIDIA チーム | Cosmos 3 | NVIDIA の自社リソース + Cosmos Coalition 連合 | オープン型 omnimodel プラットフォームで physical AI を主戦場に | | AMI Labs | Yann LeCun | JEPA シリーズ研究 | シードで 10.3 億ドル、評価額 35 億ドル | JEPA 潜在空間予測アーキテクチャで、理論路線は最も強気 |
この 4 社の技術路線は完全に同一ではありません。World Labs は実用的な 3D 空間プロダクトを重視し、Genie 3 は即時インタラクションに注力し、Cosmos 3 はオープンプラットフォームを目指し、AMI Labs は基盤アーキテクチャ研究に集中します。しかし、共通の信念は一致しています。
世界モデルで何ができる?自動運転、ロボット、ゲームの実例
世界モデルが最初に実装されている場面の多くは、ほぼ例外なく「物理世界を理解する必要がある」ことと強く結びついており、自動運転が最も分かりやすい例です。
新興企業 Decart は 2026 年 6 月に Oasis 3 を投入。数時間にわたる高度にリアルな運転環境を即時生成できます。現実では遭遇しにくいが、安全にとって重要な「レアなシーン」を、自動運転車のためにシミュレーションすることを売りにしています。たとえば、豪雨の中で突然飛び出してくる歩行者や、対向車が制御を失って車線をはみ出すケースなどです。
Oasis 3 の API はすでに利用可能で、価格は毎秒 2 セント程度です。狙いは physical AI のサプライチェーンの中でも「シミュレーション層」を押さえることです。Waymo も 2026 年 2 月に、Genie 3 に基づく自社の生成的シミュレーション・アーキテクチャを発表しました。Tesla、NVIDIA、Wayve などの企業も、それぞれ同様のことを進めています。この種の技術の本質的な価値は非常に直接的です。自動運転車が「無限に近い数の模擬シーン」で反復訓練できるようにし、本当に公道で走って衝突を起こして学ぶ必要がなくなることです。
ロボット分野も、もう一つの重要な戦場です。Cosmos 3 や Oasis 3 のようなシステムは、制御可能で複数視点のシミュレーション環境を生成できます。ロボットはこの仮想空間で把持、歩行、物体操作を学び、行動戦略を何度も改善できます。合成データで真の世界のデータ収集を置き換えられるため、ロボットの訓練コストと時間を大幅に削減できます。これまで物理ロボットで実環境における試行錯誤を数千回重ねて覚えなければならなかった動作が、今ではまずシミュレーション環境で一巡させて学べるようになります。
ゲームやコンテンツ制作は、比較的「うれしい」応用シーンです。Genie 3 や Marble は、文章一つの説明から、歩いて探索できる世界を生成できます。これはゲームのプロトタイプ開発や仮想シーン構築に直結する生産性ツールです。同時に、Luma や Runway のように元々動画生成をしていた新興企業も、自社の「物理が分かる」動画生成モデルを世界モデルの方向へ転換し始めています。これは、世界モデルが突如として生まれた新レースではなく、動画生成技術が「インタラクティブで、制御可能」へ進化する自然な次のステップであることを示しています。
これらの事例に共通する点は、世界モデルの価値が「画面がどれだけきれいか」ではなく、「訓練に使えるか、シミュレーションに使えるか、意思決定に使えるか」にあるということです。ここが、単なる動画生成ツールとの最大の境界線です。
世界モデルの論争と制限:本当に LLM より強いのか?
世界モデル陣営の中で最も注目を集めた賭けは Yann LeCun から出ています。彼は Meta を離れ、AMI Labs を創業し、10.3 億ドルのシードラウンド資金を調達しました。本質的には、キャリア全体をある判断に賭けることでした。すなわち「LLM の道筋は永遠に汎用人工知能に到達しない。出口は世界モデルしかない」という判断です。しかし、この立場は業界のコンセンサスではありません。
対立陣営で最も声量が大きいのは Anthropic の CEO、Dario Amodei です。彼の主張は、モデル規模を継続的に拡大し、アーキテクチャ上の漸進的改善を組み合わせる限り、LLM 自体で現時点の制約を突破できるし、楽観的に見れば 2026 年に、彼が「データセンターの中の天才の国」と表現するような能力の飛躍が起きる可能性すらある、というものです。
言い換えると、一方は「既存の路線の天井はもう見えていて、路線変更が必要」と考え、他方は「天井はまだ来ていない。突き進み続けるべきだ」と考えています。この路線争いについては現時点で、いずれの側も決定的な証拠を提示して相手を納得させることができていません。ある意味で、双方とも答えがまだ存在しない問題に対して、真っ当な資金を投入して賭けているような状態です。
世界モデル自身にも破綻はあります。前にも述べた通り、潜在空間の枠組みは「内部の不一致」を検出しやすくします。しかし、それは世界モデルが間違えないという意味ではありません。解決しているのは「誤りが起きるかどうか」ではなく、「誤りが捕捉され得るかどうか」です。より重要な問題は次の点です——画面が逼真であることは、物理的に正しいことではありません。
動画生成をベースにした世界モデルでは、訓練目標はより直接的に「本物っぽく見えるか」に向けられます。その結果、「物理ロジックが不合理かどうか」を同等に最適化するとは限りません。ボールが転がる軌跡が自然で滑らかに見えても、実際の加速度や摩擦力の計算は検証に耐えないかもしれません。これは自動運転やロボットのように「一度のミスが事故につながる」アプリケーション場面では見過ごせないリスクです。
計算能力と遅延コストも現実のハードルです。拡散モデル(diffusion)をベースにした世界モデルでは、1 フレームを生成するたびに複数回のノイズ除去計算が必要です。ロボットや自動運転のように即時反応が求められる場面では、この遅延コストは相当重く、意思決定がワンテンポ遅れます。現実世界では、それが擦れ違いの衝突として起きうるのです。
さらに Open-Sora チームの試算によれば、市販レベルの動画生成モデルを再現するには約 20 万ドルの計算コストが必要だとされています。これは「既存成果を再現する」ためのハードルであり、ゼロから新しいアーキテクチャを開発する研発投資は含んでいません。
世界モデルの未来:AGI へのもう一つの道?
これらの手がかりを合わせてみると、はっきりした産業シグナルが見えてきます。2026 年には、世界モデルは学術概念から、数十億ドルを動員し、産業界でもっとも重みのある人材が集まる路線争いへと変わりました。李飛飛は Marble によって「ナビゲーション可能な 3D 世界」がプロダクトになり得ることを示しました。Google DeepMind は Genie 3 で「即時インタラクション」技術が成立し得ることを証明しました。NVIDIA は Cosmos 3 でそれをオープンプラットフォームにし、physical AI のサプライチェーン全体を取りにいこうとしています。LeCun は、欧州の新興企業史上最大級のシードラウンドと自身のキャリア全体を投じ、「LLM では AGI に届かない」という判断に賭けました。
この道が本当に汎用人工知能に通じるかどうかは、現時点で誰も確定的な答えを出せません。ただ確かなのは、自動運転やロボットのように「物理世界を理解する必要がある」アプリケーションが拡大し続ける限り、世界モデルの商業的価値は継続的に検証されるということです。そして「AGI」という究極の問題が解けるのを待つ必要はありません。
読者としては、「世界モデルが LLM を置き換えるのか」と悩むより、別の角度で理解するのがよいでしょう。これら 2 つの技術路線は、長期的に併存する可能性が高いです。LLM は言語と知識を担当し、世界モデルは空間と物理を担当して、それぞれ相手が解決できない問題を担う、といった形です。
まとめると、世界モデル(World Model)は AI 業界における真剣な路線分岐を象徴しています。LLM の幻覚問題がなかなか根治できない中で、トップ研究者の一群が「AI に物理世界そのものを直接理解させる」ことへ賭け先を移しました。李飛飛の Marble、Google の Genie 3、NVIDIA の Cosmos 3 から、Yann LeCun がキャリアと欧州最大のシードラウンドで賭ける AMI Labs まで、すでに 30 億ドル超の資金がこの戦いに投じられています。
それが AGI へのもう一つの道になるのかは、まだ断定するには早すぎます。しかし確かなのは、「AI は世界をどう理解するべきか」という議論が、ようやく始まったばかりだということです。