Apa Itu Model Dunia (World Model)? Bagaimana Mengguncang Dunia, Prinsip Kerja, Pertarungan Empat Raksasa, dan Kontroversinya

世界模型(World Model)讓 AI 建立「世界如何運作」的內部模型,理解空間、物理與因果,預測的是世界的下一個狀態,而不是像大型語言模型那樣只預測下一個字。它已在自駕車、機器人、遊戲場景落地,但畫面逼真不等於物理正確,與 LLM 誰才是通往 AGI 的正確路線,至今仍是業界最大的爭論之一。
(前情提要:李飛飛談 LLM 下一步:AI 須擁有「空間智慧」才能理解真實世界,Marble 模型如何實現?)
(背景補充:Serenity:世界模型成 AI 圈最大共識,中國資金棄基礎模型,轉為物理AI)

Daftar Isi

Toggle

  • 世界模型是什麼?
  • 世界模型和大型語言模型(LLM)差在哪?
  • 世界模型怎麼運作?潛在空間與「預測下一刻」
  • 2026 世界模型戰局:四大巨頭在押什麼?
  • 世界模型能做什麼?自駕、機器人與遊戲的真實案例
  • 世界模型的爭議與限制:它真的比 LLM 強嗎?
  • 世界模型的未來:通往 AGI 的另一條路?

世界模型(World Model)是目前 AI 圈最常被提起、卻也最常被誤解的名詞之一。一句話定義:世界模型是一種讓 AI 建立「世界如何運作」內部模型的系統,讓它理解空間、物理與因果關係,並據此預測接下來會發生什麼。

它跟一般人熟悉的 ChatGPT、Claude 這類大型語言模型(LLM)不是同一條技術路線,LLM 預測的是「下一個字」,世界模型預測的是「世界的下一個狀態」。

世界模型是什麼?

世界模型(World Model),簡單來說就是讓 AI 學會「腦內模擬」的技術。舉個例子:人類過馬路前,會在腦中自動預演「如果我現在跨出去,那臺車還要幾秒到我面前」,這個預演不需要真的走到車前面試一次才知道結果。

世界模型想讓 AI 也具備這種能力,先在內部模擬各種可能,再決定下一步動作,而不是每次都要真實世界試錯。

史丹佛大學電腦科學教授、AI 領域指標人物李飛飛把世界模型的功能拆成三塊:

  • 生成(generation)
  • 理解(understanding)
  • 模擬與互動(simulation/interaction)

她創辦的 World Labs,做的產品 Marble 主打的正是第三塊,模擬與互動,這被視為整條技術鏈裡最關鍵、也最難的一環,因為光是「生成一張漂亮的圖」不難,難的是生成一個「可以走進去、可以互動、物理邏輯還要合理」的空間。

這股風潮之所以在 2026 年集中爆發,一部分原因是產業界對 LLM 的天花板出現了明顯的焦慮。當「文字接龍」這條路線的天花板越來越清楚,一批研究者開始把賭注押到另一條路,讓 AI 直接學會理解「世界」本身,而不是只學會模仿人類怎麼描述世界。

值得先說清楚一個常見誤解:世界模型不是要取代 LLM 做對話或寫作,它解決的是完全不同的問題,空間推理、物理模擬、動作規劃。這也是為什麼它會先在自駕車、機器人、遊戲這幾個「需要理解物理世界」的領域率先落地,而不是聊天機器人。

世界模型和大型語言模型(LLM)差在哪?

大型語言模型(LLM)建立在 Transformer 架構上,運作方式是預測序列中「下一個 token(詞元)」。簡單來說就是,LLM 看過極大量的文字後,學會「這句話接下來最可能出現哪個字」,整個運算過程都發生在「文字空間」裡。

它從來沒有真正「看過」或「模擬過」物理世界,它內部沒有重力、沒有碰撞、沒有空間座標,只有文字之間的統計關係。

世界模型走的是另一條路。以 Yann LeCun 提出的 JEPA 為代表,它不去預測原始畫面的每一個畫素,也不預測文字 token,而是在「潛在空間」裡預測未來狀態的抽象表徵。

白話說就是,它會先把不重要的雜訊細節(例如背景牆上一道反光)主動丟掉,只保留理解這個世界所需要的核心資訊,這顆球正在往哪個方向滾、這輛車還要幾秒到路口。因為輸出是建立在一個明確、可檢驗的內部狀態上,一旦模型「內部想的」和「輸出的」對不上,這種不一致相對容易被偵測出來,這是 LLM 難以做到的。

兩者的差異,可以用下表快速對照:

| 比較專案 | | --- | 大型語言模型(LLM) | 世界模型(World Model) | | --- | --- | | 預測目標 | 下一個 token(文字) | 世界的下一個狀態 | | 運作空間 | 文字 / 語言空間 | 潛在空間(latent space) | | 核心架構 | Transformer | JEPA、擴散模型、自迴歸 Transformer 等 | | 是否理解物理 | 不模擬物理,無內部世界模型 | 學習物體移動、碰撞、重力等物理規律 | | 典型錯誤 | 幻覺(多數模型仍在 15% 以上) | 畫面逼真但物理不一定正確 | | 代表應用 | 對話、寫作、程式碼生成 | 自駕模擬、機器人訓練、可探索 3D 世界 |

要提醒的一點是:「畫面看起來逼真」不等於「物理上是對的」。以影片生成為基礎的世界模型,因為訓練目標更直接對準「看起來真不真」,不一定會保證「物理上合不合理」,這在自駕車、機器人這種容錯率極低的場景裡,是個關鍵的區別,也是接下來爭議的核心之一。

世界模型怎麼運作?潛在空間與「預測下一刻」

要理解世界模型的運作邏輯,得先搞懂兩個詞:潛在空間和預測下一刻。

潛在空間,簡單來說就是,AI 把眼前看到的畫面「壓縮」成一組抽象數字,只留下對理解這個世界有用的資訊,丟掉多餘的視覺雜訊。

舉個例子:一段行車紀錄器畫面裡,潛在空間可能只保留「前方有一輛車,距離在縮短,速度中等」這樣的抽象描述,而不去記錄畫面裡每一片樹葉的顏色。這樣做的好處是運算量大幅降低,而且模型學到的是「規律」而不是死記畫面。

有了潛在空間,下一步就是「預測下一刻」:給定目前的狀態,加上一個動作(例如方向盤往左打),模型要預測下一個狀態會長什麼樣子。

這個過程反覆疊代,就變成一個可以「往前推演」的內部模擬器,給 AI 一個當下,它能在腦內先跑過幾種可能的未來,再決定要採取哪個動作,而不必真的去現實世界裡撞一次才知道結果。

JEPA(Joint Embedding Predictive Architecture,聯合嵌入預測架構)是這套邏輯目前最具代表性的架構,由 Yang LeCun 在 2022 年的論文《A Path Towards Autonomous Machine Intelligence》中提出。

JEPA 的核心主張是:與其逼著模型生成每一個畫素的細節(這樣做既浪費算力、又容易被無關緊要的雜訊帶偏),不如直接在抽象層次上比對「預測的未來」和「實際的未來」是否一致。

這也是為什麼 LeCun 會說,世界模型讓錯誤變得「可被偵測」,因為它的輸出必須跟一個明確的內部表徵對齊,對不上就是訊號,而不是像 LLM 那樣,錯誤只會安安靜靜地混在一整串看似流暢的文字裡。

不過潛在空間也不是萬靈丹。模型到底該丟掉哪些細節、保留哪些細節,是個沒有標準答案的工程判斷,丟太多會讓模擬失真,丟太少又會拖垮運算效率,這也是目前各家世界模型架構設計上最大的分歧點之一。

2026 世界模型戰局:四大巨頭在押什麼?

2026 年的世界模型賽道,已經聚集了產業裡分量最重的幾組人馬,資金規模也大到足以說明這不是一時的技術噱頭。

李飛飛創辦的 World Labs 是這波浪潮最早出圈的公司。2024 年 9 月,World Labs 帶著 2,3 億美元募資、10 億美元估值出關;2026 年 1 月傳出正以約 5 億美元估值洽談新一輪募資;到了 2026 年 2 月 18 日,World Labs 正式宣布募得 1 億美元,投資方包含 AMD、Autodesk、Emerson Collective、Fidelity、NVIDIA、Sea,其中 Autodesk 領投 2 億美元,是 Autodesk 有史以來對新創公司最大的一筆投資。

累計下來,World Labs 至今募資總額約 12,3 億美元。旗艦產品 Marble 於 2025 年 11 月開放限量 beta 測試,2026 年 2 月正式商用,輸入可以是文字、照片、影片、全景圖或粗略的 3D 模型,輸出是可導航、可持久儲存、可編輯的 3D 環境,而且單次生成會同時產出兩種網格:高精度幾何用的 triangle mesh,以及專門給物理引擎做碰撞偵測用的 collider mesh。

Google DeepMind 的 Genie 3 則是目前唯一做到「即時互動」的世界模型。2025 年 8 月以研究預覽形式亮相,2026 年 1 月 29 日正式公開,開放給美國地區的 Google AI Ultra 訂閱用戶使用,同時推出 Project Genie 線上 demo,讓用戶可以直接生成世界、進去探索、甚至 remix 修改。

技術規格上,Genie 3 是一個 11B 引數的自迴歸(autoregressive)Transformer,能即時生成可以自由導航的世界,解析度 720p、每秒 24 幀(24fps),一致性可以維持數分鐘不崩壞。

NVIDIA 走的是平台路線。2025 年 1 月推出 Cosmos 世界基礎模型平台,2026 年 6 月 1 日再推出 Cosmos 3,號稱首個完全開放的 omnimodel,採用混合專家式 Transformer 架構,把視覺推理、世界生成、動作預測三件事整合進單一系統,涵蓋文字、影像、影片、環境音、動作等多種模態。

訓練資料規模驚人:約 20 兆 tokens 的多模態資料,包含近 1 億張圖片、4 億支真實與合成影片。NVIDIA 表示,這套系統把 physical AI(實體 AI)的訓練與評估週期,從過去的數個月大幅縮短到數天。Cosmos 3 底下還分出 Super(給機器人、自駕車用的高精度版本)、Nano(追求極速)、Edge 三種變體,NVIDIA 也拉了 Runway、Black Forest Labs、Skild AI 等公司組成 Cosmos Coalition 聯盟。

Yann LeCun 的動作最戲劇性。2025 年 11 月,他離開待了 12 年、原本擔任 FAIR 主任的 Meta,與 Alexandre LeBrun 共同創立 AMI Labs,總部設在巴黎,另在紐約、蒙特婁、新加坡設點。

2026 年 3 月 10 日,AMI Labs 宣布種子輪募得 1.3 億美元(約 8,9 億歐元),投前估值 35 億美元,這是歐洲新創史上最大的一筆種子輪募資。投資方名單包括 Bezos Expeditions、NVIDIA、Samsung、Temasek、Toyota Ventures,以及 Mark Cuban、Eric Schmidt 等知名個人投資者。LeCun 長期公開主張「LLM 走不到通用人工智慧」,如今他把離開 Meta 後的整段生涯,連同 1.3 億美元,全押在世界模型這條路線上。

四家的定位可以簡單對照如下:

| 公司 / 團隊 | | --- | 關鍵人物 | 代表產品 | 最新募資 / 規模 | 技術定位 | | --- | --- | --- | --- | --- | | World Labs | 李飛飛 | Marble | 累計約 12,3 億美元(2026/2 單輪 10 億美元) | 可導航、可持久 3D 空間生成 | | Google DeepMind | DeepMind 團隊 | Genie 3 | Google 內部資源支援 | 11B 引數、即時互動世界生成 | | NVIDIA | NVIDIA 團隊 | Cosmos 3 | NVIDIA 自有資源 + Cosmos Coalition 聯盟 | 開放式 omnimodel 平台,主攻 physical AI | | AMI Labs | Yann LeCun | JEPA 系列研究 | 種子輪 10,3 億美元,估值 35 億美元 | JEPA 潛在空間預測架構,理論路線最激進 |

四家公司的技術路線不完全相同,World Labs 偏重可用的 3D 空間產品、Genie 3 主攻即時互動、Cosmos 3 走開放平台、AMI Labs 專注底層架構研究,但共同的信念是一致的:

下一波 AI 突破,不會只靠把 LLM 做得更大,而要靠讓 AI 真正「理解」它所處的世界。

世界模型能做什麼?自駕、機器人與遊戲的真實案例

世界模型最先落地的場景,幾乎都跟「需要理解物理世界」高度相關,自駕車是最直接的例子。

新創公司 Decart 在 2026 年 6 月推出 Oasis 3,可以即時生成長達數小時、高度逼真的駕駛環境,主打幫自駕車模擬那些現實中很難遇到、卻攸關安全的「罕見場景」,像是暴雨中突然竄出的行人、對向來車失控偏移車道。

Oasis 3 的 API 已經開放使用,價格約每秒 2 美分,目標是搶下 physical AI 供應鏈裡「模擬層」的位置。Waymo 也在 2026 年 2 月發表自家的生成式模擬架構,建立在 Genie 3 之上;Tesla、NVIDIA、Wayve 等公司則各自在做類似的事。這類技術的核心價值很直接:讓自駕車能在「無限多種模擬場景」裡反覆練習,不需要真的把車開上路去撞一次才學到教訓。

機器人領域是另一個重點戰場。Cosmos 3、Oasis 3 這類系統可以生成可控制、多視角的模擬環境,機器人可以在這個虛擬空間裡學習抓取、行走、操作物件,並反覆改進動作策略。用合成資料取代真實世界的資料蒐集,能大幅降低機器人訓練的成本與時間,過去需要實體機器人在真實環境裡試錯數千次才能學會的動作,現在可以先在模擬環境裡跑過一輪。

遊戲與內容創作則是相對「討喜」的應用場景。Genie 3、Marble 都能從一句文字描述生成一個可以走進去探索的世界,這對遊戲原型開發、虛擬場景搭建是直接的生產力工具。同時,Luma、Runway 這類原本做影片生成的新創,也開始把自家「懂物理」的影片生成模型,往世界模型的方向轉型,這說明世界模型不是憑空冒出的新賽道,而是影片生成技術往「可互動、可控制」演化的自然下一步。

這幾個案例有個共通點:世界模型的價值,不在於「畫面多漂亮」,而在於「能不能拿來訓練、拿來模擬、拿來做決策」。這正是它和單純的影片生成工具最大的分界線。

世界模型的爭議與限制:它真的比 LLM 強嗎?

世界模型陣營裡最引人注目的一場賭注,來自 Yann LeCun。他離開 Meta、創立 AMI Labs、募得 10.3 億美元種子輪,本質上是把整個職涯押在一個判斷上:LLM 這條路線永遠到不了通用人工智慧,出路必須是世界模型。這個立場並非業界共識。

反方陣營裡,聲量最大的是 Anthropic 執行長 Dario Amodei。他的主張是,只要持續擴大模型規模、搭配架構上的漸進改進,LLM 本身就足以突破現有限制,甚至樂觀預期 2026 年有機會出現他形容為「資料中心裡的天才之國」的能力躍升。

換句話說,一方認為現有路線的天花板已經看到頂,必須換路線;另一方認為天花板還沒到,繼續往前衝就對了。這場路線之爭,目前沒有任何一方能拿出決定性證據說服對方,某種程度上,兩邊都是在用真金白銀下注一個尚未有答案的問題。

世界模型自身也不是沒有破綻。前面提過,潛在空間架構讓「內部不一致」的錯誤變得容易偵測,但這不代表世界模型不會犯錯,它解決的是「錯誤能不能被抓到」,而不是「錯誤會不會發生」。更關鍵的問題在於:畫面逼真,不等於物理正確。

以影片生成為基礎的世界模型,訓練目標更直接對準「看起來像不像真的」,不見得會對「物理邏輯合不合理」做出同等的最佳化,一顆球滾動的軌跡,看起來自然流暢,但實際的加速度、摩擦力計算未必經得起檢驗。這一點在自駕車、機器人這類「一次出錯就是事故」的應用場景裡,是不能被忽視的風險。

算力與延遲成本也是現實的門檻。以擴散模型(diffusion)為基礎的世界模型,每生成一幀畫面都需要經過多次去噪運算,對於機器人、自駕車這種要求即時反應的場景來說,這種延遲代價相當高,決策慢半拍,在真實世界裡可能就是一次擦撞。

另外,根據 Open-Sora 團隊的估算,想重現一個商用等級的影片生成模型,大約需要 2 juta 美元的算力成本,這還只是「重現」既有成果的門檻,不包含從零開發新架構的研發投入。

世界模型的未來:通往 AGI 的另一條路?

把這些線索拼在一起,可以看出一個清楚的產業訊號:2026 年,世界模型已經從一個學術概念,變成一場動用數十億美元、聚集產業最重量級人物的路線之爭。李飛飛用 Marble 證明「可導航的 3D 世界」能做成產品;Google DeepMind 用 Genie 3 證明「即時互動」技術上可行;NVIDIA 用 Cosmos 3 把它變成一個開放平台,想吃下整條 physical AI 供應鏈;LeCun 則用整段職涯與歐洲新創史上最大種子輪,賭上「LLM 到不了 AGI」這個判斷。

這條路能不能真的通往通用人工智慧,目前沒有人能給出確定答案。但可以確定的是,只要自駕車、機器人這類需要「理解物理世界」的應用持續擴張,世界模型的商業價值就會持續被驗證,而不必等到「AGI」這個終極問題被解答。

對讀者來說,與其糾結「世界模型會不會取代 LLM」,不如換個角度理解:這兩條技術路線很可能會長期並存,LLM 負責語言與知識,世界模型負責空間與物理,各自解決對方解決不了的問題。

總結來說,世界模型(World Model)代表的是 AI 產業一次認真的路線分岔:當 LLM 的幻覺問題遲遲無法根治,一群頂尖研究者選擇把賭注押在讓 AI 直接理解物理世界本身。從李飛飛的 Marble、Google 的 Genie 3、NVIDIA 的 Cosmos 3,到 Yann LeCun 押上整個職涯的 AMI Labs,超過 30 億美元資金已經投入這場戰局。

它會不會是通往 AGI 的另一條路,現在下定論還太早,但可以肯定的是,這場關於「AI 該怎麼理解世界」的辯論,才剛剛開始。

AMD8,18%
ADSK-3,09%
NVDA1,86%
META-0,37%
Lihat Asli
Halaman ini mungkin berisi konten pihak ketiga, yang disediakan untuk tujuan informasi saja (bukan pernyataan/jaminan) dan tidak boleh dianggap sebagai dukungan terhadap pandangannya oleh Gate, atau sebagai nasihat keuangan atau profesional. Lihat Penafian untuk detailnya.
  • Hadiah
  • Komentar
  • Posting ulang
  • Bagikan
Komentar
Tambahkan komentar
Tambahkan komentar
Tidak ada komentar
  • Disematkan