Cơ bản
Giao ngay
Giao dịch tiền điện tử một cách tự do
Giao dịch ký quỹ
Tăng lợi nhuận của bạn với đòn bẩy
Chuyển đổi và Đầu tư định kỳ
0 Fees
Giao dịch bất kể khối lượng không mất phí không trượt giá
ETF
Sản phẩm ETF có thuộc tính đòn bẩy giao dịch giao ngay không cần vay không cháy tải khoản
Giao dịch trước giờ mở cửa
Giao dịch token mới trước niêm yết
Futures
Truy cập hàng trăm hợp đồng vĩnh cửu
CFD
Vàng
Một nền tảng cho tài sản truyền thống
Quyền chọn
Hot
Giao dịch với các quyền chọn kiểu Châu Âu
Tài khoản hợp nhất
Tối đa hóa hiệu quả sử dụng vốn của bạn
Giao dịch demo
Giới thiệu về Giao dịch hợp đồng tương lai
Nắm vững kỹ năng giao dịch hợp đồng từ đầu
Sự kiện tương lai
Tham gia sự kiện để nhận phần thưởng
Giao dịch demo
Sử dụng tiền ảo để trải nghiệm giao dịch không rủi ro
CFD
Phái sinh Hợp đồng Chênh lệch Cổ phiếu
Cổ phiếu Hoa Kỳ
Tiếp cận cổ phiếu và quỹ ETF thực của Hoa Kỳ
Cổ phiếu Hongkong
Giao dịch cổ phiếu chất lượng được niêm yết tại Hongkong
Cổ phiếu Hàn Quốc
SK Hynix
Giao dịch cổ phiếu Hàn Quốc thực và đầu tư vào các tài sản phổ biến
Futures cổ phiếu
Đòn bẩy cao, giao dịch 24/7
Cổ phiếu token hóa
Được hỗ trợ bởi tài sản cổ phiếu thực
IPO Access
Mở khóa quyền truy cập đầy đủ vào các IPO cổ phiếu toàn cầu
GUSD
3.8%
Đúc GUSD để nhận lợi suất từ RWA kho bạc
Hoạt động cổ phiếu
Giao dịch cổ phiếu phổ biến và nhận airdrop hấp dẫn
Launch
CandyDrop
Sưu tập kẹo để kiếm airdrop
Launchpool
Thế chấp nhanh, kiếm token mới tiềm năng
HODLer Airdrop
Nắm giữ GT và nhận được airdrop lớn miễn phí
Pre-IPOs
Mở khóa quyền truy cập đầy đủ vào các IPO cổ phiếu toàn cầu
Điểm Alpha
Giao dịch trên chuỗi và nhận airdrop
Điểm Futures
Kiếm điểm futures và nhận phần thưởng airdrop
Đầu tư
Simple Earn
Kiếm lãi từ các token nhàn rỗi
Đầu tư tự động
Đầu tư tự động một cách thường xuyên.
Sản phẩm tiền kép
Kiếm lợi nhuận từ biến động thị trường
Soft Staking
Kiếm phần thưởng với staking linh hoạt
Vay Crypto
0 Fees
Thế chấp một loại tiền điện tử để vay một loại khác
Trung tâm cho vay
Trung tâm cho vay một cửa
Trung tâm tài sản VIP
Kế hoạch tăng trưởng tài sản cao cấp
Gate Wealth
Nắm quyền kiểm soát tương lai tài chính của bạn
Quỹ định lượng
Chiến lược định lượng hàng đầu
Staking
Stake tiền điện tử để kiếm tiền từ các sản phẩm PoS
Đòn bẩy thông minh
Đòn bẩy không thanh lý
GUSD
3.8%
Nạp & đổi bất cứ lúc nào, miễn phí đổi
Khuyến mãi
AI
Gate AI
Trợ lý AI đa năng đồng hành cùng bạn
Gate AI Bot
Sử dụng Gate AI trực tiếp trong ứng dụng xã hội của bạn
GateClaw
Gate Tôm hùm xanh, mở hộp là dùng ngay
Gate for AI Agent
Hạ tầng AI, Gate MCP, Skills và CLI
Gate Skills Hub
Hơn 10.000 kỹ năng
Từ văn phòng đến giao dịch, thư viện kỹ năng một cửa giúp AI tiện lợi hơn
World Model là gì? Cách lật đổ thế giới, nguyên lý vận hành, cuộc chiến giữa bốn “ông lớn” và các tranh cãi
世界模型(World Model)讓 AI 建立「世界如何運作」的內部模型,理解 không gian、物理與因果,預測的是世界的下一個狀態,而不是像大型語言模型那樣只預測下一個 chữ。它已在自駕車、機器人、遊戲場景落地,但畫面逼真不等於物理正確,與 LLM 誰才是通往 AGI 的正確路線,至今仍是業界最大的爭論之一。
(前情提要:李飛飛談 LLM 下一步:AI 須擁有「空間智慧」才能理解真實世界,Marble 模型如何實現?)
(背景補充:Serenity:世界模型成 AI 圈最大共識,中國資金棄基礎模型,轉為物理AI)
本文目錄
Toggle
世界模型(World Model)是目前 AI 圈最常被提起、卻也最常被誤解的名詞之一。一句話定義:世界模型是一種讓 AI 建立「世界如何運作」內部模型的系統,讓它理解空間、物理與因果關係,並據此預測接下來會發生什麼。
它跟一般人熟悉的 ChatGPT、Claude 這類大型語言模型(LLM)不是同一條技術路線,LLM 預測的是「下一個 chữ」,世界模型預測的是「世界的下一個狀態」。
世界模型是什麼?
世界模型(World Model),簡單來說就是讓 AI 學會「腦內模擬」的技術。舉個例子:人類過馬路前,會在腦中自動預演「如果我現在跨出去,那臺車還要 mấy giây到我面前」,這個預演不需要真的走到車前面試一次才知道結果。
世界模型想讓 AI 也具備這種能力:先在內部模擬各種可能,再決定下一步動作,而不是每次都要真實世界試錯。
史丹佛大學電腦科學教授、AI 領域指標人物李飛飛把世界模型的功能拆成三塊:
她創辦的 World Labs,做的產品 Marble 主打的正是第三塊,模擬與互動,這被視為整條技術鏈裡最關鍵、也最難的一環,因為光是「生成一張漂亮的圖」不難,難的是生成一個「可以走進去、可以互動、物理邏輯還要合理」的空間。
這股風潮之所以在 2026 年集中爆發,一部分原因是產業界對 LLM 的天花板出現了明顯的焦慮。當「文字接龍」這條路線的天花板越來越清楚,一批研究者開始把賭注押到另一條路,讓 AI 直接學會理解「世界」本身,而不是只學會模仿人類怎麼描述世界。
值得先說清楚一個常見誤解:世界模型不是要取代 LLM 做 đối thoại 或 viết作,它解決的是完全不同的問題:空間推理、物理模擬、動作規劃。這也是為什麼它會先在自駕車、機器人、遊戲這幾個「需要理解物理世界」的領域率先落地,而不是聊天機器人。
世界模型和大型語言模型(LLM)差在哪?
大型語言模型(LLM)建立在 Transformer 架構上,運作方式是預測序列中「下一個 token(詞元)」。簡單來說就是:LLM 看過極大量的文字後,學會「這句話接下來最可能出現哪個字」,整個運算過程都發生在「文字空間」裡。
它從來沒有真正「看過」或「模擬過」物理世界,它內部沒有重力、沒有碰撞、沒有空間座標,只有文字之間的統計關係。
世界模型走的是另一條路。以 Yann LeCun 提出的 JEPA 為代表,它不去預測原始畫面的每一個畫素,也不預測文字 token,而是在「潛在空間」裡預測未來狀態的抽象表徵。
白話說就是:它會先把不重要的雜訊細節(例如背景牆上一道反光)主動丟掉,只保留理解這個世界所需要的核心資訊,這顆球正在往哪個方向滾、這輛車還要 mấy giây到路口。因為輸出是建立在一個明確、可檢驗的內部狀態上,一旦模型「內部想的」和「輸出的」對不上,這種不一致相對容易被偵測出來,這是 LLM 難以做到的。
兩者的差異,可以用下表快速對照:
| 比較專案 | | --- | 大型語言模型(LLM) | 世界模型(World Model) | | --- | --- | | 預測目標 | 下一個 token(文字) | 世界的下一個狀態 | | 運作空間 | 文字 / ngôn ngữ 空間 | 潛在空間(latent space) | | 核心架構 | Transformer | JEPA、擴散模型、自迴歸 Transformer 等 | | 是否理解物理 | 不模擬物理,無內部世界模型 | 學習物體移動、碰撞、重力等物理規律 | | 典型錯誤 | 幻覺(多數模型仍在 15% 以上) | 畫面逼真但物理不一定正確 | | 代表應用 | 對話、寫作、程式碼生成 | 自駕模擬、機器人訓練、可探索 3D 世界 |
要提醒的一點是:「畫面看起來逼真」不等於「物理上是對的」。以影片生成為基礎的世界模型,因為訓練目標更直接對準「看起來真不真」,不一定會保證「物理上合不合理」,這在自駕車、機器人這種容錯率極低的場景裡,是個關鍵的區別,也是接下來爭議的核心之一。
世界模型怎麼運作?潛在空間與「預測下一刻」
要理解世界模型的運作邏輯,得先搞懂 hai 個詞:潛在空間和預測下一刻。
潛在空間,簡單來說就是 AI 把眼前看到的畫面「壓縮」成一組抽象數字,只留下對理解這個世界有用的資訊,丟掉多餘的視覺雜訊。
舉個例子:一段行車紀錄器畫面裡,潛在空間可能只保留「前方有一輛車,距離在縮短,速度 trung bình」這樣的抽象描述,而不去記錄畫面裡每一片樹葉的顏色。這樣做的好處是運算量大幅降低,而且模型學到的是「規律」而不是死記畫面。
有了潛在空間,下一步就是「預測下一刻」:給定目前的狀態,加上一個動作(例如方向盤往左打),模型要預測下一個狀態會長什麼樣子。
這個過程反覆疊代,就變成一個可以「往前推演」的內部模擬器:給 AI 一個當下,它能在腦內先跑過幾種可能的未來,再決定要採取哪個動作,而不必真的去現實世界裡撞一次才知道結果。
JEPA(Joint Embedding Predictive Architecture,聯合嵌入預測架構)是這套邏輯目前最具代表性的架構,由 Yang LeCun 在 2022 年的論文《A Path Towards Autonomous Machine Intelligence》中提出。
JEPA 的核心主張是:與其逼著模型生成每一個畫素的細節(這樣做既浪費算力、又容易被無關緊要的雜訊帶偏),不如直接在抽象層次上比對「預測的未來」和「實際的未來」是否一致。
這也是為什麼 LeCun 會說,世界模型讓錯誤變得「可被偵測」,因為它的輸出必須跟一個明確的內部表徵對齊,對不上就是訊號,而不是像 LLM 那樣,錯誤只會安安靜靜地混在一整串看似流暢的文字裡。
不過潛在空間也不是萬靈丹。模型到底該丟掉哪些細節、保留哪些細節,是個沒有標準答案的工程判斷:丟太多會讓模擬失真,丟太少又會拖垮運算效率,這也是目前各家世界模型架構設計上最大的分歧點之一。
2026 世界模型戰局:四大巨頭在押什麼?
2026 年的世界模型賽道,已經聚集了產業裡分量最重的幾組人馬,資金規模也大到足以說明這不是一時的技術噱頭。
李飛飛創辦的 World Labs 是這波浪潮最早出圈的公司。2024 年 9 月,World Labs 帶著 230 億美元募資、1 tỷ 估值出關;2026 年 1 月傳出正以約 5 tỷ 美元估值洽談新一輪募資;到了 2026 年 2 月 18 日,World Labs 正式宣布募得 1 tỷ 美元,投資方包含 AMD、Autodesk、Emerson Collective、Fidelity、NVIDIA、Sea,其中 Autodesk 領投 200 triệu美元,是 Autodesk 有史以來對新創公司最大的一筆投資。
累計下來,World Labs 至今募資總額約 1,230 triệu美元。旗艦產品 Marble 於 2025 年 11 月開放限量 beta 測試,2026 年 2 月正式商用:輸入可以是文字、照片、影片、全景圖或粗略的 3D 模型,輸出是可導航、可持久儲存、可編輯的 3D 環境,而且單次生成會同時產出兩種網格:高精度几何用的 triangle mesh,以及專門給物理引擎做碰撞偵測用的 collider mesh。
Google DeepMind 的 Genie 3 則是目前唯一做到「即時互動」的世界模型。2025 年 8 月以研究預覽形式亮相,2026 年 1 月 29 日正式公開,開放給美國地區的 Google AI Ultra 訂閱用戶使用,同時推出 Project Genie 線上 demo,讓用戶可以直接生成世界、進去探索,甚至 remix 修改。
技術規格上,Genie 3 是一個 11B 引數的自迴歸(autoregressive)Transformer,能即時生成可以自由導航的世界,解析度 720p、每秒 24 幀(24fps),一致性可以維持數分鐘不崩壞。
NVIDIA 走的是平台路線。2025 年 1 月推出 Cosmos 世界基礎模型平台,2026 年 6 月 1 日再推出 Cosmos 3,號稱首個完全開放的 omnimodel,採用混合專家式 Transformer 架構,把視覺推理、世界生成、動作預測三件事整合進單一系統,涵蓋文字、影像、影片、環境音、動作等多種模態。
訓練資料規模驚人:約 20 兆 tokens 的多模態資料,包含近 1 億張圖片、400 triệu支真實與合成影片。NVIDIA 表示,這套系統把 physical AI(實體 AI)的訓練與評估週期,從過去的數個月大幅縮短到數天。Cosmos 3 底下還分出 Super(給機器人、自駕車用的高精度版本)、Nano(追求極速)、Edge 三種變體,NVIDIA 也拉了 Runway、Black Forest Labs、Skild AI 等公司組成 Cosmos Coalition 聯盟。
Yann LeCun 的動作最戲劇性。2025 年 11 月,他離開待了 12 年、原本擔任 FAIR 主任的 Meta,與 Alexandre LeBrun 共同創立 AMI Labs,總部設在巴黎,另在紐約、蒙特婁、新加坡設點。
2026 年 3 月 10 日,AMI Labs 宣布種子輪募得 1,030 triệu美元(約 890 triệu歐元),投前估值 3,500 triệu美元,這是歐洲新創史上最大的一筆種子輪募資。投資方名單包括 Bezos Expeditions、NVIDIA、Samsung、Temasek、Toyota Ventures,以及 Mark Cuban、Eric Schmidt 等知名個人投資者。LeCun 長期公開主張「LLM 走不到通用人工智慧」,如今他把離開 Meta 後的整段生涯,連同 1,030 triệu美元,全押在世界模型這條路線上。
四家的定位可以簡單對照如下:
| 公司 / 團隊 | | --- | 關鍵人物 | 代表產品 | 最新募資 / 規模 | 技術定位 | | --- | --- | --- | --- | | World Labs | 李飛飛 | Marble | 累計約 1,230 triệu美元(2026/2 單輪 1 tỷ美元) | 可導航、可持久 3D 空間生成 | | Google DeepMind | DeepMind 團隊 | Genie 3 | Google 內部資源支援 | 11B 引數、即時互動世界生成 | | NVIDIA | NVIDIA 團隊 | Cosmos 3 | NVIDIA 自有資源 + Cosmos Coalition 聯盟 | 開放式 omnimodel 平台,主攻 physical AI | | AMI Labs | Yann LeCun | JEPA 系列研究 | 種子輪 1,030 triệu美元,估值 3,500 triệu美元 | JEPA 潛在空間預測架構,理論路線最激進 |
四家公司的技術路線不完全相同,World Labs 偏重可用的 3D 空間產品、Genie 3 主攻即時互動、Cosmos 3 走開放平台、AMI Labs 專注底層架構研究,但共同的信念是一致的:
世界模型能做什麼?自駕、機器人與遊戲的真實案例
世界模型最先落地的場景,幾乎都跟「需要理解物理世界」高度相關,自駕車是最直接的例子。
新創公司 Decart 在 2026 年 6 月推出 Oasis 3,可以即時生成長達数小時、高度逼真的駕駛環境,主打幫自駕車模擬那些現實中很難遇到、卻攸關安全的「罕見場景」,像是暴雨中突然竄出的行人、對向來車失控偏移車道。
Oasis 3 的 API 已經開放使用,價格約每秒 2 cent USD,目標是搶下 physical AI 供應鏈裡「模擬層」的位置。Waymo 也在 2026 年 2 月發表自家的生成式模擬架構,建立在 Genie 3 之上;Tesla、NVIDIA、Wayve 等公司則各自在做類似的事。這類技術的核心價值很直接:讓自駕車能在「無限多種模擬場景」裡反覆練習,不需要真的把車開上路去撞一次才學到教訓。
機器人領域是另一個重點戰場。Cosmos 3、Oasis 3 這類系統可以生成可控制、多視角的模擬環境,機器人可以在這個虛擬空間裡學習抓取、行走、操作物件,並反覆改進動作策略。用合成資料取代真實世界的資料蒐集,能大幅降低機器人訓練的成本與時間:過去需要實體機器人在真實環境裡試錯數千次才能學會的動作,現在可以先在模擬環境裡跑過一輪。
遊戲與內容創作則是相對「討喜」的應用場景。Genie 3、Marble 都能從一句文字描述生成一個可以走進去探索的世界,這對遊戲原型開發、虛擬場景搭建是直接的生產力工具。同時,Luma、Runway 這類原本做影片生成的新創,也開始把自家「懂物理」的影片生成模型,往世界模型的方向轉型,這說明世界模型不是憑空冒出的新賽道,而是影片生成技術往「可互動、可控制」演化的自然下一步。
這幾個案例有個共通點:世界模型的價值,不在於「畫面多漂亮」,而在於「能不能拿來訓練、拿來模擬、拿來做決策」。這正是它和單純的影片生成工具最大的分界線。
世界模型的爭議與限制:它真的比 LLM 強嗎?
世界模型陣營裡最引人注目的一場賭注,來自 Yann LeCun。他離開 Meta、創立 AMI Labs、募得 1,030 triệu美元種子輪,本質上是把整個職涯押在一個判斷上:LLM 這條路線永遠到不了通用人工智慧,出路必須是世界模型。這個立場並非業界共識。
反方陣營裡,聲量最大的是 Anthropic 執行長 Dario Amodei。他的主張是:只要持續擴大模型規模、搭配架構上的漸進改進,LLM 本身就足以突破現有限制,甚至樂觀預期 2026 年有機會出現他形容為「資料中心裡的天才之國」的能力躍升。
換句話說:一方認為現有路線的天花板已經看到頂,必須換路線;另一方認為天花板還沒到,繼續往前衝就對了。這場路線之爭,目前沒有任何一方能拿出決定性證據說服對方,某種程度上,兩邊都是在用真金白銀下注一個尚未有答案的問題。
世界模型自身也不是沒有破綻。前面提過,潛在空間架構讓「內部不一致」的錯誤變得容易偵測,但這不代表世界模型不會犯錯:它解決的是「錯誤能不能被抓到」,而不是「錯誤會不會發生」。更關鍵的問題在於:畫面逼真,不等於物理正確。
以影片生成為基礎的世界模型,訓練目標更直接對準「看起來像不像真的」,不見得會對「物理邏輯合不合理」做出同等的最佳化:一顆球滾動的軌跡,看起來自然流暢,但實際的加速度、摩擦力計算未必經得起檢驗。這一點在自駕車、機器人這類「一次出錯就是事故」的應用場景裡,是不能被忽視的風險。
算力與延遲成本也是現實的門檻。以擴散模型(diffusion)為基礎的世界模型,每生成一幀畫面都需要經過多次去噪運算,對於機器人、自駕車這種要求即時反應的場景來說,這種延遲代價相當高:決策慢半拍,在真實世界裡可能就是一次擦撞。
另外,根據 Open-Sora 團隊的估算,想重現一個商用等級的影片生成模型,大約需要 200 nghìn USD 的算力成本,這還只是「重現」既有成果的門檻,不包含從零開發新架構的研發投入。
世界模型的未來:通往 AGI 的另一條路?
把這些線索拼在一起,可以看出一個清楚的產業訊號:2026 年,世界模型已經從一個學術概念,變成一場動用數十億美元、聚集產業最重量級人物的路線之爭。李飛飛用 Marble 證明「可導航的 3D 世界」能做成產品;Google DeepMind 用 Genie 3 證明「即時互動」技術上可行;NVIDIA 用 Cosmos 3 把它變成一個開放平台,想吃下整條 physical AI 供應鏈;LeCun 則用整段職涯與歐洲新創史上最大種子輪,賭上「LLM 到不了 AGI」這個判斷。
這條路能不能真的通往通用人工智慧,目前沒有人能給出確定答案。但可以確定的是,只要自駕車、機器人這類需要「理解物理世界」的應用持續擴張,世界模型的商業價值就會持續被驗證,而不必等到「AGI」這個終極問題被解答。
對讀者來說,與其糾結「世界模型會不會取代 LLM」,不如換個角度理解:這兩條技術路線很可能會長期並存,LLM 負責語言與知識,世界模型負責空間與物理,各自解決對方解決不了的問題。
總結來說,世界模型(World Model)代表的是 AI 產業一次認真的路線分岔:當 LLM 的幻覺問題遲遲無法根治,一群頂尖研究者選擇把賭注押在讓 AI 直接理解物理世界本身。從李飛飛的 Marble、Google 的 Genie 3、NVIDIA 的 Cosmos 3,到 Yann LeCun 押上整個職涯的 AMI Labs,超過 3 tỷ美元資金已經投入這場戰局。
它會不會是通往 AGI 的另一條路,現在下定論還太早,但可以肯定的是,這場關於「AI 該怎麼理解世界」的辯論,才剛剛開始。