AI 不只會聊天,還會『生出一個世界』:2026 世界模型(World Model)元年,Google、李飛飛、Adobe 同場競逐『空間智能』大戰
從會聊天到會造世界。Google Genie 3、李飛飛 Marble、Adobe Wonder 同台開打,世界模型正把 AI 推向能走進、可互動的 3D 空間。

過去三年,AI 的舞台幾乎被「會聊天」的大型語言模型(LLM)佔滿。我們習慣了對著對話框打字,讓 AI 幫忙寫程式、寫文案、回信。但 2026 年,一個更野心勃勃的方向正快速升溫:與其教 AI 用文字描述世界,不如讓 AI 直接「生出一個世界」——一個你可以走進去、四處走動、物件會乖乖待在原地、丟出去的球會照物理落下的 3D 空間。這個方向有個統一的名字:世界模型(World Model),而它正被視為繼聊天機器人之後,AI 的下一個主戰場。

Photo by Sebastian Svenson on Unsplash
世界模型到底是什麼?和「AI 生影片」差在哪?
很多人第一次聽到「AI 生成一個世界」,會直覺聯想到 Sora 那種文字生影片。但兩者的本質差很多。影片是一連串「固定好」的畫面,你只能看,不能改變走向;一旦鏡頭移開,剛才畫面裡的東西就等於不存在了,AI 下一秒可能把它畫成別的樣子。
世界模型的目標剛好相反:它要維持一個持續一致(persistent)的空間。你往前走再回頭,牆上那幅畫還在原位;你把箱子推到角落,它就停在角落;即使某個物件離開了畫面,它的位置與狀態依然被「記住」。換句話說,世界模型不是在「播影片」,而是在「即時模擬一個有幾何結構、有物理規則、可以互動的環境」。這也是為什麼業界越來越常用「空間智能(Spatial Intelligence)」來形容這條路線——AI 不只理解語言,還開始理解空間。
為什麼是現在?三家重量級玩家同場開打
2026 年之所以被不少人稱為「世界模型元年」,是因為原本停留在論文和展示影片的技術,這一年真的變成可以連續互動、甚至能賣錢的產品,而且一次來了三個實力堅強的陣營。
Google DeepMind:Genie 3 讓你「走進」生成的世界
Google DeepMind 的 Genie 3 是目前最受矚目的代表。它能即時生成可互動的持續 3D 環境,畫面以每秒 24 格(24 fps)、720p 的解析度運行,而且支援長達數分鐘、而非過去只有十幾秒的連續探索。更關鍵的是它的「記憶力」:物件會留在你放的地方,物理效果即使在畫面外也持續作用。Genie 3 最早在 2025 年 8 月亮相,並在 2026 年 1 月 29 日的 Project Genie 更新中,展示了從一張圖片或一段文字提示,就能生成可即時遊走的虛擬環境。

Photo by stephan sorkin on Unsplash
Adobe × 約翰霍普金斯:Wonder 把鏡頭交回你手上
2026 年 7 月,Adobe 與約翰霍普金斯大學(Johns Hopkins)發表了名為 Wonder 的研究成果,主打「可用鏡頭操控」的影片式世界模型。它能以每秒 16 格、分鐘等級的長度,讓使用者像操作遊戲攝影機一樣在生成的世界裡自由平移、旋轉。技術上,Wonder 用一個 3D 骨架(scaffold)加上環境貼圖,把鏡頭的移動與轉動轉換成密集、逐格對齊的視覺線索,再結合稀疏注意力記憶與蒸餾技術,才能在維持一致性的同時做到接近即時的速度。對創作工具龍頭 Adobe 來說,這個方向的意義不言而喻。
李飛飛的 World Labs:Marble 已經在收費了
被譽為「AI 教母」的李飛飛(Fei-Fei Li)創辦的 World Labs,則把世界模型推向商業化最前線。旗下首款商用產品 Marble 於 2025 年 11 月推出,能從文字、單張圖片、影片片段甚至空間草圖,生成可自由探索、幾何與物理都保持一致的 3D 世界。資金方面,World Labs 在 2026 年 2 月完成約 10 億美元募資,投資人陣容包含 AMD、Autodesk、NVIDIA 與 Fidelity。值得注意的是,World Labs 已揭露 Marble 在四個領域擁有付費客戶:遊戲、視覺特效(VFX)、機器人訓練與建築設計。團隊也在 2026 年 6 月 3 日發表專文,試圖把如今被濫用的「世界模型」一詞,拆成三種本質不同的系統來釐清定義。
它會改變什麼?遊戲、機器人、特效、建築都在名單上
世界模型最直接的想像當然是遊戲——理論上可以生成「無限、可即時遊玩」的關卡與場景,讓開發成本結構整個翻轉。但真正讓產業興奮的,其實是機器人訓練這塊。
機器人學習最大的痛點之一,是缺乏大量、真實又多樣的訓練資料。實體世界蒐集資料又慢又貴。而世界模型可以大量「生成」訓練環境:一台機器人可以在 Marble 生成的場景裡,從不同角度反覆接近同一個貨架、在固定位置找到同一批物件——這種「一致又可重複」的模擬環境,正是傳統資料難以提供的。這也是為什麼 NVIDIA、Autodesk 這些橫跨硬體與專業軟體的公司會押注其中。除此之外,視覺特效可以用它快速搭出可運鏡的場景,建築設計則能讓客戶「走進」還沒蓋好的空間。
個人觀點:這是 AI 從「語言」走向「世界」的關鍵一步,但別急著神化
如果說過去的 LLM 教會了 AI 人類的「語言」,那世界模型嘗試教的,是人類與生俱來、卻極難用文字說清楚的「空間直覺」——知道東西在哪、會怎麼移動、彼此如何碰撞。這一步對通往更泛用的 AI、乃至真正能在現實中做事的機器人,可能比再多一個聊天模型都更重要。三大陣營各有側重:Google 追求即時可玩、Adobe 綁定創作工具、World Labs 直攻機器人與商用模擬,光是這樣的分工就說明市場有多看好這條路。
不過也要務實一點。目前的世界模型在解析度、可探索的時間長度、長時間下的一致性,以及運算成本上都還有明顯限制——24 fps、720p、分鐘等級,聽起來厲害,但離「一個能長時間穩定運作的完整世界」還有距離,而且跑起來很燒算力。它更像是 2022、2023 年那時的生成式 AI:方向對了、進展飛快、但還很早。對關注 AI 的人來說,接下來值得盯著的,不是誰的展示影片最炫,而是誰能先把成本壓下來、把一致性做穩、並找到真正付得起錢的應用場景。世界模型這場仗,才剛剛開打。