ORON
回科技觀點
AI 趨勢9 分鐘閱讀

世界模型戰局再升溫:李飛飛丟出 Atlas、LeCun 帶 10 億美元入局,AI 從『會說話』搶進『懂空間』的下半場

上個月才聊過世界模型,這個月戰局又往前推一大步:李飛飛的 Atlas 讓你走進一張照片、LeCun 帶 10 億美元加碼、NVIDIA Cosmos 悄悄變成機器人練習場。這是一份最新進度盤點。

世界模型戰局再升溫:李飛飛丟出 Atlas、LeCun 帶 10 億美元入局,AI 從『會說話』搶進『懂空間』的下半場

9 月 1 日,史丹佛 AI 大神級人物、被稱為「AI 教母」的李飛飛(Fei-Fei Li),透過她的新創公司 World Labs 丟出了一個名為 Atlas 的模型。它的能力聽起來像科幻:給它一張照片,它就能把那個場景補完成一個立體、可以自由移動視角穿梭其中的世界。這不是又一支炫技影片,而是「世界模型」(World Model)這條賽道白熱化的最新一槍——就在我們上個月才聊過這個題目之後,戰局又往前推進了一大步。

如果你錯過了前情提要,這裡用一句話補完:世界模型想教會電腦的,不是「說人話」,而是「懂物理」——理解球滾下斜坡會怎麼走、鏡頭移開後物件還在不在原地。這是純靠文字訓練的大型語言模型(LLM)在結構上學不會的東西。而 2026 下半年,這個方向從概念驗證,快速進入了各家搶著把它「產品化」的階段。這篇想聊的,就是這一個月來最值得盯的三件新事。

AI 生成的三維虛擬地形,象徵世界模型建構出可探索的空間

Photo by Maxim Berg on Unsplash

第一件事:Atlas 把「單一模型跨模態」做到了新高度

李飛飛的團隊過去已經展示過生成 3D 場景的能力,但 Atlas 的野心明顯更大。它被定位成一個「全模態世界模型」(omni world model):用同一個模型,同時處理文字、圖片、影片與 3D 資料,全部收攏在一個統一的「空間脈絡」裡。技術上它是一個多模態的自回歸擴散 Transformer,能產出最高 1440p、長達約一分鐘、且攝影機視角可控的畫面。

換句話說,過去你可能需要拼湊好幾個專用模型才能做的事——重建場景、生成影片、控制鏡頭——Atlas 想用一個模型全包。數字上,在稀疏視角的 3D 重建測試裡,它的平均相對點雲誤差是 25.3,勝過次佳專用模型的 28.7;在人類評審的偏好測試中,它相較各家競爭對手的影片模型,勝出比例落在 75% 到 94% 之間。World Labs 至今募到約 12 億美元,資本市場顯然買這個故事。

但要潑一盆冷水:Atlas 目前不是你能打開就用的產品。它走「早期存取」(early access)路線,只開放給少數合作夥伴,需要填表申請,官方沒有公布定價、沒有 API、也沒有公開上線時間表。它更像一支實力宣示,而非一件商品——這個「差距」,等下還會再提到。

第二件事:LeCun 帶著 10 億美元,公開跟 LLM 唱反調

比起 Atlas 的技術細節,我覺得更值得玩味的是「人」的動向。深度學習三巨頭之一、以直言不諱著稱的 Yann LeCun,長年公開質疑「純語言模型通往通用人工智慧」這條路,主張真正的智慧必須先建立在對物理世界的理解之上。2026 年初,他所投入的 Advanced Machine Intelligence Labs(AMI Labs)據報募到約 10 億美元的種子輪。

這是一個很強的訊號。當一位這種份量的科學家,願意把職涯與這麼大一筆資本都押在「LLM 不是終點、世界模型才是」這個判斷上,代表這已經不只是學術辯論,而是真金白銀的產業下注。加上李飛飛的 World Labs 同樣以「空間智慧」(spatial intelligence)為旗幟募到十億級資金,你會發現:這波賭注的共同信念,就是「文字之外,AI 還缺一個對世界的直覺」。

抽象的三維渲染虛擬空間,代表 AI 建構的模擬環境

Photo by Sara Ferrari on Unsplash

第三件事:世界模型正悄悄變成機器人的「練習場」

如果說 Atlas 和 AMI Labs 代表的是「消費級/內容級」的想像,那另一條更務實的應用線,正在機器人領域安靜地跑起來。NVIDIA 的 Cosmos 系列,被定位成「世界基礎模型」(world foundation model),主打的場景不是拍漂亮影片,而是讓機器人在被丟進真實世界之前,先在 AI 生成的模擬環境裡把各種狀況練過千百遍。

這一點其實把兩條看似不同的 AI 熱潮接了起來。2026 之所以被許多人稱為人形機器人的「量產元年」,背後的關鍵拼圖,正是一個懂空間、懂物理的大腦——而世界模型提供的,恰恰是近乎無限的「虛擬練習場」。讓機器人先在生成環境裡把危險、罕見的狀況演練完,再把學到的能力搬進現實。這種「先在夢裡練、再到現實用」的訓練模式,很可能成為實體 AI 的標準流程。相較於做遊戲場景或影片,這條線的商業必要性其實更硬——因為機器人一旦不懂物理,撞壞的是真東西,甚至可能傷到人。

為什麼是「現在」集中爆發?

世界模型的概念不新,學界談很多年了。真正讓它在 2026 下半年一波接一波地端上桌,我認為有兩個現實推力。其一,是語言模型的邊際效益正在遞減:當各家旗艦在文字、程式、數學上的分數越咬越緊,整個產業自然要去找下一個能拉開差距的維度,而「理解物理世界」正好是文字模型天生的短板。其二,是實體 AI 的需求被真正點燃:當 AI 要驅動一隻手臂、一台車、一個在你家走動的機器人,它就不能只會描述世界,而必須真的懂世界。這股來自機器人的剛需,把世界模型從研究題目推成了必需品。

沉浸式頭戴顯示裝置,象徵人與 AI 生成空間的互動介面

Photo by James Yarema on Unsplash

幾句必要的冷靜

興奮之餘,還是得保持清醒。這一個月的發表,展示成分濃、可用成分淡。Atlas 停在早期存取、沒有定價與 API,這提醒我們:技術的驚艷程度,跟它能不能穩定、便宜、大規模落地,是兩回事。

更值得警惕的是評測標準本身。當一家公司同時是模型的開發者、又是評分規則的制定者,那些漂亮的勝率數字該打幾折,外界其實很難驗證——這次 Atlas 的benchmark 公平性就已經有人提出質疑。再者,世界模型要生成長時間、高一致性又符合物理直覺的場景,難度極高,目前多數展示都還卡在數十秒到一分鐘,時間一拉長,破綻往往就冒出來。

但方向是清楚的。從上個月的「元年宣告」,到這個月 Atlas 出手、LeCun 加碼、Cosmos 落地機器人,短短幾週,這條賽道就從「值得關注」變成了「開始搶跑」。對我來說,這比又一次的跑分刷新有意思得多——因為它逼著整個產業回答一個更根本的問題:智慧,到底是關於語言,還是關於理解我們身處其中的這個真實世界?當越來越多最聰明的人選擇後者,這場仗,值得我們一週一週地盯下去。

想把這些做到你的網站上?

不論是快速上線的模板建站、客製官網或後台系統,留個訊息,我們會回你「能做+報價+時程」。

加 LINE 詢問