ORON
回科技觀點
AI 趨勢10 分鐘閱讀

一個模型,同時會畫圖、拍片、配音、還能開機械手臂?FLUX 3 登場:AI 正從「會聊天」走向「懂世界」

Black Forest Labs 發表 FLUX 3,用單一模型同時處理影像、影片、聲音與機器人動作,還能生成 20 秒自帶原生音訊的影片。AI 正從「會聊天」走向「懂世界」。

一個模型,同時會畫圖、拍片、配音、還能開機械手臂?FLUX 3 登場:AI 正從「會聊天」走向「懂世界」

過去兩年,生成式 AI 大致被切成好幾塊:一個模型幫你畫圖、另一個幫你做影片、再一個負責語音、還有一批人在忙著訓練機器人。它們各自進步得很快,卻始終像是不同語言的專家,各說各話。2026 年 7 月 23 日,德國團隊 Black Forest Labs(BFL)發表的 FLUX 3,正試著把這幾塊拼回同一張桌子——用一套權重,同時處理影像、影片、聲音,甚至機器人的動作預測。

這不是又一個「畫圖更漂亮」的更新,而是一次關於「AI 該怎麼理解世界」的路線宣示。值得花幾分鐘認識它。

FLUX 3 到底是什麼?

Black Forest Labs 這個名字,對玩過 AI 繪圖的人不陌生。它們先前的 FLUX 系列,是市面上品質數一數二的開源影像生成模型,也是許多繪圖工具背後的引擎。這次的 FLUX 3,則是團隊第一個「多模態基礎模型」:影像、影片、音訊在同一個架構裡一起被學習,也是第一次能從同一組權重輸出影片、聲音與動作預測。

專業攝影機與燈光,象徵 AI 影片生成

Photo by Jakob Owens on Unsplash

BFL 的研究團隊有個很直白的理由:單一種類的資料,沒辦法完整描述這個世界。照片捕捉的是某一瞬間的空間結構;影片把時間加回來,讓物理的動態顯現;聲音則揭露了機械事件與聲響之間的因果關係。三者都只是同一個真實世界的「有損投影」。當你逼一個模型同時學這三種資料,它們會互相牽制——聲音必須對得上撞擊、動作必須符合重量、畫面必須遵守物理。這種「彼此約束」正是團隊想要的學習訊號。

最受矚目的能力:20 秒、自帶原生音訊的影片

FLUX 3 家族裡最搶眼的,是負責影片的 FLUX 3 Video。它能在單次生成中做出最長 20 秒、且自帶同步原生音訊的影片。過去多數影片模型不是沒有聲音,就是聲畫要另外對,20 秒也常常要靠拼接。FLUX 3 把畫面與聲音放進同一次生成,這在體感上是很不一樣的。

它支援的模式相當完整:文字生影片(text-to-video)、圖片生影片(image-to-video)、以參考片段做影片轉影片(video-to-video)、用關鍵影格控制轉場(keyframe-to-video),以及從既有影片與音訊接續生成。官方特別點出兩個強項:人臉表情的細膩度,以及把聲音和物理事件對應起來的能力。此外還支援多語對話、把多個片段串成多鏡頭序列(agentic chaining),以及帶動畫的文字排版設計。

數字方面,BFL 公布了初步的人類偏好測試——以 10 秒、720p、含音訊的文字生影片做比較。結果 FLUX 3 在對上 Luma Ray 3.2 時,有 93% 的比較被評審偏好;對上 Runway Gen-4.5 是 77%;對上 Grok Imagine Video 約 69%;對上 Kling v3 Pro 是 60%。而在對上 Seedance 2.0 與 Gemini Omni Flash 時只有 52%,幾乎是五五波。換句話說,它在多數對手面前領先明顯,但在最前段的競品面前並沒有拉開差距——這也提醒我們,影片生成的頂端競爭已經非常擁擠。

影片剪輯時間軸,象徵內容創作工作流程

Photo by Peter Stumpf on Unsplash

底層方法:Self-Flow,以及「把算力壓在哪裡」

FLUX 3 建立在 BFL 自家的 Self-Flow 方法上,這是一套把「生成」與「理解」統一在同一架構的做法,結合了 flow matching 的目標與自監督的特徵重建目標。Self-Flow 本身其實在 2026 年 3 月就已提出,參考實作以 Apache-2.0 授權公開;這次 FLUX 3 的新意不在方法本身,而在規模——團隊把算力與資料量大幅放大,讓同一套方法橫跨影片、影像、音訊一起訓練。

一個有意思的細節是算力分配:影片預測吃掉了整體訓練算力的 95% 以上,而音訊佔用的 token 不到 0.5%。這說明「讓 AI 理解時間與動態」是最昂貴的一環,而聲音雖然份量小,卻是把因果關係補齊的關鍵拼圖。

從螢幕走進工廠:機器人這一塊

FLUX 3 讓人意外的一步,是踏進了「實體 AI」(Physical AI)。同一套骨幹延伸出了 FLUX-mimic,一個機器人控制策略,官方稱它能在單張 RTX 5090 顯卡上、以低於 80 毫秒的延遲運行,反應速度已接近人類反射。相關的機器人版本,據報導正在 Audi 的產線上進行測試,某些任務甚至只需要約 30 分鐘的機器資料就能微調。

工業機械手臂,象徵 AI 進入實體世界與製造業

Photo by Sufyan on Unsplash

把「生成影片」和「控制機器人」放進同一個模型,乍看是兩件不相干的事,其實邏輯一致:兩者都需要理解「這個世界接下來會怎麼動」。會生成物理上合理影片的模型,本質上就握有一份對世界動態的預測能力,而這正是機器人最需要的東西。這也是近來業界常講的「世界模型」(world model)——AI 不只描述世界,還開始預測世界。

先別急著上手:釋出策略是「分批放行」

要潑一點冷水的是,FLUX 3 目前並非人人可用。影片與動作(Action)能力採早期存取,透過 API 與私有權重開放給少數合作夥伴;影像版本預計「未來幾週」推出;而大家最期待、能自行架設的開源權重版 FLUX 3 Dev,官方說要等到 2026 年稍晚。換句話說,現在看到的驚豔數字,多半來自受控環境的展示,真正的普及與第三方驗證還需要時間。

對創作者與產業意味著什麼?

對內容創作者來說,「一次生成、聲畫同步、還能多鏡頭串接」如果真的穩定,短影音、廣告分鏡、產品示意這類工作的前期成本會被再壓低一截。過去要分別處理配樂、對嘴、轉場的流程,有機會被收斂成一次描述。對影視與行銷團隊而言,這是把「試錯」變便宜的工具,而不是取代創意本身。

對製造與機器人產業來說,訊號更耐人尋味:如果一個生成模型的「世界理解」可以直接遷移去控制機械手臂,那麼視覺生成和自動化這兩條原本平行的技術線,正在開始交會。對台灣這種製造底子深厚的地方,這類「用少量資料就能微調」的機器人策略,長期值得持續觀察。

幾點個人觀察

第一,FLUX 3 真正的意義不在「影片又變好」,而在它押注了「多模態統一」這條路——與其把圖、片、聲、動作各養一個專家,不如逼一個模型在彼此矛盾中學會一致的世界觀。這條路若走通,未來的 AI 會更像「懂得世界怎麼運作」,而不只是「很會模仿資料」。

第二,別被單邊的偏好數字沖昏頭。93% 很漂亮,但在最強競品面前只有 52% 才是更誠實的座標——這代表頂端差距已經很小,接下來拼的是穩定度、成本、可控性與生態,而不只是 demo 的驚艷。

第三,開源時程是關鍵變數。FLUX 系列過去之所以影響力大,很大一部分來自它願意開源、讓社群拿去魔改。FLUX 3 Dev 何時、以什麼條件釋出,會直接決定它是「又一個封閉的強模型」,還是「再一次改寫遊戲規則的開源浪潮」。這一點,值得繼續盯著看。

AI 正在從「會聊天」走向「懂世界」,而 FLUX 3 是這個轉向裡,很具代表性的一步。它不見得是終點,但它把方向指得很清楚:下一階段的競爭,是誰能把看得見的、聽得到的、動得起來的,通通裝進同一顆腦袋裡。

想把這些做到你的網站上?

不論是快速上線的模板建站、客製官網或後台系統,留個訊息,我們會回你「能做+報價+時程」。

加 LINE 詢問