AI 進入『部署時代』:決定誰能賺錢的不再是訓練模型,而是把它跑起來——兩家推理平台半年估值飆上百億美元
2026 年 AI 競爭重心從『訓練模型』轉向『把模型跑起來』。推理將吃掉近三分之二運算資源,兩家推理平台半年內估值衝上百億美元,一場『部署』新戰爭正上演。

過去三年,AI 產業最醒目的一張支票,都開給了「訓練」——用成千上萬張 GPU、燒掉數千萬美元,去養出一個更大、更聰明的模型。但 2026 年,最會吸金的角色換了:真正讓創投搶著下注的,是一群負責「把模型跑起來、回應每一次請求」的推理(inference)平台公司。半年之內,兩家聽起來很陌生的公司——Baseten 與 Fireworks——估值一路衝上百億美元等級。
這篇文章想聊的,不是「AI 又變聰明了」,而是一個更務實的產業轉向:當模型本身逐漸變成隨手可得的商品,真正決定一家公司能不能賺錢的,開始是「有沒有本事把它跑得又快又便宜又穩」。
Photo by Winston Chen on Unsplash
推理,是一筆「永遠不會停」的帳單
訓練和推理的差別,可以用一句話講完:訓練是「一次性把學生教會」,推理則是「這位學生畢業後每天上班、每接一個問題就回答一次」。前者是偶爾發生的資本支出,模型更新時才付;後者是持續發生的營運支出,用的人越多、跑得越勤,帳單就越大。
關鍵在於後半段的經濟結構。業界估計,一個正式上線的 AI 系統,其生命週期成本有八到九成其實花在推理,而不是當初的訓練。這也是為什麼「怎麼把每一次呼叫做得更省」會突然變成一門百億美元的生意——它省下的,是客戶最痛、最長期的那條成本線。
(先前我們談過『推理晶片』的硬體戰、也聊過模型供應商之間的『token 價格戰』;這次的主角不一樣,是夾在晶片與模型中間、專門負責『把模型高效跑起來』的那層軟體服務平台。)
為什麼是現在?運算重心正式翻轉
時間點並非巧合。過去兩年企業大多還停在「實驗」階段——試接 API、做 POC、內部小規模測試;到了 2026 年,大量應用真正上線、開始面對真實流量,推理需求因此一次爆發。
數字很直白:推理工作負載預估將佔 2026 年全部 AI 運算的約三分之二,而這個比例在 2023 年還只有三分之一、2025 年約一半。市場規模方面,AI 推理市場預估將從 2025 年的約 1,060 億美元,成長到 2030 年的約 2,550 億美元。AI 的錢,正在從「蓋出更聰明的腦」,流向「讓這顆腦隨時待命、秒回每一個人」。
Photo by Albert Stoynov on Unsplash
兩個名字,半年內身價翻好幾倍
最能說明這股熱度的,是資本的動作。
Baseten 在 2026 年 6 月宣布完成 15 億美元的 Series F 募資,估值來到 110 億至 130 億美元之間。對照它在同年 2 月才以 50 億美元估值募得 3 億美元 Series E——短短四個月,估值翻了一倍多。Baseten 表示,其平台目前每天處理超過 10 億次推理呼叫,橫跨 18 朵雲上的 87 個叢集,營收更寫下年增 20 倍的紀錄。
Fireworks 的曲線同樣陡峭:2026 年 7 月完成約 15 億美元的 Series D,估值衝上 175 億美元,年度經常性營收(ARR)突破 10 億美元、年增五倍,累計募資超過 18 億美元。此外,由開源推理引擎 SGLang 孵化出的新公司 RadixArk,也在近期宣布完成超過 1 億美元的種子輪。
當一個原本被視為「基礎水電」的環節,能在半年內讓公司估值翻倍、甚至催生出百億美元級玩家,代表市場已經把「推理」當成一個獨立、且高度競爭的基礎設施類別在看待,而不再只是雲端服務裡的一個附屬功能。
對產業與使用者代表什麼?
第一,企業的策略正在轉彎。越來越多公司放棄「自己從頭訓練一個模型」的念頭,改用現成的開源或閉源模型,把重心放在「如何把它穩定、便宜、快速地部署上線」。這對多數中小型團隊其實是好消息——你不必再燒錢訓練,重點變成選對模型、接對平台。
第二,「便宜」和「省錢」是兩回事。單次推理的 token 單價確實一路走低,但因為用量暴增,整體推理支出反而持續攀升。這也是為什麼推理平台這麼值錢:誰能把每一次呼叫做得更快、更省、更穩,誰就直接幫客戶省下最大一塊持續性成本。
第三,「快」變成硬需求。推理是即時的、對延遲極度敏感——當 AI 被嵌進金融交易、客服對話、醫療系統時,差幾十毫秒都可能影響體驗甚至結果。這也讓 AI 基礎設施變得更「就近、分散」,從超大型資料中心一路延伸到邊緣運算。
Photo by Conny Schneider on Unsplash
一點觀察
如果說前幾年的 AI 是一場「誰的模型更強」的比拚,那麼 2026 年的主旋律,已經明顯轉成「誰能把模型跑得又快又便宜又穩」。這其實是個健康的訊號——它代表 AI 正從「炫技」走向「真的要賺錢、要落地」。
對一般使用者來說,這場轉變多半無感卻實在:你不會知道背後跑的是哪家推理平台,但你會感覺到 AI 回應更快了、能用的服務更多了、越來越多產品「用得起 AI」了。對想導入 AI 的企業而言,真正該問的問題,也從「要不要自己訓練模型」,變成「這個功能上線後,每天跑起來要花多少錢、夠不夠快」。
訓練決定了 AI 的上限,推理決定了 AI 能不能走進日常。2026 年,最貴、也最值得盯著看的,正是後者。