本地部署大模型:125B 參數塞進 12GB 遊戲顯卡
開源推論引擎 Strata 宣稱讓 1,250 億參數的 Qwen3.8-Flash-Next 跑在 12GB 遊戲顯卡上。稀疏啟用與分層記憶體怎麼辦到,數字又該打幾折?

Photo by Jorge Salvador on Unsplash
十月四日,一個名為 Strata 的開源推論引擎在 GitHub 上釋出,採 MIT 授權。它宣稱的事情聽起來不太合理:讓一個一千兩百五十億參數的語言模型,跑在一張只有 12GB 記憶體的遊戲顯示卡上。
這個數字落差大到值得停下來看一眼。同一個模型的 FP8 權重檔案本身就有 172.78 GiB,光是放進記憶體就需要多張伺服器等級的加速卡。而 Strata 給出的硬體需求是:12GB 顯示記憶體、32GB 系統記憶體、約 80GB 硬碟空間——一台三年內組裝的遊戲主機大致就有這個規格。
被跑起來的是什麼模型
主角是阿里巴巴 Qwen 團隊在八月二十六日釋出的 Qwen3.8-Flash-Next。它被定位成 Qwen4 架構的預覽版本,總參數約 1,800 億,其中語言主幹 1,250 億,另外包含 510 億的 N-gram 嵌入與 40 億的多 token 預測模組。原生脈絡長度 262,144 個 token,透過 YaRN 可延伸到百萬等級。授權是 qwen-community-1.0,不是 Apache-2.0,商用前需要自行確認條款。
在公開評測上,這個模型的表現並不像一個「可以塞進遊戲機」的小模型:SWE-bench Pro 62.5、CoWorkBench 73.9、MathVision 95.7。Alibaba 同時表示它的訓練成本約為前一代 Qwen3.7-Plus 的九分之一。
讓它有機會離開機房的關鍵,是架構。
Photo by Sanaila Rasheed on Unsplash
稀疏啟用:整棟樓裡只亮幾盞燈
Qwen3.8-Flash-Next 採用混合專家(Mixture-of-Experts,MoE)架構。傳統的稠密模型每處理一個 token,全部參數都要參與計算;MoE 則把網路切成大量的「專家」子模組,每一層配置 512 個專家,但每個 token 實際只會啟用其中 11 個——10 個由路由機制挑選,加上 1 個固定的共享專家。
結果是:模型總量 1,250 億參數,單一 token 真正動用的只有約 60 億。
這就像一棟住了幾百戶的大樓,深夜裡只有幾扇窗亮著。整棟樓確實存在,但任何一個瞬間,耗電的只有那幾戶。MoE 的省力之處在此,而這個特性也正好替「記憶體不夠」的機器留了一扇門:既然大部分專家在多數時候都用不到,那它們是不是一定要住在昂貴的顯示記憶體裡?
Strata 的做法:把記憶體分層
Strata 的核心策略是分層存放。使用頻率高的專家常駐 GPU 顯示記憶體,其餘的放在速度較慢、但便宜得多的系統記憶體裡,需要時再取用。引擎本身建立在 llama.cpp 與 ggml 的實作基礎上,權重的壓縮則由 ISTA-DASLab、UkisAI 與 Unsloth 等團隊完成。
搭配的是相當激進的量化。專案提供 Q2_0、IQ2_XS、IQ3_XXS、IQ3_S 等多種壓縮等級,另有針對程式撰寫優化的 Coder 變體。這裡沒有免費午餐:Coder 變體在程式任務上可達到完整模型約 91% 的分數,但在非程式任務上明顯退步;若要跑完整精度,系統記憶體需求會拉高到 96GB。
專案自行公布的吞吐量數字如下:
- NVIDIA RTX 5070(12GB)、Q2_0 量化:輸出約 94 tokens/秒,讀入提示約 2,650 tokens/秒
- AMD RX 9070 XT、Q2_0 量化:輸出約 60 tokens/秒,讀入約 1,160 tokens/秒
- 24GB 等級的顯示卡:輸出約 100 至 140 tokens/秒
- 啟用投機解碼(speculative drafter)後,宣稱吞吐再提升 1.6 至 1.8 倍
讀入速度之所以能破千,是因為引擎以 8,192 個 token 為一批處理輸入。另外,初次載入時會有一到三分鐘的記憶體鎖定過程,啟動並非即時。
需要保留的部分
這些數字目前全部來自專案方的自述,尚未有獨立第三方完成驗證。在推論引擎這個領域,量測方式的差異——批次大小、脈絡長度、是否計入首個 token 延遲——足以讓同一份硬體跑出很不一樣的成績,因此在第三方報告出現之前,把它當成「待確認的宣稱」比較穩當。
功能面也有明確邊界。預設情況下引擎一次只處理一個請求,多出來的會排隊,這意味著它適合單人使用,而不是撐起一個多人共用的內部服務。AMD 顯示卡的影像輸入在 Windows 上尚未支援。而最需要注意的是量化本身:壓到 Q2_0 這種等級,模型的輸出品質與原始權重已經不是同一回事,官方文件也直言不同壓縮等級各有取捨。
Photo by Kirill Sh on Unsplash
為什麼這個方向值得追蹤
過去兩年,開源模型的討論多半繞著「分數追上了沒」打轉。Strata 這類專案指向另一個軸線:同樣一個模型,執行它的門檻可以壓到多低。
這條軸線的影響,可能比排行榜名次更直接。目前絕大多數企業接觸生成式 AI 的方式是呼叫雲端 API,成本隨用量線性增加,資料也必須離開自己的網路。一旦接近前緣的開源模型能在一台桌機上運作,有幾件事的計算方式就會改變:處理含有敏感資訊的文件時不必再評估外送風險;長期、高頻、低複雜度的批次任務,邊際成本從每百萬 token 幾美元變成一筆電費;離線或網路受限的環境也多了一個選項。
但要說「雲端 API 從此可被取代」,又太早了。單請求排隊的限制、量化造成的品質折損、缺乏第三方驗證的效能數字,每一項都還擋在前面。更實際的理解是:地端推論正在從「幾乎不可能」變成「某些情境下值得評估」,而這個轉變本身就足以讓採購與架構的選項變多。
一點觀察
值得注意的是這件事的分工樣貌。模型來自阿里巴巴,權重壓縮由三個獨立團隊完成,推論引擎由個人開發者在既有的 llama.cpp 基礎上寫成,全部以開源形式串起來。沒有任何一方單獨做完整條鏈,但接起來之後,門檻被拉低了一個量級。
這種拼接式的推進,很難從單一公司的發布會上看出來,卻是開源生態最常見的前進方式。對關注 AI 發展的人來說,與其只盯著各家旗艦模型的發布,不如同時留意「執行成本」這條線——它決定的是技術最終能擴散到多遠的地方,而不只是跑得多快。
Strata 的宣稱是否站得住腳,接下來幾週的第三方測試會給出答案。但無論數字最後打幾折,把一個 1,250 億參數的模型推向消費級硬體這個方向,顯然已經有人在認真嘗試了。