Reflection Beam:501B 參數開源模型挑戰中國對手
Reflection AI 推出 Beam:5,010 億總參數、僅 230 億活躍,將以 Apache 2.0 釋出權重。廠商宣稱推論算力只要中國開源對手的三到四分之一。

十月初,一家成立才兩年的紐約新創 Reflection AI 丟出了一個叫 Beam 的模型。它不走 API 封閉路線,而是打算把權重完整公開;它的總參數量是 5,010 億,但每次推論只啟用 230 億。公司自己給的說法很直白:在進階推理測試上與中國領先的開源模型打成平手,而推論階段花掉的算力只要對方的三分之一到四分之一。
如果這些數字站得住腳,那麼過去一年多「開源權重的前沿由中國隊領跑」的局面,第一次出現了來自美國的正面回應。
Photo by Doon _MUC on Unsplash
先分清楚:開源權重不等於開源軟體
這兩年「開源 AI」這個詞被用得很鬆,值得先把定義釘好。一般講的開源軟體,是原始碼、建置流程、修改權利全部公開。而目前業界講的「開源權重」(open-weight)只公開一件事:訓練完成的那包參數檔。訓練資料怎麼來、資料配方如何、訓練程式碼長什麼樣,多半不會附上。
但對實際要用的人來說,權重公開已經夠關鍵了。拿到權重,代表你可以把模型下載到自己的機房或自己的雲端帳號裡跑,資料不必離開自家網路;代表你可以用自己的領域資料去微調;也代表供應商哪天漲價、改條款、甚至收掉服務,你手上那包檔案還在。
Reflection 表示 Beam 的權重會以 Apache 2.0 授權在十月釋出,同時附上技術報告與模型卡。Apache 2.0 是相對寬鬆的授權,商用、修改、再散布的門檻都低。在此之前,公司先開放一個候補名單,讓部分使用者試用早期版本。截至撰稿時,完整權重尚未公開,所有效能數字都還停留在廠商自述的階段。
為什麼是現在:開源權重的前沿換過好幾次手
把時間拉長來看,開源權重這條線的領先者換得很頻繁。早期由 Meta 的 Llama 系列定錨,後來 Mistral、Qwen 陸續跟上,再後來 DeepSeek 以極低的訓練成本把整個行業的預期打亂。到了 2026 年,排在最前面的開源權重模型,名字幾乎都來自中國團隊——Z.ai 的 GLM 系列、阿里的 Qwen、月之暗面的 Kimi。
這件事為什麼重要?因為「用什麼模型當底座」會往下決定很多事。一家公司如果要做地端部署、要微調、要控制資料不外流,它幾乎只能從開源權重模型裡選。選了哪一個,就等於接受了那個生態的工具鏈、社群慣例與升級節奏。對企業、對政府部門、對有資料落地要求的產業來說,這不是一個純技術選擇。
Beam 的出現,提供的是另一個選項。TechCrunch 在報導中直接把它定位成「要和中國開源模型競爭、而且推論成本更低」的產品。Reflection 自己則把 Beam 稱為給企業、公部門與開發者使用的「工作馬」(workhorse)模型,定位相當務實:不追求樣樣都會,而是把推理、程式碼與代理人任務做穩。
Photo by Ciprian Pardău on Unsplash
規格與數字:大模型,小開銷
Beam 是純文字的混合專家(Mixture of Experts,MoE)模型,預訓練用掉 23.8 兆個 token,中段訓練把有效上下文拉到 100 萬 token,強化學習階段則以 25.6 萬 token 為上限。它不處理圖片與影音——這點和主打多模態的競品不同,取捨很明確。
MoE 的概念是整個模型裡養了一大群「專家」,每次推論只點名其中一小部分上工。Beam 的 5,010 億總參數裡只有 230 億是活躍參數,這就是它敢宣稱推論便宜的結構性理由。作為對照,Reflection 引用的 GLM-5.2 約為 7,440 億總參數、400 億活躍參數。
Reflection 公布的自測成績包括:Terminal Bench v2.1 80.1、SWE-Bench Verified 80.9、SWE-Bench Pro v2-Hard 77.2、AIME 2026 97.8、GPQA Diamond 90.5、Humanity's Last Exam(不使用工具)36.2。公司表示這些成績與 GLM-5.2 相當,在程式與代理人任務上接近 Qwen 3.8-Max,但在原始能力上仍落後 Kimi K3。至於「省 3 到 4 倍推論算力」這個說法,Reflection 自己也註明是概略比較。
這裡要說得清楚一點:以上全部是廠商自行發布的數據,目前沒有第三方複現。模型評測的慣例是等權重真的放出來、社群跑過一輪之後再下定論,中間的落差在這個產業並不罕見。把它當成「值得追蹤的宣稱」,比當成「已確認的事實」合理。
Photo by Dima Solomin on Unsplash
背後的資本與算力:這不是小團隊的實驗
Reflection AI 由兩位前 Google DeepMind 研究員於 2024 年創立。根據 PitchBook 的資料,公司累計募得約 47 億美元,投資方包含 Nvidia、Sequoia Capital 與 Lightspeed,最近一輪的投前估值為 250 億美元。它同時與 SpaceX、Nebius 簽下合計超過 70 億美元的算力合約,鎖定 Nvidia GB300 晶片的使用權到 2029 年。
商業模式上,Reflection 推的是所謂「AI 工廠」:讓機構用自己的專有資料在自家環境訓練模型,建立在地化的 AI 系統。目標客戶是企業與有主權需求的國家,據 Axios 報導,對沖基金與交易公司也在詢問之列。公司目前正在南韓與新世界集團測試主權 AI 合作案,並規劃一座 250 百萬瓦等級的主權 AI 雲。此外,Reflection 也服務美國能源部 Genesis Mission 底下的 17 座國家實驗室。
把這些拼起來,可以看出 Beam 的開源不太像理想主義。權重免費釋出,換來的是生態採用、是「AI 工廠」的入口、是把估值撐在 250 億美元的敘事。開源在這裡是通路策略,不是慈善。這不是批評——DeepSeek、Qwen、Llama 的開源背後,也各有各的商業盤算。
對一般企業的實際意義
先講一個常見的誤會:權重公開,不代表隨便哪台機器都跑得動。5,010 億參數的模型,即使只有 230 億活躍,權重仍然得整包載入記憶體,這對硬體的要求遠超過一般伺服器。多數公司真正的取得方式,還是透過雲端業者與 GPU 租賃平台提供的託管服務——只是這時候你有了議價空間與搬家能力,因為同一包權重在哪家跑都一樣。
第二,活躍參數少帶來的成本差異,會在「量」上面被放大。單次呼叫省下的錢微不足道,但若一套系統每天要處理數萬次分類、摘要、比對,推論算力差三倍就是整年預算差三倍。對於把 AI 放進日常流程、而不是只拿來做 demo 的團隊,這個差距遲早會出現在帳單上。
第三,百萬 token 的上下文窗口,實務上的意義是「一次塞得下一整份合約、一整套法規、或一個中型程式碼庫」。這讓很多原本要靠檢索拼湊的流程可以簡化。不過上下文長並不等於模型會均勻地讀完全部,長文本的實際表現仍需個案測試。
第四,純文字是個限制。如果你的情境包含掃描文件、產品照片、介面截圖,Beam 單獨撐不起來,得另外搭配多模態模型。
幾個值得留意的觀察
第一,開源權重的競爭正在從「能力」轉向「每單位能力要花多少算力」。當各家在測試分數上愈靠愈近,差異化就會移到成本與部署難度上。Beam 的賣點不是分數最高,而是同樣的分數花更少錢——這個方向大概會被其他團隊跟進。
第二,模型來源正在變成一個採購考量。過去選模型看的是效能與價格,現在不少組織會多問一句權重是誰訓練的、授權條款寫了什麼、未來版本的維護由誰負責。開源權重陣營出現地理上的第二個選項,對採購端是好事,因為有替代方案才談得上議價與退路。
第三,別把廠商自述的 benchmark 當成採購依據。真正能決定一個模型適不適合的,是拿自家資料、自家任務跑一輪。公開測試題目涵蓋的範圍跟任何一家公司的實際工作內容,差距通常都不小。等權重正式釋出、社群評測出來之後再評估,成本更低也更準確。
第四,對台灣的中小企業而言,短期內這件事多半不會直接改變什麼。真正會被影響的是上層的服務供應商——他們換了底座,你用的工具才會跟著變便宜或變好用。值得追蹤,但不必急著反應。
小結
Beam 目前還是一個「宣稱」階段的產品:權重未公開、數字未複現、實際部署案例也還沒浮現。但它指出的方向相當清楚——開源權重的前沿不再只有一種來源,而競爭的焦點正從「誰更強」移動到「誰更省」。等這個月權重正式釋出、第三方評測陸續出來,再回頭看這些數字兌現了多少,會是比現在更有意義的一刻。