ORON
回科技觀點
AI 趨勢12 分鐘閱讀

Reflection Beam:501B 參數開源模型挑戰中國對手

Reflection AI 推出 Beam:5,010 億總參數、僅 230 億活躍,將以 Apache 2.0 釋出權重。廠商宣稱推論算力只要中國開源對手的三到四分之一。

Reflection Beam:501B 參數開源模型挑戰中國對手

十月初,一家成立才兩年的紐約新創 Reflection AI 丟出了一個叫 Beam 的模型。它不走 API 封閉路線,而是打算把權重完整公開;它的總參數量是 5,010 億,但每次推論只啟用 230 億。公司自己給的說法很直白:在進階推理測試上與中國領先的開源模型打成平手,而推論階段花掉的算力只要對方的三分之一到四分之一。

如果這些數字站得住腳,那麼過去一年多「開源權重的前沿由中國隊領跑」的局面,第一次出現了來自美國的正面回應。

多層開放式圖書館的室內,四周整面書架公開陳列,象徵模型權重被完整公開給所有人取用

Photo by Doon _MUC on Unsplash

先分清楚:開源權重不等於開源軟體

這兩年「開源 AI」這個詞被用得很鬆,值得先把定義釘好。一般講的開源軟體,是原始碼、建置流程、修改權利全部公開。而目前業界講的「開源權重」(open-weight)只公開一件事:訓練完成的那包參數檔。訓練資料怎麼來、資料配方如何、訓練程式碼長什麼樣,多半不會附上。

但對實際要用的人來說,權重公開已經夠關鍵了。拿到權重,代表你可以把模型下載到自己的機房或自己的雲端帳號裡跑,資料不必離開自家網路;代表你可以用自己的領域資料去微調;也代表供應商哪天漲價、改條款、甚至收掉服務,你手上那包檔案還在。

Reflection 表示 Beam 的權重會以 Apache 2.0 授權在十月釋出,同時附上技術報告與模型卡。Apache 2.0 是相對寬鬆的授權,商用、修改、再散布的門檻都低。在此之前,公司先開放一個候補名單,讓部分使用者試用早期版本。截至撰稿時,完整權重尚未公開,所有效能數字都還停留在廠商自述的階段。

為什麼是現在:開源權重的前沿換過好幾次手

把時間拉長來看,開源權重這條線的領先者換得很頻繁。早期由 Meta 的 Llama 系列定錨,後來 Mistral、Qwen 陸續跟上,再後來 DeepSeek 以極低的訓練成本把整個行業的預期打亂。到了 2026 年,排在最前面的開源權重模型,名字幾乎都來自中國團隊——Z.ai 的 GLM 系列、阿里的 Qwen、月之暗面的 Kimi。

這件事為什麼重要?因為「用什麼模型當底座」會往下決定很多事。一家公司如果要做地端部署、要微調、要控制資料不外流,它幾乎只能從開源權重模型裡選。選了哪一個,就等於接受了那個生態的工具鏈、社群慣例與升級節奏。對企業、對政府部門、對有資料落地要求的產業來說,這不是一個純技術選擇。

Beam 的出現,提供的是另一個選項。TechCrunch 在報導中直接把它定位成「要和中國開源模型競爭、而且推論成本更低」的產品。Reflection 自己則把 Beam 稱為給企業、公部門與開發者使用的「工作馬」(workhorse)模型,定位相當務實:不追求樣樣都會,而是把推理、程式碼與代理人任務做穩。

田徑場彎道上的藍色跑道與白色分道線,象徵開源權重模型的競賽出現第二條賽道

Photo by Ciprian Pardău on Unsplash

規格與數字:大模型,小開銷

Beam 是純文字的混合專家(Mixture of Experts,MoE)模型,預訓練用掉 23.8 兆個 token,中段訓練把有效上下文拉到 100 萬 token,強化學習階段則以 25.6 萬 token 為上限。它不處理圖片與影音——這點和主打多模態的競品不同,取捨很明確。

MoE 的概念是整個模型裡養了一大群「專家」,每次推論只點名其中一小部分上工。Beam 的 5,010 億總參數裡只有 230 億是活躍參數,這就是它敢宣稱推論便宜的結構性理由。作為對照,Reflection 引用的 GLM-5.2 約為 7,440 億總參數、400 億活躍參數。

Reflection 公布的自測成績包括:Terminal Bench v2.1 80.1、SWE-Bench Verified 80.9、SWE-Bench Pro v2-Hard 77.2、AIME 2026 97.8、GPQA Diamond 90.5、Humanity's Last Exam(不使用工具)36.2。公司表示這些成績與 GLM-5.2 相當,在程式與代理人任務上接近 Qwen 3.8-Max,但在原始能力上仍落後 Kimi K3。至於「省 3 到 4 倍推論算力」這個說法,Reflection 自己也註明是概略比較。

這裡要說得清楚一點:以上全部是廠商自行發布的數據,目前沒有第三方複現。模型評測的慣例是等權重真的放出來、社群跑過一輪之後再下定論,中間的落差在這個產業並不罕見。把它當成「值得追蹤的宣稱」,比當成「已確認的事實」合理。

天花板垂下一整叢燈泡,只有部分亮著、其餘維持暗色,象徵混合專家模型每次只啟用少數參數

Photo by Dima Solomin on Unsplash

背後的資本與算力:這不是小團隊的實驗

Reflection AI 由兩位前 Google DeepMind 研究員於 2024 年創立。根據 PitchBook 的資料,公司累計募得約 47 億美元,投資方包含 Nvidia、Sequoia Capital 與 Lightspeed,最近一輪的投前估值為 250 億美元。它同時與 SpaceX、Nebius 簽下合計超過 70 億美元的算力合約,鎖定 Nvidia GB300 晶片的使用權到 2029 年。

商業模式上,Reflection 推的是所謂「AI 工廠」:讓機構用自己的專有資料在自家環境訓練模型,建立在地化的 AI 系統。目標客戶是企業與有主權需求的國家,據 Axios 報導,對沖基金與交易公司也在詢問之列。公司目前正在南韓與新世界集團測試主權 AI 合作案,並規劃一座 250 百萬瓦等級的主權 AI 雲。此外,Reflection 也服務美國能源部 Genesis Mission 底下的 17 座國家實驗室。

把這些拼起來,可以看出 Beam 的開源不太像理想主義。權重免費釋出,換來的是生態採用、是「AI 工廠」的入口、是把估值撐在 250 億美元的敘事。開源在這裡是通路策略,不是慈善。這不是批評——DeepSeek、Qwen、Llama 的開源背後,也各有各的商業盤算。

對一般企業的實際意義

先講一個常見的誤會:權重公開,不代表隨便哪台機器都跑得動。5,010 億參數的模型,即使只有 230 億活躍,權重仍然得整包載入記憶體,這對硬體的要求遠超過一般伺服器。多數公司真正的取得方式,還是透過雲端業者與 GPU 租賃平台提供的託管服務——只是這時候你有了議價空間與搬家能力,因為同一包權重在哪家跑都一樣。

第二,活躍參數少帶來的成本差異,會在「量」上面被放大。單次呼叫省下的錢微不足道,但若一套系統每天要處理數萬次分類、摘要、比對,推論算力差三倍就是整年預算差三倍。對於把 AI 放進日常流程、而不是只拿來做 demo 的團隊,這個差距遲早會出現在帳單上。

第三,百萬 token 的上下文窗口,實務上的意義是「一次塞得下一整份合約、一整套法規、或一個中型程式碼庫」。這讓很多原本要靠檢索拼湊的流程可以簡化。不過上下文長並不等於模型會均勻地讀完全部,長文本的實際表現仍需個案測試。

第四,純文字是個限制。如果你的情境包含掃描文件、產品照片、介面截圖,Beam 單獨撐不起來,得另外搭配多模態模型。

幾個值得留意的觀察

第一,開源權重的競爭正在從「能力」轉向「每單位能力要花多少算力」。當各家在測試分數上愈靠愈近,差異化就會移到成本與部署難度上。Beam 的賣點不是分數最高,而是同樣的分數花更少錢——這個方向大概會被其他團隊跟進。

第二,模型來源正在變成一個採購考量。過去選模型看的是效能與價格,現在不少組織會多問一句權重是誰訓練的、授權條款寫了什麼、未來版本的維護由誰負責。開源權重陣營出現地理上的第二個選項,對採購端是好事,因為有替代方案才談得上議價與退路。

第三,別把廠商自述的 benchmark 當成採購依據。真正能決定一個模型適不適合的,是拿自家資料、自家任務跑一輪。公開測試題目涵蓋的範圍跟任何一家公司的實際工作內容,差距通常都不小。等權重正式釋出、社群評測出來之後再評估,成本更低也更準確。

第四,對台灣的中小企業而言,短期內這件事多半不會直接改變什麼。真正會被影響的是上層的服務供應商——他們換了底座,你用的工具才會跟著變便宜或變好用。值得追蹤,但不必急著反應。

小結

Beam 目前還是一個「宣稱」階段的產品:權重未公開、數字未複現、實際部署案例也還沒浮現。但它指出的方向相當清楚——開源權重的前沿不再只有一種來源,而競爭的焦點正從「誰更強」移動到「誰更省」。等這個月權重正式釋出、第三方評測陸續出來,再回頭看這些數字兌現了多少,會是比現在更有意義的一刻。

想把這些做到你的網站上?

不論是快速上線的模板建站、客製官網或後台系統,留個訊息,我們會回你「能做+報價+時程」。

加 LINE 詢問