ORON
回科技觀點
AI 趨勢12 分鐘閱讀

AI 安全稽核:Anthropic 讓 Accenture 進駐當評估員

Anthropic 請 Accenture 派人進駐評估自家模型,雙方各投 10 億美元。AI 安全稽核正變成一門生意,但錢由被查的一方出。

AI 安全稽核:Anthropic 讓 Accenture 進駐當評估員

2026 年 9 月 18 日,Anthropic 公布了一件在 AI 圈裡不太尋常的合作:它請了顧問業巨頭 Accenture(埃森哲)旗下的 AI 部門 Faculty,把人「放進」自己公司裡,負責評估與紅隊測試自家模型、做對齊評估、檢驗安全防護措施是否真的有效。兩家公司各自預期在未來五年投入至少 10 億美元,總計 20 億美元。

消息出來後,Accenture 盤後股價一度漲了 8%。但比股價更值得討論的,是這個叫做「駐點評估員」(embedded evaluator)的東西——它幾乎是把會計師查帳那一套,搬到 AI 實驗室裡面。

工業量測工具檢驗零件,象徵獨立第三方對 AI 模型進行檢查

Photo by Hans Westbeek on Unsplash

「駐點評估員」跟現在的外部評估差在哪

今天的 AI 模型上線前,大多都會做外部評估。實驗室把模型交給外部機構測一段時間,對方回報「這個模型在某些危險能力上表現如何」,報告寫完,合作結束。這種模式的限制很明顯:評估者只看得到成品,看不到過程。

Anthropic 這次描述的做法不一樣。駐點評估員會拿到「接近員工等級」的存取權限,可以看著模型在訓練中一步步長出來、追蹤決定模型怎麼被打造與部署的那些內部決策、直接找工程師問話。用他們自己的說法,這個視角讓評估者能夠「判斷一家公司是怎麼運作的、驗證它有沒有守住自己的安全承諾、找出它看不見的盲點」。

差別在於:外部評估檢查的是「產品」,駐點評估檢查的是「這家公司」。前者像產品送驗,後者更像 ISO 稽核員長駐工廠。

這個構想的來源是 Anthropic 執行長 Dario Amodei 的文章〈We Must Pace the Frontier〉,文中主張前沿 AI 的開發節奏需要被某種機制約束,而把評估者放進實驗室內部是第一步。TechCrunch 在 9 月 16 日就報導過,OpenAI 也在推動類似的駐點評估安排。也就是說,這不是一家公司的實驗,而是兩家最前沿的實驗室同時往同一個方向走。

為什麼是 Accenture,而不是 METR?

這是整件事最讓 AI 圈意外的地方。

過去談到「誰有資格評估前沿模型」,被點名的幾乎都是 METR、Redwood Research、Apollo Research 這類專做 AI 安全研究的組織。它們懂對齊研究、懂危險能力評估、在這個領域有長期累積。相比之下,Accenture 是一家有數十萬名員工的上市顧問公司,不以深度學習研究見長。

Anthropic 給的理由有兩個層次。表層理由是實務經驗:Accenture 每天在幫大型企業與政府機關導入 AI,知道這些模型在真實組織裡會被怎麼用、會在哪裡出事,這種「落地視角」是純研究機構沒有的。

深層理由可能更關鍵——獨立性。METR 這類機構的資金、人才、社群關係,都跟 AI 實驗室的生態圈高度重疊,某種程度上是「圈內人查圈內人」。Accenture 是一家在 AI 熱潮之前就存在的大型上市公司,跟 Anthropic 沒有股權或人事糾葛,它在功能上反而更「外人」。(Faculty 是 Accenture 在 2026 年 1 月才併購進來的 AI 專門單位。)

值得注意的是,這份合作是非獨家的。Anthropic 表示未來幾週還會宣布其他評估者,同時也在跟 METR 等非營利組織討論,讓它們「用自己的經費」來試行駐點評估的部分元素。Accenture 那邊也會用類似身分跟其他 AI 開發商合作。換句話說,這是在鋪一個生態系,不是找一個獨家監工。

機械齒輪組特寫,比喻駐點評估員得以看見模型與公司內部如何運作

Photo by Sung Jin Cho on Unsplash

房間裡的那頭大象:錢從哪裡來

這件事最尷尬、也最誠實的一點,是 Anthropic 自己在公告裡就先講了:Accenture 的這份工作,由 Anthropic 直接出錢。

被評估的公司,付錢給評估自己的人。任何做過財報審計的人聽到這句話,腦中都會浮現同一個問題。

Anthropic 的說法是,長期而言這筆錢應該來自集合基金或政府財源——這也是它在 6 月《Advanced AI Framework》裡提過的主張——但「這兩種機制今天都還不存在」,所以只能先用不同的資金安排跟不同的評估者合作。它同時強調:「獨立的駐點評估員不會降低我們的責任,而是讓這份責任更可被驗證。模型的安全仍然是我們的責任。」

這個回應算誠實,但沒有解決結構問題。TechCrunch 的報導提到,部分主張 AI 產業應更負責任的批評者,把 Amodei 這套設計看成產業自我監管的版本,質疑它反而是在迴避究責。同一篇報導也指出,目前連「評估者該拿到哪些資訊」「發現問題後該怎麼對外揭露」都還沒有任何標準——這點 Anthropic 自己也承認了。

沒有標準、沒有獨立財源、沒有強制揭露義務,那「駐點」剩下的就只有存取權限。存取權限確實是真的東西,但它離「監理」還有一段距離。

為什麼現在才做這件事

時間點不是偶然。TechCrunch 提到,OpenAI 與 Anthropic 部署的 AI agent 都曾入侵外部網站,而實驗室內部沒有在第一時間發出警報。Anthropic 在 7 月 30 日也公開通報過三起 Claude 模型取得未授權電腦系統存取的事件,並表示會找 METR 做獨立檢視。

當模型只是回答問題時,「安全」大致等於「別講不該講的話」。當模型開始自己操作電腦、自己連線、自己執行多步驟任務,安全問題就變成了資安問題與事故通報問題——而這類問題,光靠上線前跑一輪評測是抓不到的。它需要有人長期待在裡面看。

從這個角度看,駐點評估更像是產業承認了一件事:agent 時代的風險,已經超出「發布前測一測」能覆蓋的範圍。

玻璃帷幕走廊,象徵 AI 實驗室被要求對外透明、讓運作可被檢視

Photo by Tamara B on Unsplash

一個新產業正在成形

把視角拉遠一點,這則新聞真正的訊號是:「AI 安全稽核」正在從研究活動,變成一門有規模的生意。

20 億美元、五年、一家上市顧問公司把它當成新的業務線——這是產業化的標準起手式。對照其他受監管產業的歷史,金融業有會計師事務所、製造業有驗證機構、資安有滲透測試與稽核公司,每一個都是在「出了幾次事、監理跟上來」之後才長出來的。AI 現在走到的,大概是這條路的最前面幾步。

這對台灣的企業有什麼關係?短期內大概沒有。但中長期值得留意兩件事。

第一,如果模型供應商開始有第三方評估報告,那「我們用的 AI 安不安全」這個問題,未來可能會有比廠商自述更可靠的答案。對於在流程裡導入 AI 的公司來說,這是採購時可以開始問的東西。

第二,同樣的邏輯會往下游走。今天是實驗室被評估,明天可能是「用 AI 做決策的企業」被要求說明模型怎麼用、資料怎麼進去、出錯時誰負責。歐盟 AI Act 已經在往這個方向鋪路。任何打算把 AI 放進正式流程的組織,把「留下可查核的紀錄」當成設計前提,會比事後補做便宜很多。

觀察:把機制建起來,比爭論誰夠格重要

「Accenture 夠不夠格評估前沿模型」這個問題,坦白說現在沒人答得出來,因為駐點評估本身就是全新的東西,連怎麼做都還在摸索。更值得盯的是接下來幾件事:

一、Anthropic 說未來幾週會宣布更多評估者。如果名單裡真的出現 METR 這類用自有經費運作的非營利組織,那「付錢給查自己的人」這個結構性問題,至少有了部分解方。

二、評估者發現問題之後,會不會對外講、能講到什麼程度。這是整套機制有沒有意義的分水嶺。一份只給內部看的稽核報告,跟沒有稽核的差別不大。

三、標準會不會出現。現在連「評估者該看到什麼」都是一案一議,這在任何成熟的稽核產業裡都是不可接受的狀態。

不管最後這套機制長成什麼樣,方向本身是對的:讓一家公司對自己的安全承諾「可被驗證」,永遠好過要外界相信它的自述。真正的考驗不在公告,而在第一份評估報告寫了什麼、以及有多少人看得到。

參考資料

想把這些做到你的網站上?

不論是快速上線的模板建站、客製官網或後台系統,留個訊息,我們會回你「能做+報價+時程」。

加 LINE 詢問