AI 科學發現:950 個 Claude agent 找到新酶系統
Anthropic 讓約 950 個 Claude agent 掃過 20 萬個反轉錄酶序列,21 小時找出一組沒被描述過的酶系統。這個流程改變了什麼?

過去兩年,AI 在科學領域的角色大多停在「幫忙讀文獻、幫忙寫程式、幫忙跑統計」。2026 年 9 月 24 日 Anthropic 公布的一項結果,把這條線往前推了一段:他們讓大約 950 個 Claude agent 在 21 小時內掃過大型 DNA 序列資料庫,最後指認出一組過去沒有被描述過的酶系統。研究團隊把它命名為 array-associated reverse transcriptases,簡稱 ART。
這件事之所以值得寫,不是因為「AI 又贏了人類一次」,而是因為它讓一個模糊的問題變得具體:當模型可以自己決定要往哪裡找、找到什麼算有趣,科學研究最前面那段「產生假說」的工作,會被改寫成什麼樣子。
Photo by GUY GRANDJEAN on Unsplash
Claude 找到的東西是什麼
先把名詞拆開。反轉錄酶(reverse transcriptase)是一種能把 RNA 反寫回 DNA 的酵素,最為人熟知的例子是 HIV 這類反轉錄病毒靠它複製;在生物技術上,它也是 RNA 定序、cDNA 合成的基本工具。CRISPR 則是細菌用來對抗病毒的免疫系統,特徵是基因體上會出現一段一段規律重複的 DNA 序列(repeat array),中間夾著曾經入侵過的病毒片段。
Claude 這次指認出來的,是一種「反轉錄酶」旁邊帶著「類似 CRISPR 的重複序列陣列」的組合,而且主要出現在噬菌體(感染細菌的病毒)身上,旁邊還跟著一個功能不明的輔助蛋白。這三件事同時出現的情況,目前只在極少數已知系統裡看過。
Anthropic 在公告裡講得相當保守:他們還不知道 ART 的生物功能是什麼,也還不知道它有沒有生技應用價值。實驗室已經做的部分是把蛋白質在標準細菌株裡表現出來、做初步的生化與結構鑑定,並觀察到那段重複陣列確實會被轉錄成多段短 RNA——也就是說,它不是基因體裡一段沒作用的垃圾序列,而是活的、有被讀出來的東西。
規模是這次的真正變數
這次流程的數字值得拆開看:約 950 個 agent、21 小時、2.1 億個 token,掃過 20 萬個以上的反轉錄酶序列,先收斂成大約 3,500 個候選系統,再縮到 20 個特別值得看的目標,最後才交給人類進實驗室。
對照傳統做法,一位生資背景的研究者要在 20 萬個序列裡找出「結構上不太對勁」的組合,需要先想好篩選條件、寫好 pipeline、跑完再一批批人工看圖。問題是篩選條件本身就是偏見:你只會找到你想得到要找的東西。這次流程的差別在於,判斷「這個看起來奇怪、值得追下去」的那一步是由模型做的,而且做了幾千次。
換句話說,這不是一個「更聰明的模型」的故事,而是一個「把中等聰明的判斷力複製 950 份、平行跑一整天」的故事。這兩者在工程上的意義完全不同:前者要等下一代模型,後者今天就能做,而且成本是可以估算的。以目前公開的 API 定價粗估,2.1 億 token 的量級大約落在數千美元區間;相較於一個博士後花三個月做同樣的初篩,這個數字改變的是「值不值得試」的門檻。
人類科學家並沒有被跳過
有幾點必須講清楚,否則很容易把這則新聞讀成比實際更戲劇化的版本。
第一,這份結果目前尚未經過同儕審查,也還沒有正式發表在期刊上。CRISPR 領域的重要學者、MIT 與 Broad Institute 的張鋒看過這份結果後的說法是,RNA 重複陣列與反轉錄酶之間的關聯值得繼續研究,並形容這是 AI agent 能為生物學發現做出貢獻的一個有趣例子——這是「值得追」的評價,不是「已經證實」的評價。
第二,Claude 找到的是「模式」,不是「功能」。生物學裡最耗時的從來不是找出奇怪的序列,而是證明它在細胞裡到底做什麼事。那部分仍然是人在做:表現蛋白、跑結構、設計對照實驗、反覆排除其他解釋。
第三,篩選出來的 3,500 個候選裡,絕大多數最後都不會有下文。這是所有高通量篩選共同的特性,AI 讓漏斗的入口變寬了,但漏斗本身還是漏斗。
把這三點加起來,比較準確的描述是:AI 把「探索」這段變便宜了,但「驗證」那段的成本幾乎沒有變。長期來看,這會讓研究的瓶頸從「想不到要去看哪裡」移到「實驗室做不完」。
對其他產業的參考價值
大部分企業當然不會去掃 DNA 資料庫。但這個案例的結構,在其他地方是看得到影子的。
它本質上是一個「在超大量低結構資料裡,找出少數值得人看的東西」的任務。符合這個形狀的工作其實不少:幾萬份合約裡哪幾份的條款寫法不太一樣、幾年份的客服對話裡哪些抱怨在重複出現卻沒人整理、上千個料號的成本結構裡哪幾個的毛利邏輯說不通。過去這些工作要嘛靠抽樣,要嘛靠寫死的規則,兩種做法都會漏掉「規則沒想到的那一類」。
Photo by Dinesh Jatav on Unsplash
值得學的是流程設計,而不是技術本身。Anthropic 這次的做法有三個層次:大量平行的初篩、收斂成人類看得完的清單、再由人做最終判斷。三層之間有明確的交接點,而且每一層的產出都是可以檢查的。那些把 AI 一路接到最終決策、中間沒有任何人類節點的設計,出問題的時候通常沒有人說得出是在哪一步出的。
另一個現實的提醒是:這種做法的前提是資料本身夠乾淨、夠完整。基因序列資料庫之所以能這樣掃,是因為它已經被學界標準化累積了幾十年。多數公司內部的資料不是這個狀態——同一家客戶三種寫法、料號規則換過兩次、歷史紀錄散在四套系統裡。在那種狀況下,先把資料整理乾淨的效益,往往比先導入模型高。
一點觀察
2025 到 2026 年,AI 在科學上的敘事一直在「即將治癒癌症」與「不過是高級的自動完成」兩個極端之間擺盪。ART 這件事之所以值得記下來,正好是因為它兩邊都不是:它是一個具體的、範圍很窄的、還沒有被證實有用的發現,但產生它的流程確實是新的。
比較耐人尋味的是接下來的節奏。如果一次這樣的掃描成本是幾千美元、時間是一天,那麼真正的限制就不再是算力,而是有多少實驗室願意、也有能力去驗證這些被丟出來的候選。當「假說」變得比「驗證」便宜好幾個數量級,科學界的工作分配可能會被迫重新調整——而這個問題,模型本身解決不了。
同樣的邏輯也適用在企業導入 AI 的判斷上:能被 AI 快速產生的東西會迅速貶值,真正稀缺的是驗證、承擔與執行的能力。這一點在可見的未來大概不會改變。