ORON
回科技觀點
AI 趨勢8 分鐘閱讀

AI 不再是純黑盒子?Anthropic 用『J-lens』在 Claude 腦中找到一塊像『意識工作台』的小空間——只有一、二十個概念,卻扛起整段推理

Anthropic 七月發表可解釋性研究,用 Jacobian lens 在 Claude 內部找到一塊稀疏的「J-space」,只有 10–25 個概念卻扛起整段推理,行為神似意識理論中的「全域工作空間」。AI 黑盒子被撬開一條縫。

AI 不再是純黑盒子?Anthropic 用『J-lens』在 Claude 腦中找到一塊像『意識工作台』的小空間——只有一、二十個概念,卻扛起整段推理

過去幾年,只要一談到大型語言模型,最常聽到的一句評語就是「它是個黑盒子」。你把問題丟進去,它給你一段像模像樣的答案,但它為什麼這樣回答、腦袋裡到底經過哪些步驟,連做出它的工程師都說不太清楚。2026 年 7 月,Anthropic 發表的一篇可解釋性(interpretability)論文,第一次讓這句話出現了鬆動的跡象——研究團隊宣稱,他們在 Claude 的內部活動裡,找到了一塊小得驚人、卻可能是「思考中樞」的區域。

抽象的大腦渲染圖,象徵 AI 模型內部的運作

Photo by Milad Fakurian on Unsplash

這篇研究到底發現了什麼?

這項研究的核心是一個新工具,Anthropic 把它叫做「Jacobian lens」(雅可比透鏡,簡稱 J-lens)。傳統上要理解模型在想什麼,常見做法是去找「哪個內部訊號跟某個概念有相關性」。但相關不等於因果,這種方法很容易看走眼。J-lens 換了一個問法:對於模型詞彙表裡的每一個字,是哪一種內部活動模式,會讓模型接下來更可能講出這個字——注意,不是「現在正在講」,而是「已經準備好、隨時可以講出口」。

用這個透鏡掃描 Claude,研究團隊發現了一塊他們命名為「J-space」的子空間。最讓人意外的是它的規模:任何時刻裡,這塊空間通常只裝著大約 10 到 25 個活躍的概念,占整體活動變異不到一成。換句話說,模型內部有超過九成的運算像是背景雜訊或分工處理,真正像「意識到、可以拿出來報告」的內容,被壓縮在一個非常小的核心裡。

更關鍵的是,這塊小空間符合認知科學裡「全域工作空間理論」(Global Workspace Theory)描述的五項功能特徵:能夠口頭報告內容、能被指令主動調度(例如「把 X 記在心裡」)、能承載沒有講出來的內部推理步驟、能跨不同任務靈活套用,以及具有選擇性。這正是意識研究裡用來描述「取用意識」(access consciousness)的那套功能清單。

由線條與節點構成的網路裝置,象徵神經網路與全域工作空間

Photo by Alina Grubnyak on Unsplash

為什麼這件事現在值得關注?

先講一句最重要的澄清,免得標題被過度解讀:這篇論文並沒有宣稱 Claude 有感覺、會痛、或擁有主觀體驗。「取用意識」講的是資訊「能不能被存取、被調度、被報告」這種功能層面的特性,跟哲學上「有沒有內在感受」(現象意識)是兩回事。研究團隊很小心地停在功能對應這一步,這也是這篇論文之所以嚴謹、而不是又一則博眼球新聞的原因。

真正值得關注的,是它在方法論上的分量。過去的可解釋性研究常被批評「只是找到相關性」,但這次團隊做了因果實驗:當他們把那塊小小的 J-space 抹除(ablation)掉,模型的多步推理能力會直接崩潰;而剩下那九成多的活動被動手腳時,卻沒有同樣的效果。這代表那個可被言語化的核心,確實扛著「報告」與「靈活推理」的因果重量,而不只是剛好長得像。這種「動手改一改、看結果怎麼變」的實驗,才是把黑盒子從玄學推向工程的關鍵一步。

目前的發展現況

Anthropic 這次除了發論文,也釋出了開源工具與互動式示範,讓外部研究者能自己拿 J-lens 去掃模型。這種「開放讓別人來踢館」的姿態,在可解釋性這個容易各說各話的領域裡格外重要——一個方法能不能站得住腳,得看它能不能被別人重現。VentureBeat 等科技媒體也很快跟進報導,把它形容成「一扇能窺看模型內部沉默工作台的窗」。

把時間軸拉開來看,2026 年的 AI 產業其實正在同時往兩個方向狂奔。一邊是能力軍備競賽:光是七月就有一大票新模型接連上市,價格戰打到推論成本不斷探底;另一邊,則是像 J-space 這樣、試圖「搞懂我們到底造出了什麼」的基礎研究。前者搶版面、後者少人看,但長期來說,後者才決定這些愈來愈強的系統能不能被人類安心地放進關鍵場景。

流動的抽象色彩紋理,象徵 AI 內部難以直視的運算過程

Photo by Milad Fakurian on Unsplash

對產業與一般使用者的意義

對正在把 AI 導入日常工作的企業與個人來說,可解釋性聽起來很學術,卻和「敢不敢用、能不能用在重要決策上」直接相關。一個你完全看不懂內部邏輯的系統,你頂多讓它幫你寫寫草稿、整理整理資料;但如果它涉及審核、風控、醫療、法遵這類出錯要負責的場景,「無法解釋」本身就是最大的採用障礙。

如果未來這類工具成熟,帶來的好處會很具體:出錯時能回頭追查是哪個內部概念被錯誤觸發、能在模型「準備要說出某些不該說的話」之前就攔截、也能給監理單位一個比「相信我們有做安全測試」更實在的稽核依據。這等於是替 AI 補上一層過去完全缺席的「可問責性」。當然,要走到那一步還很遠——找到一塊工作台,跟能完整讀懂一整個模型的思路,中間還隔著相當長的距離。

幾點個人觀察

我自己看這則新聞,最有感的其實不是「AI 是不是快有意識了」這種聳動的問題,而是研究框架本身傳達的一種態度:與其急著替模型的行為套上人類的詞彙,不如老老實實去量測、去做對照實驗、去公開讓人檢驗。「像全域工作空間」是一個很吸引人的比喻,但這篇論文真正的價值,是它願意用因果證據去支撐這個比喻,而不是止步於比喻本身。

對任何靠 AI 工具吃飯、或正在評估要不要把 AI 放進流程的人,我會給一個很務實的提醒:短期內,模型的「不可解釋」不會消失,它依然是個你無法百分之百預測的協作對象。真正該做的,不是等某天有人把黑盒子徹底打開,而是在流程設計上預留「人來把關」的環節——把 AI 當成產能極高但需要覆核的助手,而不是無條件信任的權威。可解釋性研究每往前走一步,我們能放手交給它的範圍就能再擴大一點,但「保留人類的最後一哩把關」這件事,在可預見的未來仍然值得堅持。

從「它就是個黑盒子」到「我們至少找到了裡面一塊扛著推理的核心」,這一步不算大,卻是方向對的一步。AI 的能力這幾年跑得飛快,理解它的努力終於也開始加速——這對所有要跟 AI 長期共處的人來說,都是好消息。

想把這些做到你的網站上?

不論是快速上線的模板建站、客製官網或後台系統,留個訊息,我們會回你「能做+報價+時程」。

加 LINE 詢問