
過去兩年,關於「AI 寫的內容會不會把網路弄壞」的討論大多停在猜測與比喻。2026 年 9 月底掛上 arXiv 的一篇論文,第一次把這件事拆成可以量化的問題:網路上現在到底有多少字是 AI 寫的?把這些字餵進模型訓練,模型會變好還是變差?好壞的分界線落在哪裡?
論文叫《How Much Is an AI Token Worth? Scaling Laws for Wild AI-Generated Web Text》,作者群包含 Jenna Russell、Mohit Iyyer、Max Spero、Bradley Emi 等人,判斷哪些文字由 AI 生成時使用的是 Pangram 偵測器。研究團隊實際預訓練了 800 個語言模型,只為了回答一個問題:一個 AI 生成的 token,相對於一個人寫的 token,到底值多少。
Photo by Pierre Châtel-Innocenti on Unsplash
先看那個數字:31.1%
研究團隊用 Pangram 的偵測器去掃網路抓取的語料,結果是:2026 年 6 月的網頁資料中,經過一般品質過濾之後,有 27.5% 的 token 被判定為 AI 生成;到了 8 月,這個比例上升到 31.1%。兩個月增加約 3.6 個百分點。
這個數字需要小心理解。它說的不是「整個網際網路有三成是 AI 寫的」,而是「在模型訓練者實際會拿來用的那份、已經過品質過濾的語料裡,三成左右是 AI 生成」。品質過濾本來的目的是濾掉垃圾頁面、重複內容與機器產生的樣板文字,但 AI 寫出來的文章在表面特徵上通常很「乾淨」——句子完整、段落整齊、用詞正確,反而容易通過過濾器。換句話說,現行的過濾機制不但沒有擋下 AI 文字,某種程度上還偏好它。
另一個值得注意的是趨勢,而不只是水位。如果兩個月能漲 3.6 個百分點,那麼「越新的網路語料、AI 含量越高」會是接下來幾年的常態。而模型訓練者偏偏需要新資料——舊的語料早就被反覆用過,新知識、新事件、新術語只存在於最近的網頁裡。想要新,就得吃進更高比例的 AI 文字,這是這篇論文真正尖銳的地方。
800 個模型跑出來的曲線
研究方法本身不複雜,但很耗資源:固定人類語料的量,逐步加入不同比例的 AI 語料,訓練不同規模的模型,然後觀察模型在「人寫的文字」上的驗證損失(validation loss)如何變化。800 個模型就是這樣跑出來的。
結果呈現兩種截然不同的情況。
第一種是資料不足的模型。當手上的人類語料相對於模型規模明顯不夠時,加入 AI 文字一開始確實有幫助——人寫的字不夠用,AI 寫的字至少提供了更多語言結構讓模型學。但這個好處會飽和,而且繼續加下去會從「有幫助」反轉成「有害」。論文的描述是效益先是停滯,接著反轉為傷害。
第二種是資料充足的模型。當人類語料本來就夠用時,情況更直接:加入 AI token 幾乎立刻就推高了模型在人類文字上的損失,而同樣數量的新鮮人類 token 則是持續帶來改善。也就是說,在資料充足的情境下,AI token 的邊際價值不只是比較低,而是負的。
Photo by Zetong Li on Unsplash
研究團隊也把這些觀察整理成一條新的擴展定律(scaling law),用來預測在特定 AI 混入比例下模型的表現。他們指出,這條定律在所有混入比例上的預測誤差,比既有最佳定律低 41%,而且能外推到大 3.6 倍的模型。對實務上要決定「資料配方」的訓練團隊來說,這比單純知道「AI 資料不好」更有用——它給了一個可以估算的取捨。
論文同時釋出了 WildAI 語料庫(830 億 token,附帶標註)、全部 800 個模型與程式碼。這一點在研究社群裡的意義不小:判斷哪些字是 AI 寫的,本來就是一個會被質疑的環節,把資料攤開讓別人複驗,比單方面宣稱準確率更有說服力。
這和「模型崩潰」是同一件事嗎
不完全是。2024 年前後一系列關於「模型崩潰」(model collapse)的研究,談的是一個比較極端的設定:模型訓練在自己上一代的輸出上,如此遞迴數輪,分布逐漸收窄、罕見的樣態消失,最後退化。那是一個封閉迴圈的實驗。後續也有研究指出,如果新資料是累積在舊資料之上、而不是取代舊資料,崩潰的情況會緩和許多。
這篇新論文處理的是比較真實、也比較難處理的版本:沒有人刻意拿模型輸出去訓練模型,AI 文字只是自然地混在網路語料裡,被一起抓進來。研究者用「wild」(野生的)這個詞來區分,意思是這些 AI 文字不是實驗室裡生成的對照組,而是真的有人用模型寫完、發佈到網路上的內容。它的結論也比較節制:不是「模型會崩潰」,而是「在資料充足的情況下,這些 token 的價值是負的,而且你可能看不出來」。
「看不出來」是這篇論文另一個被低估的提醒。研究團隊建議,驗證集應該把人類文字和 AI 文字分開評估、分開回報。原因很實際:如果驗證集本身也混了三成 AI 文字,那麼一個在 AI 文字上表現越來越好、在人類文字上表現越來越差的模型,整體數字可能看起來沒什麼變化,甚至還在進步。訓練跑起來更大、更便宜、資料更新,但在使用者真正在意的那個分布上,模型其實正在悄悄變差。
論文給訓練方的三個建議
論文的實務建議相當具體,可以整理成三點:
第一,如果目標是人類文字上的表現,就要過濾掉 AI 文字。這聽起來理所當然,但實際上代表訓練流程要多一道偵測步驟,而偵測本身有成本,也有誤判。
第二,寧可重複使用人類資料,也不要用 AI 資料去擴充。這一點比較反直覺。長久以來的共識是「重複訓練同一批資料會過擬合」,所以要盡量擴大資料量。這篇論文的結論是:在 AI 文字的品質折價之下,把人類語料多跑幾輪,仍然比摻入 AI 文字划算。
第三,驗證指標要分開報。人類文字一組、AI 文字一組,不要混在一起算總分。
Photo by Irfan Syahmi on Unsplash
對經營網站的人,這代表什麼
這篇論文的對象是模型訓練者,但它的推論鏈往下延伸,會碰到每一個在網路上發佈內容的人。
最直接的一個推論是:人寫的文字,正在變成一種稀缺資源。當可用語料裡有三成是 AI 生成、而且比例持續上升,剩下那七成的相對價值就會上升。對訓練方來說,這意味著他們有動機去尋找、辨識、甚至付費取得確定由人撰寫的內容——過去兩年各大模型公司與新聞媒體、論壇、出版社簽的授權合約,背後就是這個邏輯。
第二個推論跟搜尋有關,但要小心別過度延伸。這篇論文談的是「拿 AI 文字訓練模型」的效果,不是「搜尋引擎如何排名 AI 文字」,兩件事的機制完全不同。不過有一個共通點值得注意:偵測器已經能在大規模語料上標出 AI 生成的比例,而且準確到足以支撐一篇有實驗結論的論文。這代表「這段文字是不是 AI 寫的」在技術上已經是一個可以被規模化判斷的屬性。至於各家搜尋引擎會不會把這個屬性拿來當訊號、怎麼用,目前並沒有公開說明,任何斷言都只是猜測。
第三個推論比較偏向內容策略。如果 AI 可以在幾秒內產出一篇結構完整、用詞正確、看起來很專業的文章,那麼「結構完整、用詞正確、看起來很專業」本身就不再是差異化。真正難以被量產的,是那些只有實際做過的人才寫得出來的部分:具體的數字、失敗的經過、特定情境下的取捨、客戶實際問過的問題。這些內容難寫,但也正因為難寫,它們是模型訓練語料裡那七成的來源,也是讀者願意讀完的理由。
一點觀察
有一個細節值得多想一下:31.1% 這個比例是經過品質過濾之後的數字。也就是說,現行過濾機制認定「夠好、值得留下」的那批內容裡,有將近三分之一是 AI 寫的。
這其實說明了一件有點尷尬的事——業界長期用來判斷「內容品質」的那些代理指標,像是句子完整度、拼字正確率、格式整齊程度、段落結構,已經不再能區分「有人認真寫的」和「模型隨手產的」。偵測器之所以還有用,靠的是更細微的統計特徵,而不是這些表面指標。
從這個角度看,這篇論文的價值不只在於那條擴展定律,而在於它把一個模糊的焦慮變成了可測量的量:網路語料的 AI 含量是多少、每一個百分點的代價是多少、什麼時候會從有益轉為有害。有了數字之後,討論才能從「AI 內容會不會毀掉網路」這種沒有答案的問法,變成「在什麼條件下、要付出多少代價」這種可以回答的問題。
至於內容的生產端,結論反而簡單:能被模型幾秒產出的東西,數量上永遠競爭不過模型;但模型產不出來的那部分,現在比兩年前更值錢。