ORON
回科技觀點
AI 趨勢9 分鐘閱讀

AI 開始『替你操作電腦』:OpenAI 丟出 GPT-6 Astra,還說這可能就是 AGI 的開端

OpenAI 推出史上最強的 GPT-6 Astra,主打「替你操作電腦」的代理能力,總裁更直言這可能就是 AGI 的開端。它強在哪?又藏著哪些爭議與隱憂?

AI 開始『替你操作電腦』:OpenAI 丟出 GPT-6 Astra,還說這可能就是 AGI 的開端

2026 年 9 月 3 日,OpenAI 丟出了它口中「史上最強」的模型——GPT-6 Astra。這次的主角不是又漲了幾分的考試成績,而是一個更直白的能力:它可以直接替你操作電腦。開試算表、填表單、在網頁之間點來點去,而且據稱常常快到不像人類手速。更引人側目的是,OpenAI 總裁 Greg Brockman 在發表時說了一句很重的話——他個人相信,這可能就是通用人工智慧(AGI)的開端。

一句話能不能定義 AGI,我們稍後再談。先把這件事本身講清楚:這不只是一次例行的版本更新,而是把「AI 會聊天」推進到「AI 會做事」的一次公開宣示。

GPT-6 Astra 到底是什麼

Astra 目前先以「限量預覽」形式登場,付費用戶預計會在接下來幾天陸續拿到使用權。規格上,它是一個多模態模型,能同時處理與生成文字、圖片與音訊;官方數字給到約 105 萬 token 的上下文長度、最高 12.8 萬 token 的單次輸出,知識截止日則落在 2026 年 4 月底。定價方面,輸入每百萬 token 約 10 美元、輸出每百萬 token 約 50 美元——以旗艦模型來說不算便宜。

但真正被拿出來當賣點的,是「computer use」這個詞。過去我們對大型語言模型的想像,大多停在「問它、它答你」。Astra 想證明的是另一件事:給它一個目標,它能自己在電腦裡把一連串步驟走完。OpenAI 把它形容為在資安、專業工作、軟體工程與科學研究上的「世代級跨越」。

象徵人工智慧的人形機器人

Photo by Gabriele Malaspina on Unsplash

為什麼「會操作電腦」這件事現在特別值得關注

因為它踩到了一條分界線。一個能寫報告的 AI,價值來自「幫你省下打字時間」;但一個能自己開軟體、跨頁面完成多步驟任務的 AI,價值來自「幫你把整件事做完」。前者是工具,後者更接近同事。

從報導出的基準測試也看得出這個方向。Astra 在專門衡量代理能力的 Agents' Last Exam 拿到 59.3%,在模擬真實電腦操作環境的 OSWorld 2.0 拿到 72.6%。這些數字放在一年前幾乎難以想像。它們代表的意義不是「AI 更聰明了」,而是「AI 更能在真實、雜亂、有很多步驟的環境裡把事情辦成」。這也是為什麼 OpenAI 敢把「操作你的電腦」當成頭號標題——這正是過去代理型 AI 最容易卡住、最不可靠的地方。

目前的發展現況:一週之內,戰場全開

Astra 不是孤例。就在它發表的同一週,各家實驗室幾乎是同步出招:Google 端出多個 Gemini 3.8 的變體、Meta 推進自家模型、阿里的 Qwen 也持續更新,就連 Anthropic 都在月初一口氣上了新版本。整個產業的節奏,已經從「一年一次大改版」壓縮到「幾乎每週都有新東西」。

值得玩味的是,市場的勝負手正在轉移。過去比的是「誰的發表會最響、跑分最高」;現在比的,越來越像是「誰的模型能真正被塞進日常工作流程」——客服、產品研究、寫程式、語音、內容產製。換句話說,能不能落地,比能不能刷榜更重要。這對開發者和企業其實是好消息:選擇變多了,而且大家都被逼著把「好用」放在「好看」前面。

象徵 AI 背後龐大算力的資料中心

Photo by İsmail Enes Ayhan on Unsplash

當然,這場軍備競賽的地基是算力。這一年來 AI 進展這麼快,很大一部分原因是頂尖實驗室手上累積的運算資源達到前所未有的規模。Astra 這種等級的模型,背後是成排的伺服器、驚人的電力消耗,以及一條越拉越長的供應鏈。這也解釋了為什麼「資料中心」「晶片」「電網」這些聽起來跟 AI 沒直接關係的詞,最近會頻繁出現在科技新聞裡。

對產業與用戶的影響

如果 Astra 真的如宣傳般可靠,最先有感的會是「重複、繁瑣、有明確步驟」的工作。整理試算表、跨系統搬資料、填一堆格式固定的表單、把散落的資訊彙整成一份文件——這些過去要人盯著螢幕點半天的事,正好落在代理型 AI 的甜蜜點上。

人類與 AI 互相伸手,象徵人機協作

Photo by Igor Omilaev on Unsplash

但我會提醒一件事:「能做」和「能放心交給它做」之間,還有一段距離。一個會操作電腦的 AI,權限越大、能碰的東西越多,出錯時的代價也越高。它可以幫你在後台改設定,也就意味著它有可能改錯設定;它能自動跨頁面操作,也就意味著一旦被惡意內容誤導,它可能在你沒注意時做出你不想要的動作。這不是要潑冷水,而是說:導入這類工具時,「它出事誰負責、權限怎麼收斂、關鍵動作要不要人來按最後一個確認鍵」,會比「它到底多聰明」更值得先想清楚。

那,這真的是 AGI 嗎?

回到 Brockman 那句話。他說自己相信 OpenAI 已經摸到 AGI,但也把判斷權留給使用者。我覺得這個說法本身就很誠實地暴露了現況:連定義都還沒吵完。

批評的聲音也很快出現。有人指出,OpenAI 並沒有證明 Astra 在「大多數具經濟價值的工作」上勝過人類,而這恰恰是該公司自己早年對 AGI 的定義之一。長期對 AI 熱潮持保留態度的學者 Gary Marcus 給了一個相對中肯的評價:他承認這是一次實質的技術進步,尤其在對世界的符號化建模上,但拒絕把「某一個被刷爆的基準分數」當成通用智慧的證書。也有分析算了一筆更冷靜的帳:對一般用途來說,Astra 可能只比前代好個 5% 到 10%,每次任務的成本卻貴了約 75%。

更值得注意的是來自 OpenAI 內部的提醒。首席科學家 Jakub Pachocki 直言,智慧上的進步,並不保證對齊(alignment)上的進步;而且 Astra 可能採用了某種「不透明的遞迴」機制,讓它的思考過程對研究者來說更難讀懂。這是一個矛盾的訊號——模型越強,我們卻越看不清它為什麼這樣做。

我的看法

把行銷語言撥開,我對 Astra 的判斷是三句話。第一,「會操作電腦」這個方向是對的,它把 AI 從「答題機」推向「做事的助手」,這一步的長期意義,比任何一次跑分都大。第二,別急著相信「AGI 已到」這種標題;它更像是一個很強、但仍有明顯邊界與代價的工具,值得認真用,但不值得神化。第三,對想導入的人來說,真正的功課不在追最新版本,而在想清楚:哪些流程適合交給它、哪些關鍵動作一定要留人把關、以及一旦它自動出手,錯了要怎麼收。

AI 的世界現在每週都在翻頁。GPT-6 Astra 不會是終點,很可能連今年的高潮都算不上。但它清楚地標示了下一個戰場的位置——不再是「它能不能講出漂亮的話」,而是「它能不能替你把事情做完,而且做對」。這個問題,接下來會越來越常被問到。

想把這些做到你的網站上?

不論是快速上線的模板建站、客製官網或後台系統,留個訊息,我們會回你「能做+報價+時程」。

加 LINE 詢問