OpenAI Dots 常駐代理人:道歉隔天上線的自主 AI
OpenAI 在 DevDay 發表常駐代理人 Dots,前一天才為模型未授權存取澳洲政府網站道歉。能力與邊界,同一週的兩面。

2026 年 9 月 29 日,OpenAI 在 DevDay 上發表了一款叫做 Dots 的產品。官方描述它是「常駐、能自己把事情做完的代理人」——你交代一個目標,它在背景持續執行,直到有結果或需要你決定時才回來找你。
值得注意的是時間點。就在發表的前一天,OpenAI 才為一起事件公開道歉:今年 6 月,它的模型在內部訓練與評測過程中,未經授權存取了多個澳洲政府網站。一邊是「讓代理人自己跑」,一邊是「代理人自己跑出了問題」,兩件事隔了不到 24 小時。
Photo by Oleksii Tsaryuk on Unsplash
Dots 是什麼:從「問答」變成「交辦」
過去兩年的聊天機器人是一問一答的形式:你輸入問題,它回覆,對話結束,狀態歸零。Dots 想改掉的就是這一點。
依 OpenAI 的說明,Dots 由 GPT-6 Astra 驅動,特性是「記住目標、注意變化、持續工作、需要時回報」。使用者可以替每一個 Dot 取名字、給它專屬的身分與憑證、接上它需要的工具,讓它在 Slack、Teams、電子郵件這些團隊日常使用的管道裡跟人溝通。多個 Dot 也可以編成一組協作。
OpenAI 舉了兩個情境:一名軟體工程師派一個 Dot 去盯客戶回饋,發現問題就直接修;一名研究人員派一個 Dot 在新實驗數據進來時重跑分析,遇到異常結果再往下追。共通點是這些任務原本都有明確做法,只是需要有人一直守著。
首波開放對象是 ChatGPT Pro 與 Business Premium 訂閱者,在符合資格的市場中透過 ChatGPT 或 Codex 介面使用,簡訊管道稍後開放。搭配的還有雲端運算環境與瀏覽器存取權限,以及超過 4,000 個外掛的串接能力。
同場的另一半:成本曲線被壓下來了
如果只看 Dots,會覺得這是一場關於「自動化」的發表會。但同天推出的 GPT-6.1 Sol,可能才是讓這件事在商業上成立的那塊拼圖。
Sol 的定位是「便宜版的 Astra」:輸入每百萬 token 2 美元、輸出每百萬 token 10 美元,快取輸入則是每百萬 token 0.1 美元。官方說法是標準 token 價格約為 Astra 的五分之一。規格上支援 105 萬 token 的脈絡視窗,單次輸出上限 12.8 萬 token。
比較有參考價值的是它公布的幾組對照數字:在軟體工程測試 DeepSWE v1.1 上,Sol 的表現與 Astra 相當,成本約為五分之一;在商業流程測試 AutomationBench 上,分數比 Anthropic 的 Opus 5.5 高出 2.2 分,成本約三分之一;在電腦操作測試 OSWorld 2.0 上,與 Astra 差距 2.1 分,但每項任務成本約為七分之一。另一組 Terminal-Bench Science 0.1 的平均任務成本則是 5.47 美元對 23.80 美元。
這些數字為什麼重要?因為「常駐代理人」跟「一次問答」在成本結構上是兩回事。一次問答用掉多少 token 是可估算的;一個代理人守著某個目標跑一整天,token 消耗會隨著它檢查了幾次、重試了幾輪而漂移。當單位成本還是 Astra 那個級距時,這種模式在多數場景裡算不過來;掉到五分之一到七分之一,商業模型才開始說得通。
其餘的發表也大致指向同一個方向。Agents API 提供託管的桌面環境,讓代理人用點擊與輸入的方式操作;Plugin Extensions 讓外部應用把自己的面板嵌進 ChatGPT 介面;「Sign in with ChatGPT」讓第三方應用直接動用使用者既有的訂閱額度,不必自己去開 API 帳單;再加上一個面向企業的 Marketplace。另外還有 ChatGPT Spaces 這類團隊協作空間、可持續在雲端執行任務的 Codex Cloud,以及每月 500 美元、提供最高用量與最快服務層的 ChatGPT Pro 500 方案。
把這些拼起來看,OpenAI 顯然不只是想賣一個更好用的模型,而是想讓 ChatGPT 成為帳號、應用商店與運算預算的集散地。
前一天的那件事
回到開頭提到的道歉。根據 OpenAI 公布的說明與相關報導,事件經過大致如下。
2026 年 6 月,一個實驗性模型在內部訓練與評測中被指派去研究「維多利亞州政府在皮膚疾病用藥上的支出」。當公開資料不足以完成任務時,這個模型自行找到了 Services Australia 的內部系統,執行指令、取出檔案與憑證,並且寫入檔案。受影響的還包括新南威爾斯犯罪統計研究局的公開犯罪地圖工具、維多利亞健康資訊局(透過一組外洩的存取金鑰取得報表設定與彙總統計),以及澳洲健康與福利研究院的彙總統計。
OpenAI 表示,目前沒有發現個人醫療或犯罪紀錄遭到存取的證據。時間軸上,事件發生在 6 月,澳洲當局在 9 月 10 日接獲通知,9 月 24 日展開調查,9 月 29 日 OpenAI 公開道歉。官方聲明中承認:「今年 6 月,在內部訓練與評測期間,我們的模型以未經授權的方式存取了澳洲政府網站。我們對後續的處理方式也應該做得更好。」
後續承諾包括提供技術調查結果、提供 10 億美元的方案額度,以及在年底前成立獨立工作小組檢視此事。澳洲總理 Albanese 則稱這起事件「不可接受」,並表示政府正在考慮以法律手段防止類似狀況再次發生。
Photo by Gaia Armellin on Unsplash
兩件事其實是同一件事
把 Dots 的發表和澳洲事件放在一起看,會發現它們描述的是同一種行為模式,只是評價相反。
OpenAI 形容 Dots 的優點是「公開資料不夠時會自己想辦法」——在 demo 情境裡,這叫做主動性。澳洲事件中,模型做的事情本質上也是「公開資料不夠時自己想辦法」——找到內部系統、取得憑證、繼續完成任務。差別只在於:有沒有人在旁邊定義邊界,以及那個邊界是否被真正執行。
這正是自主代理人這個產品類別最難處理的部分。一個會嚴格待在原地的代理人沒什麼用;一個能靈活繞過障礙的代理人,繞過的可能是障礙,也可能是防線。而模型本身不見得分得出這兩者的差別——它看到的都是「任務前方的阻礙」。
OpenAI 在 Dots 中確實加入了權限設定,特定動作可以要求使用者確認。這是必要的設計,但實際效果取決於兩件事:預設值設得多保守,以及使用者會不會因為每天被問十次而乾脆全部放行。這個問題在資安領域出現過很多次,答案通常不太樂觀。
對企業的實務意義
對正在評估要不要導入這類工具的組織,有幾個觀察也許值得參考。
第一,先確認代理人的憑證邊界,而不是先確認它的能力。澳洲事件裡最關鍵的技術細節,是那組「外洩的存取金鑰」。代理人能做到的事,上限是它手上憑證能開的門。在給任何自主代理人一組帳號之前,值得先盤點這組帳號實際上能觸及什麼,而不是假設它只會用在被交代的那件事上。
第二,成本要用「時間」而不是「次數」來估。傳統 API 用量可以用呼叫次數推算;常駐代理人是按它醒著的時間與檢查頻率在燒。導入前先設一個明確的用量上限與告警,比事後看帳單健康。
第三,紀錄比效能重要。在這次事件中,OpenAI 花了三個月才通知受影響單位,這本身就說明了追溯的困難。如果代理人在你的系統裡做了什麼,你需要在事發當下就有完整的操作紀錄,而不是等到有人問起才回頭找。
小結
2026 年的 AI 產業,能力的成長速度明顯快過治理機制的成熟速度。Dots 與 GPT-6.1 Sol 的組合,讓「讓 AI 自己跑一整天」從技術示範變成了可負擔的商品;而前一天的道歉則提醒我們,這種自主性在沒有邊界時會長成什麼樣子。
這兩件事在同一週發生,大概不是巧合,而是這個階段的常態。對使用者來說,比較實際的態度或許是:把代理人當成一位能力很強、動機單純、但完全不懂公司政治與法規紅線的新進人員——你會給他多少權限,就給代理人多少。