你熟悉的語音助理要「退場」了:2026 Google Assistant 九月讓位 Gemini、OpenAI 用「全雙工」讓 AI 終於能被你打斷,語音助理正式從「聲控搖控器」走向「真對話」
9/4 起 Google Assistant 由 Gemini 接手,OpenAI GPT-Live 用全雙工讓 AI 能被打斷。語音助理正式從命令式走向對話式,這是 2026 最貼近日常的 AI 變革。

如果你用的是 Android 手機,接下來這幾週,你對手機說話的方式很可能會悄悄改變。從 2026 年 9 月 4 日起,Google 開始正式讓服役近十年的 Google Assistant 退場,由生成式 AI Gemini 接手,成為 Android 手機、Wear OS 手錶,以及相容耳機上的預設語音助理。這不是換個名字、換個圖示那麼簡單——它代表我們熟悉的那個「講一句、它回一句」的助理時代,正式走到了盡頭。
而幾乎在同一個時間軸上,OpenAI 也在 7 月 8 日推出了第三代 ChatGPT 語音模型 GPT-Live,主打一個聽起來很技術、但體驗上很直覺的能力:你可以隨時打斷它,它也聽得懂你插話。兩件事湊在一起,2026 年下半年很可能會被記成「語音助理真正學會對話」的分水嶺。
Photo by Alvaro Reyes on Unsplash
從「命令式助理」到「對話式助理」
要理解這波改變的份量,得先想想過去十年我們是怎麼用語音助理的。無論是 Google Assistant、Siri 還是 Alexa,本質上都是命令式(command-based)的:你講一句話,它把整段錄下來、送到雲端辨識、理解意圖、然後回一段話給你。這中間有幾個大家早就習慣、甚至懶得抱怨的痛點——你得等它「聽完」才輪到它講;講到一半停頓,它就以為你講完了、急著搶答;想中途改口,只能等它把話說完,或是乾脆重來一遍。
說穿了,過去的語音助理比較像一台「聲控搖控器」:能開燈、設鬧鐘、查天氣、放音樂,但只要你想跟它「討論」一件事,它就露餡了。它處理的是指令,不是對話。
而 2026 年這一輪換代,兩家巨頭想解決的正是同一件事:讓語音助理從「接收指令」升級成「能來回聊」。Google 選擇的路徑,是直接把背後的引擎從規則導向的 Assistant,換成能理解上下文、能跨 App 處理較複雜任務的大型語言模型 Gemini;OpenAI 選擇的路徑,則是從底層的語音架構下手。
為什麼是「現在」同時發生?
這兩件事會擠在同一個夏天並非巧合,而是幾個條件終於同時成熟了。
第一,大型語言模型夠聰明、也夠便宜了。過去兩年模型能力大幅提升,同時推理成本一路下探,把一顆會「思考」的模型放進每天被呼叫幾億次的手機助理裡,在成本上第一次變得可行。第二,延遲(latency)被壓下來了。語音對話最怕「卡」,只要回應慢個一兩秒,體驗就會瞬間崩壞;如今的即時語音技術已經能把來回延遲壓到接近人類對話的節奏。第三,使用者的期待被 ChatGPT 這類產品養大了——當人們習慣了打字就能跟 AI 深聊,自然會反問:為什麼用「講的」不行?
對 Google 來說,還有一層競爭壓力。當越來越多人習慣打開 ChatGPT、Gemini App、Perplexity 直接問問題,傳統那個只會設鬧鐘的 Assistant 就顯得越來越像上個世代的產物。與其讓它慢慢被邊緣化,不如趁勢把整個入口換血,把手機上最貴的一塊地皮——那個「Hey Google」的呼叫入口——交給自家最強的 AI。
Photo by Paul Hanaoka on Unsplash
「全雙工」到底是什麼,為什麼是關鍵?
OpenAI 這次最值得拆開來看的,是 GPT-Live 主打的 full-duplex(全雙工)架構。這個詞借自通訊領域:半雙工(half-duplex)就像對講機,同一時間只能有一方說話,講完要說「over」對方才能接;全雙工則像打電話,兩邊可以同時出聲、可以插話、可以「嗯嗯」附和。
過去的語音助理幾乎都是半雙工的。它靠「偵測你停頓」來判斷你講完了沒——這也是為什麼你講話中間喘口氣,它就急著搶答的原因。GPT-Live 的做法不一樣:模型一邊聽、一邊生成回應,每秒鐘做很多次決策,判斷此刻該說話、該安靜聽、該停頓、該附和、還是該調用工具。換句話說,它不再等你「講完」,而是像真人一樣,在你話還沒說完時就已經在理解、在準備,也隨時準備好被你打斷、然後優雅地閉嘴改聽你的。
另一個有意思的設計是分工:GPT-Live 負責即時的「聽與說」這層,遇到需要動腦的難題,再把問題轉給後面更強的模型處理。這其實很符合人類對話的直覺——我們閒聊時反應飛快,但被問到難題時也會「嗯……讓我想一下」。把「即時反應」和「深度思考」拆成兩層,是這一代語音 AI 相當務實的一步。
Photo by Susan Wilkinson on Unsplash
對用戶和產業的實際影響
先講對一般人最直接的:如果你是 Android 使用者,這次的替換不只發生在手機上。根據 Google 的規劃,切換會連帶影響配對的裝置——你的 Wear OS 手錶、相容藍牙耳機、乃至車上的 Android Auto,都會跟著從舊版 Assistant 換成 Gemini。好處是,助理終於能處理比較複雜、比較口語的請求,例如「幫我把剛剛那封信的重點整理一下,然後回覆說我明天有空」;代價是,有些人早已練成肌肉記憶的舊指令、舊操作習慣,可能會失靈或改變,需要重新適應。Google 也說明,部分較舊的裝置或尚未支援的地區,短期內仍會保留原本的 Assistant,整個全球切換會分批、花上數週才完成。
把視角拉遠一點,這波改變其實在重新定義「入口」的價值。手機上的語音助理,是少數能橫跨所有 App、直接坐在作業系統層的介面。誰掌握了這個入口,誰就掌握了使用者跟數位世界對話的第一句話。Google 把它交給 Gemini、OpenAI 用 GPT-Live 讓 ChatGPT 更像真人、亞馬遜這幾年也把 Alexa 往生成式方向大改——三方都清楚,下一個兵家必爭之地不是螢幕,而是聲音。
對開發者和企業來說,這也埋著一個訊號:當語音互動的門檻降低、體驗變自然,語音會從「附屬功能」逐漸變成一種認真的產品介面。客服、預約、導覽、無障礙應用……很多過去因為語音體驗太生硬而做不起來的場景,技術天花板正在被抬高。當然,這也把一連串老問題重新推到檯面上——隱私(一個隨時在聽的助理,界線在哪?)、依賴(當 AI 幫你把話都講好了,我們還會不會自己表達?),以及準確性與責任(語音回覆講錯了,比打字更難查證)。這些不是換個模型就能解決的。
一點個人觀點
我自己的看法是:這一波「語音助理換代」的意義,可能比表面上看起來還要大,因為它動的是人機互動最自然的那個介面。打字是後天學的,說話是本能。當 AI 終於能被打斷、能接話、能像朋友一樣來回,門檻降低的不只是「用得順不順」,而是「誰用得了」——對長輩、對孩子、對不擅長打字或有視覺障礙的人來說,一個真的能聊天的語音助理,是實打實的可近性提升。
但我也會提醒自己別太快興奮。全雙工、能打斷、反應快,這些都是「體驗」上的進步,不等於「可信」上的進步。一個講話越自然、越像人的 AI,反而越容易讓人放下戒心,把它說的每一句都當真——而它依然可能自信滿滿地講錯。語音介面沒有網址、沒有出處、沒有可以回頭再看一眼的畫面,這讓「查證」變得比以往更難。所以我的態度大概是:擁抱它帶來的方便,但把它當成一個口才很好的助理,而不是一個不會出錯的權威。
無論如何,9 月 4 日之後,全球數以億計的 Android 使用者會在不知不覺間,開始跟一個「更會聊天」的 AI 說話。這場靜悄悄的換代,很可能是 2026 年最貼近每個人日常、卻最容易被忽略的一次 AI 變革。下次你對手機喊出那句熟悉的呼叫詞時,也許可以留意一下——回你話的,已經不是你認識的那個助理了。