Google DeepMind 推出 Gemini 3.8 Live:對話中並行推理,語音代理不中斷流程

Key takeaway

2026 年 9 月 15 日(UTC),Google DeepMind 官方帳號宣布推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,定位為其最新一代即時對話式 AI。本文已核對 Google AI for Developers 的 Live API 能力文件(模型識別碼 gemini-3.8-live、gemini-3.8-live-extended-thinking,文件標註最後更新 2026-09-15)以及 Vercel AI Gateway 同日上架說明,來源真實性已驗證。重點在於:語音代理可在近即時對話中理解畫面、自動切換多語,並在不打斷對話節奏的前提下於背景完成工具呼叫與多步推理。

Google DeepMind 推出 Gemini 3.8 Live:對話中並行推理,語音代理不中斷流程

Google DeepMind 推出 Gemini 3.8 Live:對話中並行推理,語音代理不中斷流程

2026 年 9 月 15 日(UTC),Google DeepMind 官方帳號宣布推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,定位為其最新一代即時對話式 AI。本文已核對 Google AI for Developers 的 Live API 能力文件(模型識別碼 gemini-3.8-livegemini-3.8-live-extended-thinking,文件標註最後更新 2026-09-15)以及 Vercel AI Gateway 同日上架說明,來源真實性已驗證。重點在於:語音代理可在近即時對話中理解畫面、自動切換多語,並在不打斷對話節奏的前提下於背景完成工具呼叫與多步推理。

一、核心事件:即時對話模型換代

技術細節

根據 DeepMind 官方帖文與 Google Live API 文件,Gemini 3.8 Live 系列面向低延遲語音代理與即時對話體驗,並把上一世代預覽模型(如 Gemini 3.1 Flash Live Preview)標為建議遷移的舊路徑。文件將兩款新模型並列說明:

  • Gemini 3.8 Live:建議作為多數低延遲語音代理的預設選項;支援交錯式推理(interleaved reasoning),設定階段不應傳入 thinkingLevel
  • Gemini 3.8 Live Extended Thinking:在需要更高背景推理時使用;支援可配置的背景思考層級(thinkingLevellowmediumhigh,不支援 minimal),並可開啟 thought summaries。

DeepMind 公開描述強調模型能「邊說邊想」,並在背景處理任務而不打斷對話流。開發者文件進一步指出:3.8 Live 支援非阻塞(NON_BLOCKING)函式呼叫與函式排程;Extended Thinking 僅支援非阻塞執行。兩者皆可在單一伺服器事件中同時回傳多個內容部分,客戶端必須完整處理每個事件中的所有 parts,以免漏失音訊或文字轉錄。

Vercel AI Gateway 同日 changelog 亦上架 google/gemini-3.8-livegoogle/gemini-3.8-live-extended-thinking,並摘要能力為:近即時音訊、視覺 grounding、自動切換約 97 種語言,以及對話進行中的背景工具呼叫;Extended Thinking 則可在說話同時並行多步推理,先確認請求並口述進度。

二、技術原理深度解析

Gemini Live API 的核心不是「把文字聊天模型接上 TTS」,而是以雙向串流(bidirectional streaming)維持低延遲音訊回合。輸入音訊為原始 16-bit PCM(原生 16 kHz,可重採樣),輸出音訊為 24 kHz PCM;可同時開啟輸入/輸出音訊轉錄,方便除錯與合規留存。語音活動偵測(VAD)預設由伺服器自動處理,使用者可打斷生成;亦可改為手動或混合 VAD,以換取更低的結束延遲。

與「先完整聽完、再整段生成」的傳統管線相比,3.8 Live 把工具呼叫設計成可與對話並行:預設非阻塞行為讓模型在等待工具結果時仍可繼續說話或確認進度,Extended Thinking 則把可調背景推理疊在同一會話上。文件亦提醒:當非同步推理進行中,turnComplete: true 並不代表會話已閒置,應改看 interaction_statusIN_PROGRESSIDLE)。這類細節直接影響產品狀態機設計——錯誤地把「回合完成」當成「可關閉麥克風/可卸載會話」,會造成半截回答或工具結果遺失。

能力邊界同樣寫在官方文件:原生音訊模型的回應模態以 AUDIO 為主,若需要文字需依賴輸出轉錄;音訊會話時長預設有上限(文件載明音訊約 15 分鐘、音訊加視訊約 2 分鐘,可透過會話管理技術延長);上下文窗口對原生音訊輸出模型約為 128k tokens。語言方面,Live API 文件列出支援約 97 種語言,並可由系統指示約束說話語言。對企業架構師而言,這些硬限制比行銷口號更重要:它們決定客服熱線、車載助手、現場維修指導等場景能否穩定落地。

四、日常應用場景

1. 開發者與技術團隊

開發者可經 Gemini API/Google AI Studio 的 Live/Stream 介面接入 gemini-3.8-live,並依任務選擇是否升級到 Extended Thinking。實務上需重寫事件迴圈:處理多 part 事件、非阻塞工具回傳、打斷與 VAD 參數,以及遷移指南中相對 3.1 Flash Live 的差異。邊緣與閘道端(例如經第三方 AI Gateway)則要注意模型識別碼與 realtime WebSocket 適配層是否已同步支援 3.8。

2. 企業與隱私敏感行業

金融、法律、醫療與政府服務若部署語音代理,關心的不只是「聽得懂、答得快」,而是工具呼叫是否會把客戶音訊與畫面送到不可控路徑、會話是否可審計、以及背景推理是否會延長敏感資料的駐留時間。官方能力表並未取代企業自身的資料駐留與 DPA 審查;香港機構尤須對照《個人資料(私隱)條例》與內部跨境傳輸政策,決定公有 Live API 是否可接受,或應改為私有/境內托管的語音與推理棧。

3. 一般用戶

終端使用者感受到的是更自然的語音節奏:可插話、可切換語言、模型可邊處理後台任務邊回報進度。視覺 grounding 則讓「邊看螢幕/邊看現場邊問」的助手更實用。一般用戶未必知道後台是 Live API 還是文字聊天,但延遲與打斷體驗會直接決定是否願意繼續用語音完成複雜任務。

4. 香港與亞洲市場視角

香港客服、零售、物流與專業服務高度依賴粵語/普通話/英語混用對話。官方文件列明的多語與自動語言偵測,對本地多語場景具直接意義;同時,跨境資料與行業合規仍常要求敏感語料與推理留在可控環境。企業可把公有 Gemini Live 用於低敏感對外體驗,另以香港私有 LLM 托管承載內部知識庫、客戶檔案與合規審批流程,形成分層架構。

五、專業評價與潛在考量

優勢

  • DeepMind 官方發佈與 Google Live API 文件同日對齊,模型識別碼與能力表可核對,並非僅有社群傳聞。
  • 將「對話不中斷」與「背景工具/推理」寫進 API 行為(非阻塞呼叫、interaction_status),對代理式產品工程有實作指引。
  • 相對 3.1 Flash Live Preview 有明確遷移路徑,降低長期鎖在預覽模型的風險。
  • 第三方閘道(如 Vercel AI Gateway)已上架,方便部分團隊快速試跑。

需要留意的地方

  • Live API 仍標示為預覽;配額、地區可用性與定價細節應以 Google 正式定價頁為準,本文不臆測未公開數字。
  • 會話時長與上下文上限仍在,長時熱線需設計會話恢復/摘要銜接。
  • 視覺與音訊同時上傳會擴大攻擊面與隱私暴露面,企業須限制鏡頭權限與留存政策。
  • 「可邊說邊調工具」放大了越權工具呼叫風險,必須在應用層做權限最小化與人工審批閘門。

結語

Gemini 3.8 Live 把即時語音對話推到「可並行推理與工具」的代理形態,標誌語音介面正從示範 demo 走向可編排的工作流。對香港開發者與企業而言,短期可驗證多語客服與現場助手的延遲與打斷體驗;中期則要把工具權限、會話治理與資料駐留一次設計清楚。若貴司需要在香港部署企業私有 LLM(數據集 → QLoRA/LoRA → 私有 API,年費 HK$88,000 起,100% 數據不出境),可參考 YSK Limited 的企業私有 LLM 全託管方案(https://ysk.hk/services/ai-automation)。


參考來源

  1. Google AI for Developers:Live API capabilities guide(https://ai.google.dev/gemini-api/docs/live-api/capabilities)(文件標註最後更新 2026-09-15;列明 gemini-3.8-livegemini-3.8-live-extended-thinking
  2. Vercel AI Gateway changelog:Gemini 3.8 Live models now available on AI Gateway(https://vercel.com/changelog/gemini-3-8-live-models-now-available-on-ai-gateway)(2026-09-15)
  3. X 發現來源:@GoogleDeepMind(https://x.com/GoogleDeepMind/status/2099907440422830269)(發現用,非唯一依據)

Related services & products