OpenAI 將 GPT-Live-1 全雙工語音開放至 API:邊聽邊講、可委派後端推理,語音代理進業務流程

Key takeaway

2026 年 9 月 10 日,OpenAI 於官網產品發佈頁宣布,將先前已在 ChatGPT 登場的全雙工語音模型 GPT-Live-1 正式開放至開發者 API,讓應用與業務流程可直接建置「邊聽邊講」的語音代理。官方強調,新版 API 著重讓開發者按用戶、工作流與目標,自訂語氣、節奏與對話風格,並可把深度推理與工具呼叫委派給後端文字模型。本文已對照 OpenAI 官網〈Build more natural voice experiences with GPT‑Live‑1 in the API〉、開發者文件〈Getting started with GPT-Live〉,以及《The Register》當日報導核實日期、定價與能力描述,來源真實性已驗證。

OpenAI 將 GPT-Live-1 全雙工語音開放至 API:邊聽邊講、可委派後端推理,語音代理進業務流程

OpenAI 將 GPT-Live-1 全雙工語音開放至 API:邊聽邊講、可委派後端推理,語音代理進業務流程

2026 年 9 月 10 日,OpenAI 於官網產品發佈頁宣布,將先前已在 ChatGPT 登場的全雙工語音模型 GPT-Live-1 正式開放至開發者 API,讓應用與業務流程可直接建置「邊聽邊講」的語音代理。官方強調,新版 API 著重讓開發者按用戶、工作流與目標,自訂語氣、節奏與對話風格,並可把深度推理與工具呼叫委派給後端文字模型。本文已對照 OpenAI 官網〈Build more natural voice experiences with GPT‑Live‑1 in the API〉、開發者文件〈Getting started with GPT-Live〉,以及《The Register》當日報導核實日期、定價與能力描述,來源真實性已驗證。

一、核心事件:語音層從「輪流說話」升級為「全雙工對話」

技術細節

傳統語音代理多把語音轉文字(STT)、推理模型與文字轉語音(TTS)串成管線,每一段交接都會加延遲,也容易在打斷、停頓或改口時失真。GPT-Live-1 把聆聽與發聲收進同一個語音前端模型,可同時處理進來與出去的音訊,減少链式架構的脆弱交接。

官方列出 API 版本的主要能力包括:

  • 打斷處理:以單一模型同時推理進出音訊,改善半雙工「你說完我再說」的生硬感。
  • 推理與工具委派:可把較深的推理與工具呼叫交給後端文字模型(例如 GPT-6 Astra)或第三方模型/自建代理。
  • 語氣、節奏與風格:透過系統提示詞塑造代理說話方式。
  • 背景噪音與靜默:較能在咖啡店、街道等嘈雜環境維持對話,而不必把每一步都念出來。
  • 長會話穩定度:改善長時間對話的上下文與品質。
  • 電話場景:支援以全雙工語音代理處理電話,涵蓋訂位到客服等用例。

定價方面,官網寫明前端語音層為 每分鐘 0.05 美元;後端模型與工具用量另行計費。開發者文件亦說明語音工作階段按秒計費,並可透過 WebRTC(瀏覽器)、WebSocket(伺服器音訊)或電話/SIP 路徑接入;合作方整合包括 LiveKit、Twilio、Telnyx 與 Daily/Pipecat。

二、技術原理深度解析

GPT-Live 的架構可概括為「語音對話層」與「後端任務層」分工:

1. 語音層只管對話節奏
GPT-Live-1 負責聽、說,以及決定何時向後端求助。開發者只需給短提示,說明對話風格與委派時機。

2. 後端負責查詢、工具與業務規則
委派有兩種模式:Responses 委派由平台代管後端 Responses 模型;客戶端委派則由應用自行控制模型、代理或服務。權限、確認、私有函式執行與持久任務狀態仍由應用端擁有。打斷語音並不會自動取消後端工作。

3. 評估數字(以官網為準)
OpenAI 指,GPT-Live-1 在 Full Duplex Bench 相對 GPT-Realtime-2.1 提升 30 個百分點,並在輪替延遲與互動行為有明顯改善;與 GPT-6 Astra(中等推理力度)搭配時,於衡量端到端語音代理智能的 Tau3 基準名列第一。語言學習平台 Speak 的早期評估指,相對過往輪替制系統,思考停頓期間的打斷減少近 八成。醫療排程場景方面,客戶引用稱相對級聯方案可簡化程式碼庫約 八成、刪減約 2.3 萬行程式。

四、日常應用場景

1. 開發者與技術團隊

可把即時語音客服、訂位、點餐、語言導師或語音協作工程師接到現有代理框架:前端用 GPT-Live-1 維持自然對話,後端按任務選較平價或較強的文字模型,平衡延遲與成本。

2. 企業與隱私敏感行業

電話與現場語音往往牽涉訂單、帳戶或病患行程。官方示範與客戶引言涵蓋餐廳訂位(如 Yelp Host)、客服(如 Intercom Fin)與醫療預約。企業仍應自行設計權限、確認與稽核;若對話內容屬 NDA 或合規敏感,需另建資料出域控管與私有部署策略。

3. 一般用戶

終端體驗更接近真實電話:可中途改口、加入細節、在背景噪音中繼續對話,而不必每次等系統「播完」才能再講。

4. 香港與亞洲市場視角

香港零售、餐飲、診所與跨境客服高度依賴電話與即時溝通。全雙工 API 降低自建 STT–LLM–TTS 管線的工程成本,亦利於粵語/多語場景的產品實驗。同時,企業需留意雲端語音與後端模型的跨境數據流向;若客戶資料不能出境,應評估私有 LLM 與本地閘道,而非直接把完整對話棧放上公有 API。

五、專業評價與潛在考量

優勢

  • 單一語音模型簡化架構,縮短打斷與輪替延遲,產品體驗更接近真人通話。
  • 語音與推理解耦,可按任務選後端模型,兼顧成本與能力。
  • 官方提供瀏覽器、伺服器與電話多種接入,並有多家通訊平台整合路徑。

需要留意的地方

  • 前端按分鐘計費,加上後端模型與工具,長通話場景需做成本控管與工作階段管理。
  • 打斷語音不自動取消後端任務,應用須自行處理取消、重試與冪等。
  • 評估數字來自 OpenAI 與具名客戶早期測試,實際業務成功率仍取決於提示詞、工具品質與領域資料。

結語

GPT-Live-1 進入 API,標誌語音代理從「輪流播報」走向可打斷、可委派的全雙工協作。對香港團隊而言,這既是快速驗證語音產品的機會,也提醒要把對話節奏與敏感推理分開設計。若需在香港以數據不出境的方式部署企業語音或文字代理後端,可參考 YSK Limited 的企業私有 LLM 全託管(年費由 HK$88,000 起,Dataset → QLoRA/LoRA → 私有 API,100% 數據不出境):https://ysk.hk/services/ai-automation 。亦可配合香港 APP 開發把語音前端嵌入手機或店舖流程:https://ysk.hk/services/app-development


參考來源

Related services & products