微軟人工智能實驗室(Microsoft AI)於官方新聞稿宣佈,推出首款串流語音轉文字模型 MAI-Transcribe-2-Streaming,並同步發布文字轉語音模型 MAI-Voice-2.1 與低延遲變體 MAI-Voice-2.1-Flash。官方指串流轉錄在 Artificial Analysis 榜上最終與首輪部分轉錄準確率均列第一;語音側支援二十三種語言、單一聲線跨語切換,並標示同意防護以防濫用。Azure 文件列為公開預覽。
對香港企業而言,客服語音代理、多語助手與即時字幕正成為標準需求;這次更新把「聽」與「說」兩端放進同一 Foundry/Playground 工具鏈,並公布以音訊小時與每百萬字元計的介紹價,方便資訊科技與採購團隊對照現有 Azure Speech 或第三方語音供應商。
微軟/官方:MAI-Transcribe-2-Streaming 登 Artificial Analysis 串流轉錄榜首——並推 MAI-Voice-2.1/Flash;六十語轉寫、二十三語發聲;介紹價每小時零點五四美元
微軟人工智能實驗室在官方新聞稿(標示發布時間為協調世界時二零二六年十月一日十六時)宣佈,隨同「排名第一」的串流轉錄模型上線,同步推出 MAI-Voice-2.1 與高速變體 MAI-Voice-2.1-Flash,作為構建對話式語音代理的聽寫與發聲組件。本文已核對 microsoft.ai 新聞稿與模型頁、Microsoft Learn 上 Azure Speech/Foundry 文件,以及 Microsoft News Source 轉載內容;來源真實性已驗證。
一、核心事件:聽寫與發聲一次補齊語音代理迴路
技術細節
官方將語音代理描述為必須在「人類仍感覺像對話」的時間窗內完成聽、懂、決策與說的迴路。MAI-Transcribe-2-Streaming 面向即時音訊:支援六十種語言,並提供自動、連續的語言偵測;不需等對方說完才出字,而在收到音訊後約逾一百毫秒產生首輪假設(partials),再隨上下文修正並盡快提交穩定稿。官方稱這讓語音代理可在句子中途開始推理或呼叫工具,即時字幕亦可邊說邊出字;在即時聽寫或字幕等內部評估中,官方指文字出現速度較最接近競爭對手快約兩倍。
在準確率方面,官方指該模型在 Artificial Analysis 串流語音轉文字榜上,最終轉錄與首輪部分轉錄準確率均列第一,並在準確率對延遲評估中位於帕累托前沿。新聞稿圖表數據標示最終字錯誤率約百分之二點五零(Artificial Analysis 串流榜,日期標為二零二六年九月二十八日)。介紹價為每小時音訊零點五四美元,適用至當年年底。
語音生成一側,MAI-Voice-2.1 為官方所述迄今最強多語文字轉語音模型,支援二十三種語言與二十六個地區設定;重點是「同一聲線」可切換英語、普通話、德語等而維持可辨識的同一說話者,並以當地口音呈現,而非把單一口音硬套到所有語言。標價為每百萬字元二十二美元。MAI-Voice-2.1-Flash 支援相同語言與跨語聲線,但針對高流量、對延遲敏感的負載:官方稱可生成四十五秒音訊,端到端延遲約一百五十毫秒;模型推論快約百分之五十五,較可比模型約便宜百分之六十,標價每百萬字元十五美元。兩款語音模型均支援以數秒參考音訊做跨支援語言的聲線克隆,並內建同意防護(consent guardrails)以降低濫用風險。
取得途徑方面,官方寫明可經 OpenRouter 使用兩款 Voice 模型,並可經 Microsoft Foundry、MAI Playground 等取得三款模型;另提及 Vercel、稍後的 LiveKit 與 Azure Voice Live 等整合面。Microsoft Learn 文件將 MAI-Transcribe-2-Streaming 與 MAI-Voice 列為公開預覽,提醒尚無服務等級協議、不建議直接用於正式生產負載,並說明可經類似 OpenAI Realtime 的 WebSocket 或 Azure Speech SDK 接入;串流轉錄文件亦列出瑞典中部、美國中部、東南亞等可服務區域(部分區域標示即將提供)。
二、技術原理深度解析
串流轉錄與批次轉錄的差異,在於必須在說話仍進行時輸出可修正的中間結果。官方強調 partials 讓代理「搶時間」:先根據不完整語音啟動工具或檢索,再在最終稿穩定後校正。這與僅在整段音檔結束後才返回文字的批次模型(例如較早的 MAI-Transcribe-2 批次路線)形成互補——成本與延遲特性亦不同,企業需按「邊說邊做」還是「事後歸檔」選型。
文字轉語音側,跨語單一聲線降低品牌要為每種語言另建聲庫的成本;Flash 以較低每字元價與較短端到端延遲,對接客服高峰與互動式代理。官方並以 MAI Playground 內的 Chatter 示範,把轉寫與發聲串成即時對話代理,方便開發者在同一沙盒驗證閉環,而非分開試聽各模型。
對資安與合規團隊而言,聲線克隆加上同意防護,是產品聲明中的重要對照點:企業若要以品牌聲線對外服務,仍須自行完成收集同意、保留審計與地區私隱法規評估;公開預覽條款亦意味著可用性、配額與功能可能調整。
四、日常應用場景
1. 開發者與技術團隊
可在 Foundry 部署基礎模型,或以 Realtime 相容 WebSocket/Speech SDK 接入既有代理編排;語音輸出亦可經 OpenRouter 試作。適合把現有文字代理加上聽寫與發聲,或替換延遲偏高的第三方串流轉寫。
2. 企業與隱私敏感行業
客服、銀行與保險熱線、內部多語會議字幕、培訓與角色扮演內容,是官方點名的方向。香港金融與專業服務機構若已在 Azure 落地,可把語音層留在既有合約與區域控制內試點;若數據主權要求更嚴,仍應評估音訊是否出境、預覽條款與日後正式版 SLA。
3. 一般用戶
一般消費者可經 MAI Playground 體驗 Chatter 等示範;正式產品體驗則視各 Microsoft 消費面產品是否後續接入而定。目前新聞稿重點在開發者與企業構建代理。
4. 香港與亞洲市場視角
語音模型明示支援包括簡體中文在內的多語切換,對服務粵港兩地、東南亞與內地客戶的香港聯絡中心有直接意義;串流轉錄文件將 Southeast Asia 列為可服務區域之一,有利亞太延遲規劃。同時,假冒客服與語音社交工程在本地持續高企,企業引入語音代理時,更應同步強化身份核實、防釣魚與員工提示——技術升級不能取代保安流程。
五、專業評價與潛在考量
優勢
- 官方同時交付串流聽寫與多語發聲,並以公開基準宣稱準確率前列與可陳述的介紹價,降低企業組裝語音代理的整合摩擦。
- 單一聲線跨語與 Flash 低延遲,切合品牌一致的多市場客服與高併發場景。
- 可走 Foundry/Azure 既有身分與區域佈署,對已採用微軟雲的團隊較易納管。
需要留意的地方
- Learn 文件標示公開預覽:無 SLA、功能可能受限,不應用於關鍵生產而未備援。
- Artificial Analysis 排名與「較競爭對手快兩倍」等表述屬供應商引用或內部評估,採購仍應以自有音訊與方言(含粵語場景)重測。
- 聲線克隆即便利於品牌,亦提高深度偽造與社會工程風險;同意防護是必要但非充分條件。
- 介紹價有期限(轉錄至年底);語音每百萬字元價需與通話時長、打斷率一併建模,避免低估高峰成本。
結語
微軟今次以串流轉錄榜首敘事,搭配 Voice 2.1/Flash 與 Playground 示範,把語音代理的聽寫與發聲兩端產品化,並給出可對照的價與延遲數字。對香港企業資訊科技而言,價值在於可於 Azure/Foundry 生態內加速試點多語客服與內部助手,同時必須把預覽條款、方言實測與聲線濫用防護一併納入上線門檻。
若貴公司計劃在香港部署私有或受控的企業 AI(含客服代理、內部知識助手與語音工作流),可參考 YSK Limited 的企業私有 LLM 全託管——數據集建構、QLoRA/LoRA 微調至私有 API,年費由港幣八萬八千元起,強調數據不出境:https://ysk.hk/services/ai-automation
參考來源
- Microsoft AI 官方新聞稿:Our first streaming transcription model debuts at no. 1 on Artificial Analysis(https://microsoft.ai/news/our-first-streaming-transcription-model/)
- Microsoft AI 模型頁:MAI-Voice-2.1(https://microsoft.ai/models/mai-voice-2-1/)
- Microsoft Learn:MAI-Transcribe-2-Streaming overview(https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming)
- Microsoft Learn:MAI-Voice-2.1 and MAI-Voice-2.1-Flash(https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-voices)
- MAI Playground(https://playground.microsoft.ai/)
- Microsoft News Source(LATAM)同題轉載與圖表說明(https://news.microsoft.com/source/latam/company-news-es/nuestro-primer-modelo-de-transcripcion-de-streaming-debuta-en-el-numero-1-en-analisis-artificial/)