Hugging Face 於二零二六年九月三十日推出 Open TTS Leaderboard:以字/詞錯誤率、批次與串流延遲、以及講者嵌入相似度等客觀指標,系統評測開源多語文字轉語音(TTS)與聲音複製模型。官方指截至當日 Hub 上已有逾八千個 TTS 模型,但人工競技場更新跟不上;以 Artificial Analysis Voice Arena 為例,九十二款模型中僅十六款為開源權重。來源真實性已驗證:本文核對自 Hugging Face 官方網誌與公開 Space。
對要在香港部署客服語音、內部知識朗讀或短劇旁白的團隊,這類榜單把「聽起來不錯」拆成可重跑的工程量度,並特別標出串流首包音訊時間(TTFA),方便對照語音代理的可互動性。
Hugging Face/官方:推出 Open TTS Leaderboard——以可懂度/速度/音色相似度客觀評測開源多語語音合成;競技場僅約一成七開源權重;串流 TTFA 面向語音代理
開源語音合成近一年釋放節奏極快,但評測長期依賴 MOS、MUSHRA 等人工偏好,或以 TTS Arena v2、Artificial Analysis Voice Arena 等「二選一投票」累積 Elo。Hugging Face 文章指出:人工偏好仍是最終裁判,但競技場難以跟上模型上架速度;開源權重也因需由營運方自行託管推論,而在競技場中明顯佔比偏低(Artificial Analysis 九十二款中僅十六款開源;Voice Arena 亦有類似傾斜)。投票者標準隨時間漂移,亦削弱長期可比性。
Open TTS Leaderboard 改以可自動化的客觀指標補位:可懂度用提示文本與生成音訊經自動語音辨識(ASR)回寫後的詞錯誤率(WER)/字元錯誤率(CER),ASR 採用 Open ASR Leaderboard 上表現領先的開源 Qwen3 ASR;速度以 H200 GPU 上批次離線推論的逆即時因子(RTFx),以及 batch size 1 的首包音訊時間(TTFA,另提供部分 CPU 結果)衡量;聲音複製則以 WavLM 講者嵌入的餘弦相似度(SIM)估算音色保留。官方強調:客觀指標可把單次評測從「等票數的數週」壓到「數小時」,但 WER 與 SIM 並不直接等同年齡感、情感表現或聽者偏好,故不會取代人工競技場,反而可協助競技場篩選值得納入的開源模型。
一、核心設計:多語、聲音複製與可聽對照
技術細節
預設榜以 Seed TTS Eval 與 CV3 Eval(zero-shot)英語分割的宏平均 WER 排序;官方點名 hexgrad/Kokoro-82M、Supertone/supertonic-3、fishaudio/s2-pro 在英語 WER(兩分割平均)表現領先,並以 Pareto 圖同時呈現 WER、批次 RTFx 與模型體積的取捨。介面可切換多語:Seed TTS Eval 僅有英語與中文音訊,其餘語言以 CV3 Eval(zero-shot)分數呈現;中文、日文、韓文以字元為單位故報 CER,「跨語平均 WER」則為各語宏平均。多語強勢模型包括 k2-fsa/OmniVoice、fishaudio/s2-pro、FunAudioLLM/Fun-CosyVoice3-0.5B-2512。
開啟「Voice cloning」後,可比較支援該功能的模型,並顯示 SIM 欄與相關 Pareto 圖。部分模型(如 bosonai/higgs-tts-3-4b、openbmb/VoxCPM2)在提供參考音訊時,平均 WER 反而改善。Listen 分頁可直接試聽指標背後的生成樣本,並在登入 Hugging Face 帳號後投票,以便過濾垃圾票;Streaming 分頁則以同一組五十句英語 CV3-Eval 提示、預設聲線、先丟棄三次暖機後取 TTFA 中位數,比較 H200(及部分 CPU)上的串流體驗——有 Streaming API 者量度「第一個音訊塊到達」,無串流者則量度整句生成完才能播放的時間。官方特別提到 kyutai/pocket-tts 在 GPU 與 CPU 串流皆具競爭力。
二、技術原理深度解析
文字轉語音的「好不好聽」同時包含可懂度、延遲、音色一致性與主觀自然度。競技場用成對偏好逼近後者,但成本高、開源覆蓋差。Open TTS 把前三項對應到 ASR 回寫、即時/串流時序與講者嵌入距離:ASR 錯誤率把「說得清不清楚」變成可重現數字;RTFx/TTFA 把「能不能即時對話」從行銷口號變成硬體對齊的基準;SIM 則約束聲音複製是否跑題。種子資料與 CV3 零樣本設定,迫使模型在未見過的提示與聲線條件下工作,較接近產品落地時的不可控輸入。
對語音代理而言,TTFA 往往比總體 MOS 更能決定產品體感:使用者按下說話後,若首包音訊遲遲不到,對話感會立刻崩壞。榜單把串流與非串流模型放在同一度量下,避免「離線批次很漂亮、互動場景卻卡頓」的選型陷阱。官方亦計劃開源評測腳本(對齊 Open ASR Leaderboard 倉庫模式),讓社群以 Issue/PR 擴充資料集與指標。
四、日常應用場景
1. 開發者與技術團隊
在選定開源 TTS 權重前,先在 Open TTS Leaderboard 對照目標語言的 WER/CER、體積與 RTFx;若產品是語音代理或即時導覽,優先看 Streaming 分頁的 TTFA,並用 Listen 抽樣聽真實輸出。聲音品牌或有聲內容若依賴聲音複製,應同時盯 SIM 與可懂度,避免「像本人但聽不懂」或「清楚但不像」。
2. 企業與隱私敏感行業
金融、醫療與政府單位若須把語音合成留在私有環境,開源權重+客觀榜有助縮小候選集,再以內部語料與合規聲線做第二輪人工聽測。客觀指標不能取代法務對聲音權利與個資的審查,但可減少只憑行銷影片選型的盲盒風險。
3. 一般用戶與創作者
短影音、有聲書試作與無障礙朗讀,可先聽 Listen 分頁樣本,再決定是否下載較大權重。勿把單一英語 WER 第一名直接套用到粵語或繁中場景——應切換語言欄位並以本地語料覆核。
4. 香港與亞洲市場視角
香港產品常需同時處理繁體中文、英語與少量日韓內容;榜單強調「英語分數不能代理其他語言」,對本地多語客服與旅遊場景特別有用。企業若要把 TTS/STT 接到私有知識庫與內部 API,亦可一併評估本機或專用閘道部署,避免音訊與文本離開合規邊界。
五、專業評價與潛在考量
優勢
- 把開源 TTS 從競技場邊緣拉回可規模化、可重跑的評測軌道,補上開源覆蓋缺口。
- 多語切換、聲音複製 SIM、串流 TTFA 與 Listen 試聽同場,選型路徑完整。
- 明確聲明客觀指標的上限,並預告開源評測腳本,降低「榜即真理」的誤用。
需要留意的地方
- 文章發布於二零二六年九月三十日;榜上名次與模型版本會持續變動,引用時應註明查閱日期。
- WER/CER 受 ASR 本身錯誤影響;SIM 不度量情感與韻律美感。
- Seed TTS Eval 語言覆蓋有限,非中英語種主要依附 CV3 Eval,跨語比較需讀方法說明。
- 人工偏好與品牌聲線仍須內部聽測與授權;榜單不能替代版權與個資合規。
結語
Open TTS Leaderboard 回應的是語音生態的結構性落差:開源模型爆炸式增長,但評測仍偏慢、偏閉源、偏英語主觀投票。以可懂度、速度與音色相似度組成的客觀座標,再加上串流 TTFA 與可聽樣本,讓工程團隊能更快篩出值得進入人工聽測的權重——尤其適合多語與語音代理場景。
若你需要在香港部署可私有化的語音與語言模型能力(資料集整理、微調到私有 API,年費由 HK$88,000 起、強調數據不出境),可參考 YSK Limited 的企業私有 LLM 全託管:https://ysk.hk/services/ai-automation
參考來源
- Hugging Face Blog:Open TTS Leaderboard: Scalable Evaluation for Multilingual Text-to-Speech and Voice Cloning(2026-09-30)https://huggingface.co/blog/open-tts-leaderboard
- Hugging Face Space:Open TTS Leaderboard https://huggingface.co/spaces/hf-audio/open_tts_leaderboard