彭博行業研究(Bloomberg Intelligence)高級分析師 Robert Lea 在最新報告指出,中國頂級 AI 模型在基準測試得分上,僅落後美國對手約百分之三,是歷來最小差距;五月時約為百分之九,年初約為百分之十五。報告認為,差距急速收窄主要源於 DeepSeek 九月推出的 V4.1 Flash。
報告同時提醒,排名會變動,分數高亦不等於賺錢:中國市場有逾一千一百個大型語言模型,低毛利的 token 供應加上價格戰,行業或要到二零三零年才可望盈利。對香港企業而言,這意味中美模型的實際能力差距已小到值得認真比較,但選型時仍要計及監管與供應風險。
彭博行業研究:中美 AI 基準差距縮至歷來最低約百分之三——DeepSeek V4.1 Flash 登 LiveBench 全球第六;中國 AI 業或至二零三零年才盈利
彭博社香港時間十月五日清晨報道,彭博行業研究(Bloomberg Intelligence,下稱 BI)發表報告,指美國 AI 公司相對中國的性能領先優勢在過去數月大幅收窄至歷來最低。本文以彭博報道(經《海峽時報》全文轉載核對)、《信報》即時新聞,以及 DeepSeek 官方 API 文件互相比對,來源真實性已驗證;BI 報告原文屬付費內容,本文只引用公開報道所載的數字與引述,不作推算。以下拆解報告重點、背後的技術原因,以及對香港企業選用模型的實際含意。
一、核心事件:差距由十五%縮至三%
報告要點
根據彭博報道,BI 高級分析師 Robert Lea 的報告有以下主要論點:
- 差距數字:中國頂級模型在基準測試得分上落後美國對手約百分之三,五月時約為百分之九,年初約為百分之十五。
- 觸發點:DeepSeek 九月發布的 V4.1 Flash 在九月的 LiveBench 排行榜位列全球第六,是 DeepSeek 自二零二五年推出推理模型 R1 以來排名最高的中國模型。
- 分數對比:DeepSeek 最近一次 LiveBench 得分為 81.1,Anthropic 最佳成績為 83.4。Lea 認為這代表 DeepSeek 已提供與 Anthropic、OpenAI 頂級系統「相若的表現」。
- 但只佔少數:LiveBench 前十五名模型之中,只有三個來自中國。
- 市場含意:性能提升意味中國模型會進一步搶佔市場份額。Lea 形容,中國的進展「令人更加懷疑美國在 AI 領域技術霸權的長期可持續性」。
為何引起關注
報告直指,中國的追趕源於 AI 專業能力加深,以及研究人員針對本土硬件優化模型的能力,這令人質疑美國以出口管制限制 Nvidia 晶片等技術、阻止華為等發展替代方案的成效。彭博亦提到,中國較低成本的模型在用戶數量上正追近美國對手,而 Anthropic 與 OpenAI 正爭取以上市實現萬億美元估值,並以性能優勢作賣點。
二、技術原理深度解析
1. V4.1 Flash 做對了甚麼
DeepSeek 官方 API 文件(九月十日公告)列出 V4.1-Flash 的關鍵設計:
- 架構:五千五百二十億參數的混合專家(MoE)模型,採用新的「因果編碼器—解碼器」設計,輸入端只啟用八十億參數、輸出端啟用一百六十億參數。
- 快取成本:相比上一代,KV 快取只需約四分之一的 HBM 記憶體及八分之一的 SSD 儲存。官方特別指出,快取命中費用往往佔代理(agent)成本的一大部分,壓縮快取可顯著降低這部分開支。
- 產品線整合:API 模型名稱改為
deepseek-flash,並原生支援多模態;官方稱多方測試顯示 V4.1-Flash 在性能、成本、速度與總運行時間上均勝過 V4-Pro,由九月十四日起 V4-Pro 的請求改導向 V4.1-Flash,直至 V4.1-Pro 推出。 - 開放權重:模型與技術報告已在 Hugging Face 公開。
換言之,這次追近並非單靠堆算力,而是靠「輸入輸出不對稱啟用」與快取壓縮,把每次推理實際動用的參數與記憶體壓低。這正好呼應 BI 所說的「針對本土硬件優化」:在高端 GPU 受限的環境下,省記憶體、省頻寬的設計更具優勢。
2. 基準分數要怎樣讀
LiveBench 以模型對問題、謎題及任務的回應評分,彭博把它比喻為類似量度人類智商的過程。單看報道中的兩個分數,DeepSeek 81.1 與 Anthropic 83.4 相差二點三分。不過,綜合基準只是一個切面:代理編程、長時間任務、工具調用穩定性、多語言(尤其粵語及繁體中文)等能力,未必在單一總分反映。Lea 本人亦提醒排名會變動。
三、日常應用場景
1. 開發者與技術團隊
差距收窄後,「美國閉源模型做主力、中國開放權重模型做後備」不再是唯一組合。團隊可按任務分流:高風險推理及最終審核用最強模型,大量批次摘要、分類、檢索增強生成(RAG)等改用成本更低的模型。關鍵是先建立自己的評測集,而不是只看排行榜。
2. 企業與隱私敏感行業
開放權重模型可以在自家伺服器或私有雲部署,數據不必經第三方 API。對金融、醫療、法律等受監管行業而言,「性能已接近頂級」加上「可私有化部署」,是值得重新評估的組合。但同時要留意報告提到的風險:中國模型在美國面對愈來愈嚴格的監管審查,在模型蒸餾指控之後甚至可能被禁用;跨境業務必須預先評估合規影響。
3. 一般用戶
報告指,字節跳動的豆包在 AI 應用變現方面領先,而 DeepSeek 與騰訊的聊天機械人仍然免費。對一般用戶而言,免費又夠用的選擇會愈來愈多,但服務條款、數據去向仍需自行留意。
4. 香港與亞洲市場視角
《信報》亦於今早報道此消息,反映本地財經界關注中美 AI 競爭對科技股及企業 IT 預算的影響。香港企業處於兩大模型生態之間,選擇空間比單一市場更大,但也要同時應對兩邊的監管變化。實務上建議三點:一、以多模型架構保留切換能力,避免綁死單一供應商;二、以粵語、繁體中文及本地業務文件建立內部評測;三、涉及客戶個人資料的工作負載,優先考慮可私有化部署的方案,以符合《個人資料(私隱)條例》要求。
四、專業評價與潛在考量
優勢
- 性能差距由年初約十五%收窄至約三%,代表企業以較低成本取得接近頂級能力的機會增加。
- V4.1-Flash 的快取壓縮與不對稱啟用設計,直接針對代理工作負載的主要成本來源。
- 開放權重讓企業可自行部署、審計與微調。
需要留意的地方
- 基準不等於實戰:LiveBench 前十五名中只有三個中國模型,單一最佳成績接近,不代表整體梯隊同樣接近。
- 盈利壓力:Lea 指中國 AI 業或要到二零三零年才盈利,國內逾一千一百個大型語言模型陷入價格戰;他認為要令行業回到可持續盈利軌道,需要競爭降溫、行業洗牌及更理性的定價。供應商若被淘汰,企業的長期支援便成疑問。
- 監管風險:美國對中國模型的審查與潛在禁令,可能影響跨境業務及使用美國雲端服務的企業。
- 報告原文未公開:BI 報告屬付費研究,計算方法細節以公開報道為限。
結語
由十五%到九%再到三%,一年之內的收窄速度才是這份報告的重點。對企業而言,問題已不再是「中國模型夠不夠用」,而是如何在性能、成本、數據主權與監管風險之間,為不同工作負載配對合適的模型,並保留隨時切換的能力。
如需在香港把開放權重模型部署在自己的環境、讓數據不出境,可參考 YSK Limited 的企業私有 LLM 全託管服務(年費 HK$88,000 起,https://ysk.hk/services/ai-automation);開發團隊若想先在本機試行 Hugging Face 模型並以 OpenAI 相容介面接入現有工具,亦可看看 MIT 開源的 YSK Omni v1.0.2(預設埠 3850,https://ysk.hk/products/ysk-omni)。
參考來源
- 彭博社(Bloomberg):US Lead in AI Over China Narrows After DeepSeek Gains, BI Says(二零二六年十月四日 21:03 GMT,即香港時間十月五日 05:03)— https://www.bloomberg.com/news/articles/2026-10-04/us-lead-in-ai-over-china-narrows-after-deepseek-gains-bi-says
- 《海峽時報》轉載彭博全文:US lead in AI over China narrows after DeepSeek gains, Bloomberg Intelligence says — https://www.straitstimes.com/world/united-states/us-lead-in-ai-over-china-narrows-after-deepseek-gains-bloomberg-intelligence-says
- 《信報》即時新聞:美國AI對中國領先優勢縮至歷來最少(二零二六年十月五日)— https://www2.hkej.com/instantnews/current/article/4531397
- DeepSeek 官方 API 文件:V4.1-Flash 發布公告(二零二六年九月十日)— https://api-docs.deepseek.com/news/news260910
- DeepSeek-V4.1-Flash 模型頁(Hugging Face)— https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash