The Information:DeepSeek 押注華為訓練晶片——梁文鋒稱「必須成功」,第四季起可望交貨

Key takeaway

The Information 於二零二六年九月二十一日獨家報道,中國人工智能實驗室 DeepSeek 首席執行官梁文鋒向投資者表示,改用更多國產晶片訓練模型是公司重大優先事項,並預期華為技術最快可於本年度第四季開始向 DeepSeek 交付訓練用晶片。報道作者駐香港;文中亦指梁文鋒把「在華為晶片上訓練」形容為必須成功的重大賭注之一。來源真實性已驗證。

The Information:DeepSeek 押注華為訓練晶片——梁文鋒稱「必須成功」,第四季起可望交貨

The Information 於二零二六年九月二十一日獨家報道,中國人工智能實驗室 DeepSeek 首席執行官梁文鋒向投資者表示,改用更多國產晶片訓練模型是公司重大優先事項,並預期華為技術最快可於本年度第四季開始向 DeepSeek 交付訓練用晶片。報道作者駐香港;文中亦指梁文鋒把「在華為晶片上訓練」形容為必須成功的重大賭注之一。來源真實性已驗證。

對香港與亞洲企業而言,這不只是供應鏈新聞:當前沿模型訓練愈來愈受美國出口管制約束,能夠在受控供應鏈上完成訓練與微調的能力,會直接影響私有模型、本地部署與跨境數據策略。本文整理事件、技術含義、應用場景與專業評價。

The Information:DeepSeek 押注華為訓練晶片——梁文鋒稱「必須成功」,第四季起可望交貨

一、核心事件:閉門會上的訓練路線重申

據 The Information 香港團隊記者 Juro Osawa、Qianer Liu 報道(約二零二六年九月二十一日太平洋時間凌晨刊出),梁文鋒在周日一場閉門、面對面的會議上向投資者說明:公司正把更多訓練負載轉向國產晶片,並預期華為將於二零二六年第四季起向 DeepSeek 交付訓練用處理器。報道引述兩名直接知情人士。

同篇報道指出,DeepSeek 在訓練階段擴大採用華為晶片——相對推斷(運行模型),訓練通常需要更強算力與互聯頻寬——顯示雙方正合力擺脫美國對先進晶片出口管制所造成的供應瓶頸。The Information 官方帳號同日亦摘要:DeepSeek 正減少對 Nvidia 的依賴;梁文鋒預期華為處理器將在訓練最大模型時扮演更大角色,並把「在華為晶片上訓練」列為公司最大賭注之一,強調「必須成功」(has to work)。

報道並提到 DeepSeek 正敲定第二輪融資:目標募集約五百億元人民幣(約七十五億美元),估值約五千億元人民幣。以上數字均出自 The Information 公開摘要,本文不另作推算。

技術細節:為何「訓練用晶片」比「推斷用」更難替代

出口管制與供應替代的關鍵,往往不在「能不能跑聊天」,而在「能不能穩定完成大規模預訓練與持續後訓練」:

  1. 算力密度與互聯:訓練需要高頻寬、低延遲的 GPU/加速器叢集與高速互聯;推斷可用較多量化與批處理技巧降低硬體門檻。
  2. 軟體棧適配:模型團隊長期優化於某一廠商的編譯器、核心庫與分散式訓練框架;改用另一供應商意味著核心、通信原語與數值穩定性都要重新驗證。
  3. 供應節奏:梁文鋒所稱「第四季交貨」若屬實,代表的是可排程的產能窗口,而不只是樣品演示;對融資與產品路線圖,交貨時點比口號更重要。

換言之,DeepSeek 此次表態把「國產替代」從推論側的權宜之計,拉到訓練側的戰略賭注——這也是報道標題強調 bypass U.S. export controls 的原因。

二、技術原理深度解析:出口管制如何倒逼訓練架構

美國對先進加速器與相關製造設備的出口限制,目標之一是抬高中國實驗室訓練前沿模型的成本與時程。產業常見因應可粗分為三條路:

  • 尋求合規或降規規格的境外晶片:在許可範圍內採購,但峰值算力與供貨量受配額與審批影響。
  • 改寫演算法以「少算力換效果」:例如更激進的稀疏、蒸餾、合成數據與後訓練策略,降低對頂級訓練叢集的絕對依賴。
  • 轉向本土可取得的訓練加速器與軟體生態:以華為昇騰等路線為代表,用可預期的國內產能換取訓練自主性,代價是工程適配與生態成熟度風險。

DeepSeek 過往以高效率訓練與開源權重策略受到關注;若訓練底盤逐步切到華為,意味著其工程優勢必須在新硬體上可複現——包括吞吐、收斂穩定性與多機擴展。對競爭對手與雲端供應商而言,這也是觀察「非 Nvidia 訓練叢集能否支撐前沿模型」的公開壓力測試。

需要強調:The Information 為付費訂閱媒體,全文細節(例如具體晶片型號、叢集規模、與現有 Nvidia 產能的比例)可能僅對訂戶開放。本文僅採納其公開標題、摘要、作者署名與官方社交帳號已披露之陳述,不臆測未公開規格。

三、日常應用場景

1. 開發者與技術團隊

若你依賴 DeepSeek 或其他可能轉向國產訓練棧的開源/商用權重,應在 CI 與基準測試中預留「硬體世代變更」:同一權重在不同加速器上的數值誤差、量化行為與服務延遲可能不同。部署代理(agent)時,把模型供應商的訓練供應鏈列為依賴風險,與 API 價格並列追蹤。

2. 企業與隱私敏感行業

金融、法律、醫療與政府相關單位若需自訓或持續微調領域模型,核心問題是:訓練數據與梯度更新能否留在可接受的司法管轄與供應商邊界內。DeepSeek—華為路線說明「訓練主權」正成為採購條件;香港企業評估私有 LLM 時,除推斷託管地外,亦應問清楚微調/持續訓練發生在何處、使用哪一類加速器與是否可審計。

3. 一般用戶

一般聊天用戶短期不一定察覺底層訓練晶片更換;但模型更新節奏、地區可用性與合規聲明,長遠會受訓練產能約束。選擇服務時可關注供應商是否清楚說明數據留存與訓練用途,而不是只看排行榜分數。

4. 香港與亞洲市場視角

報道兩位作者均以香港為基地,題材本身緊貼粵港澳與亞洲半導體—AI 供應鏈。香港企業常見做法是:推理與應用層用多雲/多模型,敏感微調則放在可控環境。若訓練算力供應進一步「陣營化」,多供應商備援與私有化微調會更有價值——這正是本地託管私有模型的需求來源之一。

對必須讓數據留在香港、又要做領域微調的機構,可參考 YSK Limited 的企業私有 LLM 全託管:Dataset → QLoRA/LoRA → 私有 API,年費 HK$88,000 起,官網列明 100% 數據不出境。

四、專業評價與潛在考量

優勢

  • 把「訓練自主」從口號推進到可驗證的交貨窗口(第四季),便於投資者與客戶追蹤。
  • 訓練側採用華為,比僅在推斷側替換更能檢驗本土加速器生態是否成熟。
  • 與融資進程綁定(第二輪目標規模已見諸公開摘要),市場可同時觀察資本與產能兩條線。
  • 對香港讀者具地緣信息優勢:報道出自駐港記者團隊,便於對照本地企業的多供應商策略。

需要留意的地方

  • 公開摘要並未詳列晶片型號、良率、叢集規模或相對 Nvidia 的性能對照;「交貨」不等於「已達同等訓練效率」。
  • 軟體棧遷移風險高,短期或出現訓練不穩定、工程人力擠佔產品迭代的情況。
  • 出口管制與實體清單政策仍可能變化;供應鏈敘事需持續以一手報道與官方文件更新,不宜一次定論。
  • 融資目標與估值為報道所述目標,是否足額完成須待後續一級市場披露,本文不視為已完成交易。

結語

DeepSeek 透過投資者閉門會,把華為訓練晶片提升到「必須成功」的戰略高度,並給出二零二六年第四季起交貨的時間預期。這標誌著亞洲前沿模型競爭,正從「誰的權重分數更高」,延伸到「誰能在受管制的世界裡穩定完成訓練」。對香港企業來說,實務啟示是:評估 AI 供應商時,要把訓練供應鏈、微調地點與數據出境邊界寫進盡職調查清單。

若貴司希望在香港落地可審計的領域模型與私有 API,可了解 YSK Limited 企業私有 LLM 全託管(年費 HK$88,000 起,數據不出境):https://ysk.hk/services/ai-automation ;若同時需要雲端遷移、零信任與備援架構,亦可參考雲端遷移與網絡安全服務(官網刊 99.99% SLA):https://ysk.hk/services/cloud-security 。查詢 WhatsApp +852 6160 4242 或 [email protected]


參考來源

  1. The Information:Juro Osawa、Qianer Liu「DeepSeek Bets Big on Huawei Chips to Bypass U.S. Export Controls」(2026-09-21;公開摘要/標題核對)https://www.theinformation.com/articles/deepseek-bets-big-huawei-chips-bypass-u-s-export-controls
  2. The Information 官方帳號相關獨家摘要帖文(2026-09-21;發現來源,內容與公開摘要一致)https://x.com/theinformation/status/2102057805582676366https://x.com/theinformation/status/2102118187416297616
  3. YSK Limited llms.txt(公司服務與刊例價格,寫作前已刷新)https://ysk.hk/llms.txt

Related services & products