2026 年 9 月 15 日(太平洋時間),NVIDIA 於聖塔克拉拉 AI Infra Summit 公布 AI 工廠(AI factory)能效與軟硬整合進展,重點包括 NVIDIA DSX MaxLPS/DSX Flex、Vera Rubin NVL72 與代理式負載基準 SemiAnalysis AgentX 的最新數字。本文已核對 NVIDIA 官方部落格〈AI Infra Summit: NVIDIA Vera Rubin and DSX Platform Advancements Showcase Energy Efficiencies of Optimizing Tokens Per Watt for AI Factories〉(標註 2026-09-15),來源真實性已驗證。產業焦點正從「峰值算力」轉向「每一兆瓦能產出多少可用代幣」。
一、核心事件:AI 工廠以電為硬約束
技術細節
NVIDIA hyperscale/HPC 副總裁 Ian Buck 在逾八千人規模的 AI Infra Summit 上,把敘事錨在「agentic AI 正在改寫基礎設施需求」:工作負載要更多效能、效率與規模,而電網接駁與機房功率預算往往比晶片供應更早成為瓶頸。官方文章以「經驗證的 agentic tokens per megawatt」作為工廠級指標,並把 NVIDIA DSX 描述為可橫跨機架/廠區做功率最佳化的軟體平台。
官方載明的合作與驗證包括:Amazon Annapurna Labs 與 NVIDIA 合作 NVHBM 客製高頻寬記憶體;d-Matrix 把 NVLink Fusion 與自家 Raptor XPU 整合;Emerald AI 與 NVIDIA 在 Silicon Valley Power 展示可調負載的商業化 AI 工廠彈性用電方案;雲端供應商 Lambda 以 NVIDIA DSX MaxLPS 在 Blackwell 伺服器上公布實測;Pinterest 則以 Blackwell 平台與 Dynamo 推理軟體推進視覺探索場景的對話式 AI。
在數字方面,NVIDIA 寫道:DSX MaxLPS 可透過全廠功率最佳化,達到最高約 1.4 倍代幣/兆瓦;Lambda 實測在同一功率預算下把節點數由典型 16 台全功率節點提升至 19 台,集群代幣吞吐約由每秒 400 萬升至 500 萬(約增 24%),每瓦效能提升約 23%。對下一代 Vera Rubin NVL72 工廠,官方稱在合適部署環境下,DSX MaxLPS 可在同一兆瓦預算內帶來最高約 40% 更多 GPU 容量。另就代理式基準,Vera Rubin NVL72 在 SemiAnalysis AgentX(DeepSeek V4 Pro)上,官方宣稱相對 GB300 NVL72 最高約 30 倍吞吐/兆瓦,以及最高約 45 倍更低的每百萬代幣成本。上述倍數均屬廠商/基準披露,企業採購時應以自身工作負載複現為準。
二、技術原理深度解析
傳統資料中心規劃常以「靜態功率配額」保護峰值:每個機架預留足以應付尖峰的瓦數,結果大量預算在平均負載時被閒置。DSX MaxLPS 的思路是持續監測 GPU 與機架功耗,把可用功率動態調度到當下最需要的地方,並回收靜態配置留下的餘裕;訓練與推理功耗曲線不同,混合負載工廠因此特別受益。
DSX Flex 則把工廠接到電網訊號:負載削減請求、需求反應事件與電價訊號可依預設工作負載層級自動動作——高優先任務續跑,其餘暫緩後再恢復。Emerald AI 與 Silicon Valley Power 的示範顯示,系統可回應數百次需求訊號並保護關鍵 AI 作業。這把「AI 工廠」從純耗電戶,轉成可參與電網彈性的可控負載。
在機架與互連層,官方把 Vera Rubin NVL72、NVLink 規模擴展、Dynamo/TensorRT LLM 推理棧與功率平滑/能量緩衝並列為「共設計」:短尖峰被吸收後,系統可更貼近持續需求運轉,把原本「被鎖死的功率頭寸」轉成可計費算力。對代理式工作負載,官方另提到與 Groq 3 LPX 組合以追求更低延遲推理,並引用長上下文場景下的每用戶輸出代幣速率;企業應把這類數字視為特定基準條件下的上限,而非通用 SLA。
四、日常應用場景
1. 開發者與技術團隊
基建與平台團隊需要改監控面板:除 GPU 利用率,還要追蹤機架/廠區級瓦數、代幣吞吐與功率事件。混合訓練/推理隊列要能標註優先級,才能讓 MaxLPS/Flex 的調度有語義。對香港與亞太的 MSP、GPU 雲與私有機房,這意味著容量規劃文件要補上「同兆瓦可服務的 agent 會話數」假設,而不只是 H100/Blackwell 卡數。
2. 企業與隱私敏感行業
金融、電訊與政府外包的 AI 專案常卡在機房供電與電費,而非模型授權。可調負載與更高代幣/兆瓦,有助在既有電力合約內擠出更多推理額度;同時,彈性減載政策必須寫進業務連續性計畫,避免監管報表或交易時段被自動降級。若敏感語料不能上公有雲,企業仍需在可控機房部署私有推理棧,並把功率治理當成資安與合規的一部分。
3. 一般用戶
一般用戶不會直接購買 DSX,但會感受下游產品:同樣電費與碳預算下,服務商能否提供更長上下文、更多工具呼叫的代理助手。功率效率改善也可能減緩「AI 漲價轉嫁」壓力,惟實際資費仍由各平台定價決定。
4. 香港與亞洲市場視角
香港數據中心土地與電力緊張,企業上雲或自建 GPU 叢集時,電力接駁與電費往往主導 TCO。NVIDIA 把「代幣/兆瓦」與電網需求反應寫進官方敘事,對本地雲端遷移、混合雲與災難備援設計具參考價值:選址與契約應預留可參與需求反應的彈性,並要求供應商提供可稽核的吞吐/瓦數報表。亞洲多地同樣面臨電網排隊,能在既有兆瓦內提高有效算力的軟體層,可能比等待新變電站更現實。
五、專業評價與潛在考量
優勢
- 官方部落格同日公開,並附 Lambda、Emerald AI、SemiAnalysis AgentX 等具名驗證,便於交叉核對。
- 把產業指標從峰值 FLOPS 轉向代幣/兆瓦,貼近代理式 AI 的真實成本結構。
- DSX Flex 對接電網訊號,回應「AI 工廠拖垮電網」的公共政策焦慮。
需要留意的地方
- 1.4×、40%、30×、45× 等數字均為條件性上限,依賴工作負載、散熱、供電拓撲與軟體版本;採購評測須以自家 agent 軌跡重跑。
- 彈性減載若設計不當,可能在尖峰電價或電網事件時打擊客戶 SLA。
- 全棧綁定(系統、網路、推理軟體、功率管理)提高轉換成本,企業應保留多供應商與可觀測性出口。
- 官方文章屬行銷技術稿,獨立第三方長期現場數據仍待累積。
結語
AI Infra Summit 這輪訊息清楚:下一階段 AI 基礎設施競爭,是在既有電力信封內榨出更多可服務的代理代幣。對香港企業而言,評估 GPU 雲或私有叢集時,應要求供應商交出可驗證的吞吐/兆瓦與需求反應策略,而不是只比卡型號。若貴司需要在香港推進雲端遷移與網絡安全加固(官網刊 99.99% SLA),可參考 YSK Limited 的雲端遷移與網絡安全服務(https://ysk.hk/services/cloud-security)。
參考來源
- NVIDIA Blog:AI Infra Summit: NVIDIA Vera Rubin and DSX Platform Advancements Showcase Energy Efficiencies of Optimizing Tokens Per Watt for AI Factories(https://blogs.nvidia.com/blog/ai-infra-summit-vera-rubin-dsx-energy-efficiencies-tokens-per-watt-ai-factories/)(2026-09-15)
- X 發現來源:@nvidia(https://x.com/nvidia/status/2099907057025536506)(發現用,非唯一依據)