Google Cloud 第八代 TPU 登場:TPU 8i 與 TPU 8t 專攻推理與訓練,效能與成本大幅提升

重點摘要

Google Cloud 近日再次強調其第八代 Tensor Processing Unit(TPU)系統的優勢。根據官方說法,TPU 8i 與 TPU 8t 兩款晶片可帶來「可持續的經濟效益」,在低延遲服務場景下,效能/美元比最高提升達 80%,並可無縫擴展至超過 100 萬顆晶片的規模。

Google Cloud 第八代 TPU 登場:TPU 8i 與 TPU 8t 專攻推理與訓練,效能與成本大幅提升

Google Cloud 近日再次強調其第八代 Tensor Processing Unit(TPU)系統的優勢。根據官方說法,TPU 8iTPU 8t 兩款晶片可帶來「可持續的經濟效益」,在低延遲服務場景下,效能/美元比最高提升達 80%,並可無縫擴展至超過 100 萬顆晶片的規模。

這兩款晶片是 Google 首次將訓練與推理功能明確拆分成兩種專用架構,專為「Agentic AI」(代理式 AI)時代而設計。

一、兩款晶片的定位

項目 TPU 8t(Training) TPU 8i(Inference)
主要用途 大規模預訓練、Embedding 密集工作負載 低延遲推理、Agent 服務、長上下文推理
單 Pod 規模 最高 9,600 顆晶片 最高 1,152 顆晶片
記憶體 216 GB HBM 288 GB HBM + 384 MB 片上 SRAM
峰值效能 12.6 FP4 PFLOPs 10.1 FP4 PFLOPs
網路拓撲 3D Torus Boardfly
效能提升 訓練效能/美元最高提升約 2.7 倍 低延遲服務效能/美元最高提升約 80%

TPU 8t 被定位為「訓練動力引擎」,目標是把前沿模型的開發週期從「數月」縮短至「數週」。TPU 8i 則專注於推理與 Agent 工作負載,強調低延遲與高吞吐量。

二、技術亮點

1. 專用架構設計

以往 TPU 多為通用設計,第八代首次針對訓練與推理的不同需求進行分化:

  • TPU 8t 強化 SparseCore 與 LLM Decoder Engine,適合大規模預訓練。
  • TPU 8i 配備 Collectives Acceleration Engine(CAE),大幅降低多 Agent 與 Mixture-of-Experts 模型的同步延遲。

2. 規模與互連

  • TPU 8t 單一 Superpod 可達 9,600 顆晶片,共享 2 PB 高頻寬記憶體。
  • 整體系統可擴展至超過 100 萬顆晶片,支援超大規模 AI 基礎設施。

3. 經濟性與效率

官方強調「Performance-per-dollar」的提升,尤其在低延遲推理場景中,成本效益可提升約 80%。這對企業部署大規模 Agent 系統至關重要。

三、對產業與日常應用的影響

1. 對企業與開發者

  • 訓練成本下降,有助於更多企業自行微調大型模型。
  • 推理延遲降低,使即時 Agent(客服、自動化工作流、多步驟推理)更實用。
  • Google Cloud 的 AI Hypercomputer 架構將硬體、軟體與網路整合,降低部署門檻。

2. 對香港與亞洲市場

香港企業若需部署私有 LLM、企業級 Agent 或高吞吐推理服務,可評估 Google Cloud 的 TPU 資源。相較純 GPU 方案,專用 TPU 在特定工作負載上可能更具成本優勢。

同時,本地技術團隊也可協助企業進行:

  • 模型遷移與效能調優
  • 私有 LLM 與 Agent 系統的架構設計
  • 混合雲或地端部署規劃

四、專業評價與前瞻

優勢觀察
Google 將訓練與推理晶片分開設計,反映 AI 工作負載已明顯分化。針對 Agentic AI 的優化,顯示其對未來應用方向的判斷。

需要留意的地方

  • 這些晶片目前主要透過 Google Cloud 提供,並非消費級產品。
  • 實際效能與成本需視具體模型與工作負載而定,企業應進行實測。
  • 與 NVIDIA 等通用 GPU 生態相比,TPU 的軟體生態仍相對封閉。

整體而言,第八代 TPU 的推出,進一步鞏固 Google 在 AI 基礎設施領域的垂直整合優勢,也為企業提供更多高效率的訓練與推理選擇。


參考來源

延伸閱讀 · 相關服務與產品