Google Cloud 近日再次強調其第八代 Tensor Processing Unit(TPU)系統的優勢。根據官方說法,TPU 8i 與 TPU 8t 兩款晶片可帶來「可持續的經濟效益」,在低延遲服務場景下,效能/美元比最高提升達 80%,並可無縫擴展至超過 100 萬顆晶片的規模。
這兩款晶片是 Google 首次將訓練與推理功能明確拆分成兩種專用架構,專為「Agentic AI」(代理式 AI)時代而設計。
一、兩款晶片的定位
| 項目 | TPU 8t(Training) | TPU 8i(Inference) |
|---|---|---|
| 主要用途 | 大規模預訓練、Embedding 密集工作負載 | 低延遲推理、Agent 服務、長上下文推理 |
| 單 Pod 規模 | 最高 9,600 顆晶片 | 最高 1,152 顆晶片 |
| 記憶體 | 216 GB HBM | 288 GB HBM + 384 MB 片上 SRAM |
| 峰值效能 | 12.6 FP4 PFLOPs | 10.1 FP4 PFLOPs |
| 網路拓撲 | 3D Torus | Boardfly |
| 效能提升 | 訓練效能/美元最高提升約 2.7 倍 | 低延遲服務效能/美元最高提升約 80% |
TPU 8t 被定位為「訓練動力引擎」,目標是把前沿模型的開發週期從「數月」縮短至「數週」。TPU 8i 則專注於推理與 Agent 工作負載,強調低延遲與高吞吐量。
二、技術亮點
1. 專用架構設計
以往 TPU 多為通用設計,第八代首次針對訓練與推理的不同需求進行分化:
- TPU 8t 強化 SparseCore 與 LLM Decoder Engine,適合大規模預訓練。
- TPU 8i 配備 Collectives Acceleration Engine(CAE),大幅降低多 Agent 與 Mixture-of-Experts 模型的同步延遲。
2. 規模與互連
- TPU 8t 單一 Superpod 可達 9,600 顆晶片,共享 2 PB 高頻寬記憶體。
- 整體系統可擴展至超過 100 萬顆晶片,支援超大規模 AI 基礎設施。
3. 經濟性與效率
官方強調「Performance-per-dollar」的提升,尤其在低延遲推理場景中,成本效益可提升約 80%。這對企業部署大規模 Agent 系統至關重要。
三、對產業與日常應用的影響
1. 對企業與開發者
- 訓練成本下降,有助於更多企業自行微調大型模型。
- 推理延遲降低,使即時 Agent(客服、自動化工作流、多步驟推理)更實用。
- Google Cloud 的 AI Hypercomputer 架構將硬體、軟體與網路整合,降低部署門檻。
2. 對香港與亞洲市場
香港企業若需部署私有 LLM、企業級 Agent 或高吞吐推理服務,可評估 Google Cloud 的 TPU 資源。相較純 GPU 方案,專用 TPU 在特定工作負載上可能更具成本優勢。
同時,本地技術團隊也可協助企業進行:
- 模型遷移與效能調優
- 私有 LLM 與 Agent 系統的架構設計
- 混合雲或地端部署規劃
四、專業評價與前瞻
優勢觀察
Google 將訓練與推理晶片分開設計,反映 AI 工作負載已明顯分化。針對 Agentic AI 的優化,顯示其對未來應用方向的判斷。
需要留意的地方
- 這些晶片目前主要透過 Google Cloud 提供,並非消費級產品。
- 實際效能與成本需視具體模型與工作負載而定,企業應進行實測。
- 與 NVIDIA 等通用 GPU 生態相比,TPU 的軟體生態仍相對封閉。
整體而言,第八代 TPU 的推出,進一步鞏固 Google 在 AI 基礎設施領域的垂直整合優勢,也為企業提供更多高效率的訓練與推理選擇。
參考來源
- Google Cloud 官方帖文:https://x.com/googlecloud/status/2083323071897747667
- Google 官方部落格:第八代 TPU 技術詳解(2026 年 4 月 Google Cloud Next)
- Ars Technica、ServeTheHome 等技術媒體報道