TPU(Tensor Processing Unit:張量處理器)是Google於2016年自行開發並發表的AI訓練與推論專用ASIC(特定應用積體電路)。其設計針對TensorFlow框架的張量運算(多維陣列的矩陣乘法)最佳化,能以比GPU更高的電力效率處理深度學習工作負載。在Google Cloud Platform(GCP)上從TPU v2到v5持續世代更新,截至2024年提供TPU v5e與TPU v5p。
TPU的架構結合了大規模矩陣乘法單元(MXU:Matrix Multiply Unit)與晶片上記憶體(HBM)。TPU v4每1顆晶片具備275TOPS的運算效能,將4096顆晶片互連的「TPU Pod系統」可實現超過1 exaFLOPS的效能。透過採用BFloat16(Brain浮點格式),在維持精度的同時提高運算效率。由台積電負責製造。
TPU是Google自有垂直整合策略的核心,用於Gemini、PaLM等大型語言模型(LLM)的訓練與推論。專門以雲端形式提供,不對外銷售(與AWS Trainium、Microsoft Azure Maia同為自研ASIC)。與NPU(智慧型手機用邊緣推論)及GPU(通用AI)的差異,請參閱AI 加速器的用語。ASIC與FPGA的設計架構比較,則在ASIC與FPGA的差異(效能、成本與用途比較)的文章中說明。