比較最後更新 2026年10月8日

GPU與ASIC的差異(AI推論晶片比較)

GPU(Graphics Processing Unit)通用性高,能對應所有AI模型;ASIC(Application-Specific Integrated Circuit:特定應用積體電路)則以專為特定工作負載設計的方式,將電力效率與推論效能最大化。超大規模雲端業者(Google、Amazon、微軟等)為了降低GPU採購成本與對供應商的依賴風險,正推動ASIC自研,AI晶片的多樣化正在加速。

Verdict結論

GPU與ASIC最大的差異在於「通用性與電力效率之間的取捨」。GPU可對應所有AI模型與演算法,且為現成品可立即採購,但由於是通用設計,最佳化有其極限。ASIC針對特定模型或運算子最佳化,可實現同等效能GPU的2~5倍電力效率;但從設計到投片需要1.5~3年,開發費用高達數十~數百億日圓。這正是超大規模雲端業者推動ASIC自研的原因。

主要差異

GPU(通用AI)與ASIC(特定用途專用)依比較項目比較
比較項目GPU(通用AI)ASIC(特定用途專用)
通用性高(對應所有AI模型與演算法)低(針對特定模型、運算子最佳化)
開發期間・成本為現成品,可立即採購從設計到投片需1.5~3年,開發費用數十~數百億日圓
電力效率(推論)通用設計,最佳化有其極限經最佳化,可達同等效能GPU的2~5倍電力效率
推論成本(大量處理時)高(GPU採購費與電費皆高昂)量產後低(製造成本與電費皆降低)
可程式性高(可透過CUDA、ROCm靈活對應)低(設計變更需要重新投片)
代表產品NVIDIA H100/B200/GB200、AMD MI300XGoogle TPU v5、AWS Trainium2、Microsoft Maia、Apple M-series Neural Engine
製程TSMC 4nm(H100)、3nm(B200等)台積電最先進節點(TPU v5:7nm,Trainium2:相當於3nm)

超大規模雲端業者加速ASIC自研

Google自TPU v1(2016年)起率先投入自研AI晶片,目前推出TPU v5e與TPU v5p。AWS開發並部署Trainium(訓練)與Inferentia(推論),微軟有Azure Maia,Meta則有MTIA(Meta Training and Inference Accelerator)。這些晶片都是針對自家AI工作負載(TensorFlow、PyTorch)所設計,在相同工作負載下實現比NVIDIA GPU更高的電力效率。另一方面,新創企業與大學、研究機構多半選擇通用性高的GPU;ASIC則是在工作負載固定的大規模量產用途中才能符合成本效益。

FPGA:介於GPU與ASIC之間的選項

FPGA是可變更設計的彈性硬體,雖然難以達到ASIC等級的最佳化,但能以比GPU更省電、更低延遲的方式進行推論。Microsoft Azure將FPGA(Catapult)用於Bing搜尋引擎的AI推論,以因應AI模型的快速更新。不過在大規模平行處理上不及GPU,因此用途有限。ASIC與FPGA的詳細比較請參閱ASIC與FPGA的差異(效能、成本與用途比較)一文,AI加速器的整體概要也請參閱AI 加速器。

常見問題

AI推論應該選擇GPU還是ASIC?
在工作負載固定且量大的資料中心推論中,ASIC的電力效率較佳。在研究、開發、模型經常變更的用途或小規模情況下,GPU的通用性較有利。這正是NVIDIA GPU市場快速成長的同時,超大規模雲端業者也同步推動ASIC自研的背景。
Google的TPU比GPU快嗎?
在自家AI工作負載(經由TensorFlow/XLA編譯器)上,TPU在相同功耗範圍內實現了比GPU更高的推論吞吐量。不過通用性不及GPU,在支援PyTorch等其他框架的易用性上,GPU較具優勢。
開發ASIC需要多少成本?
以TSMC 5~3nm節點進行先進ASIC的投片,費用達數十億~數百億日圓,開發期間從設計到量產一般需要2~3年。因此只有預計量產數百萬~數千萬顆的大企業或超大規模雲端業者才能符合成本效益。

延伸閱讀


所屬主題