GPU與ASIC最大的差異在於「通用性與電力效率之間的取捨」。GPU可對應所有AI模型與演算法,且為現成品可立即採購,但由於是通用設計,最佳化有其極限。ASIC針對特定模型或運算子最佳化,可實現同等效能GPU的2~5倍電力效率;但從設計到投片需要1.5~3年,開發費用高達數十~數百億日圓。這正是超大規模雲端業者推動ASIC自研的原因。
主要差異
| 比較項目 | GPU(通用AI) | ASIC(特定用途專用) |
|---|---|---|
| 通用性 | 高(對應所有AI模型與演算法) | 低(針對特定模型、運算子最佳化) |
| 開發期間・成本 | 為現成品,可立即採購 | 從設計到投片需1.5~3年,開發費用數十~數百億日圓 |
| 電力效率(推論) | 通用設計,最佳化有其極限 | 經最佳化,可達同等效能GPU的2~5倍電力效率 |
| 推論成本(大量處理時) | 高(GPU採購費與電費皆高昂) | 量產後低(製造成本與電費皆降低) |
| 可程式性 | 高(可透過CUDA、ROCm靈活對應) | 低(設計變更需要重新投片) |
| 代表產品 | NVIDIA H100/B200/GB200、AMD MI300X | Google TPU v5、AWS Trainium2、Microsoft Maia、Apple M-series Neural Engine |
| 製程 | TSMC 4nm(H100)、3nm(B200等) | 台積電最先進節點(TPU v5:7nm,Trainium2:相當於3nm) |
超大規模雲端業者加速ASIC自研
Google自TPU v1(2016年)起率先投入自研AI晶片,目前推出TPU v5e與TPU v5p。AWS開發並部署Trainium(訓練)與Inferentia(推論),微軟有Azure Maia,Meta則有MTIA(Meta Training and Inference Accelerator)。這些晶片都是針對自家AI工作負載(TensorFlow、PyTorch)所設計,在相同工作負載下實現比NVIDIA GPU更高的電力效率。另一方面,新創企業與大學、研究機構多半選擇通用性高的GPU;ASIC則是在工作負載固定的大規模量產用途中才能符合成本效益。
FPGA:介於GPU與ASIC之間的選項
FPGA是可變更設計的彈性硬體,雖然難以達到ASIC等級的最佳化,但能以比GPU更省電、更低延遲的方式進行推論。Microsoft Azure將FPGA(Catapult)用於Bing搜尋引擎的AI推論,以因應AI模型的快速更新。不過在大規模平行處理上不及GPU,因此用途有限。ASIC與FPGA的詳細比較請參閱ASIC與FPGA的差異(效能、成本與用途比較)一文,AI加速器的整體概要也請參閱AI 加速器。