AI加速器是為了以高速、省電方式執行機器學習與深度學習的訓練(Training)及推論(Inference)處理而設計的專用半導體晶片總稱。相對於通用CPU、GPU,它結合專門處理矩陣運算、張量運算、稀疏運算的運算單元與高頻寬記憶體介面,大幅提升AI工作負載的處理效率。主要類別有GPU(NVIDIA H100/B200)、雲端用ASIC(Google TPU、AWS Trainium、Microsoft Azure Maia)、邊緣用NPU(Apple Neural Engine、Qualcomm Hexagon)。
AI加速器市場由輝達擁有壓倒性市占率(截至2024年約80%),同時Google、Amazon、Microsoft、Meta等超大規模雲端業者也以自研ASIC推進自主化。訓練用途必須搭配HBM(高頻寬記憶體),NVIDIA H100搭載80GB的HBM3。推論用途重視省電與小型化,將NPU整合到邊緣裝置為主流。小晶片設計(運算晶粒+I/O晶粒分離)也日益普及。
AI加速器的製造與台積電CoWoS(2.5D封裝)、InFO等先進封裝技術一同演進。將以台積電N4/N3節點製造的GPU晶粒與HBM並排置於矽中介層上的CoWoS封裝,已成為高效能AI伺服器的標準配置。2025~2026年間,Blackwell(輝達)、Trainium3(AWS)、TPU v6(Google)的大量生產持續推進,推升對台積電與Samsung Foundry的需求。也請參閱ASIC與FPGA的差異(效能、成本與用途比較)的比較文章。