CPU與GPU最大的差異在於「核心數量與設計理念」。CPU配備4~128個具有大型複雜控制電路的高效能核心,負責循序處理、條件分支,以及OS與應用程式等通用工作,並以大容量的L1/L2/L3快取將延遲降到最低。GPU以數千~數萬個小型核心超平行執行矩陣與張量運算,並透過HBM3或GDDR6X確保1~3TB/s的頻寬。AI訓練的核心由GPU擔任。
主要差異
| 比較項目 | CPU | GPU |
|---|---|---|
| 核心數・架構 | 高效能核心4~128個(附大型複雜控制電路) | 數千~數萬個小型核心(CUDA Core、Streaming Multiprocessor等) |
| 擅長的處理 | 循序處理、條件分支、OS/應用程式等通用工作 | 矩陣運算、張量運算、影像處理等超平行運算 |
| 快取架構 | 大容量L1/L2/L3快取(重視延遲最小化) | 容量小但頻寬高的Shared Memory、L2快取 |
| 記憶體連接 | DDR5、LPDDR5(頻寬:100~200GB/s級) | HBM3/GDDR6X(頻寬:1~3TB/s,AI伺服器用) |
| TDP(熱設計功耗) | 約65~350W(伺服器用最高350W) | 300~700W(NVIDIA H100 SXM:700W,B200:超過1000W) |
| AI訓練效能 | 輔助角色(資料前處理、排程) | 主角(H100:2000TOPS,B200:4500TOPS) |
| 製程範例 | Intel Core Ultra(Intel 4nm)、AMD Ryzen(TSMC 4nm) | NVIDIA H100(TSMC 4nm)、AMD MI300X(TSMC 5nm) |
| 代表產品 | Intel Core Ultra・Xeon、AMD Ryzen・EPYC、Apple M-series | NVIDIA H100/B200、AMD Instinct MI300X、Intel Gaudi3 |
CPU與GPU的分工:異質運算
在現代運算系統中,結合CPU與GPU的「異質運算(heterogeneous computing)」已成為標準。CPU負責OS管理、工作排程與複雜的商業邏輯,GPU/NPU則承接AI推論、影像處理、科學運算等平行度高的工作負載。在AI伺服器中,1台伺服器採用CPU×2+GPU×8的配置相當普遍,CPU與GPU之間以NVLink、PCIe連接。在SoC(智慧型手機、嵌入式)領域,則以將CPU、GPU、NPU、DSP整合於單一晶片的異質SoC為主流。
AI時代GPU朝NPU・ASIC的演進
隨著深度學習興起,GPU的市場價值飆升,輝達的市值已遠遠超越英特爾。另一方面,Google(TPU)、Amazon(Trainium)、微軟(Maia)等主要雲端企業正減少對GPU的依賴,推動AI專用ASIC(AI加速器)的自主研發。智慧型手機方面,在GPU之外另搭載NPU(Neural Processing Unit)作為專用AI核心的SoC已成標準,Apple Neural Engine與Qualcomm Hexagon實現了比GPU更高的AI處理效率。GPU與NPU的比較請參閱GPU與NPU的差異(AI推論・邊緣AI比較)一文,GPU與ASIC的比較請參閱GPU與ASIC的差異(AI推論晶片比較)一文。