GPU與NPU最大的差異在於「功耗與負責的角色」。GPU是通用平行處理器,資料中心用的功耗達200~700W,負責大規模AI訓練與推論。NPU是專為神經網路運算設計的MAC陣列,功耗僅0.1~5W,低了好幾個數量級,因此適合在智慧型手機與IoT裝置上進行常時推論(Apple A17 Pro約2W即可達35TOPS)。「訓練用GPU、邊緣推論用NPU」的分工是2020年代的標準。
主要差異
| 比較項目 | GPU | NPU |
|---|---|---|
| 設計目的 | 通用平行運算(繪圖、AI訓練、科學運算) | AI推論專用(高效率執行NN運算的特定運算子) |
| 核心架構 | 數千~數萬個Shader/CUDA核心+TensorCore | 專注於MAC(乘積累加)陣列的小型專用電路 |
| 功耗 | 200~700W(資料中心用)、10~25W(行動裝置用) | 0.1~5W(行動裝置用NPU,可常時推論) |
| 每瓦AI推論效能 | 在資料中心用途中效能高(H100:2000TOPS) | 邊緣用途的電力效率為GPU的10~50倍(Apple A17 Pro:35TOPS,約2W) |
| 可程式性 | 高(可透過CUDA、ROCm靈活撰寫任意運算) | 有限(基本上經由特定運算子函式庫,支援新運算子有時需要較長時間) |
| 主要搭載裝置 | AI伺服器、工作站、電競PC、汽車 | 智慧型手機SoC、穿戴式裝置、智慧攝影機、車用ECU |
| 代表產品 | NVIDIA H100/B200、AMD Instinct MI300X、Intel Arc | Apple Neural Engine(A/M-series)、Qualcomm Hexagon、MediaTek APU |
NPU需求產生的背景:邊緣AI崛起
自2017年Apple A11 Bionic首度搭載Neural Engine以來,主要智慧型手機SoC整合NPU迅速成為標準。要在抑制電池消耗的同時處理常時啟動的相機AI(臉部辨識、場景判斷)、語音辨識(Siri、Google助理)、生物辨識與即時翻譯,比GPU更具電力效率的NPU不可或缺。隨著生成式AI(LLM)在終端本地推論的需求擴大(Apple Intelligence、Gemini Nano等),2024年以後NPU的TOPS效能競爭日趨激烈。
異質AI:GPU與NPU的協同運作
在最先進的AI系統中,「訓練用雲端GPU、推論用邊緣NPU」的協同模式已經確立。大型LLM的訓練在NVIDIA H100叢集上進行,再以量化、蒸餾、剪枝將模型輕量化,交由智慧型手機NPU推論。在SoC層級,同一晶片內的GPU、NPU、CPU、DSP依工作負載分擔任務,並由OS(iOS、Android)的AI框架(Core ML、NNAPI)進行協調調度。AI加速器的整體解說請參閱AI 加速器,CPU與GPU的比較請參閱CPU與GPU的差異(架構・用途・製程比較)。