比較最後更新 2026年10月8日

GPU與NPU的差異(AI推論・邊緣AI比較)

GPU(Graphics Processing Unit)是擅長資料中心大規模AI訓練與推論的通用平行處理器,NPU(Neural Processing Unit)則是專為智慧型手機、IoT裝置的低功耗AI推論而設計的專用核心。AI的「訓練」由GPU負責、邊緣裝置上的「推論」由NPU負責,這樣的分工已成為2020年代的標準。兩者經常並存於SoC中,依工作負載區分使用。

Verdict結論

GPU與NPU最大的差異在於「功耗與負責的角色」。GPU是通用平行處理器,資料中心用的功耗達200~700W,負責大規模AI訓練與推論。NPU是專為神經網路運算設計的MAC陣列,功耗僅0.1~5W,低了好幾個數量級,因此適合在智慧型手機與IoT裝置上進行常時推論(Apple A17 Pro約2W即可達35TOPS)。「訓練用GPU、邊緣推論用NPU」的分工是2020年代的標準。

主要差異

GPU與NPU依比較項目比較
比較項目GPUNPU
設計目的通用平行運算(繪圖、AI訓練、科學運算)AI推論專用(高效率執行NN運算的特定運算子)
核心架構數千~數萬個Shader/CUDA核心+TensorCore專注於MAC(乘積累加)陣列的小型專用電路
功耗200~700W(資料中心用)、10~25W(行動裝置用)0.1~5W(行動裝置用NPU,可常時推論)
每瓦AI推論效能在資料中心用途中效能高(H100:2000TOPS)邊緣用途的電力效率為GPU的10~50倍(Apple A17 Pro:35TOPS,約2W)
可程式性高(可透過CUDA、ROCm靈活撰寫任意運算)有限(基本上經由特定運算子函式庫,支援新運算子有時需要較長時間)
主要搭載裝置AI伺服器、工作站、電競PC、汽車智慧型手機SoC、穿戴式裝置、智慧攝影機、車用ECU
代表產品NVIDIA H100/B200、AMD Instinct MI300X、Intel ArcApple Neural Engine(A/M-series)、Qualcomm Hexagon、MediaTek APU

NPU需求產生的背景:邊緣AI崛起

自2017年Apple A11 Bionic首度搭載Neural Engine以來,主要智慧型手機SoC整合NPU迅速成為標準。要在抑制電池消耗的同時處理常時啟動的相機AI(臉部辨識、場景判斷)、語音辨識(Siri、Google助理)、生物辨識與即時翻譯,比GPU更具電力效率的NPU不可或缺。隨著生成式AI(LLM)在終端本地推論的需求擴大(Apple Intelligence、Gemini Nano等),2024年以後NPU的TOPS效能競爭日趨激烈。

異質AI:GPU與NPU的協同運作

在最先進的AI系統中,「訓練用雲端GPU、推論用邊緣NPU」的協同模式已經確立。大型LLM的訓練在NVIDIA H100叢集上進行,再以量化、蒸餾、剪枝將模型輕量化,交由智慧型手機NPU推論。在SoC層級,同一晶片內的GPU、NPU、CPU、DSP依工作負載分擔任務,並由OS(iOS、Android)的AI框架(Core ML、NNAPI)進行協調調度。AI加速器的整體解說請參閱AI 加速器,CPU與GPU的比較請參閱CPU與GPU的差異(架構・用途・製程比較)。

常見問題

NPU與GPU哪一種較適合AI推論?
視用途而定。資料中心的大規模AI推論以GPU為主角。在智慧型手機、IoT、車用等以電池驅動的邊緣裝置上,NPU的電力效率(TOPS/W)大幅超越GPU,因此NPU最為合適。
NPU會取代GPU嗎?
在邊緣裝置的輕量推論上,NPU會取代或補足GPU的角色,但在大規模AI訓練或大規模推論伺服器上無法取代GPU。兩者設計目的不同,是互補的存在。
智慧型手機會同時搭載GPU與NPU嗎?
是的。Apple A17 Pro、Qualcomm Snapdragon 8 Gen 3、MediaTek Dimensity 9300等最新SoC都將CPU、GPU、NPU全部整合在一起。分工上由GPU負責遊戲、影片、UI繪製,NPU負責AI推論與相機處理。

延伸閱讀


所屬主題