Verdict結論
HBM與GDDR6最大的差異在於「封裝方式與匯流排寬度」。HBM以TSV將DRAM晶粒進行3D堆疊,再經由矽中介層與GPU連接,1個堆疊為1024bit,HBM3E可實現1.2TB/s的頻寬,是AI資料中心不可或缺的記憶體。GDDR6是將個別封裝晶片安裝在PCB上的方式,每1顆晶片32bit,雖然頻寬較差但成本低,廣泛用於遊戲用GPU等一般用途。
主要差異
| 比較面向 | HBM(以HBM3E為基準) | GDDR6 / GDDR6X |
|---|---|---|
| 最大頻寬(1個堆疊/晶片) | HBM3E:1.2TB/s(8個堆疊合計) | GDDR6X:約80GB/s × 12顆 = 960GB/s(RTX 4090) |
| 匯流排寬度 | 1024bit(1個堆疊) | 32bit(1顆晶片) |
| 結構 | 以TSV將多顆DRAM晶粒3D堆疊,透過矽中介層連接GPU | 將個別封裝晶片安裝在PCB上 |
| 功耗 | 相對於高頻寬,功耗效率優異(HBM3E約460GB/s/W) | GDDR6X每單位頻寬的功耗高於HBM |
| 成本 | 非常昂貴(HBM3E每1個堆疊數萬日圓起) | 便宜許多(GDDR6每1顆晶片數千日圓起) |
| 搭載封裝 | 必須使用矽中介層(CoWoS等) | 可直接安裝在PCB上(標準封裝) |
| 主要用途 | AI資料中心GPU(H100/H200/B200)・HPC・AI加速器 | 遊戲用GPU(RTX 4090等)・工作站・一般繪圖 |
| 主要廠商 | SK 海力士(業界第一)・美光・三星 | 三星・SK 海力士・美光・Kingston |
| 取得容易度・通用性 | 供應有限(因AI需求而缺貨) | 作為通用品大量供應,設計資產豐富 |
為什麼AI GPU必須使用HBM
大型語言模型(LLM)的訓練・推論需要高速讀寫數百億~數千億個參數,記憶體頻寬因此成為瓶頸。NVIDIA H100搭載HBM3(80GB、3.35TB/s),相較於A100(HBM2e、2TB/s)實現約1.6倍的頻寬。GDDR6在頻寬、功耗效率與安裝面積各方面都無法滿足AI GPU的需求,因此在資料中心AI用途上,HBM已成為實質上的標準。
HBM市場的供應限制及其對AI半導體的影響
HBM需要TSV形成、晶圓接合與CoWoS封裝,製造流程比一般DRAM複雜,擴充產能需要時間。2023~2024年AI需求急增,使HBM3/3E長期供不應求,SK 海力士獨家供應NVIDIA H200用的HBM3E等情況顯示,HBM的供應能力正左右著AI半導體的產量。
常見問題
HBM與GDDR6哪一個比較快?
HBM快得多。HBM3E(搭載8個堆疊時)的總頻寬約1.2TB/s,而搭載GDDR6X的RTX 4090也只有約960GB/s。此外,HBM的匯流排寬度大幅領先,能以較少的腳位數實現高頻寬,這一點也較為優異。
遊戲用GPU不使用HBM嗎?
基於成本考量,遊戲用途幾乎沒有採用案例。雖然AMD Radeon Pro WX 9100等部分專業用產品曾採用HBM2,但消費級遊戲市場仍以GDDR6/6X為主流。
GDDR7能與HBM抗衡嗎?
GDDR7(最大頻寬約192GB/s×晶片)的頻寬效率有所改善,但與HBM4(目標2TB/s以上)的頻寬差距依然很大,預料資料中心AI GPU仍將由HBM維持優勢。
延伸閱讀
Compare