HBM vs DDR5:AI GPU 顯示記憶體與伺服器系統記憶體有何分別?
目錄
HBM 與 DDR5 都屬 DRAM,但在 AI 伺服器內負責不同工作。 HBM 透過先進封裝靠近 GPU/ASIC,主要提供加速器本地頻寬;DDR5 通常以 DIMM 連接 CPU,提供容量較大、可擴充的主機系統記憶體。[1] [2]
兩者通常同時存在。資料和模型可由 SSD 進入 DDR5,再傳到加速器 HBM;CPU、GPU、網絡與儲存的工作亦會在不同層之間移動。所以「HBM 會不會取代 DDR5」不是最有效的問題;投資者應先判斷瓶頸發生在加速器頻寬、主機容量,還是兩層之間的資料搬移。
本文證據截至 2026 年 9 月 2 日。產品峰值只用來說明特定配置,不建立跨所有伺服器通用的效能倍數。
HBM 和 DDR5 在伺服器內怎樣分工?
| 比較維度 | HBM | DDR5 |
|---|---|---|
| 主要使用者 | GPU/ASIC/加速器 | CPU/主機系統 |
| 系統位置 | 與計算晶片同封裝或非常接近 | 主機板 DIMM/焊接模組,連接 CPU 控制器 |
| 主要任務 | 高吞吐讀取權重、activation、KV Cache 和中間資料 | 作業系統、資料準備、CPU 工作負載、較大工作集和緩存 |
| 優先目標 | 總頻寬、頻寬/瓦特、封裝密度 | 容量、通用性、模組化、每 bit 成本與維修 |
| 擴充方法 | 增加 stack、堆疊高度或改變加速器封裝 | 增加通道、DIMM、單模組容量或 CXL 擴充層 |
| 主要限制 | 封裝面積、良率、功耗、合格供應與固定容量 | CPU 通道、插槽、訊號完整性、速度/容量取捨 |
AMD 的記憶體技術資料亦把 HBM 列為內部/整合式高頻寬記憶體,把 DDR5 列為外部記憶體接口,這個物理位置差異比單一峰值規格更耐久。[3]
為甚麼 HBM 頻寬高,DDR5 容量較易擴充?
HBM 使用寬達大量 I/O 的短距離接口,讓許多資料同時進出加速器。DDR5 透過 CPU 記憶體通道與 DIMM 擴充,板級距離較長、接口較窄,但標準模組可按伺服器平台增加容量,也較容易安裝與更換。
AMD 曾以其特定 Versal HBM 與 Versal Premium 配置比較,列出最高約 6 倍頻寬和每 bit 功耗低 65%的結果。這是同一廠商特定裝置的內部分析,證明「靠近計算+超寬接口」的工程效果,不能外推為所有 HBM 對所有 DDR5 伺服器的固定倍數。[4]
容量方面,HBM 在加速器製造時已固定;增加 stack 會消耗封裝面積並提高組裝、測試與散熱難度。DDR5 則能使用更多或更高容量 DIMM,代價是 CPU 可支援的通道、插槽和速度有限。因此,HBM 擅長保存最需要頻寬的工作集,DDR5 擅長承載更大的主機工作集。
資料從 SSD、DDR5 到 HBM 怎樣移動?
一個簡化的 AI 資料路徑是:
企業 SSD/網絡儲存
→ DDR5 主機記憶體:載入、解碼、排程、緩存
→ PCIe/專用互連
→ HBM:GPU/ASIC 反覆讀取權重與中間資料
→ 結果返回主機、網絡或儲存
實際系統可使用直接儲存、統一虛擬位址、CPU–GPU 一致性、資料並行或模型切分,但判斷方法相同:資料若不能留在最快的一層,就要付出搬移時間和能耗。Micron 的 AI 資料中心產品地圖把 HBM、DDR5/MRDIMM/SOCAMM 和資料中心 SSD 放在同一系統,亦反映 AI 記憶體需求不是單一品類。[6]
若要判斷完整 AI memory hierarchy,還要把快取、GDDR/SOCAMM、CXL 與企業 SSD 加入同一資料流;AI 記憶體階層按資料溫度與搬移成本比較這些層級。
CXL 可以用 DDR5 取代 HBM 嗎?
CXL 可讓處理器以一致性協定接觸擴充記憶體,CXL 2.0 亦加入 switching 與 memory pooling,讓容量能在多個主機或裝置之間更有效分配。[5]
它主要改善「容量不足或配置僵化」問題,不能把較遠的 DDR5 自動變成加速器封裝內 HBM 的頻寬與延遲。CXL 層還要考慮鏈路、switch、裝置控制器、NUMA 拓撲和軟件放置策略。更準確的關係是:
- HBM:保存最熱、最需要頻寬的加速器工作集;
- DDR5:保存 CPU/主機側較大的工作集;
- CXL memory:擴充或池化部分較冷、容量敏感的工作集;
- SSD:保存更大、持久化但存取較慢的資料。
只有工作負載實測能判斷多一層容量是否抵銷額外資料搬移成本。
哪種瓶頸對應哪一層記憶體?
| 系統症狀 | 先核對的變數 | 主要相關層 |
|---|---|---|
| GPU 算力高但利用率低 | HBM 頻寬、kernel 資料重用、加速器互連 | HBM/軟件 |
| 模型或 KV Cache 放不進加速器 | HBM 容量、量化、切分、卸載策略 | HBM+DDR5/CXL |
| CPU 預處理或資料載入拖慢 | DDR5 通道、容量、CPU、儲存與 PCIe | DDR5+SSD |
| 增加 batch 後延遲急升 | 工作集、頻寬、排隊、資料搬移 | HBM 或 GDDR+互連 |
| 容量利用不均、部分主機閒置 | pooling、NUMA、軟件配置 | DDR5+CXL |
這張表不替代 benchmark,而是把「記憶體不夠」拆成可驗證假設。若瓶頸是 GPU 本地頻寬,單純增加 DDR5 容量不會直接修復;若瓶頸是主機資料準備,增加 HBM 亦未必提高端到端吞吐。
對記憶體供應商的投資含義是甚麼?
AI 伺服器增加時,HBM 與 DDR5 可能同時受惠,但收入驅動不同:HBM 要核對產品世代、客戶平台、stack 良率、base die、封裝和合格出貨;DDR5 要核對伺服器出貨、每台容量、DIMM mix、合約價、庫存和 CPU 平台。兩者都要由出貨和 ASP 走到毛利、存貨、應收、CFO 與 CapEx,才能判斷股東現金。
Samsung、SK hynix 與 Micron 的 HBM/DRAM 暴露和財務口徑可在 記憶體三雄比較繼續核對;產品價格、庫存與產能則見 記憶體週期。
常見問題:HBM、DDR5 與系統記憶體
HBM 是顯示記憶體,DDR5 是系統記憶體嗎? 在常見 GPU 伺服器中可以這樣理解:HBM 是加速器本地記憶體,DDR5 是 CPU/主機系統記憶體。兩者都屬 DRAM,但接口、封裝、容量、升級方法和主要使用者不同。
HBM 比 DDR5 快多少? 沒有跨平台固定倍數。必須同時列出 HBM 世代、stack 數、GPU 配置、CPU 記憶體通道、DIMM 數量和測量層級;廠商倍數只能用於其列明產品。
AI 伺服器能否只用 HBM、不用 DDR5? 常見 GPU 伺服器仍要由 CPU 執行作業系統、排程、資料準備和 I/O,因此通常同時配置主機 DRAM 與加速器 HBM。專用 SoC 或統一記憶體架構可能採用不同設計,不能外推所有伺服器。
HBM 與 GDDR 又有何分別? 兩者都可作為加速器本地記憶體;HBM 用堆疊、超寬接口和先進封裝取得頻寬,GDDR 用離散晶片和高單針速率取得頻寬。完整比較見 HBM vs GDDR。
Klaro Research
資料來源與更新依據
資料截止:2026年9月2日
- [1] Samsung Semiconductor High Bandwidth Memory 產品與技術說明
第一方 · 原始資料 · 查閲:2026年9月2日
- [2] Samsung Semiconductor DDR5 產品與應用說明
第一方 · 原始資料 · 查閲:2026年9月2日
- [3] AMD AMD Memory 技術與外部記憶體接口
第一方 · 原始資料 · 查閲:2026年9月2日
- [4] AMD Versal HBM Series 與 DDR5 特定配置比較
第一方 · 原始資料 · 查閲:2026年9月2日
- [5] Compute Express Link Consortium CXL 2.0 記憶體擴充與 pooling 說明
權威資料 · 原始資料 · 發佈:2020年11月10日 · 查閲:2026年9月2日
- [6] Micron Technology AI 資料中心記憶體與儲存產品地圖
第一方 · 原始資料 · 查閲:2026年9月2日
研究限制
- HBM 與 DDR5 的實際頻寬、容量、功耗和延遲取決於世代、處理器、通道、DIMM、stack 與軟件,沒有跨所有平台通用的倍數。
- CXL 可延伸或共享系統記憶體,但拓撲、協定、軟件和裝置會增加延遲與頻寬限制;本文不把它視為 HBM 等價替代。
需要重新檢查的事件
- 主要 AI 伺服器平台改變 HBM、DDR5、SOCAMM/MRDIMM 或 CXL 的系統角色與配置時更新。
- 新一代 HBM/DDR 標準或 CXL 記憶體 pooling 出現大規模部署證據,令容量與資料搬移結論改變時重核。
本文僅供參考,不構成投資建議。