HBM vs DDR5:AI GPU 顯示記憶體與伺服器系統記憶體有何分別?

作者 Klaro 編輯部 ·發佈於 2026年7月21日 ·最後更新2026年9月2日

靠近 AI 加速器的 HBM 堆疊與伺服器主機板上的 DDR5 DIMM 並列
HBM 提供加速器本地高頻寬,DDR5 提供 CPU/主機側容量;圖片為結構概念示意。
目錄

HBM 與 DDR5 都屬 DRAM,但在 AI 伺服器內負責不同工作。 HBM 透過先進封裝靠近 GPU/ASIC,主要提供加速器本地頻寬;DDR5 通常以 DIMM 連接 CPU,提供容量較大、可擴充的主機系統記憶體。[1] [2]

兩者通常同時存在。資料和模型可由 SSD 進入 DDR5,再傳到加速器 HBM;CPU、GPU、網絡與儲存的工作亦會在不同層之間移動。所以「HBM 會不會取代 DDR5」不是最有效的問題;投資者應先判斷瓶頸發生在加速器頻寬、主機容量,還是兩層之間的資料搬移。

本文證據截至 2026 年 9 月 2 日。產品峰值只用來說明特定配置,不建立跨所有伺服器通用的效能倍數。

HBM 和 DDR5 在伺服器內怎樣分工?

比較維度 HBM DDR5
主要使用者 GPU/ASIC/加速器 CPU/主機系統
系統位置 與計算晶片同封裝或非常接近 主機板 DIMM/焊接模組,連接 CPU 控制器
主要任務 高吞吐讀取權重、activation、KV Cache 和中間資料 作業系統、資料準備、CPU 工作負載、較大工作集和緩存
優先目標 總頻寬、頻寬/瓦特、封裝密度 容量、通用性、模組化、每 bit 成本與維修
擴充方法 增加 stack、堆疊高度或改變加速器封裝 增加通道、DIMM、單模組容量或 CXL 擴充層
主要限制 封裝面積、良率、功耗、合格供應與固定容量 CPU 通道、插槽、訊號完整性、速度/容量取捨

AMD 的記憶體技術資料亦把 HBM 列為內部/整合式高頻寬記憶體,把 DDR5 列為外部記憶體接口,這個物理位置差異比單一峰值規格更耐久。[3]

為甚麼 HBM 頻寬高,DDR5 容量較易擴充?

HBM 使用寬達大量 I/O 的短距離接口,讓許多資料同時進出加速器。DDR5 透過 CPU 記憶體通道與 DIMM 擴充,板級距離較長、接口較窄,但標準模組可按伺服器平台增加容量,也較容易安裝與更換。

AMD 曾以其特定 Versal HBM 與 Versal Premium 配置比較,列出最高約 6 倍頻寬和每 bit 功耗低 65%的結果。這是同一廠商特定裝置的內部分析,證明「靠近計算+超寬接口」的工程效果,不能外推為所有 HBM 對所有 DDR5 伺服器的固定倍數。[4]

容量方面,HBM 在加速器製造時已固定;增加 stack 會消耗封裝面積並提高組裝、測試與散熱難度。DDR5 則能使用更多或更高容量 DIMM,代價是 CPU 可支援的通道、插槽和速度有限。因此,HBM 擅長保存最需要頻寬的工作集,DDR5 擅長承載更大的主機工作集。

資料從 SSD、DDR5 到 HBM 怎樣移動?

一個簡化的 AI 資料路徑是:

企業 SSD/網絡儲存
→ DDR5 主機記憶體:載入、解碼、排程、緩存
→ PCIe/專用互連
→ HBM:GPU/ASIC 反覆讀取權重與中間資料
→ 結果返回主機、網絡或儲存

實際系統可使用直接儲存、統一虛擬位址、CPU–GPU 一致性、資料並行或模型切分,但判斷方法相同:資料若不能留在最快的一層,就要付出搬移時間和能耗。Micron 的 AI 資料中心產品地圖把 HBM、DDR5/MRDIMM/SOCAMM 和資料中心 SSD 放在同一系統,亦反映 AI 記憶體需求不是單一品類。[6]

若要判斷完整 AI memory hierarchy,還要把快取、GDDR/SOCAMM、CXL 與企業 SSD 加入同一資料流;AI 記憶體階層按資料溫度與搬移成本比較這些層級。

CXL 可以用 DDR5 取代 HBM 嗎?

CXL 可讓處理器以一致性協定接觸擴充記憶體,CXL 2.0 亦加入 switching 與 memory pooling,讓容量能在多個主機或裝置之間更有效分配。[5]

它主要改善「容量不足或配置僵化」問題,不能把較遠的 DDR5 自動變成加速器封裝內 HBM 的頻寬與延遲。CXL 層還要考慮鏈路、switch、裝置控制器、NUMA 拓撲和軟件放置策略。更準確的關係是:

  • HBM:保存最熱、最需要頻寬的加速器工作集;
  • DDR5:保存 CPU/主機側較大的工作集;
  • CXL memory:擴充或池化部分較冷、容量敏感的工作集;
  • SSD:保存更大、持久化但存取較慢的資料。

只有工作負載實測能判斷多一層容量是否抵銷額外資料搬移成本。

哪種瓶頸對應哪一層記憶體?

系統症狀 先核對的變數 主要相關層
GPU 算力高但利用率低 HBM 頻寬、kernel 資料重用、加速器互連 HBM/軟件
模型或 KV Cache 放不進加速器 HBM 容量、量化、切分、卸載策略 HBM+DDR5/CXL
CPU 預處理或資料載入拖慢 DDR5 通道、容量、CPU、儲存與 PCIe DDR5+SSD
增加 batch 後延遲急升 工作集、頻寬、排隊、資料搬移 HBM 或 GDDR+互連
容量利用不均、部分主機閒置 pooling、NUMA、軟件配置 DDR5+CXL

這張表不替代 benchmark,而是把「記憶體不夠」拆成可驗證假設。若瓶頸是 GPU 本地頻寬,單純增加 DDR5 容量不會直接修復;若瓶頸是主機資料準備,增加 HBM 亦未必提高端到端吞吐。

對記憶體供應商的投資含義是甚麼?

AI 伺服器增加時,HBM 與 DDR5 可能同時受惠,但收入驅動不同:HBM 要核對產品世代、客戶平台、stack 良率、base die、封裝和合格出貨;DDR5 要核對伺服器出貨、每台容量、DIMM mix、合約價、庫存和 CPU 平台。兩者都要由出貨和 ASP 走到毛利、存貨、應收、CFO 與 CapEx,才能判斷股東現金。

Samsung、SK hynix 與 Micron 的 HBM/DRAM 暴露和財務口徑可在 記憶體三雄比較繼續核對;產品價格、庫存與產能則見 記憶體週期。

常見問題:HBM、DDR5 與系統記憶體

HBM 是顯示記憶體,DDR5 是系統記憶體嗎? 在常見 GPU 伺服器中可以這樣理解:HBM 是加速器本地記憶體,DDR5 是 CPU/主機系統記憶體。兩者都屬 DRAM,但接口、封裝、容量、升級方法和主要使用者不同。

HBM 比 DDR5 快多少? 沒有跨平台固定倍數。必須同時列出 HBM 世代、stack 數、GPU 配置、CPU 記憶體通道、DIMM 數量和測量層級;廠商倍數只能用於其列明產品。

AI 伺服器能否只用 HBM、不用 DDR5? 常見 GPU 伺服器仍要由 CPU 執行作業系統、排程、資料準備和 I/O,因此通常同時配置主機 DRAM 與加速器 HBM。專用 SoC 或統一記憶體架構可能採用不同設計,不能外推所有伺服器。

HBM 與 GDDR 又有何分別? 兩者都可作為加速器本地記憶體;HBM 用堆疊、超寬接口和先進封裝取得頻寬,GDDR 用離散晶片和高單針速率取得頻寬。完整比較見 HBM vs GDDR。

Klaro Research

資料來源與更新依據

資料截止:2026年9月2日

  1. [1] Samsung Semiconductor High Bandwidth Memory 產品與技術說明

    第一方 · 原始資料 · 查閲:2026年9月2日

  2. [2] Samsung Semiconductor DDR5 產品與應用說明

    第一方 · 原始資料 · 查閲:2026年9月2日

  3. [3] AMD AMD Memory 技術與外部記憶體接口

    第一方 · 原始資料 · 查閲:2026年9月2日

  4. [4] AMD Versal HBM Series 與 DDR5 特定配置比較

    第一方 · 原始資料 · 查閲:2026年9月2日

  5. [5] Compute Express Link Consortium CXL 2.0 記憶體擴充與 pooling 說明

    權威資料 · 原始資料 · 發佈:2020年11月10日 · 查閲:2026年9月2日

  6. [6] Micron Technology AI 資料中心記憶體與儲存產品地圖

    第一方 · 原始資料 · 查閲:2026年9月2日

研究限制

  • HBM 與 DDR5 的實際頻寬、容量、功耗和延遲取決於世代、處理器、通道、DIMM、stack 與軟件,沒有跨所有平台通用的倍數。
  • CXL 可延伸或共享系統記憶體,但拓撲、協定、軟件和裝置會增加延遲與頻寬限制;本文不把它視為 HBM 等價替代。

需要重新檢查的事件

  • 主要 AI 伺服器平台改變 HBM、DDR5、SOCAMM/MRDIMM 或 CXL 的系統角色與配置時更新。
  • 新一代 HBM/DDR 標準或 CXL 記憶體 pooling 出現大規模部署證據,令容量與資料搬移結論改變時重核。

本文僅供參考,不構成投資建議。