HBM vs DDR5:AI GPU 显存与服务器系统内存有什么区别?

作者 Klaro 编辑部 ·发布于 2026年7月21日 ·最后更新2026年9月2日

靠近 AI 加速器的 HBM 堆叠与服务器主机板上的 DDR5 DIMM 并列
HBM 提供加速器本地高带宽,DDR5 提供 CPU/主机侧容量;图片为结构概念示意。
目录

HBM 与 DDR5 都属 DRAM,但在 AI 服务器内负责不同工作。 HBM 通过先进封装靠近 GPU/ASIC,主要提供加速器本地带宽;DDR5 通常以 DIMM 连接 CPU,提供容量较大、可扩充的主机系统内存。[1] [2]

两者通常同时存在。资料和模型可由 SSD 进入 DDR5,再传到加速器 HBM;CPU、GPU、网络与存储的工作亦会在不同层之间移动。所以「HBM 会不会取代 DDR5」不是最有效的问题;投资者应先判断瓶颈发生在加速器带宽、主机容量,还是两层之间的资料搬移。

本文证据截至 2026 年 9 月 2 日。产品峰值只用来说明特定配置,不建立跨所有服务器通用的效能倍数。

HBM 和 DDR5 在服务器内怎样分工?

比较维度 HBM DDR5
主要使用者 GPU/ASIC/加速器 CPU/主机系统
系统位置 与计算芯片同封装或非常接近 主机板 DIMM/焊接模块,连接 CPU 控制器
主要任务 高吞吐读取权重、activation、KV Cache 和中间资料 作业系统、资料准备、CPU 工作负载、较大工作集和缓存
优先目标 总带宽、带宽/瓦特、封装密度 容量、通用性、模块化、每 bit 成本与维修
扩充方法 增加 stack、堆叠高度或改变加速器封装 增加通道、DIMM、单模块容量或 CXL 扩充层
主要限制 封装面积、良率、功耗、合格供应与固定容量 CPU 通道、插槽、信号完整性、速度/容量取舍

AMD 的内存技术资料亦把 HBM 列为内部/整合式高带宽内存,把 DDR5 列为外部内存接口,这个物理位置差异比单一峰值规格更耐久。[3]

为什么 HBM 带宽高,DDR5 容量较易扩充?

HBM 使用宽达大量 I/O 的短距离接口,让许多资料同时进出加速器。DDR5 通过 CPU 内存通道与 DIMM 扩充,板级距离较长、接口较窄,但标准模块可按服务器平台增加容量,也较容易安装与更换。

AMD 曾以其特定 Versal HBM 与 Versal Premium 配置比较,列出最高约 6 倍带宽和每 bit 功耗低 65%的结果。这是同一厂商特定装置的内部分析,证明「靠近计算+超宽接口」的工程效果,不能外推为所有 HBM 对所有 DDR5 服务器的固定倍数。[4]

容量方面,HBM 在加速器制造时已固定;增加 stack 会消耗封装面积并提高组装、测试与散热难度。DDR5 则能使用更多或更高容量 DIMM,代价是 CPU 可支持的通道、插槽和速度有限。因此,HBM 擅长保存最需要带宽的工作集,DDR5 擅长承载更大的主机工作集。

资料从 SSD、DDR5 到 HBM 怎样移动?

一个简化的 AI 资料路径是:

企业 SSD/网络存储
→ DDR5 主机内存:载入、解码、排程、缓存
→ PCIe/专用互连
→ HBM:GPU/ASIC 反复读取权重与中间资料
→ 结果返回主机、网络或存储

实际系统可使用直接存储、统一虚拟位址、CPU–GPU 一致性、资料并行或模型切分,但判断方法相同:资料若不能留在最快的一层,就要付出搬移时间和能耗。Micron 的 AI 数据中心产品地图把 HBM、DDR5/MRDIMM/SOCAMM 和数据中心 SSD 放在同一系统,亦反映 AI 内存需求不是单一品类。[6]

若要判断完整 AI memory hierarchy,还要把快取、GDDR/SOCAMM、CXL 与企业 SSD 加入同一数据流;AI 内存阶层按资料温度与搬移成本比较这些层级。

CXL 可以用 DDR5 取代 HBM 吗?

CXL 可让处理器以一致性协定接触扩充内存,CXL 2.0 亦加入 switching 与 memory pooling,让容量能在多个主机或装置之间更有效分配。[5]

它主要改善「容量不足或配置僵化」问题,不能把较远的 DDR5 自动变成加速器封装内 HBM 的带宽与延迟。CXL 层还要考虑链路、switch、装置控制器、NUMA 拓扑和软件放置策略。更准确的关系是:

  • HBM:保存最热、最需要带宽的加速器工作集;
  • DDR5:保存 CPU/主机侧较大的工作集;
  • CXL memory:扩充或池化部分较冷、容量敏感的工作集;
  • SSD:保存更大、持久化但存取较慢的资料。

只有工作负载实测能判断多一层容量是否抵销额外资料搬移成本。

哪种瓶颈对应哪一层内存?

系统症状 先核对的变量 主要相关层
GPU 算力高但利用率低 HBM 带宽、kernel 资料重用、加速器互连 HBM/软件
模型或 KV Cache 放不进加速器 HBM 容量、量化、切分、卸载策略 HBM+DDR5/CXL
CPU 预处理或资料载入拖慢 DDR5 通道、容量、CPU、存储与 PCIe DDR5+SSD
增加 batch 后延迟急升 工作集、带宽、排队、资料搬移 HBM 或 GDDR+互连
容量利用不均、部分主机闲置 pooling、NUMA、软件配置 DDR5+CXL

这张表不替代 benchmark,而是把「内存不够」拆成可验证假设。若瓶颈是 GPU 本地带宽,单纯增加 DDR5 容量不会直接修复;若瓶颈是主机资料准备,增加 HBM 亦未必提高端到端吞吐。

对内存供应商的投资含义是什么?

AI 服务器增加时,HBM 与 DDR5 可能同时受益,但收入驱动不同:HBM 要核对产品世代、客户平台、stack 良率、base die、封装和合格出货;DDR5 要核对服务器出货、每台容量、DIMM mix、合约价、库存和 CPU 平台。两者都要由出货和 ASP 走到毛利、存货、应收、CFO 与 CapEx,才能判断股东现金。

Samsung、SK hynix 与 Micron 的 HBM/DRAM 暴露和财务口径可在 内存三雄比较继续核对;产品价格、库存与产能则见 内存周期。

常见问题:HBM、DDR5 与系统内存

HBM 是显示内存,DDR5 是系统内存吗? 在常见 GPU 服务器中可以这样理解:HBM 是加速器本地内存,DDR5 是 CPU/主机系统内存。两者都属 DRAM,但接口、封装、容量、升级方法和主要使用者不同。

HBM 比 DDR5 快多少? 没有跨平台固定倍数。必须同时列出 HBM 世代、stack 数、GPU 配置、CPU 内存通道、DIMM 数量和测量层级;厂商倍数只能用于其列明产品。

AI 服务器能否只用 HBM、不用 DDR5? 常见 GPU 服务器仍要由 CPU 执行作业系统、排程、资料准备和 I/O,因此通常同时配置主机 DRAM 与加速器 HBM。专用 SoC 或统一内存架构可能采用不同设计,不能外推所有服务器。

HBM 与 GDDR 又有何分别? 两者都可作为加速器本地内存;HBM 用堆叠、超宽接口和先进封装取得带宽,GDDR 用离散芯片和高单针速率取得带宽。完整比较见 HBM vs GDDR。

Klaro Research

资料来源与更新依据

资料截止:2026年9月2日

  1. [1] Samsung Semiconductor High Bandwidth Memory 产品与技术说明

    第一方 · 原始资料 · 查阅:2026年9月2日

  2. [2] Samsung Semiconductor DDR5 产品与应用说明

    第一方 · 原始资料 · 查阅:2026年9月2日

  3. [3] AMD AMD Memory 技术与外部内存接口

    第一方 · 原始资料 · 查阅:2026年9月2日

  4. [4] AMD Versal HBM Series 与 DDR5 特定配置比较

    第一方 · 原始资料 · 查阅:2026年9月2日

  5. [5] Compute Express Link Consortium CXL 2.0 内存扩充与 pooling 说明

    权威资料 · 原始资料 · 发布:2020年11月10日 · 查阅:2026年9月2日

  6. [6] Micron Technology AI 数据中心内存与存储产品地图

    第一方 · 原始资料 · 查阅:2026年9月2日

研究限制

  • HBM 与 DDR5 的实际带宽、容量、功耗和延迟取决于世代、处理器、通道、DIMM、stack 与软件,没有跨所有平台通用的倍数。
  • CXL 可延伸或共享系统内存,但拓扑、协定、软件和装置会增加延迟与带宽限制;本文不把它视为 HBM 等价替代。

需要重新检查的事件

  • 主要 AI 服务器平台改变 HBM、DDR5、SOCAMM/MRDIMM 或 CXL 的系统角色与配置时更新。
  • 新一代 HBM/DDR 标准或 CXL 内存 pooling 出现大规模部署证据,令容量与资料搬移结论改变时重核。

本文仅供参考,不构成投资建议。