AI 記憶體階層:Memory Wall、KV Cache、HBM、CXL 與 SSD

作者 Klaro 編輯部 ·發佈於 2026年9月3日

AI 資料由晶片內快取、HBM、主機 DRAM、CXL 記憶體移至企業 SSD 的五層結構
概念圖按資料溫度、容量與持久性呈現常見 AI 記憶體階層;實際拓撲取決於平台、互連、軟件及工作負載。
目錄

AI 記憶體階層,是把模型權重、activation、KV Cache、資料集和檢查點,按速度、容量、持久性及搬移成本分配到不同硬件。 靠近運算的 SRAM/cache 與 HBM 最快但容量有限;主機 DDR/SOCAMM、CXL 記憶體與企業 NVMe SSD 逐步增加容量和持久性,同時增加資料搬移延遲與軟件管理要求。

Memory Wall(記憶體牆)並不等於「HBM 缺貨」。它描述的是計算單元需要資料的速度、容量或能耗,跟不上模型工作負載。增加 GPU 算力後,如果權重或 KV Cache 不能及時進入運算單元,昂貴的計算核心仍會等待資料。

對投資者而言,真正的需求單位不是某一種記憶體的市場口號,而是資料在哪裏、多久會重用、搬一次要付出多少時間和電力,以及供應商能否把產品變成部署、收入與現金。 本文證據截至 2026 年 9 月 2 日。

AI 記憶體階層包含哪些硬件?

層級 常見硬件 主要保存資料 優勢 主要代價
晶片內 SRAM、register、L1/L2 cache 正在運算的極熱資料 最接近計算、延遲最低 面積與容量非常有限
加速器本地 HBM、部分平台的 GDDR 模型權重、activation、活躍 KV Cache 高總頻寬,可維持 GPU/ASIC 利用率 成本、功耗、封裝面積、良率與固定容量
主機記憶體 DDR5 RDIMM/MRDIMM、LPDDR5X SOCAMM CPU 工作集、資料準備、暖 KV Cache、卸載權重 容量較大、模組化、CPU 可直接使用 與 GPU 之間仍有搬移成本
擴充/共享 CXL-attached memory、remote DRAM 較冷工作集、共享容量、資源池 擴充與 pooling,提高容量利用率 互連、NUMA、switch、軟件放置與延遲
持久化儲存 企業 NVMe SSD、網絡/物件儲存 資料集、checkpoint、模型檔、context/較冷 KV blocks 容量大、可持久保存、每 bit 成本較低 存取較慢、寫入耐久與資料搬移要管理

NVIDIA Dynamo 的 KVBM 文件已把 KV blocks 分為 GPU、host、disk 和 object storage tiers,證明多層 cache 不只是概念;每層要先設定容量和 offload 規則,錯誤配置會因反覆搬移而降低效能。[2]

AI 推理資料由晶片內快取、HBM、主機記憶體、CXL 移至企業 SSD 的五層圖

AI 推理数据由芯片内缓存、HBM、主机内存、CXL 移至企业 SSD 的五层图

AI 推理資料五層路徑繁體中文手機圖

AI 推理数据五层路径简体中文手机图

圖:常見 AI 推理資料階層的概念圖。資料越冷、重用時間越長,越可能移往容量較大的一層;實際配置必須以模型、互連和軟件實測。

KV Cache 為甚麼會令 HBM 容量不足?

Transformer 推理會為已處理的 token 保存 attention 的 key 和 value 狀態,後續生成新 token 時可以直接重用,避免每次重算完整前文。這組狀態稱為 KV Cache。

KV Cache 會隨上下文長度、同時請求數、模型層數、hidden dimensions、attention 架構和資料精度改變。模型權重已佔用一部分 HBM 後,剩餘容量還要分給 KV Cache、activation、工作空間和通訊 buffer;長上下文與高併發因而可以在算力耗盡前先碰到容量限制。

NVIDIA Dynamo 把 KV Cache-aware routing、重用與 offloading 分開:有相同 prefix 的請求可重用 cache,較冷的 blocks 可以移到主機 DRAM、local disk 或 remote storage,減少重新計算。[1]

這個機制不保證 offload 一定更快。NVIDIA NIM 文件指出,host offload 能保留更多可重用 blocks,但 CPU–GPU 搬移仍有 overhead;互連較慢、cache 命中率太低或資料頻繁來回時,搬移成本可能抵銷收益。[3]

熱、暖、冷資料應放在哪一層?

資料狀態 放置原則 常見層級 需要驗證的指標
正在每個 token 使用 優先保留頻寬和最低搬移距離 SRAM/cache、HBM/GDDR tokens/second、GPU utilization、memory bandwidth
近期很可能重用 容量與回載時間平衡 HBM、host DDR/SOCAMM cache hit rate、TTFT、host-to-device transfer
跨請求或較長時間重用 只在命中收益高於搬移成本時保存 host DRAM、CXL memory、NVMe SSD 命中率、尾延遲、每 token 成本、SSD endurance
長期保存 重視容量、持久性和資料管理 NVMe、網絡/物件儲存 throughput、availability、資料保護、總成本

NVIDIA 在 2026 年提出 CMX Context Memory Storage Platform,目標是把 agentic AI 的長上下文和 KV Cache 從一般持久化儲存分出一個專用 context tier。這證明 SSD/網絡層開始直接參與推理資料路徑;其產品效能與商業採用仍要由正式部署、客戶和收入驗證。完整 NAND、controller、韌體與供應商比較見 AI 企業 SSD。[4]

CXL Memory 解決的是頻寬還是容量?

CXL 包含 CXL.io、CXL.cache 和 CXL.mem。CXL.mem 讓 host 或裝置以一致性方法接觸 device-attached memory;較新的規格亦支援 switching、sharing 和 memory pooling,使容量可以跨系統更靈活分配。[5]

CXL 主要改善容量、利用率和資源配置,不能把較遠的 memory pool 變成 GPU 封裝內的 HBM。資料離計算愈遠,便愈依賴互連、switch、拓撲和軟件把正確頁面放在正確節點。若工作負載需要每個 token 反覆讀取同一資料,HBM 仍更接近問題;若大量容量只在少數時刻使用,CXL 的共享價值才較高。

投資者研究 CXL 時應把證據分成四級:

  1. protocol/IP 支援;
  2. controller 或 switch 產品;
  3. OEM 平台與軟件整合;
  4. 客戶部署、收入與現金。

Astera Labs和 Marvell已提供相關連接產品,但產品發布不能直接等同 CXL memory pooling 已形成大規模收入。

SOCAMM2、MRDIMM 與 DDR5 RDIMM 怎樣分工?

截至 2026 年 9 月 2 日,DDR5 RDIMM 是成熟伺服器主機記憶體;MRDIMM 透過 multiplexing 提高記憶體子系統資料率;SOCAMM2 則把 LPDDR5X 的低功耗與較小 form factor 帶到可更換的伺服器模組。三者都屬主機/系統記憶體選擇,不是 HBM 的同位置替代品。

AMD 截至 2026 年 4 月 6 日的資料指出,DDR5 RDIMM 仍會是一般用途伺服器的重要標準;SOCAMM2 的吸引力在功耗、密度和水平安裝,現階段 RAS 功能與適用工作負載仍要追上成熟 RDIMM。AMD 計劃在 2027 年部分 EPYC 平台支援 LPDDR5X SOCAMM2。[6]

Micron 與 SK hynix 都把 SOCAMM2、HBM 和企業 SSD 放入 AI 記憶體組合,支持「多層同時增長」的產業方向。這些公司資料首先證明產品布局;真正的收入證據仍要核對客戶平台、樣品、認證、量產、bit 出貨與產品 mix。[7] [8]

訓練與推理對記憶體的需求有何不同?

訓練需要保存權重、activation、gradient、optimizer state 和 checkpoint,並在多個加速器之間高頻交換;HBM 容量、頻寬、GPU interconnect 和網絡共同控制吞吐。推理的 prefill 偏重計算,decode 經常受權重與 KV Cache 搬移限制;長上下文、高併發和 prefix reuse 令多層 cache 更重要。

工作負載 最容易先受限 階層設計重點
大模型訓練 HBM 容量/頻寬、加速器互連、checkpoint I/O 保持資料並行與高 GPU 利用率,縮短 checkpoint 停頓
高吞吐推理 權重讀取、HBM 頻寬、batch 與排程 在 TTFT、tokens/second 和併發之間平衡
長上下文/agentic AI KV Cache 容量、重用、回載與持久性 HBM 熱層+host/SSD 暖冷層,按命中率搬移
RAG/embedding index、向量資料、網絡與 SSD I/O 將資料檢索與模型執行分開量度

更完整的 prefill/decode 與晶片架構差異見 AI 訓練 vs 推理及 AI 推理晶片。

哪些上市公司對應每一層需求?

需求層 代表公司或產業 收入前必須出現的證據
加速器與片上 cache NVIDIA、AMD、ASIC/IP 供應商 晶片出貨、平台利用率、軟件採用與毛利
HBM/GDDR Samsung、SK hynix、Micron 客戶認證、合格出貨、stack 良率、產品收入與現金
DDR/SOCAMM/MRDIMM Samsung、SK hynix、Micron 伺服器平台支援、容量 mix、bit 出貨、ASP 與庫存
CXL controller/switch/memory Astera Labs、Marvell、記憶體原廠與 IP 供應商 OEM 設計、量產部署、收入披露,不只協定支援
NAND/企業 SSD Samsung、SK hynix/Solidigm、Micron、Sandisk及 Kioxia 客戶認證、容量出貨、controller/韌體、ASP、毛利與 CFO

同一公司可以橫跨多層,收入純度仍由實際業務組合決定。Samsung 有手機、Foundry 與顯示業務;SK hynix、Micron 較集中於記憶體,仍同時受 DRAM/NAND 周期影響;Sandisk 和 Kioxia 主要位於 NAND/SSD 層,HBM/DRAM 則由三大綜合記憶體原廠主導。

投資者怎樣判斷真正的 AI 記憶體受惠?

把產業敘事轉成公司研究,可以依次核對:

工作負載是否真的受記憶體限制
→ 哪一層是容量/頻寬/持久性瓶頸
→ 新產品是否完成平台認證
→ 是否開始合格、可重複出貨
→ 產品 mix 與 ASP 是否進入收入和毛利
→ 庫存、應收、CFO 與 CapEx 是否形成股東現金

若只有 benchmark,證明的是指定配置可行;若只有產品公告,證明的是供應商準備參與;若已有客戶部署但沒有分部披露,仍不能量化收入純度。Klaro 的 記憶體週期可繼續核對價格、庫存與產能,HBM 供應鏈則把 DRAM 晶粒、堆疊、base die、封裝與測試拆開。

常見問題:Memory Wall、KV Cache 與 CXL

Memory Wall 和程式設計的 memory barrier 是同一概念嗎? 不是。Memory Wall 描述計算與記憶體頻寬/容量/延遲之間的系統瓶頸;memory barrier 是控制處理器或編譯器記憶體操作順序的同步機制。

KV Cache 一定要放在 HBM 嗎? 正在生成 token、頻繁讀取的 KV blocks 通常適合留在 HBM。可重用但較冷的 blocks 可以卸載至 host DRAM、CXL memory 或 SSD;是否划算取決於命中率、互連和回載成本。

CXL 可以取代 HBM 嗎? CXL 主要提供一致性連接、擴充與 pooling;它增加可用容量,沒有把遠端 memory 的物理距離、頻寬和延遲變成加速器本地 HBM。

SOCAMM2 是否會取代 DDR5 RDIMM? 較準確的判斷是按場景並存。SOCAMM2 強調低功耗、密度與模組化,成熟 RDIMM 則有一般伺服器生態和 RAS 優勢;平台支援與正式部署會決定各自適用範圍。

SSD 進入 KV Cache 是否等於所有 NAND 公司都受惠? 不是。SSD 要先符合延遲、吞吐、耐久、controller、韌體和軟件要求,再由部署規模、出貨、ASP、毛利和現金證明公司捕捉。企業 SSD 的公司與供應鏈需要獨立比較。

Klaro Research

資料來源與更新依據

資料截止:2026年9月2日

  1. [1] NVIDIA NVIDIA Dynamo 架構與 KV Cache offloading

    第一方 · 原始資料 · 查閲:2026年9月2日

  2. [2] NVIDIA Dynamo KVBM cache tiers 設定文件

    第一方 · 原始資料 · 查閲:2026年9月2日

  3. [3] NVIDIA NIM KV Cache reuse 與 host offload

    第一方 · 原始資料 · 查閲:2026年9月2日

  4. [4] NVIDIA BlueField-4 CMX Context Memory Storage Platform

    第一方 · 原始資料 · 發佈:2026年3月16日 · 查閲:2026年9月2日

  5. [5] Compute Express Link Consortium CXL 101:CXL.cache、CXL.mem、擴充與 pooling

    權威資料 · 原始資料 · 查閲:2026年9月2日

  6. [6] AMD LPDDR5X SOCAMM2 的伺服器能效、模組化與 RAS 邊界

    第一方 · 原始資料 · 發佈:2026年4月6日 · 查閲:2026年9月2日

  7. [7] Micron Technology AI 資料中心 HBM、系統記憶體與 SSD 產品地圖

    第一方 · 原始資料 · 查閲:2026年9月2日

  8. [8] SK hynix HBM、SOCAMM2 與 eSSD 的 AI 記憶體階層

    第一方 · 原始資料 · 發佈:2026年7月3日 · 查閲:2026年9月2日

研究限制

  • 五層圖是用於投資研究的概念架構;實際系統可省略、合併、平行或遠端部署某些層,不應由圖形位置推算延遲與頻寬。
  • KV Cache 容量與卸載效益取決於模型架構、上下文、batch、重用率、互連、儲存和軟件;沒有跨平台固定的每 token 成本。
  • 廠商規格與 benchmark 只證明指定平台能力,不能直接推導市場份額、收入、毛利或股票回報。

需要重新檢查的事件

  • NVIDIA CMX/Dynamo、主要推理框架或雲端平台公布量產部署與 KV Cache tiering 實測,改變 HBM/DRAM/SSD 邊界時更新。
  • CXL memory pooling、SOCAMM2/MRDIMM 或 High Bandwidth Flash 取得大規模商用與收入證據時重核產業映射。

本文僅供參考,不構成投資建議。