AI 資料中心液冷是甚麼?由晶片冷板到機房排熱
目錄
AI 資料中心液冷,是用液體回路把 CPU、GPU、記憶體或電源等高熱元件的熱量帶走,再經 CDU 與設施排熱系統送到機房外。 一套完整系統通常包括冷板、軟管、快速接頭、歧管、冷卻液分配單元(CDU)、設施水路、熱交換器及冷水機組、dry cooler 或冷卻塔。
NVIDIA 的 GB300 NVL72 參考架構把 72 顆 Blackwell Ultra GPU 集中在最高約 142kW 的液冷機架,並加入機架級漏液偵測。DGX 硬件指南進一步顯示,CPU 與 GPU 透過冷板散熱,網絡及儲存元件仍使用風冷。現行量產方向因此以 direct-to-chip 液冷加局部風冷的混合冷卻 為主。[1][2]
對投資者而言,液冷需求的核心單位是「每個機架需要移走多少熱,以及哪家供應商負責哪一段」。產品發布要進一步通過平台認證、設施整合、交付與收入確認,才會形成可持續的公司現金流。
本文證據截至 2026 年 9 月 4 日。
圖:液冷把熱由 IT 設備送到設施側,再由冷水機組、dry cooler 或冷卻塔排出;各段使用不同設備、供應商與收入確認周期。
AI 機架為甚麼開始採用液冷?
機架功率密度上升後,散熱問題由單一伺服器擴大為機架與設施共同設計。風冷要增加風量、風壓與風扇功耗,機房亦需要更大的 air handler、duct 及冷熱通道能力;冷板則可直接在主要熱源附近吸收熱量,以較小體積把熱送入液體回路。
GB300 NVL72 的 142kW 級設計提供一個清楚例子:運算密度、NVLink、電源架和液冷歧管在同一 rack-scale system 內共同交付。[1] 液冷需求因而與 GPU 數量、機架平台、設施接電及機房施工同步,而非獨立發生。
熱量如何從晶片走到機房外?
| 熱路徑 | 設備作用 | 工程上要核對的條件 | 投資者對應證據 |
|---|---|---|---|
| 晶片/封裝 → 冷板 | 將 CPU/GPU 等元件熱量傳入冷卻液 | 接觸、流道、材料、壓降、平台認證 | design qualification、量產與 cold-plate 收入 |
| 冷板 → 歧管 | 把多個元件及 tray 的流量匯集 | 快速接頭、流量平衡、漏液偵測、維修 | 每機架內容量、良率與出貨 |
| 歧管 → CDU | 控制溫度、壓力、流量與水質 | kW capacity、approach temperature、冗餘、監控 | CDU 訂單、installed MW、服務收入 |
| CDU → 設施水路 | 透過 heat exchanger 隔離 IT 與 facility loop | FWS 水溫、水質、泵、管路與冗餘 | 新建/改造工程、驗收周期 |
| 設施水路 → 室外 | 由 chiller、dry cooler 或 tower 排熱 | 氣候、水源、供水溫度、free cooling | 設施設備收入、能耗及維運 |
OCP 的 cold-plate loop requirements 把 IT 側稱為 Technology Cooling System(TCS),設施側稱為 Facility Water System(FWS)。CDU 位於兩者之間,液體的比熱、黏度、密度、流量和 approach temperature 都會改變泵功耗及散熱能力。[3]
風冷、direct-to-chip、後門熱交換與浸沒式怎樣分工?
| 方式 | 熱量接收位置 | 常見使用情境 | 主要設施要求 |
|---|---|---|---|
| 風冷 | heatsink、風扇與機房空氣 | 一般伺服器、網絡、儲存及較低密度機架 | air handler、CRAH/CRAC、冷熱通道 |
| Direct-to-chip | 貼近 CPU/GPU 等元件的冷板 | 高功率 AI/HPC,保留標準機架與部分風冷 | manifold、CDU、TCS 及 facility heat rejection |
| Rear-door heat exchanger | 機架排出的熱空氣 | 既有機房提高 rack density 或處理殘餘熱 | 門體換熱器、液體供應與維修空間 |
| Immersion | IT equipment 直接接觸介電液 | 高 heat capture、特定 HPC 或新設計環境 | tank、流體、材料相容、吊運與專用維護 |
風冷仍負責大量低熱或未進入液體回路的元件。Direct-to-chip 對現有 rack ecosystem 的延續性較高;immersion 則改變設備外形、材料及維修流程。完整技術決策見 冷板式液冷 vs 浸沒式液冷。
舊風冷機房能否加入液冷?
可以,關鍵在於熱量最終交給哪一套設施系統。Microsoft 公開的 HXU 架構把 direct-to-chip 冷板連到 air-to-liquid heat exchanger,使既有風冷機房可以承接高熱 AI rack;風扇把液體中的熱送回機房空氣,再由原有 air-cooling infrastructure 排出。[4]
另一條路徑是 liquid-to-liquid CDU,直接接入 facility water。這通常具備更高集中容量,但需要評估水路、機房樓板、管道、water quality、condensation、冗餘與施工窗口。改造決策應至少回答:
- 新 rack 的 design thermal load 與未來 margin;
- 機房是否具備可用的 FWS,供回水溫度及容量是多少;
- 施工期間如何維持 uptime;
- 漏液、閥門、泵和 CDU 的 service domain 如何隔離;
- facility heat rejection 在全年最高環境溫度下能否工作。
液冷會怎樣改變 PUE 與用水?
液冷可降低部分 server fan、CRAH/CRAC 及 compressor work,也會加入 pumps、CDU controls 和 heat-rejection load。最終結果取決於供水溫度、環境氣候、chiller 使用、evaporative cooling、IT utilization 和量測邊界。
PUE 衡量總設施能源相對 IT 能源;WUE 衡量冷卻與加濕用水相對 IT 電量。Microsoft 將 WUE 定義為年度冷卻及加濕用水公升數除以 IT kWh,並指出所在地氣候會顯著改變比較。[5] 因此,一個散熱方案應同時看 PUE、WUE、heat capture、rack density、可靠性和每次有用運算的能源。公式與算例見 資料中心 PUE。
液冷標準化正在解決甚麼問題?
冷板尺寸、快速接頭、冷卻液、材料、流量、壓差、監控與 CDU 接口若各自封閉,會增加 multi-vendor integration 和維修成本。OCP 的 cold-plate、CDU、coolant 及 immersion 工作組正在建立可互通基礎;中國 GB/T 48023-2026 亦已於 2026 年 7 月 30 日發布,並將於 2027 年 2 月 1 日實施。[3][6]
標準發布屬於 qualification 基礎。供應商收入仍由客戶採用、工廠良率、出貨、現場驗收與付款進一步確認。
投資者應沿哪條證據鏈研究?
機架平台與熱負載
→ 技術與設施方案
→ 標準/平台認證
→ 產能與供應能力
→ 訂單、出貨及驗收
→ 收入、毛利與營運資金
→ 自由現金及每股回報
想找上市公司,可由 AI 液冷與散熱概念股進入冷板、CDU、facility cooling 和整機供應商;想理解 CDU 與 chiller 的分工,可繼續閱讀 資料中心 CDU。供電與散熱如何共同限制機架,則由 AI 電力概念股及 AI 基礎設施瓶頸承接。
常見問題:AI 液冷、風冷與機房改造
液冷伺服器是否完全不用風扇?
Direct-to-chip 系統通常只把高熱元件接入液體回路,其餘元件仍可用風冷。Immersion 的設備及維護方式則另有設計。
CDU 會直接製造冷水嗎?
L2L CDU 主要控制並交換 TCS 與 FWS 的熱量;冷水機組、dry cooler 或冷卻塔負責設施側製冷或排熱。L2A CDU/HXU 則把熱送入空氣。
液冷適合舊資料中心嗎?
適合程度取決於可用水路、空間、樓板、施工窗口與 heat-rejection capacity。Air-to-liquid HXU 是改造路徑之一,L2L CDU 則需要更完整的 facility connection。
研究液冷公司最重要的財務證據是甚麼?
先確認產品所在層級,再依次核對 qualification、產能、出貨、驗收、收入、毛利及 working capital。Installed MW 或訂單能見度是領先證據,現金回收完成財務驗證。
Klaro Research
資料來源與更新依據
資料截止:2026年9月4日
- [1] NVIDIA GB300 NVL72 AI Factory System Hardware and Components
第一方 · 行業資料 · GB300 NVL72 reference architecture · 發佈:2026年5月18日 · 查閲:2026年9月4日
- [2] NVIDIA DGX GB Rack Scale Systems Hardware Guide
第一方 · 行業資料 · GB200/GB300 rack hardware · 發佈:2026年3月3日 · 查閲:2026年9月4日
- [3] Open Compute Project Cold Plate Cooling Loop Requirements Rev 2.0
權威資料 · 方法文件 · Cold-plate liquid-cooling loop requirements · 查閲:2026年9月4日
- [4] Microsoft Datacenters Liquid Cooling Heat Exchanger Units
第一方 · 行業資料 · Air-cooled data-centre retrofit for direct-to-chip cooling · 查閲:2026年9月4日
- [5] Microsoft Datacenters Measuring Energy and Water Efficiency for Microsoft Datacenters
第一方 · 行業資料 · PUE and WUE definitions and FY2025 metrics · 查閲:2026年9月4日
- [6] 國家市場監督管理總局 GB/T 48023-2026 数据中心冷板式液冷系统技术规范
權威資料 · 監管/交易所 · 2027-02-01 實施 · 發佈:2026年7月30日 · 查閲:2026年9月4日
- [7] U.S. Department of Energy Best Practices Guide for Energy-Efficient Data Center Design
權威資料 · 監管/交易所 · 2024 data-centre design guide · 查閲:2026年9月4日
研究限制
- 機架功耗、液體溫度、流量、氣候、冗餘及設施水路共同決定實際冷卻設計,本文提供架構與判斷框架。
- 供應商公布的節能、節水及 TCO 數字適用於指定配置,跨設施比較須固定量測邊界及工作負載。
需要重新檢查的事件
- NVIDIA、AMD 或主要雲端平台改變機架熱設計、液冷接口或 heat-capture 架構時更新。
- OCP、ASHRAE、ISO 或 GB/T 更新冷板、CDU、冷卻液及效率標準時更新。
本文僅供參考,不構成投資建議。