AI 数据中心液冷是什么?从芯片冷板到机房排热
目录
AI 数据中心液冷,是用液体回路把 CPU、GPU、内存或电源等高热元件的热量带走,再经 CDU 与设施排热系统送到机房外。 一套完整系统通常包括冷板、软管、快速接头、歧管、冷却液分配单元(CDU)、设施水路、热交换器及冷水机组、dry cooler 或冷却塔。
NVIDIA 的 GB300 NVL72 参考架构把 72 颗 Blackwell Ultra GPU 集中在最高约 142kW 的液冷机架,并加入机架级漏液侦测。DGX 硬件指南进一步显示,CPU 与 GPU 通过冷板散热,网络及存储元件仍使用风冷。现行量产方向因此以 direct-to-chip 液冷加局部风冷的混合冷却 为主。[1][2]
对投资者而言,液冷需求的核心单位是「每个机架需要移走多少热,以及哪家供应商负责哪一段」。产品发布要进一步通过平台认证、设施整合、交付与收入确认,才会形成可持续的公司现金流。
本文证据截至 2026 年 9 月 4 日。
图:液冷把热由 IT 设备送到设施侧,再由冷水机组、dry cooler 或冷却塔排出;各段使用不同设备、供应商与收入确认周期。
AI 机架为什么开始采用液冷?
机架功率密度上升后,散热问题由单一服务器扩大为机架与设施共同设计。风冷要增加风量、风压与风扇功耗,机房亦需要更大的 air handler、duct 及冷热通道能力;冷板则可直接在主要热源附近吸收热量,以较小体积把热送入液体回路。
GB300 NVL72 的 142kW 级设计提供一个清楚例子:运算密度、NVLink、电源架和液冷歧管在同一 rack-scale system 内共同交付。[1] 液冷需求因而与 GPU 数量、机架平台、设施接电及机房施工同步,而非独立发生。
热量如何从芯片走到机房外?
| 热路径 | 设备作用 | 工程上要核对的条件 | 投资者对应证据 |
|---|---|---|---|
| 芯片/封装 → 冷板 | 将 CPU/GPU 等元件热量传入冷却液 | 接触、流道、材料、压降、平台认证 | design qualification、量产与 cold-plate 收入 |
| 冷板 → 歧管 | 把多个元件及 tray 的流量汇集 | 快速接头、流量平衡、漏液侦测、维修 | 每机架内容量、良率与出货 |
| 歧管 → CDU | 控制温度、压力、流量与水质 | kW capacity、approach temperature、冗余、监控 | CDU 订单、installed MW、服务收入 |
| CDU → 设施水路 | 通过 heat exchanger 隔离 IT 与 facility loop | FWS 水温、水质、泵、管路与冗余 | 新建/改造工程、验收周期 |
| 设施水路 → 室外 | 由 chiller、dry cooler 或 tower 排热 | 气候、水源、供水温度、free cooling | 设施设备收入、能耗及维运 |
OCP 的 cold-plate loop requirements 把 IT 侧称为 Technology Cooling System(TCS),设施侧称为 Facility Water System(FWS)。CDU 位于两者之间,液体的比热、黏度、密度、流量和 approach temperature 都会改变泵功耗及散热能力。[3]
风冷、direct-to-chip、后门热交换与浸没式怎样分工?
| 方式 | 热量接收位置 | 常见使用情境 | 主要设施要求 |
|---|---|---|---|
| 风冷 | heatsink、风扇与机房空气 | 一般服务器、网络、存储及较低密度机架 | air handler、CRAH/CRAC、冷热通道 |
| Direct-to-chip | 贴近 CPU/GPU 等元件的冷板 | 高功率 AI/HPC,保留标准机架与部分风冷 | manifold、CDU、TCS 及 facility heat rejection |
| Rear-door heat exchanger | 机架排出的热空气 | 既有机房提高 rack density 或处理残余热 | 门体换热器、液体供应与维修空间 |
| Immersion | IT equipment 直接接触介电液 | 高 heat capture、特定 HPC 或新设计环境 | tank、流体、材料相容、吊运与专用维护 |
风冷仍负责大量低热或未进入液体回路的元件。Direct-to-chip 对现有 rack ecosystem 的延续性较高;immersion 则改变设备外形、材料及维修流程。完整技术决策见 冷板式液冷 vs 浸没式液冷。
旧风冷机房能否加入液冷?
可以,关键在于热量最终交给哪一套设施系统。Microsoft 公开的 HXU 架构把 direct-to-chip 冷板连到 air-to-liquid heat exchanger,使既有风冷机房可以承接高热 AI rack;风扇把液体中的热送回机房空气,再由原有 air-cooling infrastructure 排出。[4]
另一条路径是 liquid-to-liquid CDU,直接接入 facility water。这通常具备更高集中容量,但需要评估水路、机房楼板、管道、water quality、condensation、冗余与施工窗口。改造决策应至少回答:
- 新 rack 的 design thermal load 与未来 margin;
- 机房是否具备可用的 FWS,供回水温度及容量是多少;
- 施工期间如何维持 uptime;
- 漏液、阀门、泵和 CDU 的 service domain 如何隔离;
- facility heat rejection 在全年最高环境温度下能否工作。
液冷会怎样改变 PUE 与用水?
液冷可降低部分 server fan、CRAH/CRAC 及 compressor work,也会加入 pumps、CDU controls 和 heat-rejection load。最终结果取决于供水温度、环境气候、chiller 使用、evaporative cooling、IT utilization 和测量边界。
PUE 衡量总设施能源相对 IT 能源;WUE 衡量冷却与加湿用水相对 IT 电量。Microsoft 将 WUE 定义为年度冷却及加湿用水公升数除以 IT kWh,并指出所在地气候会显著改变比较。[5] 因此,一个散热方案应同时看 PUE、WUE、heat capture、rack density、可靠性和每次有用运算的能源。公式与算例见 数据中心 PUE。
液冷标准化正在解决什么问题?
冷板尺寸、快速接头、冷却液、材料、流量、压差、监控与 CDU 接口若各自封闭,会增加 multi-vendor integration 和维修成本。OCP 的 cold-plate、CDU、coolant 及 immersion 工作组正在建立可互通基础;中国 GB/T 48023-2026 亦已于 2026 年 7 月 30 日发布,并将于 2027 年 2 月 1 日实施。[3][6]
标准发布属于 qualification 基础。供应商收入仍由客户采用、工厂良率、出货、现场验收与付款进一步确认。
投资者应沿哪条证据链研究?
机架平台与热负载
→ 技术与设施方案
→ 标准/平台认证
→ 产能与供应能力
→ 订单、出货及验收
→ 收入、毛利与运营资金
→ 自由现金及每股回报
想找上市公司,可由 AI 液冷与散热概念股进入冷板、CDU、facility cooling 和整机供应商;想理解 CDU 与 chiller 的分工,可继续阅读 数据中心 CDU。供电与散热如何共同限制机架,则由 AI 电力概念股及 AI 基础设施瓶颈承接。
常见问题:AI 液冷、风冷与机房改造
液冷服务器是否完全不用风扇?
Direct-to-chip 系统通常只把高热元件接入液体回路,其余元件仍可用风冷。Immersion 的设备及维护方式则另有设计。
CDU 会直接制造冷水吗?
L2L CDU 主要控制并交换 TCS 与 FWS 的热量;冷水机组、dry cooler 或冷却塔负责设施侧制冷或排热。L2A CDU/HXU 则把热送入空气。
液冷适合旧数据中心吗?
适合程度取决于可用水路、空间、楼板、施工窗口与 heat-rejection capacity。Air-to-liquid HXU 是改造路径之一,L2L CDU 则需要更完整的 facility connection。
研究液冷公司最重要的财务证据是什么?
先确认产品所在层级,再依次核对 qualification、产能、出货、验收、收入、毛利及 working capital。Installed MW 或订单能见度是领先证据,现金回收完成财务验证。
Klaro Research
资料来源与更新依据
资料截止:2026年9月4日
- [1] NVIDIA GB300 NVL72 AI Factory System Hardware and Components
第一方 · 行业资料 · GB300 NVL72 reference architecture · 发布:2026年5月18日 · 查阅:2026年9月4日
- [2] NVIDIA DGX GB Rack Scale Systems Hardware Guide
第一方 · 行业资料 · GB200/GB300 rack hardware · 发布:2026年3月3日 · 查阅:2026年9月4日
- [3] Open Compute Project Cold Plate Cooling Loop Requirements Rev 2.0
权威资料 · 方法文件 · Cold-plate liquid-cooling loop requirements · 查阅:2026年9月4日
- [4] Microsoft Datacenters Liquid Cooling Heat Exchanger Units
第一方 · 行业资料 · Air-cooled data-centre retrofit for direct-to-chip cooling · 查阅:2026年9月4日
- [5] Microsoft Datacenters Measuring Energy and Water Efficiency for Microsoft Datacenters
第一方 · 行业资料 · PUE and WUE definitions and FY2025 metrics · 查阅:2026年9月4日
- [6] 国家市场监督管理总局 GB/T 48023-2026 数据中心冷板式液冷系统技术规范
权威资料 · 监管/交易所 · 2027-02-01 实施 · 发布:2026年7月30日 · 查阅:2026年9月4日
- [7] U.S. Department of Energy Best Practices Guide for Energy-Efficient Data Center Design
权威资料 · 监管/交易所 · 2024 data-centre design guide · 查阅:2026年9月4日
研究限制
- 机架功耗、液体温度、流量、气候、冗余及设施水路共同决定实际冷却设计,本文提供架构与判断框架。
- 供应商公布的节能、节水及 TCO 数字适用于指定配置,跨设施比较须固定测量边界及工作负载。
需要重新检查的事件
- NVIDIA、AMD 或主要云端平台改变机架热设计、液冷接口或 heat-capture 架构时更新。
- OCP、ASHRAE、ISO 或 GB/T 更新冷板、CDU、冷却液及效率标准时更新。
本文仅供参考,不构成投资建议。