AI 数据中心液冷是什么?从芯片冷板到机房排热

作者 Klaro 编辑部 ·发布于 2026年9月4日

AI 机架的热量由芯片冷板、歧管、CDU 和设施排热设备传到室外
Klaro Research 原创热路径图;设备位置依 NVIDIA、OCP 与 Microsoft 的公开架构整理,实际设计按机架及设施条件调整。
目录

AI 数据中心液冷,是用液体回路把 CPU、GPU、内存或电源等高热元件的热量带走,再经 CDU 与设施排热系统送到机房外。 一套完整系统通常包括冷板、软管、快速接头、歧管、冷却液分配单元(CDU)、设施水路、热交换器及冷水机组、dry cooler 或冷却塔。

NVIDIA 的 GB300 NVL72 参考架构把 72 颗 Blackwell Ultra GPU 集中在最高约 142kW 的液冷机架,并加入机架级漏液侦测。DGX 硬件指南进一步显示,CPU 与 GPU 通过冷板散热,网络及存储元件仍使用风冷。现行量产方向因此以 direct-to-chip 液冷加局部风冷的混合冷却 为主。[1][2]

对投资者而言,液冷需求的核心单位是「每个机架需要移走多少热,以及哪家供应商负责哪一段」。产品发布要进一步通过平台认证、设施整合、交付与收入确认,才会形成可持续的公司现金流。

本文证据截至 2026 年 9 月 4 日。

AI 数据中心由芯片冷板到设施排热的完整热路径

AI 数据中心从芯片冷板到设施排热的完整热路径

AI 数据中心液冷热路径繁体手机图

AI 数据中心液冷热路径简体手机图

图:液冷把热由 IT 设备送到设施侧,再由冷水机组、dry cooler 或冷却塔排出;各段使用不同设备、供应商与收入确认周期。

AI 机架为什么开始采用液冷?

机架功率密度上升后,散热问题由单一服务器扩大为机架与设施共同设计。风冷要增加风量、风压与风扇功耗,机房亦需要更大的 air handler、duct 及冷热通道能力;冷板则可直接在主要热源附近吸收热量,以较小体积把热送入液体回路。

GB300 NVL72 的 142kW 级设计提供一个清楚例子:运算密度、NVLink、电源架和液冷歧管在同一 rack-scale system 内共同交付。[1] 液冷需求因而与 GPU 数量、机架平台、设施接电及机房施工同步,而非独立发生。

热量如何从芯片走到机房外?

热路径 设备作用 工程上要核对的条件 投资者对应证据
芯片/封装 → 冷板 将 CPU/GPU 等元件热量传入冷却液 接触、流道、材料、压降、平台认证 design qualification、量产与 cold-plate 收入
冷板 → 歧管 把多个元件及 tray 的流量汇集 快速接头、流量平衡、漏液侦测、维修 每机架内容量、良率与出货
歧管 → CDU 控制温度、压力、流量与水质 kW capacity、approach temperature、冗余、监控 CDU 订单、installed MW、服务收入
CDU → 设施水路 通过 heat exchanger 隔离 IT 与 facility loop FWS 水温、水质、泵、管路与冗余 新建/改造工程、验收周期
设施水路 → 室外 由 chiller、dry cooler 或 tower 排热 气候、水源、供水温度、free cooling 设施设备收入、能耗及维运

OCP 的 cold-plate loop requirements 把 IT 侧称为 Technology Cooling System(TCS),设施侧称为 Facility Water System(FWS)。CDU 位于两者之间,液体的比热、黏度、密度、流量和 approach temperature 都会改变泵功耗及散热能力。[3]

风冷、direct-to-chip、后门热交换与浸没式怎样分工?

方式 热量接收位置 常见使用情境 主要设施要求
风冷 heatsink、风扇与机房空气 一般服务器、网络、存储及较低密度机架 air handler、CRAH/CRAC、冷热通道
Direct-to-chip 贴近 CPU/GPU 等元件的冷板 高功率 AI/HPC,保留标准机架与部分风冷 manifold、CDU、TCS 及 facility heat rejection
Rear-door heat exchanger 机架排出的热空气 既有机房提高 rack density 或处理残余热 门体换热器、液体供应与维修空间
Immersion IT equipment 直接接触介电液 高 heat capture、特定 HPC 或新设计环境 tank、流体、材料相容、吊运与专用维护

风冷仍负责大量低热或未进入液体回路的元件。Direct-to-chip 对现有 rack ecosystem 的延续性较高;immersion 则改变设备外形、材料及维修流程。完整技术决策见 冷板式液冷 vs 浸没式液冷。

旧风冷机房能否加入液冷?

可以,关键在于热量最终交给哪一套设施系统。Microsoft 公开的 HXU 架构把 direct-to-chip 冷板连到 air-to-liquid heat exchanger,使既有风冷机房可以承接高热 AI rack;风扇把液体中的热送回机房空气,再由原有 air-cooling infrastructure 排出。[4]

另一条路径是 liquid-to-liquid CDU,直接接入 facility water。这通常具备更高集中容量,但需要评估水路、机房楼板、管道、water quality、condensation、冗余与施工窗口。改造决策应至少回答:

  1. 新 rack 的 design thermal load 与未来 margin;
  2. 机房是否具备可用的 FWS,供回水温度及容量是多少;
  3. 施工期间如何维持 uptime;
  4. 漏液、阀门、泵和 CDU 的 service domain 如何隔离;
  5. facility heat rejection 在全年最高环境温度下能否工作。

液冷会怎样改变 PUE 与用水?

液冷可降低部分 server fan、CRAH/CRAC 及 compressor work,也会加入 pumps、CDU controls 和 heat-rejection load。最终结果取决于供水温度、环境气候、chiller 使用、evaporative cooling、IT utilization 和测量边界。

PUE 衡量总设施能源相对 IT 能源;WUE 衡量冷却与加湿用水相对 IT 电量。Microsoft 将 WUE 定义为年度冷却及加湿用水公升数除以 IT kWh,并指出所在地气候会显著改变比较。[5] 因此,一个散热方案应同时看 PUE、WUE、heat capture、rack density、可靠性和每次有用运算的能源。公式与算例见 数据中心 PUE。

液冷标准化正在解决什么问题?

冷板尺寸、快速接头、冷却液、材料、流量、压差、监控与 CDU 接口若各自封闭,会增加 multi-vendor integration 和维修成本。OCP 的 cold-plate、CDU、coolant 及 immersion 工作组正在建立可互通基础;中国 GB/T 48023-2026 亦已于 2026 年 7 月 30 日发布,并将于 2027 年 2 月 1 日实施。[3][6]

标准发布属于 qualification 基础。供应商收入仍由客户采用、工厂良率、出货、现场验收与付款进一步确认。

投资者应沿哪条证据链研究?

机架平台与热负载
→ 技术与设施方案
→ 标准/平台认证
→ 产能与供应能力
→ 订单、出货及验收
→ 收入、毛利与运营资金
→ 自由现金及每股回报

想找上市公司,可由 AI 液冷与散热概念股进入冷板、CDU、facility cooling 和整机供应商;想理解 CDU 与 chiller 的分工,可继续阅读 数据中心 CDU。供电与散热如何共同限制机架,则由 AI 电力概念股及 AI 基础设施瓶颈承接。

常见问题:AI 液冷、风冷与机房改造

液冷服务器是否完全不用风扇?

Direct-to-chip 系统通常只把高热元件接入液体回路,其余元件仍可用风冷。Immersion 的设备及维护方式则另有设计。

CDU 会直接制造冷水吗?

L2L CDU 主要控制并交换 TCS 与 FWS 的热量;冷水机组、dry cooler 或冷却塔负责设施侧制冷或排热。L2A CDU/HXU 则把热送入空气。

液冷适合旧数据中心吗?

适合程度取决于可用水路、空间、楼板、施工窗口与 heat-rejection capacity。Air-to-liquid HXU 是改造路径之一,L2L CDU 则需要更完整的 facility connection。

研究液冷公司最重要的财务证据是什么?

先确认产品所在层级,再依次核对 qualification、产能、出货、验收、收入、毛利及 working capital。Installed MW 或订单能见度是领先证据,现金回收完成财务验证。

Klaro Research

资料来源与更新依据

资料截止:2026年9月4日

  1. [1] NVIDIA GB300 NVL72 AI Factory System Hardware and Components

    第一方 · 行业资料 · GB300 NVL72 reference architecture · 发布:2026年5月18日 · 查阅:2026年9月4日

  2. [2] NVIDIA DGX GB Rack Scale Systems Hardware Guide

    第一方 · 行业资料 · GB200/GB300 rack hardware · 发布:2026年3月3日 · 查阅:2026年9月4日

  3. [3] Open Compute Project Cold Plate Cooling Loop Requirements Rev 2.0

    权威资料 · 方法文件 · Cold-plate liquid-cooling loop requirements · 查阅:2026年9月4日

  4. [4] Microsoft Datacenters Liquid Cooling Heat Exchanger Units

    第一方 · 行业资料 · Air-cooled data-centre retrofit for direct-to-chip cooling · 查阅:2026年9月4日

  5. [5] Microsoft Datacenters Measuring Energy and Water Efficiency for Microsoft Datacenters

    第一方 · 行业资料 · PUE and WUE definitions and FY2025 metrics · 查阅:2026年9月4日

  6. [6] 国家市场监督管理总局 GB/T 48023-2026 数据中心冷板式液冷系统技术规范

    权威资料 · 监管/交易所 · 2027-02-01 实施 · 发布:2026年7月30日 · 查阅:2026年9月4日

  7. [7] U.S. Department of Energy Best Practices Guide for Energy-Efficient Data Center Design

    权威资料 · 监管/交易所 · 2024 data-centre design guide · 查阅:2026年9月4日

研究限制

  • 机架功耗、液体温度、流量、气候、冗余及设施水路共同决定实际冷却设计,本文提供架构与判断框架。
  • 供应商公布的节能、节水及 TCO 数字适用于指定配置,跨设施比较须固定测量边界及工作负载。

需要重新检查的事件

  • NVIDIA、AMD 或主要云端平台改变机架热设计、液冷接口或 heat-capture 架构时更新。
  • OCP、ASHRAE、ISO 或 GB/T 更新冷板、CDU、冷却液及效率标准时更新。

本文仅供参考,不构成投资建议。