2026 年 2 月,NVIDIA 宣布已经向客户交付 Vera Rubin 样片,标志着 Rubin 平台从架构发布进一步进入客户验证阶段。对热设计工程师而言,更值得关注的并不是算力数字本身,而是封装、微通道冷板以及整机液冷架构如何把热量送出机架。
1. 散热问题从单卡放大到机架
单颗 Rubin GPU 的公开设计功耗约 2.3 kW,热量必须在很短路径内被带走。Vera Rubin NVL72 把这一压力放到机架尺度:72 颗 Rubin GPU、36 颗 Vera CPU,以及 NVLink、网络和其他系统组件,集成在同一个 rack-scale computing system 中。
NVIDIA 当前公开信息还给出了单卡互连与内存能力:每颗 Rubin GPU 配备 288 GB HBM4,HBM4 带宽 19.2 TB/s,GPU NVLink 带宽 3 TB/s。冷却侧,官方目前明确将 NVL72 定义为 100% liquid-cooled architecture,并支持 45°C coolant inlet temperature。
因此,Rubin 的散热设计要同时回答两件事:
- 芯片到冷却液之间的热阻如何压下来
- 72 颗 GPU 以及 CPU、网络等系统热量,如何稳定进入机架级液冷回路
接下来从单卡热路径说起,再看 Lid、TIM2、Strata 模块冷板,以及机架和数据中心这一侧。
2. 单卡热路径:公开方案总表
官方已经把 NVL72 的冷却架构说清楚了;但是关于 Rubin Lid 结构、TIM2 材料、通道尺寸、镀层和模块冷板覆盖范围,则主要来自产业链、工程访谈和分析资料。
据这些信息综合判断,首代 Rubin 不是裸 Die 直接接冷板,而是:
GPU Die / HBM → TIM1 → Package / Lid → TIM2 → Microchannel Cold Plate / Coolant

图1 NVIDIA Rubin GPU 热路径
下表是目前公开资料中的首代方案速览,并非 NVIDIA 官方规格。
| 项目 | Rubin 首代量产 / 当前公开方案 | 说明 |
|---|---|---|
| Package 是否带 Lid | 带 Lid | 不是裸 Die 直接接冷板 |
| Lid 结构 | 早期双片式,后续资料称改为单片式 / 配 stiffener | 控制大尺寸封装翘曲 |
| TIM2 | 两种公开说法并存 | 早期为液态金属 Indium;部分 2026 年资料称量产改为 graphite pad |
| 冷板 | MCCP(微通道冷板) | GPU 区域微通道化 |
| 通道 pitch | 约100 µm | 相比 Blackwell 约 150 µm |
| 冷板材料 | 铜基,接触面Au plating | 与液态金属防腐蚀描述绑定最深 |
| 覆盖范围 | GPU 冷板 + 大型模块冷板 | Strata 覆盖 2×Rubin GPU、1×Vera CPU、SOCAMM、VRM 等 |
3. 为什么首代仍然带 Lid?
NVIDIA 最初考虑过把 heat-spreader lid 直接做成集成微通道冷板(MCL):
Die → TIM → Micro-channel Lid → coolant
少一层热扩散结构,理论上热阻最低。公开工程访谈则显示,MCL 因封装、物流、测试等制造问题,没有赶上首批 Rubin。首代因此退回更传统的路径:
GPU package → heat-spreader Lid → TIM2 → cold plate
后续资料还提到 Lid 从早期双片式转向单片式,或配合 stiffener,目的之一是控制大尺寸封装翘曲。NVIDIA 尚未公布完整结构图纸。
4. TIM2:公开资料存在版本冲突
TIM2 是目前公开信息最不一致的一层。
早期 / 设计阶段的描述很明确:TIM2 是 Indium-based liquid-metal。对应叠层可以理解为:铜基 MCCP → 镀金接触面 → TIM2 → 镀金 Lid → Rubin Package(GPU dies + HBM)。

图2 Rubin GPU 封装到冷板的界面叠层
这也是公开资料反复提到 Lid 和冷板接触面镀金的原因:防止液态金属 Indium 腐蚀铜。SemiAnalysis 的 Rubin BOM / 热设计资料即按此描述。
但 2026 年 5 月以后出现了“最终 TIM2 改成 graphite”的报道,原因据称与液态金属泄漏 / 可靠性有关。因此量产 TIM2 目前只能并列两种说法:
- 工程初期:Indium liquid-metal TIM2
- 2026 年部分后续资料:graphite-based TIM2
NVIDIA 尚未公布量产 TIM2 的最终材料。
5. 从单卡冷板到 Strata 模块
Rubin 并不是一颗 GPU 配一套完全独立的散热系统。公开资料指出,NVL72 的 Strata compute module 用一块较大的模块化冷板同时覆盖:
- 2 × Rubin GPU
- 1 × Vera CPU
- SOCAMM
- 各种 VRM

图3 Strata Compute Module 冷板覆盖范围
冷却由此从 chip-level 转到 module-level:一块冷板同时处理两颗高功率 GPU,以及 CPU、内存和电源器件,减少独立管路并统一分配流量。NVIDIA 还强调模块化、无缆、无软管的 tray 设计。compute tray 纳入 100% 液冷架构后,更多产品要素也会被 NVIDIA 把控。
6. 液冷继续延伸到整个 Rack
再往外看,单卡热路径进入机架和数据中心回路:
GPU → Cold Plate → Module / Tray Manifold → Rack Manifold → CDU → Facility Cooling Loop → Dry Cooler

图4 NVIDIA Rubin 从 GPU 到数据中心的液冷热路径
45°C 入口温度的意义,不只是 GPU 还能不能冷下来,而是许多数据中心可以用环境空气和干式冷却器排热,减少机械制冷。这是 Rubin 与传统风冷 GPU 服务器最大的差别之一:芯片热设计已经和机架 CDU、设施侧冷却绑在一起。
7. 结语
Rubin 的散热升级,不是把风扇换成水冷那么简单。四个层级要一起看:
| 层级 | 核心问题 |
|---|---|
| GPU Package | 带 Lid、控制翘曲、降低封装和 TIM 热阻 |
| Cold Plate | MCCP 高热流密度换热 |
| Module / Tray | Strata 冷板协同冷却 GPU、CPU、SOCAMM、VRM |
| Rack / Facility | 45°C 温水、CDU、Dry Cooler |
目前公开图景可以概括为:
首代带 Lid,经 TIM2 进入微通道冷板,再由 Strata 模块冷板把两颗高功率 GPU 及周边器件的热量送进 100% 液冷、45°C 入口的机架回路。
真正值得跟踪的,是这条完整链路:
Package → Lid → TIM2 → MCCP → Strata Module → Rack → CDU → Dry Cooler
参考信息说明
本文信息来源并不相同。
NVIDIA 官方已明确的事实:
- NVL72 为 100% 液冷,支持 45°C 入口温度
- 第三代 MGX rack-scale architecture
- compute tray 与 NVLink switch tray 采用模块化、无风扇设计
- NVL72 含 72 个 Rubin GPU、36 个 Vera CPU,并集成 NVLink、网络和其他系统组件
以下内容来自公开资料整理,NVIDIA 尚未作为官方规格公布:
- 首代带 Lid,MCL 未赶上首批
- Lid 由双片式转向单片式 / stiffener
- TIM2 早期为 Indium,2026 年部分资料称改为 graphite pad
- GPU 区域 MCCP,通道 pitch 约 100 µm;铜基冷板,接触面镀金
- Strata 冷板覆盖 2×GPU + CPU + SOCAMM + VRM