NVIDIA Vera Rubin 散热方案解析

作者:colin · 2026/9/23 · 浏览:3

2026 年 2 月,NVIDIA 宣布已经向客户交付 Vera Rubin 样片,标志着 Rubin 平台从架构发布进一步进入客户验证阶段。对热设计工程师而言,更值得关注的并不是算力数字本身,而是封装、微通道冷板以及整机液冷架构如何把热量送出机架。


1. 散热问题从单卡放大到机架

单颗 Rubin GPU 的公开设计功耗约 2.3 kW,热量必须在很短路径内被带走。Vera Rubin NVL72 把这一压力放到机架尺度:72 颗 Rubin GPU、36 颗 Vera CPU,以及 NVLink、网络和其他系统组件,集成在同一个 rack-scale computing system 中。

NVIDIA 当前公开信息还给出了单卡互连与内存能力:每颗 Rubin GPU 配备 288 GB HBM4,HBM4 带宽 19.2 TB/s,GPU NVLink 带宽 3 TB/s。冷却侧,官方目前明确将 NVL72 定义为 100% liquid-cooled architecture,并支持 45°C coolant inlet temperature

因此,Rubin 的散热设计要同时回答两件事:

  1. 芯片到冷却液之间的热阻如何压下来
  2. 72 颗 GPU 以及 CPU、网络等系统热量,如何稳定进入机架级液冷回路

接下来从单卡热路径说起,再看 Lid、TIM2、Strata 模块冷板,以及机架和数据中心这一侧。


2. 单卡热路径:公开方案总表

官方已经把 NVL72 的冷却架构说清楚了;但是关于 Rubin Lid 结构、TIM2 材料、通道尺寸、镀层和模块冷板覆盖范围,则主要来自产业链、工程访谈和分析资料。

据这些信息综合判断,首代 Rubin 不是裸 Die 直接接冷板,而是:

GPU Die / HBM → TIM1 → Package / Lid → TIM2 → Microchannel Cold Plate / Coolant

01-thermal-path.png

图1 NVIDIA Rubin GPU 热路径

下表是目前公开资料中的首代方案速览,并非 NVIDIA 官方规格。

项目 Rubin 首代量产 / 当前公开方案 说明
Package 是否带 Lid 带 Lid 不是裸 Die 直接接冷板
Lid 结构 早期双片式,后续资料称改为单片式 / 配 stiffener 控制大尺寸封装翘曲
TIM2 两种公开说法并存 早期为液态金属 Indium;部分 2026 年资料称量产改为 graphite pad
冷板 MCCP(微通道冷板) GPU 区域微通道化
通道 pitch 100 µm 相比 Blackwell 约 150 µm
冷板材料 铜基,接触面Au plating 与液态金属防腐蚀描述绑定最深
覆盖范围 GPU 冷板 + 大型模块冷板 Strata 覆盖 2×Rubin GPU、1×Vera CPU、SOCAMM、VRM 等

3. 为什么首代仍然带 Lid?

NVIDIA 最初考虑过把 heat-spreader lid 直接做成集成微通道冷板(MCL):

Die → TIM → Micro-channel Lid → coolant

少一层热扩散结构,理论上热阻最低。公开工程访谈则显示,MCL 因封装、物流、测试等制造问题,没有赶上首批 Rubin。首代因此退回更传统的路径:

GPU package → heat-spreader Lid → TIM2 → cold plate

后续资料还提到 Lid 从早期双片式转向单片式,或配合 stiffener,目的之一是控制大尺寸封装翘曲。NVIDIA 尚未公布完整结构图纸。


4. TIM2:公开资料存在版本冲突

TIM2 是目前公开信息最不一致的一层。

早期 / 设计阶段的描述很明确:TIM2 是 Indium-based liquid-metal。对应叠层可以理解为:铜基 MCCP → 镀金接触面 → TIM2 → 镀金 Lid → Rubin Package(GPU dies + HBM)。

04-tim2-stack.png

图2 Rubin GPU 封装到冷板的界面叠层

这也是公开资料反复提到 Lid 和冷板接触面镀金的原因:防止液态金属 Indium 腐蚀铜。SemiAnalysis 的 Rubin BOM / 热设计资料即按此描述。

2026 年 5 月以后出现了“最终 TIM2 改成 graphite”的报道,原因据称与液态金属泄漏 / 可靠性有关。因此量产 TIM2 目前只能并列两种说法:

  • 工程初期:Indium liquid-metal TIM2
  • 2026 年部分后续资料:graphite-based TIM2

NVIDIA 尚未公布量产 TIM2 的最终材料。


5. 从单卡冷板到 Strata 模块

Rubin 并不是一颗 GPU 配一套完全独立的散热系统。公开资料指出,NVL72 的 Strata compute module 用一块较大的模块化冷板同时覆盖:

  • 2 × Rubin GPU
  • 1 × Vera CPU
  • SOCAMM
  • 各种 VRM

05-strata-cold-plate.png

图3 Strata Compute Module 冷板覆盖范围

冷却由此从 chip-level 转到 module-level:一块冷板同时处理两颗高功率 GPU,以及 CPU、内存和电源器件,减少独立管路并统一分配流量。NVIDIA 还强调模块化、无缆、无软管的 tray 设计。compute tray 纳入 100% 液冷架构后,更多产品要素也会被 NVIDIA 把控。


6. 液冷继续延伸到整个 Rack

再往外看,单卡热路径进入机架和数据中心回路:

GPU → Cold Plate → Module / Tray Manifold → Rack Manifold → CDU → Facility Cooling Loop → Dry Cooler

03-rack-loop.png

图4 NVIDIA Rubin 从 GPU 到数据中心的液冷热路径

45°C 入口温度的意义,不只是 GPU 还能不能冷下来,而是许多数据中心可以用环境空气和干式冷却器排热,减少机械制冷。这是 Rubin 与传统风冷 GPU 服务器最大的差别之一:芯片热设计已经和机架 CDU、设施侧冷却绑在一起。


7. 结语

Rubin 的散热升级,不是把风扇换成水冷那么简单。四个层级要一起看:

层级 核心问题
GPU Package 带 Lid、控制翘曲、降低封装和 TIM 热阻
Cold Plate MCCP 高热流密度换热
Module / Tray Strata 冷板协同冷却 GPU、CPU、SOCAMM、VRM
Rack / Facility 45°C 温水、CDU、Dry Cooler

目前公开图景可以概括为:

首代带 Lid,经 TIM2 进入微通道冷板,再由 Strata 模块冷板把两颗高功率 GPU 及周边器件的热量送进 100% 液冷、45°C 入口的机架回路。

真正值得跟踪的,是这条完整链路:

Package → Lid → TIM2 → MCCP → Strata Module → Rack → CDU → Dry Cooler


参考信息说明

本文信息来源并不相同。

NVIDIA 官方已明确的事实:

  • NVL72 为 100% 液冷,支持 45°C 入口温度
  • 第三代 MGX rack-scale architecture
  • compute tray 与 NVLink switch tray 采用模块化、无风扇设计
  • NVL72 含 72 个 Rubin GPU、36 个 Vera CPU,并集成 NVLink、网络和其他系统组件

以下内容来自公开资料整理,NVIDIA 尚未作为官方规格公布:

  • 首代带 Lid,MCL 未赶上首批
  • Lid 由双片式转向单片式 / stiffener
  • TIM2 早期为 Indium,2026 年部分资料称改为 graphite pad
  • GPU 区域 MCCP,通道 pitch 约 100 µm;铜基冷板,接触面镀金
  • Strata 冷板覆盖 2×GPU + CPU + SOCAMM + VRM