• 正文
  • 相关推荐
申请入驻 产业图谱

十万卡超算能烧开西湖水?算力的上限,卡在散热了

10/08 11:16
595
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

液冷技术

“曙光8000十万卡AI超算集群全速运行一年半,产生的总热量足以烧开整个西湖的水。”这句广为流传的比喻,让顶级AI算力的热负荷被具象化。

芯片算力、模型参数、集群规模年年都在刷新,热量这个物理事实却一直没变:电能进入芯片,几乎全部变成热。算力的上限,最后卡在散热上。

曙光8000没有走传统风冷,而是用相变浸没液冷加金刚石铜复合导热材料,才把十万颗芯片的热量压住。这套方案在国内智算中心里已不算孤例。

从头部云厂商的数据中心到商用AI服务器,散热从机房配套问题,变成算力落地、降本、稳运都要先过的关。

01、算力在涨,散热先撞墙

这几年AI集群的功率曲线抬得很快。早年数据中心单机柜功耗普遍在5-10kW,普通风冷就能管住;眼下AI训练集群单机柜普遍突破80kW、100kW,十万卡集群的机柜功耗已在向兆瓦级靠近。单颗AI芯片的功耗,也从百瓦级涨到千瓦级,局部热流密度成倍往上走。

功耗涨得快,散热跟得慢,痛点就显出来了。传统风冷下,高负载服务器会触发芯片降频、算力缩水,宕机风险抬高,散热能耗也压不下来。

多家智算中心披露的数据显示,老旧风冷数据中心的散热能耗能占到总用电的30%-50%,电费是运营里最重的一笔成本。贵州国家算力枢纽基地早年用风冷时,服务器有效算力只发挥到70%,卡在高温导致的保护性降频上。

算力规模化高密度升级已成行业常态,近日,中国移动北京公司联合中国移动云公司宣布华为昇腾950DT千卡超节点正式落地昌平区信息港数据中心移动云北京节点,再次印证算力集群向超高密度、超大规模迭代的趋势。该超节点基于华为超节点架构,单节点搭载1024卡算力,峰值算力达1EFLOPS(FP8),支持256TB统一内存与微秒级超低时延,可全面支撑大模型大规模训推、智能体开发、复杂AI场景落地等高阶算力需求。

此类千卡、十万卡级别高密度算力集群的持续落地,让算力规模持续扩容,但也意味着集群整体热负荷、芯片局部热流密度同步飙升,散热的短板会被进一步放大,成为制约超高密算力集群稳定运行、效能释放的核心瓶颈。

02、三条技术路线,适配不同功率密度

行业目前是风冷、冷板式液冷、浸没式液冷三条路线并行,各有适配的算力密度。

风冷

风冷靠服务器风扇强制对流、机房精密空调换热,产业链成熟、运维简单、改造成本低,仍是老旧IDC和中型云厂商推理集群的主流。短板也明显,空气换热效率低,单机柜功率做到30kW左右就到头,高负载下噪音和PUE都压不住,芯片局部热点也解决不了。

AI高密度场景的新建项目基本不再选它,只留在低功耗推理这类场景当补充。行业普遍认为,同等AI芯片配置下,风冷集群长期满载会让芯片温度偏高15℃-25℃,硬件老化速度也会随之提高,算力亦难以满负荷释放。

冷板式液冷

冷板式液冷把微通道金属冷板贴在GPU、CPU等核心发热芯片表面,冷却液在板内循环带走核心热量,内存、电源等器件仍靠空气散热,是从传统机房往全液冷过渡的折中方案。

相比浸没式,其服务器改动小、能沿用传统运维,初期建设成本据厂商测算能低30%-40%。它只覆盖核心芯片,整机散热不彻底,单机柜功耗有上限,管路接头也有渗漏风险。

浪潮信息公开实测,其商用冷板式液冷方案能把PUE控制在1.15以内,覆盖大部分通算、智算升级场景,腾讯、百度、华为云的中型AI算力集群多用这条路线。

对比风冷,冷板式可降低机房能耗25%以上,芯片运行温度低10-18℃。

浸没式

浸没式是散热效率最高的路线,分单相和相变两种。

单相浸没把服务器整机泡在绝缘冷却液里,靠液体显热换热;相变浸没用低沸点冷媒,靠液体沸腾汽化带走大量热量,曙光8000走的就是相变路线。它能做到整机无死角散热、消除局部热点,PUE最低可到1.05,代价是设备要重新设计、冷却液贵、运维体系全新。据悉,高端氟化冷却液每升报价超过500元,单柜用量可达400-600升,初期投入不低。

浸没式是十万卡、百万卡集群和超高密智算中心的选择。阿里云仁和数据中心是全球规模最大的全浸没液冷数据中心之一。

该项目落地杭州余杭,为国内首座5A级绿色液冷数据中心,采用单相浸没液冷技术,服务器整机浸泡在绝缘冷却液中,省去风扇与机房空调。据阿里云披露,落地后PUE最低降到1.09,每年节电7000万度,完成了大规模全浸没液冷在云算力场景的商用验证。

03、散热最后一毫米:导热材料

液冷解决的是“热量外排”,芯片到散热器之间那层导热材料,决定热量能不能快速导出。界面热阻过高,液冷再好也会让热量堆积、芯片降频。这里的主赛道也在换材料。

传统基底是纯铜和铝,纯铜导热系数401W/(m·K),工艺成熟、价格低,适配普通风冷和低功耗冷板。单颗芯片功耗到千瓦级、热流密度上来之后,铜的导热速率就不够用了,界面热阻拉高,热量导不出去。

金刚石是自然界导热性能最好的材料,金刚石铜复合材料结合金刚石超高导热性和铜的工艺适配,据曙光相关披露,导热能力是纯铜的两倍以上。曙光8000直接采用裸芯片焊接金刚石铜散热器,去掉传统芯片金属上盖加导热垫片的多层结构,把散热器焊在裸芯片表面,压缩导热路径、降低界面热阻,解决了十万卡集群芯片局部热点堆积的问题,也是集群长期全速运行的关键支撑。该裸芯片直焊金刚石铜热沉工艺,此前国内规模化落地难度较高。

芯片和散热底座之间的热界面材料(TIM)也在升级。传统导热硅脂成本低,但长期高温运行会干涸老化、热阻升高,扛不住AI服务器7×24小时运行。据公开报道,华为、浪潮的高端AI服务器机型已批量用液态金属替代硅脂。石墨散热膜、碳化硅热沉等新材料,则在边缘算力和小型高密度服务器里试点。

“烧开西湖水”只是把算力的能耗换成一个能感知的画面。AI算法能迭代、算力规模能翻倍,热量的产生和散去却得按物理定律来。从曙光8000的相变浸没加金刚石散热方案,到各云厂商、算力枢纽的液冷落地,行业已经在这条路上投入了大量真金白银。算力能不能继续往上堆,散热这条线能不能同步跟上,是其中的关键变量之一。

#AI服务器 #液冷技术 #AI算力

相关推荐

DRAMeXchange(全球半导体观察)官方订阅号,专注于半导体晶圆代工、IC设计、IC封测、DRAM、NAND Flash、SSD、移动装置、PC相关零组件等产业,致力于提供半导体产业资讯、行情报价、市场趋势、产业数据、研究报告等。