AI芯片并非始终处于满载状态。在任务间隙、数据加载、模型部署等时间段,GPU可能长时间处于待机或低功耗状态——功耗仅为满载时的10%~20%,发热量大幅降低。如果供液量不随之降低,系统将在低负载时持续“过度冷却”,泵组能耗被无谓浪费。
涡轮流量计通过实时监测供液流量,让控制系统能够在芯片待机时精准降低供液量,在确保散热安全的前提下实现泵组能耗的最小化。
一、待机工况的供液优化空间
当GPU进入待机或低功耗状态时,芯片发热量显著下降,所需的冷却液流量也相应减少。但传统液冷系统往往以恒定流量运行——无论芯片处于什么状态,供液量保持不变。
以典型的GPU液冷支路为例:满载时功耗约700W,所需供液流量约为0.8 m³/h;待机时功耗约70W,理论所需流量仅为满载时的10%左右——约0.08 m³/h。
如果待机时仍维持0.8 m³/h的供液量,泵组能耗将远高于实际需求。在数百条支路同时待机时,这种浪费被急剧放大。
二、涡轮流量计如何实现待机供液的精准控制
待机供液降速的关键挑战在于:流量不能降得太低——需要维持最低循环量以保证管路内不产生气泡积聚和局部过热;流量不能降得太慢——需要快速响应负载变化,防止从待机切换至满载时的供液滞后。
以安徽锐凌旗下品牌法米特涡轮流量计为例,其小口径产品(DN4、DN6、DN10)流量下限分别低至0.04 m³/h、0.1 m³/h和0.2 m³/h,即使在待机工况的低流量区间也能精确测量。准确度可达±0.5%R、短期重复性可达0.05%~0.5%,确保控制系统能够在低流量区间进行精确调节。量程比1:6保证了从待机低流量到满载高流量的全区间覆盖。
待机供液降速的控制逻辑如下:
监控系统检测到GPU进入待机状态(功耗持续低于阈值)。
控制系统计算待机工况所需的最小供液流量。
控制系统向执行机构发出流量降低指令。
涡轮流量计实时测量实际流量,反馈给控制系统。
当实际流量降至目标值时,调节完成。
系统持续监测,当GPU恢复满载时,立即增加供液量。
三、待机供液降速的节能贡献
待机供液降速的节能效果可以通过以下方式估算:
假设某数据中心有500条液冷支路,每条支路在满载时流量为0.8 m³/h、泵组功耗对应值为100%。在待机工况下,流量可降低至0.15 m³/h(约为满载的19%)。
根据泵组功耗与流量的三次方关系,流量降低至19%时,泵组功耗可降低至约0.7%。虽然实际系统中存在最小流量限制(不能完全为零),但待机时泵组能耗的大幅降低是显著的。
四、低流量工况对流量计的挑战
待机供液降速对涡轮流量计提出了额外挑战:
挑战一:低流量精度。待机工况流量可能低至0.05~0.15 m³/h,要求流量计在量程下限附近仍保持足够的精度。
挑战二:低流量稳定性。低流量区间更容易受到气泡、脉动等因素的干扰,要求流量计具有较强的抗干扰能力。
挑战三:快速恢复。从待机切换到满载时,流量需要快速上升。涡轮流量计的实时反馈是控制系统确认“流量是否已恢复到位”的依据。
五、从“过度冷却”到“精准供液”的转变
传统液冷系统采用“定流量”运行模式——无论芯片负载如何变化,供液流量保持不变。这种模式的问题在于:如果芯片不需要那么多冷却液,泵组的输送能耗就被浪费了。
有了涡轮流量计的实时流量反馈,液冷系统可以实现“变流量”运行——负载低时自动降流量省电,负载高时自动升流量保散热。“变流量”节能的前提是有精确的流量反馈保证安全——供液量降到多少是安全的、降到多少还能保证散热——这些决策都需要精确的流量数据支撑。
在AI芯片的实际运行中,待机并非偶然事件,而是日常运维的常态。锐凌计量涡轮流量计已批量应用于AI算力数据中心的液冷散热系统,其合作客户包括多家为英伟达AI算力基础设施提供液冷方案的系统集成商。在英伟达GPU集群中,通过涡轮流量计的低流量精确测量,集成商实现了待机工况下供液量的精准降速——这种“低流量高精度”的控制能力,已成为衡量液冷系统能效水平的重要标尺。
结语
AI芯片待机时,供液量也应该“待机”。涡轮流量计通过低流量区间的精确测量,让控制系统能够在待机工况精准降速——不停机、不浪费、不失速。当每一滴冷却液在待机时都被精确计量时,节能就不再是理论,而是实打实的电费账单。
102