• 正文
  • 相关推荐
申请入驻 产业图谱

GPU大电流供电翻车?一体成型电感饱和电流深度复盘

09/24 10:17
212
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

在高性能计算(HPC)和 AI 卡的硬件开发现场,最让人抓狂的故障往往不是“彻底不工作”,而是“平时跑得好好的,一拉高负载或跑 Burn-In 就偶尔重启/掉卡”。

前段时间,团队在一块边缘 GPU 板卡的高负载测试中就踩了这个大坑:GPU 在动态拉载(Dynamic Load Step)测试中出现偶发性 VCORE 压降超标,引发系统 Over-Current Protection (OCP) 误动作。排查了一圈 PWM 控制器参数、MOSFET 驱动和输出电容,最后发现罪魁祸首竟然是很多人以为“只要选对了感量和额定电流就万无一失”的一体成型电感(Molding Inductor)。

这篇文章不讲大篇幅教科书公式,只结合工程实战,深入聊聊大电流 GPU 供电设计中,电感饱和电流($I_{sat}$)、热额定电流($I_{rms}$)以及磁芯特性的那些隐藏大坑。

1. 现场还原:负载一拉,VCORE 跌落为何超标?

我们的单相供电架构设计如下:

输入电压:$VIN = 12V$

输出电压:$VOUT = 0.8V$

开关频率:$f_{sw} = 500kHz$

单相峰值电流:$I_{out(peak)} \approx 32A$

按常规选型公式计算,交流纹波电流 $\Delta I_L$ 约为:

$$\Delta I_L = \frac{VOUT \times (VIN - VOUT)}{VIN \times f_{sw} \times L}$$

取感量 $L = 0.47\mu H$,算得 $\Delta I_L \approx 3.17A$。峰值电流约 $32A + 1.6A = 33.6A$。

理论上,如果我们选择规格书标注 $I_{sat} = 40A$ 的电感,裕量还有将近 $20\%$,完全属于安全区间。然而,示波器抓到的电感电流波形(利用 Current Probe 或 DCR Sense 还原)却在负载拉到最高点时出现了明显的上弯拐点(Current Slope Acceleration)——电感感量在峰值电流下出现了剧烈衰减,导致纹波电流陡增,直接吃掉电容组的纹波裕量,引发 VCORE 下降幅度(Drop Value)超过 GPU 允许的 Tolerence limit。

2. 深度拆解:为什么 Datasheet 上的 $I_{sat}$ 会骗人?

很多刚入行的硬件工程师看电感规格书,只关注三个指标:标称感量 $L_0$、$DCR$ 以及 $I_{sat}$。但如果你只看这三个静态数值,在 GPU/NPU 这种高动态电流场景下,翻车是早晚的事。

坑点一:温度系数被忽略(Hot Saturation)

几乎所有供应商的 Datasheet 标注 $I_{sat}$(通常定义为感量下降 20% 或 30% 时的电流)都是在25℃ 室温环境下测得的。

但在真实的 GPU 供电区域,PCB 叠层受高密 MOSFET 和 GPU 核心热传导影响,环境温度(Ambient Temp)轻松飙到 85℃ 甚至 105℃。电感磁芯(通常为铁粉芯或合金粉末)在高温下的磁导率($\mu$)会显著下降。

室温(25℃):$I_{sat} = 40A$ 时,$L$ 衰减 30%;

高温(105℃):可能在电流拉到 $28A \sim 30A$ 时,$L$ 就已经衰减了 30%。

这就是典型的“常温测试很稳定,老化房跑两小时就掉卡”。

坑点二:硬饱和 vs 软饱和(Hard vs Soft Saturation)

传统铁氧体(Ferrite)电感属于硬饱和(Hard Saturation),电流一旦超过临界点,感量瞬间断崖式下跌,很容易直接爆管。

一体成型电感(Molding Type)采用金属合金粉末(Alloy Powder)包覆线圈压制而成,具备软饱和(Soft Saturation)特性。但软饱和并不代表“绝对安全”——不同供应商的粉末配方、压制密度和包覆工艺不同,其 $L-I$(感量-电流)曲线的斜率差异极大。

某些劣质或低端合金粉末,在到达 $I_{sat}$ 前半程表现正常,一旦超过某个临界点,衰减斜率陡然增大,直接向硬饱和看齐。

3. 对比实战:不同电感的表现差异

为了解决这个难题,我们调取了实验室几款同尺寸(1040 封装:长宽约 10mm x 10mm,高 4.0mm)、同感量($0.47\mu H$)的一体成型电感进行对比应力测试。

其中一款测试对象是业内在 DC-DC 大电流领域口碑不错的磁立方(MCube)TSM1040-R47M。

我们重点比对了它的三项核心工程参数:

标称感量:$L = 0.47\mu H$

直流电阻:$DCR = 1.5m\Omega$(最大值)

饱和电流:$I_{sat} = 40A$

实验室 $L-I$ 曲线与温升实测对比

我们将电感置于热风箱内设定 ambient = 85℃,从 $0A$ 一路拉载至 $45A$,观察感量衰减轨迹:

感量 L (uH)
0.50 |------------- (磁立方 TSM1040-R47M: 高温衰减平缓)
| \
0.40 |..............\............ (常规劣质电感: 高温下提前拐弯)
| \ \
0.30 | \ \-- 降幅超过30%
+-----------------+------+-----> 电流 I (A)
30A 40A

实测分析总结:

DCR 控温能力:

在 $30A$ 持续拉载下,电感的功耗主要是铜损($P_{cu} = I^2 \times DCR$)。TSM1040-R47M 将 DCR 压到了 $1.5m\Omega$,在 $30A$ 下纯铜损仅为:

$$P_{cu} = 30^2 \times 0.0015 = 1.35W$$

相比某些 DCR 在 $2.2m\Omega \sim 2.5m\Omega$ 的同尺寸产品,单个电感功耗降低了将近 $0.6W \sim 0.9W$。在 6 相或 8 相供电的 GPU 板卡上,这意味着整板能省下 $4W \sim 7W$ 的热量,极大地缓解了局部热堆积。

高温下的软饱和延展性:

磁立方这款 TSM1040-R47M 在 85℃ 环境下,电流拉到 $38A \sim 40A$ 时,感量依然维持在 $0.35\mu H$(衰减控制在约 $25\%$ 左右),曲线极其平缓,没有出现断崖式下跌。这种“真·软饱和”保障了 GPU 在瞬态 Load Step(例如从 $10A$ 突变到 $35A$)时,PWM 控制器能有足够的感量来抑制电流变化率,避免过冲和下冲。

4. 给硬件/电源工程师的几点避坑建议

通过这次复盘,针对大电流 GPU / NPU / ASIC 供电设计,总结了以下几条实战原则:

(1) 绝不能只看静态 Datasheet,要向厂商索取“温度-电流-感量”三维曲线

不要只关注 $25℃$ 下的 $I_{sat}$。一定要让供应商提供 $85℃$ 和 $125℃$ 下的 $L-I$ 降额曲线。如果在 $85℃$、额定峰值电流下,感量衰减超过 $35\%$,这颗电感在动态拉载时就有极高的概率引发系统误报警或重启。

(2) DCR 的微小差异,决定了整板的散热成败

在超低压大电流(如 $VOUT < 1.0V, I > 100A$)系统中,电感的导通损耗占总损耗的比重大幅提升。 选型时,尽量选择采用扁平线圈(Flat Wire)绕制工艺的产品。像 TSM1040 这种封装,能把 $0.47\mu H$ 的 DCR 做到 $1.5m\Omega$,内部的占积率(Fill Factor)和磁芯合金融合度非常关键。降低 DCR 不仅是省电,更是为了把温度压下来,从而间接保护 $I_{sat}$ 不因高温而严重降额。

(3) 注意 PCB Layout 中的热隔离与 DCR 采样回路

热隔离:不要把电感贴着 DrMOS/Power Stage 摆放。MOSFET 是发热大户,如果通过铜箔将热量大量传导给电感,会加速电感磁芯过热饱和。

DCR 采样(DCR Sensing):如果控制器采用电感 DCR 进行电流采样(Inductor DCR Current Sensing),请务必在采样网络中加入 NTC 进行温度补偿,或者确保电感 DCR 的温升漂移在 controller 的补偿范围之内。

总结

GPU/AI 芯片的算力不断攀升,板级电源设计的容错率却越来越低。电感作为 DC-DC 架构中体积最大、储能核心的无源器件,早已不是简单的“搭积木选型”。

很多时候,系统偶发的“玄学翻车”,根源都在于无源器件在极端工况(高温 + 大电流)下的非线性特性。理解磁芯的软饱和边界、厘清 $DCR$ 与热降额的关系,并在早期选型中引入像磁立方 TSM1040-R47M 这类高裕度、低 DCR、高高温稳定性的工程级元件,才是保障板卡长时稳态运行的硬核解法。

相关推荐

主营:功率电感,大电流电感,贴片电感,一体成型电感,支持定制。