• 正文
  • 相关推荐
申请入驻 产业图谱

Agent正在改写CPU:GPU配比

7小时前
415
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

英特尔CEO陈立武:过去几年,高性能计算的故事几乎只关于GPU和其他加速器;最近几个月,CPU却开始重新回到AI系统的中心。他把位置说得更直白:CPU现在是整个AI栈的编排层和关键控制平面,客户部署服务器CPU与加速器的配比,也在向CPU一侧回摆。

回答两个问题:(1)GPU越来越强,AI服务器为什么反而需要更多CPU?(2)这轮变化传到国产AI服务器,缺的又是哪一环?判断先摆在这:Agent把一次模型推理拉成了一条不断调用工具、检索数据、执行代码和更新状态的工作流。GPU负责算,CPU负责编排这条流程。

英特尔Q1电话会议上,CFO David Zinsner给出了更具体数字:训练负载通常是7到8颗GPU配1颗CPU;推理大约收窄至3到4比1;到了Agent和多智能体,“甚至可能往反方向翻过去一点”。同一场会上他还说,一季度收入本可以更高,但“需求持续超过我们正在扩大的供给”。

TrendForce的口径也接近:今天的AI数据中心多数运行在1:4到1:8之间,未来会落到1:1到1:2。AI基础设施的投资叙事仍围着GPU转,先绷紧的却是那颗过去两年常被当成配角的芯片。AI的工作方式已经变了。

一、GPU已经这么强了,CPU怎么又成了瓶颈?

把三种负载并排放,差别一眼就看得出来。

表1|三类负载的CPU与GPU分工。训练与普通推理中CPU处在周边位置,Agent把它推到流程中间

在前两类负载中,CPU主要做数据准备和任务分发;GPU计算时间够长,这些工作通常不显眼。

Agent的执行是一连串循环:模型判断下一步,调用工具;工具在主机侧或外部服务上执行,结果回到上下文,模型再继续推理。循环一轮接一轮,每一次工具执行都可能让计算离开GPU,等主机侧或外部服务把结果送回来。

Agent把一次推理变成了一条反复切换的工

图1|Agent执行循环:GPU推理与CPU侧工具执行交替发生。传统推理一次通过,CPU处在周边;Agent执行工具时,GPU会等待主机侧或外部服务返回结果

SemiAnalysis首席分析师Dylan Patel在今年4月的一次访谈里,把这种变化说得很直白:"AI头几年,CPU确实严重滞后,你发一个字符串,它回一个字符串,对CPU没什么需求。"但现在,模型输出内容、检查环境、再基于反馈继续执行,"这个循环变得越来越紧。"

他给的现实注脚是:代码Agent的收入在很短时间内从几十亿美元冲到超过100亿美元,单个任务的时长也从几十秒拉长到连续六到八个小时。

任务一拉长,工具调用和状态切换就不断往CPU侧堆积。Agent增加的不只是Token数量,更是控制流、工具链和系统调用。GPU可以靠加卡扩Token吞吐,但控制流不会因为多插几张卡就自动加快。

二、GPU没变慢,它在等米下锅

CPU会把GPU拖慢,通常卡在工具调用、隔离环境和调度搬运这些环节。

工具调用:Agent的手长在CPU上

一个Agent要干活,就得调用外部工具:Python解释器、搜索引擎、数据库查询、网页抓取与解析、单元测试与编译。这些任务多数仍运行在CPU侧。它们分支密集、I/O密集、延迟敏感,正是CPU更擅长的活。(向量检索、部分数据库算子和数值计算可以用GPU加速,只是今天主流的Agent框架里,它们大多还在主机侧。)

佐治亚理工与英特尔的联合研究把五类典型Agent负载放上台架实测(数据取自2026年4月修订版论文),结果有些出人意料:

RAG(Haystack)的端到端时延中,向量检索一项就占了81%–89%,几乎决定了整体快慢;SWE-Agent的Bash执行在两套配置下分别占到25%和65%,CPU侧负担随环境变化剧烈;而Toolformer则相反,LLM推理吃掉77%–88%的时延,CPU反而很轻。ChemCrow与Web-Augmented Agent介于两者之间(完整分布见图2)。

不同Agent对CPU的依赖程度差异极大,不能一概而论,但没有任何一类能完全绕开CPU。

同样叫Agent,CPU侧时延占比可以从25%到89%

图2 | 四类工具密集型 Agent 负载的 CPU 侧工具时延占比。区间为论文不同硬件配置(Sys 1 / Sys 2)下的实测范围。

注①:Toolformer 因 LLM 推理占主导(77%–88%)、CPU 侧极轻,方向与上述四类相反,未纳入本图横向对比,详见正文。

注②:论文早期摘要曾给出 90.6% 的上限,英特尔技术博客概括为 50%–90%;本文统一采用 2026年4月 v3 修订版正文口径(约 89%)。以上数据仅对应工具密集型负载,不代表所有 Agent 范式。

沙箱隔离:每个Agent并发都要消耗一份 CPU 的线程与内存

Coding Agent不适合共用一个执行环境。它要写文件、装依赖、跑测试、执行模型生成的代码;一旦共享,一个Agent的副作用可能污染另一个Agent的状态,也很难追溯。常见解法是把执行环境隔开:容器、微虚拟机或独立进程。

推理跟Token数走,沙箱则跟并发Agent数走。每多一个并发Agent,就要多维持一套独立的资源命名空间、进程状态和工作集。镜像层和只读页可以共享,写时复制也能省下一部分;但独立的部分照样压在CPU的核心数、线程数和主机内存上,GPU帮不上忙。

于是会出现一种反直觉的资源账:GPU利用率还没打满,机器却已经开不出新的沙箱了。论文把这件事量化得很直观:批大小从64加到128后,Web-Augmented Agent中CPU侧摘要环节的平均时延分别拉长到2.0倍(Sys 1)和1.9倍(Sys 2),同一区间内GPU侧LLM推理的平均时延基本没动。

表2|SWE-Agent负载下,批大小翻倍时各组件的平均时延增幅。四档从GPU到CPU单调递增:并发翻一倍,涨的是CPU那一段

论文对Web-Augmented Agent、SWE-Agent与ChemCrow的归因一致:吞吐在批大小128处饱和,原因是CPU重型工具的核心超额订阅。作者的结论更直接:CPU并行策略的效率低于GPU,在Agent负载中会过早把吞吐顶到天花板,进而拖累昂贵GPU资源的利用率。

调度与搬运:GPU开始等人

除了工具和沙箱,CPU还要负责请求编排、子Agent间的数据传递、状态管理与CPU—GPU同步。单看都不重,却一起挤在关键路径上。GPU的下一批数据和指令,要等CPU准备好。

制造业里有个词叫停机待料:机器没坏,产能也在,就是等不来料。工具密集型Agent里,GPU也会落到这种状态。Blackwell比Hopper快得多,Rubin还会更快,但GPU会反复等CPU或外部服务把结果送回来。英特尔把这部分损耗叫GPU Idle Tax(GPU空转税)。算力付了全款,只用上其中一部分。

关键在于,CPU 卡住的是串行控制、外部交互和隔离执行,矩阵运算仍然主要交给 GPU。Agent 把一批 GPU 不擅长接手的任务堆到 CPU 侧,GPU 就被卡在等待上,空转税由此产生。此时真正紧张的不再是浮点能力,而是核心数、内存带宽和低延迟响应。

很明显,瓶颈已经从算得快不快,转移到了喂得及不及时。

三、CPU:GPU 从 1:8 到 1:2:别迷信这个数字

传统8卡训练服务器通常配1到2颗CPU,对应1:8或1:4。CPU主要做数据准备、任务分发和检查点等主机侧工作。在不少8卡系统中,一颗CPU已经够用,再加CPU也未必换来相称收益。

到了推理,尤其是Agent场景,工具调用从偶发变成每个请求都要跑几次,沙箱数量随着并发Agent数增加;GPU单卡性能又明显快过CPU单核。为了不让GPU停机待料,系统只好把CPU配得更密。

产品配置提供了一组旁证。NVIDIA GB200 NVL72在单机柜内配置36颗Grace CPU与72颗Blackwell GPU,CPU:GPU正好是1:2。下一代Vera Rubin NVL72维持同一配比:36颗Vera CPU配72颗Rubin GPU;小型化的NVL4则是2颗Vera配4颗Rubin,同样1:2。Vera单颗88核176线程,通过1.8TB/s的NVLink-C2C与GPU相连;NVIDIA将Vera定位为面向数据搬运与Agent推理的CPU。

主机CPU也重新成了平台厂商要争的位置:按英特尔一季度披露,Xeon 6被选为NVIDIA DGX Rubin NVL8系统的host CPU。同期Arm打破35年只卖IP的惯例,直接销售成品CPU;NVIDIA也把Vera作为独立产品对外出售,因为客户需要更灵活的CPU与GPU配比。

三家厂商,三个动作,指向同一件事:CPU不再是GPU的配件,而是可以单独售卖、值得单独争夺的商品。

配比收窄:从1颗CPU喂8张卡,到1颗CPU喂2张卡

图3|三代平台的CPU:GPU配置对比。图示为归一化到1颗CPU的相对配比,非机柜内实际物理排布;传统8卡服务器按1颗CPU计为1:8,配2颗时为1:4

英特尔研究人员基于自己的实测给出更激进的区间:部分Agent场景下,最优CPU:GPU约在0.8:1到1.4:1,接近一颗CPU配一颗GPU;某些负载下,CPU数量甚至超过GPU。但同一篇博客也提醒:合理的配比高度取决于工作负载。

GB200和Vera Rubin的1:2,说明主流平台正在提高CPU密度;这不等于一条适用于所有AI服务器的标准答案。模型结构、工具复杂度、并发量、沙箱粒度和调度策略不同,最优配比也会不同。

那么,配比会不会继续收窄?

主要看两件事:Agent在推理中的占比会不会继续提高,以及工具调用、沙箱执行会不会被DPU或专用硬件接走。CPU单核与GPU性能的相对提升速度,会决定这条曲线走得有多快、能走多远。

不过,软件可能比硬件更早改写这条曲线。前面那篇论文提出的两种调度优化,不改一颗芯片,就把服务时延最多压低了3.9倍。这说明,相当一部分CPU不够用,其实是CPU没被用好。如果调度层的优化跑在硬件扩容前面,市场对CPU的增量需求可能会被明显削平。(COMB与MAS的完整倍率见文末口径说明。)

四、多加两颗CPU没用,服务器得推倒重来

如果配比真从1:8走到1:2,工程上至少得重算四处:CPU插槽、内存、互连,以及供电和散热。

核心、线程与内存。沙箱并发直接吃核心,单颗CPU的核心数从几十走向上百;在启用主机内存卸载的系统中,长任务的KV cache还会往CPU侧大内存溢出。核心数一涨,内存容量和通道数必须同步跟上,否则加出来的核心喂不饱。

CPU—GPU互连与数据路径。CPU与GPU之间的同步变频繁,链路带宽和延迟从够用就行变成系统卡点。PCIe代际、CXL的内存语义,以及NVLink-C2C这类紧耦合方案之间的差别,在训练负载下不明显,在Agent负载下会被放大。

沙箱、虚拟化与调度软件。单机要支撑的隔离实例数上升一个量级,虚拟化开销必须优化,前面提到的3.9倍就出在这一层。调度软件现在是系统设计的一部分,不能再当作部署后的配角。

供电、散热与整机结构。CPU与内存的功耗占比上升,机柜的供电分配、液冷回路和机位规划都要重新算。

变化不只在CPU采购量。AI服务器正从以GPU为中心、其他部件围着它转的加速器系统,变成CPU、GPU、内存与网络共同设计的异构计算系统。

成本结构也会跟着重排。CPU配置密度提高会同步放大内存、互连器件和供电模块的需求,整机BOM里非GPU部分的占比因此上升;TrendForce观察到英特尔与AMD在2026年一季度末上调了部分CPU产品线价格。供给紧张既有Agent带来的需求变化,也有产能爬坡的影响。英特尔已明确在扩大产出,Intel 3制程的Xeon 6进入满产爬坡、18A良率好于内部预期,即便如此仍预计需求超过供给会延续到今明两年。

竞争转向系统平衡后,国内厂商要面对的是核心、互连与软件栈能不能协同,CPU单点性能只是其中一项。

五、中国厂商真正要补的一课,不在芯片里

配比收窄会把压力从卡够不够快移到CPU、内存、互连和调度能不能跟上。国产服务器CPU要过的仍是三层技术检验,后两层更难;除此之外,还得看产品能不能真正进入整机厂商的选择范围。

先看核心规模与内存通道。按鲲鹏社区公开规格,华为鲲鹏920基于7nm工艺,最高64核、集成8通道DDR4内存控制器,支持PCIe 4.0与CCIX;阿里平头哥倚天710采用5nm工艺与2.5D双DIE封装,两个DIE各64核、合计128个Armv9核心,支持DDR5与PCIe 5.0;飞腾腾云S5000C提供64核/32核/16核三种形态,面向计算、存储与AI服务器场景。部分产品的核心规模和内存通道已具备基本条件;参数够看,不等于真实Agent负载能跑好。

这一层还要问一句:参数够但整机厂商拿不拿得到?例如,倚天710并不对外销售,只供阿里云自用。

再看CPU与加速器的紧耦合互连。公开资料里,这一层最值得盯。海外平台正在通过一致性C2C互连,把CPU与GPU纳入更紧耦合的共享内存体系:Vera与Rubin之间是1.8TB/s的NVLink-C2C,CPU侧内存对GPU近乎可直接寻址。从公开产品规格看,国产组合目前仍以标准PCIe为主,CPU与加速卡是松耦合关系;训练负载下这道差距会被长算子摊薄,Agent负载里的高频小批量同步却最吃这一段。

国内厂商也开始在这一层布局。按海光信息2025年年度报告,公司于2025年9月发布HSL(Hygon System Link)系统总线互联协议。年报将它定义为“开放、高带宽、低延迟的互联总线协议规范,主要用于连接海光CPU与各类xPU”,目标是与xPU、IO、操作系统及OEM厂商实现紧耦合高速互联;核心内容包括开放完整总线协议、提供IP参考设计、开放指令集,并支持缓存一致性和多链路扩展。

缓存一致性尤其关键。有无缓存一致性,是紧耦合互连和普通PCIe挂载最实在的差别:它决定CPU与加速卡之间是互相传数据,还是共用一份数据。Agent负载里那些高频、小批量、来回同步的动作,吃的就是这个差别。

海光在年报里把未来目标写成从适配兼容走到原生协同。协议发出来只是第一步,后面要看多少加速卡、整机和操作系统厂商真正接入,以及接入后的实测带宽与延迟。

最后看沙箱密度与调度软件栈。公开数据最少,也最看长期积累。高并发隔离环境的每瓦效率、虚拟化开销、调度器与CPU微架构的协同,不是芯片下线就能解决的问题,要靠真实负载长期打磨;COMB与MAS的实验也说明,软件调度本身可能带来显著收益。由于缺少可比的公开实测,目前还不能判断国产在这一层的能力差距;能确认的是,负载数据和长期运行样本还不够。

表3|国产服务器CPU在Agent时代的三层能力检验。核心数与通道数为各厂商公开产品规格;财务数据为上市公司定期报告口径;第三层缺少可比的公开实测数据,故不作量化评价

三层里,第一层看规格,第三层看长期运行。公开资料里,互连是目前最值得盯的一层。国产AI服务器多数仍是加速卡和通用CPU的松耦合组合,Agent负载放大的恰恰是CPU与加速器之间那条链路。协议能不能形成生态,要看有多少加速卡、整机和操作系统真正接入。

先立一把尺子。要跨过互连这一层,得把CPU与加速器做成硬件缓存一致的共享内存,且已量产外供。按这个口径,全球只有NVIDIA走完整条链路:NVLink-C2C把Vera与Rubin纳入同一内存域。

把这把尺子放到国内,各家打法的位置就清楚了。

真正贴着互连层的只有第一档,而且三家都是自用闭环,协议服务自家芯片和自家云,没有一家把互连作为开放标准外供‌。

第二档CPU、加速卡、整机三件齐备,但用一致性协议把它们串起来,尚无公开量产案例。第三档手里没有CPU,能不能接进别人的协议,直接决定生态成不成。

再往后的软件层玩家做的是协议之上的优化,价值真实,天花板却由上面几档决定,底层不通,上层再挤也挤不出共用一份数据。

所以国内的问题不是没人做,而是各自成闭环,还没长出一个能互相接入的公共层。

表4|互连层:中国厂商各自站在哪里。分类维度是各家与紧耦合缓存一致性的距离,不是综合实力排序

结语:下一代AI服务器,拼的是系统平衡

这轮变化说明,AI基础设施正在从单点堆料走向系统工程。过去两年比谁的GPU多,接下来更该看谁的GPU真正在算。

接下来更值得盯两类数:GPU因等待CPU产生的空转时间,以及不同负载下的CPU:GPU配比。前者直接显示瓶颈,后者会落到采购单和机柜设计上。CPU侧时延占比,是拆解前者时常看的指标。

对国内还要多盯一件事:紧耦合互连协议发布后,第二家、第三家加速卡和整机厂商能不能真接进来。那才说明中间的互连能力补上了,核心数和整机之外也有了连接能力。

GPU仍然决定AI系统的算力上限,CPU、内存、互连和调度则越来越决定这些算力能不能跑出来。比起盯谁的GPU跑分高,我更想看看半年后,有多少家国内厂商真的把一致性互连协议跑通。

参考来源与口径说明:

本文数据截至2026年8月初。文中对独立研究、厂商自测与披露、第三方机构预测、上市公司公告四类证据做了刻意区分:产品规格与性能指标仅代表厂商公开口径,不作跨平台统一结论;配比数字来自不同口径与不同测量方法,不可直接相加或取中间值;论文实测数据依赖具体硬件配置与负载,不构成普适结论。国产部分仅采用厂商公开产品规格与上市公司定期报告口径。

  参考来源:

[1]Intel|1Q2026 Earnings Call — CEO/CFO Prepared Remarks(Lip-Bu Tan)

[2]Intel|INTC Q1 2026 Earnings Call Transcript — Q&A(David Zinsner)

[3]Intel / SEC|Form 10-Q for the quarterly period ended March 28, 2026

[4]Georgia Tech & Intel|Towards Understanding, Analyzing, and Optimizing Agentic AI Execution: A CPU-Centric Perspective,arXiv:2511.00739(v1 2025-11-01;本文采用 v3, 2026-04-16)

[5]Intel|Avoid the GPU Idle Tax: Choosing the Right CPU to GPU Ratios for Agentic AI

[6]TrendForce|The Great Rebalance: How Agentic AI Is Reshaping the CPU:GPU Ratio

[7]NVIDIA|GB200 NVL72

[8]NVIDIA|Vera Rubin NVL72

[9]SemiAnalysis|Dylan Patel 访谈(付费播客)

[10]Cast AI|2026 State of Kubernetes Optimization Report

[11]华为鲲鹏社区|鲲鹏920处理器

[12]阿里巴巴平头哥(T-Head)|倚天710 发布信息

[13]飞腾|腾云S5000C 高性能服务器CPU

[14]海光信息(688041.SH)|2025年年度报告

#深芯盟  #湾芯展  #半导体产业研究 #Agent  #GPU #CPU

相关推荐