2018年9月,杭州云栖大会,阿里宣布成立一家名叫平头哥的芯片公司,名字据说来源于那个男人的一次非洲之旅。
说实话,当时业内看好的人并不多。互联网公司做芯片,听起来总有点跨界玩票的意思。芯片是一个出了名的慢行业,要投入长周期、重资金,还得接受失败率很高的现实:一颗芯片从立项到量产通常要好几年,一次流片的费用就可能是几千万甚至上亿,而且一旦出错,钱和时间都回不来。
很多人觉得,一家习惯了「小步快跑、快速迭代」的互联网公司,未必能沉得住这口气。
八年过去了,还是在云栖大会,还是这家叫平头哥的公司,发布了新一代训推一体AI芯片真武V900,性能提升至真武M890的3倍,是目前算力最强的中国自研AI芯片(之一),能够满足万亿参数级大模型的训练和推理。
这几年,「算力」成了整个AI行业最焦虑的词。模型越做越大,卡越来越难买,每家公司都在问同一个问题:我们的算力到底从哪儿来?在这样的背景下再看这八年,当年那个被质疑玩票的平头哥,已经悄悄地把数据中心里几乎所有关键芯片都做了一遍。
八年,从单点突破到全栈自研
先来看看平头哥的八年造芯路径。
2019年,成立刚一年的平头哥推出第一颗芯片含光800。这是一颗为具体场景深度定制的推理芯片,每秒能处理7万8千张图片,当时拿下了同类芯片性能和能效比两项第一,后来用在了双11淘宝主搜里。
2021年,服务器CPU倚天710发布,阿里成为国内第一家具备CPU研发设计能力的互联网公司。这颗芯片性能比同期业界标杆高20%,能效比提升超过50%,现在还在阿里云上跑视频编解码、高性能计算和游戏等业务。
2023年,存储侧补上了第一颗SSD主控芯片镇岳510。
2024年,首颗训推一体AI芯片真武810E推出,配合自研T-Head SAIL软件栈,支撑了千问大模型的训练和推理。
今年4月,网络侧发布首款智能网卡磐脉920,这是国内首款内置PCIe Switch的400G智能网卡。
今年5月,真武M890亮相,性能是810E的3倍,同时推出了搭载ICN Switch 1.0的128卡超节点。
今年9月,真武V900发布,性能又是M890的3倍。
AI芯片、服务器CPU、互联芯片、智能网卡、存储主控,八年时间,算力、网力、存力全做了一遍。真武系列三年迭代三代,已经服务超过650家企业客户。阿里巴巴集团CEO吴泳铭在云栖大会上表示,由于平头哥芯片产品线的成熟和客户的广泛应用,平头哥AI芯片的年出货量将大幅提升。
从造零件,到造系统
回头看这条时间线,今年是一个明显的转折。
前几年,平头哥做的更像是造零件:缺什么就补什么,一颗一颗地把数据中心里的关键芯片从无到有做出来。
到了今年,这些零件开始被组装成一台完整的机器。
为什么是现在?因为AI对算力的需求已经变了。大模型到了万亿参数、MoE架构和Agent应用普及的阶段,单纯比拼某一颗芯片的指标已经不够,真正要比的是整个计算系统的效率。
如果把一个AI计算系统拆开来看,大致有三个层次:最底层是单颗芯片的计算能力,中间是芯片与芯片之间的连接能力,最上层是负责调度和执行的通用计算能力。
这次云栖大会上的三个和芯片相关的进展,正好分别对应这三层:真武V900解决「算得快」,ICN Switch和超节点解决「连得好」,倚天CPU路线图解决「调度得动」。
下面我们一层一层来看。
真武V900,训练推理如何既要又要
真武V900是一颗训推一体的芯片。现在很多AI芯片是有分工的,要么主攻训练,要么主攻推理,因为这两件事对硬件的要求差别很大。
训练是一个吃显存的过程。以常见的混合精度加Adam优化器为例,每个参数除了权重本身,还要存梯度、FP32主权重和两份优化器状态,粗略算下来每个参数要占16字节左右。一个万亿参数的模型,光是这些状态就要16TB左右,这还没算中间激活值。所以训练必须把模型切到大量芯片上,每颗芯片的显存越大,需要切的份数就越少,芯片之间的通信也就越少。
推理则是一个吃带宽的过程。大模型生成每一个Token,都要把相关的权重从显存里读一遍,同时还要维护不断增长的KV Cache。这个阶段的瓶颈往往不在计算,而在显存容量和带宽。所以推理会想方设法压低精度,从FP16到FP8再到FP4,精度每降一半,同样的显存能装下的参数量就翻一倍,读取的数据量也减少一半。当然,精度降到FP4后很容易损失模型效果,所以业界一般会配合按块缩放之类的技术来保住精度。
训推一体,就是要一颗芯片同时满足这两套几乎相反的需求。真武V900基于平头哥自研的并行计算架构,搭载216GB大容量显存,片间互联带宽达到1200GB/s,已经和绿厂最新的Blackwell Ultra进到了同一个量级(显存288GB,NVLink带宽1.8TB/s)。它原生支持从高精度训练到低精度、超低精度推理的全场景。和上一代M890相比,V900单芯片性能提升至3倍。
要知道,M890今年5月才发布,4个月后又翻了3倍,说明平头哥没有在挤牙膏。
根据阿里的说法,V900将于2027年第一季度量产售卖。
真正的短板:通信墙
不过,单芯片性能再强,也只是把木桶的长板变得更长。现在决定AI系统性能的那块短板,是芯片和芯片之间的通信能力,也就是传说中的「通信墙」。
这个瓶颈也不是一下子产生的,而是和模型的变化、芯片连接方式的变化紧密相关。
在传统设计里,一台AI服务器里一般装着8颗AI芯片。在同一台服务器内部,芯片之间用专用的高速互联直接相连,带宽能做到几百GB/s甚至上TB/s。但是一旦跨出这台服务器,芯片之间就只能通过网卡和交换机走网络,带宽大约只有几十GB/s,和机内互联相比差了一个数量级以上,延迟也高得多。
打个比方,同一台服务器里的芯片就像坐在同一间办公室的同事,有事转个身就能说;跨服务器的芯片则像在不同楼里办公,每次沟通都得打电话、发邮件。业内有行业黑话,把前一种叫Scale-up(纵向扩展),后一种叫Scale-out(横向扩展)。
问题在于,大模型里通信最密集的那些操作,比如张量并行和前面提到的专家并行,都需要芯片之间频繁交换数据。用前面办公室的例子,这些专家只有在同一间办公室里才能高效运行。模型规模还不大的时候,8颗芯片组成的小办公室基本够用。可到了万亿参数的MoE模型,专家往往要分布到几十甚至上百颗芯片上,8卡明显装不下,大量通信只能走慢得多的网络。
通信墙就是这样形成的。
解决思路其实很直接:把这间办公室扩大。现在常用的方法,就是用专门的互联芯片,把高速互联的范围从一台服务器里的8颗芯片,扩展到几十、几百甚至上千颗芯片,让它们之间都能以接近机内的带宽和延迟通信。这样一组由大量AI芯片组成、内部全部高速互联的系统,就是超节点的雏形。
所以,一个超节点能连多少颗芯片、连得有多快,很大程度上决定了它能高效运行多大的模型。
超节点,让千颗芯片像一颗芯片
那么,上千颗芯片到底怎么才能连成一个超节点?这就是这次的第二个看点。
超节点的核心是一颗专门负责芯片之间数据交换的互联芯片ICN Switch,即片间互联网络(Inter-Chip Network)。
这颗芯片并不是第一次出现。今年5月的阿里云峰会上,平头哥就和真武M890一起发布了ICN Switch 1.0。它支持平头哥自研的ICN互联总线协议,吞吐量达到25.6Tbps,芯片之间点对点时延低于150纳秒。阿里用它把128颗M890装进一个机柜,组成了128卡超节点,全带宽互联的规模从上一代的16卡提升到了64卡。
这次云栖大会,平头哥把真武V900和ICN Switch组合在一起,把全带宽高速互联的规模推到了千卡级别,而且同一套架构可以覆盖从单机8卡到千卡集群的全部场景。从16卡到64卡,再到千卡,相当于前面说的办公室在一年多时间里扩大了几十倍。
规模变大只是一方面,更关键的是这个超节点里的芯片之间怎么通信。它遵循两个很重要的原则:原生内存语义和内存统一编址。
先讲内存语义。传统的芯片间通信走的是「消息语义」:发送方要准备好数据缓冲区、构造描述符、发起DMA传输,接收方收到后还要做完成通知、同步,再把数据拷贝到计算要用的位置。每一步都有软件栈的开销,一次通信往往要花几微秒。对大块数据来说,这点开销可以忽略;但对MoE那种高频的小数据包来说,真正传输数据的时间可能还没有这些手续花的时间长。
内存语义则是让一颗芯片直接用读写指令访问另一颗芯片的显存,就像访问自己的本地内存一样,中间没有打包、握手和拷贝。在M890那一代,ICN Switch 1.0已经把通信时延做到了百纳秒级,比传统方式低了一个数量级。
再讲统一编址,它指的是所有卡的显存在地址空间上连成一片,形成一个全局共享的大内存。对软件来说,它看到的不再是一千块互相独立的显存,而是一块巨大的内存。
打个比方,原来每个车间都有自己的仓库,想用别的车间的零件,得填单子、打包、发货、签收。现在所有仓库打通了,货架统一编号,需要哪个零件直接到对应的货架上拿。
这个特性带来的最大价值其实在软件端。做过分布式训练的朋友应该都清楚,数据放在哪张卡、什么时候搬、怎么和计算重叠,这些工作非常消耗精力,也很容易出错。统一编址让编程模型大大简化,框架和算子开发者可以把更多精力放在模型本身。这也是全球AI芯片厂商都在往内存语义互联方向走的原因。
从M890的128卡超节点,到V900的千卡全带宽高速互联,Scale-up域扩大了将近一个数量级,而且同一套架构可以覆盖从单机8卡到千卡集群的全场景。
也就是说,现在上千颗真武V900终于可以像一颗"超级芯片"那样协同工作了。
算、存、网拼齐:一台50万卡的计算机
有了算力和互联还不够。这次阿里发布的新一代超节点服务器里放了四类自研芯片:真武V900负责计算,ICN Switch负责超节点内的Scale-up互联,磐脉智能网卡负责超节点之间的Scale-out网络,镇岳SSD主控负责数据存取。
算、存、网三块一次性补齐,而且做到了系统级的协同优化。
再加上阿里云新设计的智算中心网络架构,这套系统可以稳定支撑50万卡规模的单一AI集群。
另外,基于真武M890的超节点已经规模化商用,是国内第一个跑通Qwen3.8和Kimi K3两个超2万亿参数模型的超节点。你正在用的这两个模型,很可能就跑在平头哥的这几颗芯片上。通过算子优化和软硬件协同,真武超节点实例在Agentic推理场景里最多可以实现1.5倍的性能提升。
硬件不换,靠系统优化多出50%的性能,这就是全栈的价值。
CPU,智能体时代被低估的主角
最后一层是CPU。
过去两年说到AI算力,大家主要关注的是GPU。但到了智能体时代,CPU的重要性正在回升。智能体的任务规划、状态管理、工具调用,以及大量数据的预处理和编排,几乎都要由CPU完成。
GPU负责思考,CPU负责安排和执行。如果CPU跟不上,GPU再强也只能空等。
所以Agent需要的CPU,要单核性能强、内存带宽高,并且和GPU紧耦合。
这次平头哥首次公开了倚天服务器CPU的路线图:2027年推出倚天720和倚天730。720在单核性能、核密度和能效上全面提升;730首次采用平头哥全自研的CPU微架构,单核SPECint 2017/GHz性能最高可达倚天710的1.4倍。
未来还将继续推出倚天750,采用第二代自研核,并支持平头哥自研的ICN片间互联总线协议。这个就有意思了。
目前CPU和AI芯片之间大多通过PCIe连接,带宽和延迟都比较有限。在Agent场景下,CPU负责调度,AI芯片负责推理,两者之间的数据交互非常频繁,PCIe很容易成为瓶颈,通信墙再次出现。另外,随着上下文越来越长,业界也在尝试把一部分KV Cache放到CPU的大容量内存里,这同样需要CPU和AI芯片之间有一条更宽、更快的通道。
倚天750接入ICN总线,意味着CPU就和真武AI芯片进入了同一套互联体系。前面讲的超节点解决的是AI芯片之间怎么连,这一步解决的则是CPU和AI芯片之间怎么连。到这里,阿里算力版图中的关键大芯片拼图也补上了。
定义需求,不要猜需求
回到开头的那个问题:八年前那个被质疑「玩票」的平头哥,现在到底做成了什么?
这次云栖大会给出的回答,是他们做了一套为AI时代量身定制的计算系统。
真武负责算力,ICN Switch负责互联,磐脉负责网络,镇岳负责存储,倚天负责调度,未来CPU和AI芯片还会接入同一条总线。
现在算力的竞争,已经从拼芯片,进入到拼系统的时代,这样的体系必须有真实场景来反复打磨。而阿里做芯片最大的优势,就是它本身拥有庞大而完整的应用场景:有云、有淘宝、有钉钉、有各种实际业务,还有千问这样一线水平的大模型。芯片做出来可以直接放进阿里云和自家业务里跑,用自家最前沿的模型去验证和优化,然后快速规模化。
芯片、模型、平台、云,这条完整的链条,是绝大多数芯片公司很难复制的。
从这个角度看,很多芯片公司是在猜几年以后大家需要什么,而阿里是在自己定义几年以后需要什么。
八年前的质疑,今年在云栖大会上有了一个相当完整的回答。
(注:本文不代表老石任职单位的观点。)
518
