前段时间参加云栖大会,阿里云的AI算力硬件,给我留下了深刻印象。
这几年,我一直都在关注国产算力。平时看得比较多的,是华为的昇腾和鲲鹏,还有海光、摩尔线程、沐曦、寒武纪等厂商的芯片。说实话,阿里云的算力硬件,虽然平时也有耳闻,但一直没太关注。
阿里云的玩法,和刚才提到的厂商不太一样。阿里云本身就是云服务商,是甲方,就和运营商一样。阿里云做硬件,主要是自给自足,大部分不对外销售。
换言之,阿里云用自己的硬件,建自己的数据中心(算力资源池),然后以云服务或平台的形式,对外销售(出租)算力。
像华为的话,虽然也有自己的云,但自身主要角色仍然是乙方。他们提供算力软硬件解决方案和产品,卖给云服务商、运营商和政企客户。然后这些客户搭建自己的算力集群和数据中心,跑自己的业务,或者再卖给下游客户。
阿里云的玩法,好处是自产自销,需求明确——云服务部门想要什么产品,技术研发部门就按需求设计,不需要考虑别人的需求和意见。反正性能足够强,自己用起来方便,就可以了。
不对外销售,在生态方面,也不需要考虑太多,能够提供上层业务服务就可以了。
但坏处就是,因为不太面向开放市场,所以不容易卖给别的客户,没办法赚更多的“硬件收入”。从生态的角度来说,相对封闭,外部开发者难以直接基于阿里云硬件进行开发和适配。
如果说华为有点像英伟达的话(卖铲),那么,阿里云就有点像谷歌(自己造铲,自己挖矿)。
这次看云栖大会上的展示,发现阿里云在硬件这块,玩得相当专业。很多硬件的性能指标,已经超过了友商同类产品。硬件的品类丰富程度,也超出了我的意料。
说白了,真的有一种“士别三日,当刮目相看”的感觉。阿里云这个家伙,闷头搞啊搞,突然变出了这么多的自研产品,属实令人意外。
阿里云的AI基础硬件种类太多,加上他们又特别喜欢取各种奇怪的“武侠风”名字,所以,总让人分不清头绪。
接下来,我就给大家做一个阿里云AI硬件产品体系的详细盘点。一方面,方便大家认清楚产品的名字,另一方面,也趁机深入了解一下各个产品的性能和特点。
█ 芯片
阿里云的AI算力硬件基础设施,横向可以分为“算力、存力、网络”三个大类,纵向可以分为“芯片、整机/超节点、整机柜集群”三个层级。
我们先看看芯片。
阿里云的芯片,基本上都依托于平头哥(T-HEAD)。
平头哥,全称是平头哥半导体有限公司,是阿里巴巴集团2018年成立的全资芯片设计主体,有点像华为的海思半导体。
平头哥的自研芯片,是阿里云算力硬件体系的底座,分为数据中心算力芯片+嵌入式芯片(物联网、端侧)两大产品线。
● 真武
数据中心算力芯片中,最重要的主力芯片,就是真武系列AI训练推理一体芯片,可以对标华为的昇腾系列。
真武系列的代表型号,包括真武810E、真武M890、真武V900。
具体参数见下面的表格:
最值得关注的是真武V900。
本届云栖大会上刚刚发布的这款芯片,基于自研并行计算架构设计,搭载216GB大容量显存,片间互联带宽达1200GB/s,芯片原生支持FP8、FP4低精度计算,性能是M890的3倍。
根据阿里云的计划,真武V900将于2027第一季度量产。
真武J900是规划中的下一代旗舰,暂时没有太多信息。
值得一提的是,真武系列的前身是含光系列。代表型号是含光800,属于早期云端推理芯片,面向图像、视频、OCR场景,大规模部署过。
● 倚天
然后,是倚天系列。倚天是Arm系列通用CPU,类似华为的鲲鹏系列。
倚天的代表型号是倚天710、倚天720、倚天730。710已经规模商用,720和730将于明年推出。
据称,倚天720在单核性能、核密度与能效方面都有全面提升。倚天730的话,将首次基于平头哥全自研CPU微架构设计,单核性能将最高提升至倚天710的1.4倍。
未来,阿里云还将推出基于第二代自研核的倚天750。
如果我没记错的话,真武芯片好像是可以直接对外售卖裸芯片的。倚天好像是不行,主要是自用。
● 玄铁
玄铁系列,面向的是端侧和物联网应用,是基于RISC-V架构的嵌入式CPU芯片。这个系列是阿里云平头哥起家的产品,对外直接销售,在国内有很高的出货量,好像是RISC-V处理器中出货量最大的。
玄铁系列包括C系列、E系列、R系列三大产品线。
C系列,是高性能RISC-V,面向高性能计算,用于边缘AI、智能座舱、具身智能、智能视觉。代表型号是玄铁C908、C910、C920、C930(主力服务器级)、C950(旗舰)。
E系列,是低功耗MCU,定位极简、低功耗、小面积,面向嵌入式场景。
R系列,定位硬实时、低延迟、高确定性,面向工业控制、汽车控制、电机驱动等。
● CIPU、磐脉、ICN
刚才说的是算力芯片。平头哥还有通信、存储、安全芯片。
通信的解决方案,要讲一下CIPU、磐脉、ICN。
阿里云前几年提出了CIPU概念,即阿里云自研云基础设施处理器(Cloud Infrastructure Processing Unit)。这个芯片替代传统网卡,硬件卸载虚拟化、网络、存储、安全,降低CPU的负担,也提升整体效率。
CIPU其实有点类似于英伟达的DPU(数据处理单元)和英特尔的基础设施处理器(IPU)。
磐脉,是平头哥自研的智能网卡芯片/网卡硬件,属于网卡ASIC芯片,负责GPU之间海量数据高速传输,主打AI智算集群高速网络(Scale-out组网)。可以对标英伟达的ConnectX系列智能网卡。目前旗舰版本是磐脉920。
阿里云还有非常关键的ICN Switch。
ICN,英文全称Inter-Chip Network,芯片间互联交换(Scale-Up,节点内互联、柜内互联),有点类似华为的灵衢总线技术,以及英伟达的NVLink技术。
ICN Switch 1.0,用在磐久AL128超节点(单机柜128张真武M890,下文会介绍)上,单芯片吞吐25.6Tbps,支持64卡全带宽无收敛互联。
ICN Switch的下一代(2.0?),估计2027年第一季度推出,搭配真武V900和磐久AL64超节点,片间带宽1200GB/s,目标支持千卡级柜域全带宽互联,原生内存语义、统一编址。我记得华为的昇腾950超节点(灵衢2.0)也是支持这些特性。
● 镇岳
存储的话,平头哥有镇岳系列存储主控芯片,代表型号是镇岳510(SSD主控芯片,PCIe5.0,IO处理能力3400K IOPS,时延4μs,基于RISC-V玄铁内核)。
在存储方面,还有AliFlash之类的,以及一些SSD产品硬件。
● 安全
安全的话,平头哥有神盾可信安全芯片,以及独立的TPM/TCM可信平台模块芯片、硬件TEE加密计算等。
█ 整机/超节点
接下来,看看服务器整机和超节点这个层级。
阿里云自研云原生服务器整机品牌叫做磐久,分为通用服务器和AI超节点服务器两大分支。
通用服务器,主要面向云计算、大数据等常规业务场景,包括高性能计算、高性能存储、大容量存储几类,不多介绍了。
重点看AI智算超节点。磐久超节点,包括AL64、AL128、AL144,数字代表了卡的数量。
最新的磐久AL128超节点服务器,内置真武V900、新一代ICN Switch、磐脉智能网卡及镇岳SSD主控芯片,正交无缆化,Pb/s级Scale-up带宽,百纳秒级延迟,单一集群可扩展至50万卡规模,将于2027年第一季度上线。
磐久AL144,阿里云的旗舰AI超节点,主打万卡级Scale Up光互连,单柜最大支持144张GPU(柜内通过正交铜互连,也是Pb/s级Scale-up带宽,百纳秒级延迟),跨柜可扩展至万卡级(通过二级SNPO光互连最大可扩展到10368卡),面向MoE超大模型。
功耗方面,磐久AL144的整柜功耗高达650kW,最大支持单GPU功耗3500W。
为了支持如此巨大的功耗,磐久AL144采用了800V垂直供电架构,配合服务器内800V PDB和垂直喷射微通道冷板。这属于全液冷原生设计。
差点忘了,阿里云还有一个磐久CXL内存扩展超节点。
传统服务器的CPU与DDR内存强绑定,内存容量受插槽限制,也会形成资源孤岛。
磐久CXL内存扩展超节点基于CXL 3.1协议做内存池化,把内存资源从CPU解耦,可以构建一个共享内存池,用来解决大模型KV Cache、数据库场景的内存墙问题。
█ 集群
整机/超节点再往上,就是集群层级了。阿里云的完整大规模算力硬件集群系统,被命名为灵骏(Lingjun)。
灵骏的基本算力硬件单元,是磐久AL64/AL128/AL144超节点,这个没啥好说的。
集群关键在于Scale-out网络,也就是节点间的高速互联网络。灵骏集群采用自研的HPN(High Performance Network)高性能网络架构,支持RDMA协议,能够实现万卡规模下的线性加速比,确保大规模分布式训练的高效通信。
HPN有7.0和8.0两个主流版本。
HPN7.0,2023年大规模部署,51.2T以太网交换芯片,网卡以400G RDMA为主,可以构建单层千卡、两层万卡集群,计算网与存储网双平面分离,自研Solar-RDMA+HPCC流控+ACCL通信库,降低AI训练通信延迟和抖动,提升集群整体训练效率。
HPN 8.0,2025年云栖大会的时候发布,配套真武M890超节点,支持64卡超节点Scale-up,支撑Qwen3.8等万亿MoE模型,GPU互联带宽6.4Tbps,存储网络带宽800Gbps。
HPN8.0 pro增强版,单集群可支持13万个800G端口,集群上限达到十万卡级别。
阿里云的自研交换机好像是叫过白虎这个名字,有待确认,官方文件和新闻里好像没有这么写,可能是内部花名。
核心的ASIC交换芯片,阿里云展示了102.4T的产品(UPO,Ultra Performance NPO)。
自研的51.2T路由器,既有128×400G的规格,也有64×800G的规格,可以构建数据中心之间的连接(Scale-Across),为构建更大规模、更高带宽的智算集群提供了灵活的组网选择。
顺便提一下阿里云的光通信技术水平。
阿里云在算力芯片上很强,这也还是可以理解的。但是,本次参观云栖大会,发现阿里云在光通信领域也令人震惊。
首先,800G/1.6T光模块,阿里云都有自研。然后,自研的C+L单波1.6T传输设备,也有。
这几年光通信里很火的CPO(共封装光学)和NPO(近封装光学)技术,阿里云都有深入布局。硅光芯片,阿里云有自研。液冷解决方案,也有研究。
怎么说呢,这几年光通信圈里“易中天”搞得风生水起,股价猛涨(最近跌了)。这么一看,阿里云自研也没差多少。这块能力如果剥离出来,单独成立一家公司,恐怕也能在光通信市场占据一席之地。
你要说华为搞通信出身,光通信技术有深厚积累,是理所当然的。阿里云并不是通信出身啊,怎么就能自研出这么多东西来?反正我是挺佩服的。
集群的存储方面,阿里云有自研的盘古分布式存储系统,还有CPFS(Cloud Parallel File Storage,云并行文件存储)。
这个CPFS是灵骏智算集群配套的集群级共享存储,能够支持大规模AI训练场景下的高吞吐、低延迟数据访问需求。
█ 结语
好啦,以上就是针对阿里云AI算力硬件产品体系的盘点与梳理。一些端侧产品例如无影之类的,还有一些软件生态和平台例如真武PPU SDK、PAI之类的,我就不多介绍了。
我简单画了一张硬件体系图,供大家参考:
总而言之,阿里云作为一个云服务商,其自研算力体系已从底层芯片到上层集群实现了全栈闭环,而且技术水平已跻身全球第一梯队。这确实是非常令人意外,感觉他们平时还是太低调了,突然亮出家底,才让人意识到其技术储备之深厚。
如前面所说,阿里云的这种“自产自销”的模式,有好处也有坏处。坦率地说,小枣君其实更倾向于术业专攻,将产品能力单独剥离出来,孵化成独立的商业实体,面向更多的客户,进而形成更广泛的国产生态,可能会更好。
当然,这也只是我的一家之言。算力、存力和集群通信是一个巨大的市场,国内厂商拥有很大的发展空间。阿里云这种独树一帜的模式,究竟会如何发展,还有待时间的检验。
384
