• 正文
  • 相关推荐
申请入驻 产业图谱

一文看懂阿里云AI算力硬件体系

10小时前
384
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

前段时间参加云栖大会,阿里云的AI算力硬件,给我留下了深刻印象。

这几年,我一直都在关注国产算力。平时看得比较多的,是华为的昇腾和鲲鹏,还有海光、摩尔线程、沐曦、寒武纪等厂商的芯片。说实话,阿里云的算力硬件,虽然平时也有耳闻,但一直没太关注。

阿里云的玩法,和刚才提到的厂商不太一样。阿里云本身就是云服务商,是甲方,就和运营商一样。阿里云做硬件,主要是自给自足,大部分不对外销售。

换言之,阿里云用自己的硬件,建自己的数据中心(算力资源池),然后以云服务或平台的形式,对外销售(出租)算力。

像华为的话,虽然也有自己的云,但自身主要角色仍然是乙方。他们提供算力软硬件解决方案和产品,卖给云服务商、运营商和政企客户。然后这些客户搭建自己的算力集群和数据中心,跑自己的业务,或者再卖给下游客户。

阿里云的玩法,好处是自产自销,需求明确——云服务部门想要什么产品,技术研发部门就按需求设计,不需要考虑别人的需求和意见。反正性能足够强,自己用起来方便,就可以了。

不对外销售,在生态方面,也不需要考虑太多,能够提供上层业务服务就可以了。

但坏处就是,因为不太面向开放市场,所以不容易卖给别的客户,没办法赚更多的“硬件收入”。从生态的角度来说,相对封闭,外部开发者难以直接基于阿里云硬件进行开发和适配。

如果说华为有点像英伟达的话(卖铲),那么,阿里云就有点像谷歌(自己造铲,自己挖矿)。

这次看云栖大会上的展示,发现阿里云在硬件这块,玩得相当专业。很多硬件的性能指标,已经超过了友商同类产品。硬件的品类丰富程度,也超出了我的意料。

说白了,真的有一种“士别三日,当刮目相看”的感觉。阿里云这个家伙,闷头搞啊搞,突然变出了这么多的自研产品,属实令人意外。

阿里云的AI基础硬件种类太多,加上他们又特别喜欢取各种奇怪的“武侠风”名字,所以,总让人分不清头绪。

接下来,我就给大家做一个阿里云AI硬件产品体系的详细盘点。一方面,方便大家认清楚产品的名字,另一方面,也趁机深入了解一下各个产品的性能和特点。

█ 芯片

阿里云的AI算力硬件基础设施,横向可以分为“算力、存力、网络”三个大类,纵向可以分为“芯片、整机/超节点、整机柜集群”三个层级。

我们先看看芯片。

阿里云的芯片,基本上都依托于平头哥(T-HEAD)。

平头哥,全称是平头哥半导体有限公司,是阿里巴巴集团2018年成立的全资芯片设计主体,有点像华为的海思半导体。

平头哥的自研芯片,是阿里云算力硬件体系的底座,分为数据中心算力芯片+嵌入式芯片(物联网、端侧)两大产品线。

● 真武

数据中心算力芯片中,最重要的主力芯片,就是真武系列AI训练推理一体芯片,可以对标华为的昇腾系列。

真武系列的代表型号,包括真武810E、真武M890、真武V900。

具体参数见下面的表格:

最值得关注的是真武V900。

本届云栖大会上刚刚发布的这款芯片,基于自研并行计算架构设计,搭载216GB大容量显存,片间互联带宽达1200GB/s,芯片原生支持FP8、FP4低精度计算,性能是M890的3倍。

根据阿里云的计划,真武V900将于2027第一季度量产。

真武J900是规划中的下一代旗舰,暂时没有太多信息。

值得一提的是,真武系列的前身是含光系列。代表型号是含光800,属于早期云端推理芯片,面向图像、视频、OCR场景,大规模部署过。

● 倚天

然后,是倚天系列。倚天是Arm系列通用CPU,类似华为的鲲鹏系列。

倚天的代表型号是倚天710、倚天720、倚天730。710已经规模商用,720和730将于明年推出。

据称,倚天720在单核性能、核密度与能效方面都有全面提升。倚天730的话,将首次基于平头哥全自研CPU微架构设计,单核性能将最高提升至倚天710的1.4倍。

未来,阿里云还将推出基于第二代自研核的倚天750。

如果我没记错的话,真武芯片好像是可以直接对外售卖裸芯片的。倚天好像是不行,主要是自用。

● 玄铁

玄铁系列,面向的是端侧和物联网应用,是基于RISC-V架构的嵌入式CPU芯片。这个系列是阿里云平头哥起家的产品,对外直接销售,在国内有很高的出货量,好像是RISC-V处理器中出货量最大的。

玄铁系列包括C系列、E系列、R系列三大产品线。

C系列,是高性能RISC-V,面向高性能计算,用于边缘AI、智能座舱、具身智能、智能视觉。代表型号是玄铁C908、C910、C920、C930(主力服务器级)、C950(旗舰)。

E系列,是低功耗MCU,定位极简、低功耗、小面积,面向嵌入式场景。

R系列,定位硬实时、低延迟、高确定性,面向工业控制、汽车控制、电机驱动等。

● CIPU、磐脉、ICN

刚才说的是算力芯片。平头哥还有通信、存储、安全芯片。

通信的解决方案,要讲一下CIPU、磐脉、ICN。

阿里云前几年提出了CIPU概念,即阿里云自研云基础设施处理器(Cloud Infrastructure Processing Unit)。这个芯片替代传统网卡,硬件卸载虚拟化、网络、存储、安全,降低CPU的负担,也提升整体效率。

CIPU其实有点类似于英伟达的DPU(数据处理单元)和英特尔的基础设施处理器(IPU)。

磐脉,是平头哥自研的智能网卡芯片/网卡硬件,属于网卡ASIC芯片,负责GPU之间海量数据高速传输,主打AI智算集群高速网络(Scale-out组网)。可以对标英伟达的ConnectX系列智能网卡。目前旗舰版本是磐脉920。

阿里云还有非常关键的ICN Switch。

ICN,英文全称Inter-Chip Network,芯片间互联交换(Scale-Up,节点内互联、柜内互联),有点类似华为的灵衢总线技术,以及英伟达的NVLink技术。

ICN Switch 1.0,用在磐久AL128超节点(单机柜128张真武M890,下文会介绍)上,单芯片吞吐25.6Tbps,支持64卡全带宽无收敛互联。

ICN Switch的下一代(2.0?),估计2027年第一季度推出,搭配真武V900和磐久AL64超节点,片间带宽1200GB/s,目标支持千卡级柜域全带宽互联,原生内存语义、统一编址。我记得华为的昇腾950超节点(灵衢2.0)也是支持这些特性。

● 镇岳

存储的话,平头哥有镇岳系列存储主控芯片,代表型号是镇岳510(SSD主控芯片,PCIe5.0,IO处理能力3400K IOPS,时延4μs,基于RISC-V玄铁内核)。

在存储方面,还有AliFlash之类的,以及一些SSD产品硬件。

● 安全

安全的话,平头哥有神盾可信安全芯片,以及独立的TPM/TCM可信平台模块芯片、硬件TEE加密计算等。

█ 整机/超节点

接下来,看看服务器整机和超节点这个层级。

阿里云自研云原生服务器整机品牌叫做磐久,分为通用服务器和AI超节点服务器两大分支。

通用服务器,主要面向云计算、大数据等常规业务场景,包括高性能计算、高性能存储、大容量存储几类,不多介绍了。

重点看AI智算超节点。磐久超节点,包括AL64、AL128、AL144,数字代表了卡的数量。

最新的磐久AL128超节点服务器,内置真武V900、新一代ICN Switch、磐脉智能网卡及镇岳SSD主控芯片,正交无缆化,Pb/s级Scale-up带宽,百纳秒级延迟,单一集群可扩展至50万卡规模,将于2027年第一季度上线。

磐久AL144,阿里云的旗舰AI超节点,主打万卡级Scale Up光互连,单柜最大支持144张GPU(柜内通过正交铜互连,也是Pb/s级Scale-up带宽,百纳秒级延迟),跨柜可扩展至万卡级(通过二级SNPO光互连最大可扩展到10368卡),面向MoE超大模型。

功耗方面,磐久AL144的整柜功耗高达650kW‌,最大支持单GPU功耗3500W。

为了支持如此巨大的功耗,磐久AL144采用了800V垂直供电架构‌,配合服务器内800V PDB和垂直喷射微通道冷板。这属于全液冷原生设计。

差点忘了,阿里云还有一个磐久CXL内存扩展超节点。

传统服务器的CPU与DDR内存强绑定,内存容量受插槽限制,也会形成资源孤岛。

磐久CXL内存扩展超节点基于CXL 3.1协议做内存池化,把内存资源从CPU解耦,可以构建一个共享内存池,用来解决大模型KV Cache、数据库场景的内存墙问题。

█ 集群

整机/超节点再往上,就是集群层级了。阿里云的完整大规模算力硬件集群系统,被命名为灵骏(Lingjun)。

灵骏的基本算力硬件单元,是磐久AL64/AL128/AL144超节点,这个没啥好说的。

集群关键在于Scale-out网络,也就是节点间的高速互联网络。灵骏集群采用自研的HPN(High Performance Network)高性能网络架构,支持RDMA协议,能够实现万卡规模下的线性加速比,确保大规模分布式训练的高效通信。

HPN有7.0和8.0两个主流版本。

HPN7.0,2023年大规模部署,51.2T以太网交换芯片,网卡以400G RDMA为主,可以构建单层千卡、两层万卡集群,计算网与存储网双平面分离,自研Solar-RDMA+HPCC流控+ACCL通信库,降低AI训练通信延迟和抖动,提升集群整体训练效率。

HPN 8.0,2025年云栖大会的时候发布,配套真武M890超节点,支持64卡超节点Scale-up,支撑Qwen3.8等万亿MoE模型,GPU互联带宽6.4Tbps,存储网络带宽800Gbps。

HPN8.0 pro增强版,单集群可支持13万个800G端口,集群上限达到十万卡级别。

阿里云的自研交换机好像是叫过白虎这个名字,有待确认,官方文件和新闻里好像没有这么写,可能是内部花名。

核心的ASIC交换芯片,阿里云展示了102.4T的产品(UPO,Ultra Performance NPO)。

自研的51.2T路由器,既有128×400G的规格,也有64×800G的规格,可以构建数据中心之间的连接(Scale-Across),为构建更大规模、更高带宽的智算集群提供了灵活的组网选择。

顺便提一下阿里云的光通信技术水平。

阿里云在算力芯片上很强,这也还是可以理解的。但是,本次参观云栖大会,发现阿里云在光通信领域也令人震惊。

首先,800G/1.6T光模块,阿里云都有自研。然后,自研的C+L单波1.6T传输设备,也有。

这几年光通信里很火的CPO(共封装光学)和NPO(近封装光学)技术,阿里云都有深入布局。硅光芯片,阿里云有自研。液冷解决方案,也有研究。

怎么说呢,这几年光通信圈里“易中天”搞得风生水起,股价猛涨(最近跌了)。这么一看,阿里云自研也没差多少。这块能力如果剥离出来,单独成立一家公司,恐怕也能在光通信市场占据一席之地。

你要说华为搞通信出身,光通信技术有深厚积累,是理所当然的。阿里云并不是通信出身啊,怎么就能自研出这么多东西来?反正我是挺佩服的。

集群的存储方面,阿里云有自研的盘古分布式存储系统,还有CPFS(Cloud Parallel File Storage,云并行文件存储)。

这个CPFS是灵骏智算集群配套的集群级共享存储,能够支持大规模AI训练场景下的高吞吐、低延迟数据访问需求。

█ 结语

好啦,以上就是针对阿里云AI算力硬件产品体系的盘点与梳理。一些端侧产品例如无影之类的,还有一些软件生态和平台例如真武PPU SDK、PAI之类的,我就不多介绍了。

我简单画了一张硬件体系图,供大家参考:

总而言之,阿里云作为一个云服务商,其自研算力体系已从底层芯片到上层集群实现了全栈闭环,而且技术水平已跻身全球第一梯队。这确实是非常令人意外,感觉他们平时还是太低调了,突然亮出家底,才让人意识到其技术储备之深厚。

如前面所说,阿里云的这种“自产自销”的模式,有好处也有坏处。坦率地说,小枣君其实更倾向于术业专攻,将产品能力单独剥离出来,孵化成独立的商业实体,面向更多的客户,进而形成更广泛的国产生态,可能会更好。

当然,这也只是我的一家之言。算力、存力和集群通信是一个巨大的市场,国内厂商拥有很大的发展空间。阿里云这种独树一帜的模式,究竟会如何发展,还有待时间的检验。

阿里巴巴

阿里巴巴

阿里巴巴集团经营多项业务,另外也从关联公司的业务和服务中取得经营商业生态系统上的支援。业务和关联公司的业务包括:淘宝网、天猫、聚划算、全球速卖通、阿里巴巴国际交易市场、1688、阿里妈妈、阿里云、蚂蚁金服、菜鸟网络等。

阿里巴巴集团经营多项业务,另外也从关联公司的业务和服务中取得经营商业生态系统上的支援。业务和关联公司的业务包括:淘宝网、天猫、聚划算、全球速卖通、阿里巴巴国际交易市场、1688、阿里妈妈、阿里云、蚂蚁金服、菜鸟网络等。收起

查看更多

相关推荐

通信行业知名新媒体鲜枣课堂创始人,通信行业资深专家、行业分析师、自媒体作者,《智联天下:移动通信改变中国》丛书作者。通信行业13年工作经验,曾长期任职于中兴通讯股份有限公司,从事2/3/4G及5G相关技术领域方面的研究,曾担任中兴通讯核心网产品线产品经理、能力提升总监、中兴通讯学院二级讲师、中兴通讯高级主任工程师,拥有丰富的行业经验和积累。