夸娥与MUSA支撑规模交付,PD异构探索存量GPU协同
【四问】
一、147%的增长,首先证明了什么?
二、硬件与超节点逐渐同质化,算力落地还卡在哪?
三、MUSA怎样降低已有CUDA项目的软件迁移成本?
四、PD异构怎样让新GPU与机房存量卡协同工作?
图1|本期营收与6.60亿元夸娥合同交付概览。数据据摩尔线程2026年半年度报告整理。
一、147%的增长,首先证明了什么?
答案主要在云端产品与夸娥交付。上半年云端智算产品收入16.93亿元,占总营收97.5%;3月签下的6.60亿元夸娥合同在报告期内完成交付并确认收入。
由于半年报没有单列该合同对应的会计收入和毛利,6.60亿元只能作为合同规模,不能直接换算为本期收入占比。可以确认的是,147%的增长来自大模型算力需求释放、S5000与夸娥稳定供货,以及订单顺利转为收入。
二、硬件与超节点逐渐同质化,算力落地还卡在哪?
先快速看硬件底座:S5000单卡AI稠密算力最高1000 TFLOPS,配备80GB显存和1.6TB/s显存带宽,支持FP8到FP64,八卡可通过MTLink组成节点内全互联。按摩尔线程公布的口径,它在所选CV与LLM训练场景中达到对照产品74%以上,Llama 3 70B训练MFU超过60%,万卡级训练线性扩展效率为95%。
这些指标说明S5000具备进入大模型训练和规模组网的基础。但GPU、互联、集合通信、调度、训练软件和RAS组成超节点,已经是主流厂商的共同路线。夸娥真正证明的是,摩尔线程能把这些能力组合成客户可验收、可调度、可运维的完整系统,并按合同完成大额交付。
但集群进场不等于切换结束:客户还要迁移运行多年的CUDA工程,也要处理机房里仍有使用价值的存量GPU。前者是软件沉没成本,后者是硬件沉没成本。
图2|夸娥交付、MUSA基础能力与PD异构方案处于不同证据层级。
三、MUSA怎样降低已有CUDA项目的软件迁移成本?
硬件进机房后,原有CUDA工程还要接到新的软件栈上。
一个AI项目表面使用PyTorch或vLLM,下面往往连着CUDA算子、通信库、编译脚本和自定义扩展;换卡也意味着这些调用重新指向MUSA。半年报明确将torch_musa、MUSA SDK及加速库列为支撑夸娥千卡、万卡集群训练与推理的成熟能力,并把降低迁移成本视为GPU商业化的重要壁垒。这说明MUSA已经是当前集群交付的一部分。
在此基础上,摩尔线程还准备了不同深度的迁移入口:MUSIFY改源码,MUSA Mapping在编译时映射API,torchada从Python调用层转接,vLLM-MUSA从推理框架接入。它们面向不同项目条件,把一次全面重写拆成多个可选入口。其中MUSIFY与torch_musa可在半年报中找到,其他入口来自开发者文档和代码仓库;半年报尚未量化这些迁移工具单独带来的订单、收入或维护成本降幅。
图3|项目条件不同,CUDA工程可以从不同层级接入MUSA。
四、PD异构怎样让新GPU与机房存量卡协同工作?
智算中心通常分期建设,机房里会同时存在不同代际、不同厂商的GPU;在线请求的输入和输出长度也不断变化,Prefill与Decode所需资源的比例随流量摆动。
传统部署让计算密集的Prefill和访存密集的Decode共用一组卡,容易出现一边排队、另一边闲置。PD分离把两段变成独立资源池,按首Token时延和逐Token时延分别扩容;跨厂商异构再让不同卡型各做擅长的阶段。
图4|PD异构将Prefill与Decode分池部署,并通过KV Cache衔接同一条推理请求。
因此,对承载在线推理、长上下文、混合卡型并有SLA要求的智算中心,PD更像一项通用调度能力。半年报只披露公司推出了PD异构分离方案,以提高资源利用率并提供兼顾成本、性能与灵活性的混合部署路径,没有披露客户、合同或收入。
更具体的跨厂商Prefill与Decode分工,来自摩尔线程与硅基流动8月发布的联合白皮书。
白皮书给出一套工程样例:4台S5000负责Prefill,2台HXXX负责Decode,两端统一采用FP8,并通过Mooncake RDMA传递KV Cache。在双方测试口径下,常规并发首Token时延为1至6秒,逐Token时延为0.011至0.020秒,整体对标4台HXXX组成的同构集群。
这组结果证明了联合测试条件下的工程可行性,但不能据此认定PD异构贡献了本期收入;其长期稳定性和规模商用效果,仍要由具名项目的生产数据检验。
结语
147%的增长直接对应全功能GPU需求、夸娥商业化加速和稳定供货。MUSA虽未形成单独收入项目,却已经支撑夸娥集群与模型适配,属于本期产品商业化的基础能力;多入口迁移能否进一步缩短客户切换周期,仍缺少量化案例。PD异构则停留在方案披露和联合测试层面,尚无客户与收入证据。
把三层关系分开,才能既说明本期收入从哪里来,也看清摩尔线程准备怎样扩大下一阶段的落地范围。
参考资料:
[1] 摩尔线程:2026年半年度报告。[2] 摩尔线程:关于签订日常经营重大合同的公告(2026-009)。[3] 摩尔线程:MTT S5000产品页及夸娥智算集群技术资料。[4] 摩尔线程开发者文档:MUSIFY与MUSA Mapping。[5] Moore Threads:torchada、torch_musa与vLLM-MUSA代码仓库。[6] 摩尔线程、硅基流动:《PD分离异构算力混部实践技术白皮书》,2026年8月。[7] 摩尔线程:Mooncake Transfer Engine MUSA与PD分离接入说明。
#深芯盟 #湾芯展 #半导体产业研究 #摩尔线程 #夸娥 #MUSA #PD #GPU
460
