近日,硅基流动与摩尔线程联合发布《PD 分离异构算力混部实践技术白皮书》(以下简称“《白皮书》”),首次系统阐述基于硅基流动自研高性能推理引擎、以摩尔线程 MTT S5000 与国际高端 GPU 协同工作的 PD 分离推理方案。
经真实生产级集群验证,该方案在 Prefill 阶段以 2:1 部署比例实现国产 GPU 对国际高端 GPU 的算力等效替代,全链路服务质量全面对标纯国际高端 GPU 集群,为国产算力大规模商业化部署提供了可量化、可复制的实践。
Token 需求大爆发,异构混部破解算力瓶颈
大模型行业重心正从“训练更大模型”转向“以更高性价比、更高稳定性生产优质 Token(词元)”。据工业和信息化部数据,截至 2026 年 6 月底,我国智能算力规模已达 2185 EFLOPS,同比增长 177%。《白皮书》指出,面对算力需求的爆发式增长与自主可控的双重挑战,将计算密集型的 Prefill 阶段与访存密集型的 Decode 阶段分离,并分别调度至最适配的异构算力执行,是破解成本、效率与国产化算力瓶颈的核心思路。
基于硅基流动自研推理引擎,双方在由 4 台 MTT S5000 与 2 台国际高端 GPU 组成的“4P2D”异构集群上部署 Kimi K2.6,对标由 4 台国际高端 GPU 组成的“2P2D”纯国际集群。
MTT S5000 凭借原生 FP8 精度与充沛的稠密算力,专门负责 Prefill 阶段的大规模矩阵计算;国际高端 GPU 则利用 4.8 TB/s 的显存带宽高效执行 Decode 阶段的逐 Token 生成。两侧推理精度统一采用 FP8,并通过 Mooncake RDMA 高速网络实现 KV Cache 跨芯片零拷贝传输,确保端到端数据的一致性与正确性。硅基流动高性能推理引擎则在整个过程中提供统一的模型加载、执行及调度接口,使同一模型服务在异构算力之间无缝流转、高效运行。

实测数据显示,MTT S5000 单卡在 Prefill 阶段吞吐量达国际高端 GPU 的 46% 至 54%,在 128K 上下文、16 并发极限场景下,单卡平均吞吐达 2047 tokens/s。通过 2:1 的集群部署比例,异构集群在算力总量维度全面对标纯国际集群。

全链路服务质量方面,异构集群的首 Token 时延(TTFT)为 1 至 6 秒,每 Token 输出时延(TPOT)稳定在 0.011 至 0.020 秒,系统吞吐随并发增加呈线性平缓下降,表现与纯国际高端 GPU 集群一致,充分满足在线服务严苛的 SLA 要求。此外,依托 KV Cache FP8 压缩存储,方案还可有力支撑 1M 超长上下文推理。

高性能推理引擎加持,加速国产算力从“可用”迈向“好用”
这一性能突破源于硅基流动自研推理引擎与摩尔线程 MUSA 全栈平台的深度协同。硅基流动推理引擎通过统一硬件抽象层(HAL)消除了异构壁垒,实现两侧模型代码与配置完全一致,并为 PD 阶段分别定制并行策略,最大化异构资源利用率;摩尔线程自研 MATE 高性能算子库则深度适配硬件指令,配合自适应无损模型量化技术,使 FP8 精度在异构芯片上获得与原生 FP16 对齐的推理精度。
MTT S5000 基于第四代 MUSA 架构“平湖”打造,完整支持 FP8 至 FP64 全精度计算。其核心芯片 PH100 已首批通过中国信息安全测评中心的《安全可靠测评》(2026 年第 2 号),安全可靠等级为I级,原生适配 PyTorch 等主流 AI 框架,支持代码平滑迁移。

硅基流动高性能推理引擎四层联合优化框架
目前,该方案已完成 RDMA 通信兼容性验证及极限抗压测试,具备规模化生产落地条件。以 2:1 比例实现 MTT S5000 对国际高端 GPU 的等效替代,显著降低了推理成本与供应风险。
《白皮书》的发布对行业发展有深远意义。具体而言,本方案依托硅基流动推理引擎的异构调度能力,为国产算力规模化部署提供了不牺牲用户体验的可行替代路径;在 KV Cache 通信、精度对齐、仿真调度等方面形成的可复用技术规范,也推动了异构算力标准建设;而引擎多后端统一抽象能力所支撑的异构算力高效协同,则为全国一体化算力网建设与安全可控AI产业底座的构建提供了关键技术基础。
在 AI 基础设施的竞争中,不只是算力规模的竞争,更是 Token 生产效率、系统工程能力与产业协同能力的竞争。本次双方发布的 PD 分离异构算力混部方案,正是“Token 工厂”实现优质 Token 大规模、高性价比生产的关键支撑,也为国产算力从“可用”迈向“好用”树立了重要里程碑。
261