• 正文
  • 相关推荐
申请入驻 产业图谱

国产GPU:原生FP8让Token产量翻倍,收入翻倍

09/22 16:57
445
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

过去几年,评价一张国产 GPU,行业最习惯问的无非几个问题:能不能跑?跑得有多快?

和国际主流 GPU 的差距还有多少?

但到了大模型进入规模推理阶段,如果仍然只围绕峰值算力讨论一张 GPU,可能已经不够了。

因为对于真正采购 GPU 的云厂商、模型公司和算力运营商来说,最终需要回答的并不是“这张卡参数有多漂亮”,而是一个更现实的问题:

花出去的每一块钱,最终到底能生产多少满足服务质量要求的 Token?

摩尔线程最近发布了一份《MTT S5000 Prefill-as-a-Service 技术白皮书》。

其中一个很有意思的变化是,这份白皮书没有停留在传统的 GPU Benchmark,而是直接开始算一笔“Token 经济账”。

按照白皮书给出的典型 Agent 混合上下文负载假设,单台 8 卡 MTT S5000 的等效 Prefill 吞吐约为 83,670.6 Token/s;再结合 90% Prefix Cache 命中率以及相应 API 价格测算,100% 利用率下,对应的理论月收入约为 56.4 万元

如果利用率下降至 40%,白皮书给出的名义月收入仍约为 22.6 万元。

当然,这里的“月收入”不是“月利润”。白皮书自己也特别注明,这一测算尚未计入服务器折旧、电费、机房、网络与运维等成本,完整的 TCO 和回本周期仍需要进一步计算。

但恰恰是这种开始谈收入、谈利用率、谈单位 Token 成本的做法,让我觉得比单纯再公布一个峰值算力数字更值得关注。

因为它意味着国产 GPU 的竞争逻辑正在发生变化:

从“参数经济学”,逐渐进入“Token 经济学”。

而如果进一步拆解摩尔线程这套方案,会发现背后还有一条更值得讨论的技术主线——FP8。

一、为什么一张GPU,现在要开始算“Token经济账”?

要理解这笔账,首先要理解今天的大模型推理已经发生了什么变化。

过去的大模型问答,输入可能只有几百、几千 Token。

但 Agent、AI Coding、RAG、长文档分析兴起以后,一次模型调用需要处理的上下文越来越长。

代码文件、历史对话、检索结果、工具调用记录,可能一次性把输入推到数万乃至几十万 Token。

这时候,大模型回答问题的过程,其实可以拆成两个性质完全不同的阶段。

第一个阶段叫 Prefill

简单理解,就是先把用户提供的大量上下文“读完”。

GPU 会对整个输入 Prompt 进行并行计算,并建立后续生成需要的 KV Cache。

这个过程主要是大规模矩阵运算,因此更偏 compute-bound,也就是吃算力

第二个阶段叫 Decode

上下文理解完成以后,模型开始一个 Token 一个 Token 地生成答案。

此时每生成一个新 Token,都要不断读取模型权重以及历史 KV Cache,瓶颈越来越容易转向显存容量和显存带宽,因此更偏 memory-bound

摩尔线程白皮书将两者概括得很清楚:

Prefill 主要受到浮点算力约束,而 Decode 更多受到显存带宽约束。

问题是,传统推理系统通常让两件事情由同一类 GPU 完成。

于是会出现一个很现实的资源错配。

做 Prefill 时,需要的是高密度算力;

做 Decode 时,更需要大显存和高带宽。

但如果为了同时兼顾两种负载,所有节点都采购同样规格的高端 GPU,就意味着总有一部分昂贵资源没有得到充分利用。

这也是 PD 分离,Prefill-Decode Disaggregation 开始受到越来越多关注的原因。

二、PD分离,本质上是第一次允许GPU“按瓶颈采购”

PD 分离的思想并不复杂:

把 Prefill 和 Decode 拆开。

Prefill 独立组成一个计算资源池;

Decode 独立组成另一个生成资源池。

这样做之后,两边可以分别采购最符合自己工作负载特征的硬件。

Prefill 更看重 FP8 等低精度矩阵计算能力和计算密度;

Decode 则更看重显存容量、显存带宽以及稳定低延迟。

白皮书给出的目标也并不是简单追求一个脱离业务条件的“最高 Token/s”。

Prefill 侧重点是更高的 MFU 和更低的 TTFT;

Decode 侧则需要追求高并发下稳定的 ITL。

最终真正应该优化的是满足服务等级目标之后的有效吞吐,也就是 goodput

这件事情对数据中心意味着什么?

过去购买 GPU,有点像给所有工作买完全一样的“全能机器”。

PD 分离以后,则第一次可以按照真实瓶颈采购:

计算不够,就增加 Prefill 算力;

显存和带宽不够,就扩 Decode 资源。

于是 GPU 的采购逻辑,也开始从:“哪张卡综合参数最高?”

变成:“哪种硬件最适合完成这一段工作,而且单位成本最低?”

这一步非常关键。

因为 AI 基础设施一旦进入规模化阶段,最昂贵的不是某一张 GPU,而是大量 GPU 长期处于低效利用状态。

三、真正决定异构PD能不能成立的,不只是算力,而是KV Cache

如果故事只讲到这里,PD 分离似乎很简单:

Prefill 找一张擅长计算的 GPU;

Decode 找一张擅长显存和带宽的 GPU。

但真正进入工程层面以后,一个更麻烦的问题出现了。

Prefill 算完以后,Decode 怎么接着算?

答案是 KV Cache。

可以把 KV Cache 简单理解成:

大模型读完几十万 Token 的上下文以后形成的一份“中间记忆”。

Decode 接下来每生成一个 Token,都要用到这份记忆。

所以 PD 分离以后,实际上凭空增加了一条新的数据链路

Prefill GPU → 网络 → Decode GPU。

Prefill 负责生成 KV Cache。

然后通过高速网络,把 KV Cache 送到 Decode 节点。

Decode 再接着生成。

摩尔线程的方案中,S5000 作为 Prefill 计算池,Prefill 产生的 KV Cache 通过 Mooncake Transfer Engine 跨节点传输,并结合 RDMA 等技术减少数据拷贝。

问题也随之而来。

如果 KV Cache 太大怎么办?

网络会不会成为新的瓶颈?

两种 GPU 的数据格式如果不一样怎么办?

是不是还要在中间重新转换一次?

所以,异构 PD 分离真正难的,从来不是:“两张卡能不能分别算。”

而是:“两张来自不同计算体系的GPU,算完之后能不能高效率地交接。”

而这正是 FP8 在这套架构中真正开始变得重要的地方。

四、为什么FP8正在从“精度格式”,变成AI基础设施的“硬通货”?

过去很长一段时间,大模型训练和推理大量使用 FP16、BF16。

FP16 每个数据元素占用 16 bit。

FP8 则是 8 bit。

最直观的变化就是:在不考虑 scale、metadata 等额外开销的简化条件下,同样数量的数据,从 FP16 换到 FP8以后,逻辑数据体积大约可以下降一半。

对于短上下文来说,这也许只是一个性能优化。

但进入几十万 Token 的长上下文以后,性质就不一样了。

因为 KV Cache 会随着上下文长度持续增大。

白皮书给出的理论关系显示,KV Cache 容量与模型层数、上下文长度、KV Head 数量、单头维度以及数据元素字节数近似呈线性关系。其中 FP16/BF16 通常按 2 Byte 计算,而 FP8/INT8 是 1 Byte。

所以,上下文越长,数据格式的位宽,就越不只是一个精度问题,而开始成为一个基础设施成本问题。

FP8 的价值至少有三层。

第一层是显存。

相同逻辑数量的 KV 数据,FP8 可以显著降低存储容量需求。

第二层是网络。

PD 分离以后 KV Cache 要跨节点搬运。

数据量越低,同一条高速网络能够承载的请求越多。

而第三层,我认为可能才是这篇白皮书里最值得关注的一层:

异构兼容。

如果 Prefill GPU 输出一种格式,而 Decode GPU 使用另一种格式,中间就必须完成一次数据转换。

这意味着新增 Kernel、新增显存操作、新增延迟,也增加了整个系统的复杂度。

如果是一两张 GPU 做 Demo,这些开销可能不明显。

但如果是一整个在线推理集群,这些额外成本最终都会变成单位 Token 成本。

所以在 PD 分离场景中,FP8 已经不再只是:

“我的 GPU 支持一种更低的计算精度。”

它开始变成异构算力之间的一种数据语言

五、S5000真正值得看的地方,是硬件级原生FP8

这也是为什么我认为,理解摩尔线程 S5000,不能只盯着 PFLOPS。

按照摩尔线程白皮书给出的定义,S5000 支持 FP8 至 FP64 的完整精度,并且是国产 GPU 中较早支持 FP8 的产品之一

放在今天的国产通用 GPU 市场里,硬件级原生 FP8 仍然是一项相对稀缺的能力。

但更重要的是:

FP8 只有真正进入完整数据链路,它的价值才会被释放出来。

以 PD 分离为例。

理想情况是:

S5000 完成 Prefill;

生成 FP8 KV Cache;

通过高速互联传输;

Decode 端继续处理。

中间尽可能不再进行格式转换。

摩尔线程白皮书对此写得非常细。

如果 Prefill 和 Decode 两端的 KV Cache 在数据类型、页大小和内存布局等条件上完全一致,就可以走页粒度直传路径,绕过数据类型转换和布局重排;如果数据类型或者布局不同,则仍然需要额外的转换 Kernel。

而真正做到零转换直传,还需要 FP8 的具体格式、scale、KV 页大小、内存布局和元数据等保持一致。

这句话非常重要。

因为它告诉我们:

真正有价值的“原生FP8”,并不是规格表里多了一行“支持FP8”,而是从计算,到KV Cache,再到网络传输,最后到下一块GPU,整个链路能不能围绕FP8高效率运转。

在半导体行业,这是两个完全不同层次的能力。

“支持一个 Feature”,和“围绕一个 Feature 构建出可以生产部署的数据通路”,从来不是一回事。

六、为什么FP8对国产GPU还有一层更重要的价值:进入存量算力集群

如果站在客户角度看,这里面还有一个比芯片本身更加现实的问题:

客户机房里的 GPU 已经买了。

服务器已经部署了。

高速网络已经建好了。

推理框架已经调通了。

模型已经上线了。

大量软件和运维体系,也已经围绕现有 GPU 形成。

这时候,如果一家国产 GPU 公司给客户的答案是:

“把原来的系统全部换掉,然后重新建设一套。”

技术上也许能做。

商业决策上却会非常沉重。

因为客户损失的不只是 GPU 本身。

还有已有资产、软件迁移成本、模型适配成本和整个工程体系的切换成本。

这也是为什么我觉得,异构 PD 分离对国产 GPU 的商业意义,很可能比单纯的性能对比更加重要。

它提供了另一种进入数据中心的方式:

不是第一天就要求替代全部 GPU。

而是:先承接最适合自己的那一部分工作负载。

比如把 Prefill 独立出来。

原来的 GPU 继续承担 Decode。

新的国产 GPU 作为 Prefill 算力池加入。

这时候,FP8 的意义就出现了。

因为异构系统最怕的并不是两张 GPU 性能不同。

真正怕的是:两个体系之间根本无法低成本地交接数据。

如果 KV Cache 格式能够匹配,高速网络能够直传,同时软件生态又具备较低迁移成本,那么国产 GPU 和现有 GPU 的关系就不一定只能是“二选一”。

它们完全可能出现在同一条推理流水线上。

这可能代表国产 AI 芯片一种非常值得关注的商业化路径:

从“国产替代”,走向“国产增量”。

先作为新增资源进入客户已有体系。

再通过实际 TCO 和运行效率,逐渐扩大自己能够承接的工作负载。

某种意义上,这可能比要求客户一次性完成整套基础设施替换,更符合数据中心真实的投资规律。

七、这时候,再看“单台月收入56.4万元”,意义就完全不同了

理解了前面的技术逻辑以后,再回头看摩尔线程为什么要给一台 S5000 服务器算“月收入”,这笔账就很好理解了。

白皮书设定了一个典型 Agent 混合上下文场景:

约 50% 请求映射至 64K 档;

40% 映射至 200K;

9% 映射至 300K;

1% 映射至 400K。

结合不同长度下测得的 Prefill 性能,得到加权等效吞吐:

83,670.6 Token/s。

按照白皮书采用的定价模型:

缓存未命中输入 Token:8 元/百万 Token;

缓存命中 Token:2 元/百万 Token。

假设 Prefix Cache 命中率达到 90%,那么加权单价变成:

0.1 × 8 + 0.9 × 2

2.6 元/百万 Token。

再乘以一个月对应的运行时间:

83,670.6 Token/s
× 2.592 百万秒/月
× 2.6 元/百万 Token

最终得到:

约56.4万元/月。

这也是为什么“月入 56 万”这个数字看起来很抓眼球。

但从专业角度,必须把它准确理解成:

在特定模型、上下文分布、Cache命中率、API价格和100%利用率假设成立的情况下,一台8卡S5000所提供的Prefill能力,对应约56.4万元/月的理论服务收入。

它不是利润。

也不是固定收益。

更不是买一台机器就自动每个月到账 56 万。

但这个数字仍然很有价值。

因为它第一次把 GPU 从“性能参数”映射到了“商业产出”。

八、我更关注的,其实是国产GPU开始有了自己的“坪效”

商业地产会看坪效。

数据中心会看 PUE。

云计算公司看服务器利用率。

那么 AI 算力最终同样需要一套经济指标:

一台服务器,一个月到底能生产多少有价值Token?

进一步还可以问:

一 PFLOPS 算力每个月创造多少收入?

一千瓦电能转换成多少有效 Token?

一台服务器折旧以后还有多少净贡献?

单位百万 Token 的综合成本是多少?

真正进入产业化阶段以后,GPU 最终一定会面对这些问题。

因为 TFLOPS 和 PFLOPS,本质上只是生产工具的理论能力。

客户真正购买的是生产结果。

就像一家工厂不会永远只比较两台机床的电机功率。

最终一定会比较:

谁单位时间生产的合格产品更多;

谁的设备利用率更高;

谁的单位产品成本更低;

谁的投资回收周期更短。

大模型基础设施也一样。

未来 GPU 真正重要的指标,可能越来越从:

TFLOPS / PFLOPS

转向:

元 / 百万 Token。

以及:

满足 SLO 的 Token / 元。

这也是摩尔线程这份白皮书另一个值得注意的地方。

它甚至进一步尝试定义“单位算力收入”:

按照白皮书的 64K 场景测算,单台服务器满载月收入约 64.6 万元,对应单位算力收入约 16.15 万元/PFLOPS/月

这个指标最终大概率会成为行业标准。

但这种思路本身值得肯定:

国产GPU正在尝试从“性能设备”,变成可以计算投入产出比的生产资料。

九、所以,原生FP8真的能让Token翻倍、收入翻倍吗?

这是一个非常容易传播,但也必须讲清楚的问题。

答案不是简单的“是”或者“不是”。

从数据表示的角度看:

FP16 是 16 bit。

FP8 是 8 bit。

在其他条件相同、暂不考虑 scale 和 metadata 的理想情况下,数据体积确实可以接近减半。

这意味着:

同样的显存可以承载更多 KV Cache;

同样的网络可以传输更多数据;

同样时间里可以减少一部分数据搬运压力。

如果原来的系统瓶颈恰好就在这些环节,FP8 就有机会带来非常显著的系统级收益。

但不能简单得出:

“FP8数据减半,所以Token一定翻倍。”

因为一套大模型推理系统最终的吞吐,还受到:

GPU 实际利用率、

Kernel 效率、

Batch Size、

模型结构、

KV Cache 布局、

Prefix Cache 命中率、

网络拓扑

RDMA 效率、

调度算法、

Decode 侧能力,

等一系列因素影响。

所以我更愿意把原生 FP8 的价值描述成:

它不是让Token和收入自动×2的魔法按钮,但它可能是异构PD架构释放Token产能与经济性的一个关键“效率开关”。

这两种说法看起来只差一点。

实际代表的是完全不同的技术理解。

十、为什么这件事对国产GPU尤其重要?

过去国产 GPU 的竞争,经历了几个阶段。

第一阶段是:

能不能做出来。

第二阶段是:

能不能把大模型跑起来。

第三阶段是:

性能、软件生态和稳定性到底做到什么程度。

而进入推理基础设施时代以后,我认为会出现第四个维度:

谁能够用最低的切换成本,进入客户已经存在的算力体系?

这也是我认为 S5000 原生 FP8 值得重点观察的真正原因。

它背后连接的不是孤立的一个 FP8 参数。

而是一整条产业链:

FP8计算 → KV Cache → 高速互联 → PD分离 → 长上下文 → Agent → Token经济账。

把这条链条连起来以后,就会发现,摩尔线程此次真正想解决的问题,并不是:

“国产 GPU 能不能也支持 FP8?”

而是:

“国产GPU能不能使用主流AI基础设施已经采用的数据方式,成为现有推理集群的一部分?”

如果这个问题能够持续得到客户侧和规模部署的验证,它的价值可能远比某一次单卡跑分更大。

因为对于数据中心来说,真正昂贵的从来不是一张 GPU。

而是整个系统迁移和资产重构的成本。

十一、真正的经济账,其实还差最后半张表

当然,现在还不能仅仅看到 56.4 万元/月,就直接得出投资回报率已经被完全算清楚。

因为白皮书当前主要解决的是 Revenue,也就是收入端。

真正完整的经济账,还应该继续减去:

服务器采购成本;

400G 网络与交换设备;

GPU 功耗;

CPU、内存及整机功耗;

IDC 机房成本;

运维成本;

设备折旧;

软件和模型适配成本。

同时还要考虑真实业务中不可能长期维持 100% 利用率。

Prefix Cache 命中率也可能发生变化。

异构 PD 还会受到 KV Cache 传输、混合请求调度、在途显存占用以及跨节点 Prefix Cache 命中率等因素影响。

白皮书也明确提醒,这些因素都可能使实际吞吐低于理论估计。

所以,我更期待摩尔线程下一步把这张表继续向下算。

比如:

月度Token收入

减:折旧 + 电费 + IDC + 网络 + 运维

等于:月度净贡献。

然后再进一步:

服务器采购成本 ÷ 月度净贡献

等于:

静态投资回收周期。

如果这张表最后能够在真实客户业务中跑通,那么国产 GPU 才真正完成了一次很重要的身份转变:

从芯片产品,走向生产资料。

结语:国产GPU下一场竞争,可能不再是谁的参数表更漂亮

我一直觉得,判断一个硬科技产业是否真正进入商业化阶段,有一个很有意思的观察指标:

厂商什么时候开始愿意讨论成本,而不仅仅讨论性能。

性能解决的是:

能不能上牌桌。

成本解决的是:

客户会不会买。

而 ROI 最终决定的是:

客户会不会持续采购,并且扩大部署。

从这个角度看,摩尔线程这次围绕 S5000 提出的 Prefill-as-a-Service 和 PD 分离,并不是简单多做了一个性能测试。

它实际上正在尝试回答一个更接近产业化的问题:

在真实的大模型推理基础设施里,一张国产GPU到底能够创造多少有效Token,它能不能以更合适的成本进入客户已经存在的算力体系?

原生 FP8 在这里,也就不再只是规格表里的一行技术参数。

它一头连接着高密度低精度计算;

一头连接着越来越庞大的 KV Cache;

中间是高速互联;

后面则连接 PD 分离、Agent 和长上下文。

最终,所有这些技术问题都会落到一张经济报表上:

每个月能生产多少Token?

每百万Token成本多少?

资产利用率多少?

多久能够回本?

所以,与其简单说:

“原生 FP8 让 Token 产量翻倍、收入翻倍。”

我更愿意把这件事理解为:

原生FP8正在成为国产GPU参与下一代异构AI基础设施竞争的一张重要入场券。

数据位宽可以减半。

但真正有价值的,是它是否能够进一步把 KV Cache 搬运、异构协同、算力利用率和客户已有资产全部串起来。

如果这条链条最终能够在越来越多真实生产环境中成立,那么国产 GPU 下一阶段竞争的核心,也许真的不再只是“谁的峰值性能更高”。

而是谁能让客户用同样一块钱,

生产出更多满足SLO的Token。

这,才是大模型推理真正的经济账。

相关推荐