Token(词元)已成为AI服务运营的核心计量单元与价值载体,而Token的高效规模化运营高度依赖于以云网融合为基本特征的新型信息基础设施。
在Token运营的生命周期中,不同环节对云网能力的诉求呈现显著的差异化与复杂性。首先,在模型部署阶段,面对千亿级参数模型及纷繁复杂的垂直行业应用,单一算力架构难以满足多样化的推理需求,系统须具备异构算力与网络的统一纳管、智能调度能力,才能确保模型自适应地部署至最优节点。在此基础上,依托精细化的推理分层优化策略,针对Token生成不同阶段的负载特征,匹配最优算力与网络资源,精准破解差异化推理场景下的性能瓶颈。
其次,在用户多模态数据上传阶段,网络须提供弹性的大带宽接入能力,以承载用户侧突发流量。在Prefill(预填充)阶段,系统需要瞬时处理海量提示词,分布式集群部署场景要求智算中心内部网络提供超高速、强互联能力,以消除大规模并行计算的通信瓶颈,确保首Token时延达标。进入Decode(解码)阶段后,系统需要不断访问显存中的KV Cache(Key-Value Cache,键值缓存),实现逐Token流式输出。高并发连续批处理场景需要依靠智算中心内部网络的高吞吐能力,支撑大规模GPU(graphics processing unit,图形处理单元)间的并行调度;而在跨智算中心的PD(Prefill-Decode,预填充与解码)分离部署模式下,则需依赖智算中心之间网络的极低丢包率、微秒级确定性时延及低抖动特性,确保KV Cache交互的流畅性。与此同时,随着多智能体并发推理场景的兴起,智能体任务的细粒度切分与随机调度使得算力连接关系高频变更,这就要求网络必须提供相应的SLA(service level agreement,服务等级协定)保障机制与弹性组网。
最后,云网体系须具备覆盖Token“生成—流转—结算”全过程的主动防护与合规审计能力,为构建可信赖的Token经济环境提供根本保障。
综上所述,Token规模化运营要求运营商云网基础设施必须具备异构调度、流量承载、状态同步及内生安全四大核心能力。然而,现有云网能力在上述维度仍存在断层。
Token规模化运营面临的挑战
挑战一:异构算力的全域协同与调度尚待突破
当前产业处于从通算向智算过渡的异构混合期,算力属性、技术路线和生态差异大,虽有相关行业标准陆续发布,但跨架构、跨厂家、分属不同运营主体的芯片资源,尚未形成广泛商用的统一度量与纳管体系。此外,异构算力若脱离网络拓扑与模型业务特征进行孤立调度,将出现数据传输瓶颈、模型服务质量下降等问题,无法实现全局最优。
挑战二:网络能力与Token业务特征的深度适配亟待加强
Token服务过程具有显著的差异化流量特征,对入算、算内、算间三级网络分别提出了带宽弹性、吞吐极限及确定性保障等方面的极致要求。而传统网络仅作为比特管道,缺乏对Token流量的感知与差异化承载能力。面向Token经营的网业深度协同技术方案目前仍处于试点探索阶段,尚未形成大规模商用方案。
挑战三:广域RDMA无损传输技术瓶颈制约算力纵深协同
随着推理场景向长上下文演进,KV Cache已成为继算力、存力之后的第三大核心资源,其跨节点/跨数据中心的KV Cache同步对广域网络提出高效、无损、弹性的严苛要求。然而,广域智算互联面临长距拥塞反馈慢、混合业务流控难、跨域协同编排难等挑战,导致广域RDMA(remote direct memory access,远程直接存储器访问)技术在行业应用中尚处于现网验证阶段,产业链主体应进一步推动其向商用部署升级。
挑战四:Token全生命周期的可信治理体系建设迫在眉睫
Token全生命周期面临恶意提示词注入、数据泄露及版权确权等多重风险。目前的外挂式安全手段难以支撑大规模Token计量的精准溯源与防篡改需求,亟须构建涵盖端、边、云、网的一体化内生安全防护架构,确立可信赖的Token流通基座。
Token运营的关键技术
“算力—网络—模型”协同调度技术
为解决异构算力资源池化、统一调度的问题,应构建“算力—网络—模型”一体化协同调度机制。首先,通过对异构算力和网络资源进行统一纳管,形成物理分散硬件资源的统一视图,奠定资源池化基础。其次,采用多维状态采集机制,多维度感知模型与位置、GPU利用率、显存占用情况,以及算力相关网络拓扑、链路带宽、拥塞状况等,实现“算力—网络—模型”的多维信息建模。在资源层之上,采用全局一体化调度算法,依据不同运营阶段的业务需求,将模型部署和Token任务动态精准导向最优计算节点,从而实现“算力—网络—模型”的高效协同。
三级协同的高速无损网络技术
为解决网业协同深度不足的问题,应进一步提升网络智能化水平,构建“数据中心网络—入算网络—算间互联网络”三级协同的高效智能互联架构。在节点层面,采用超高速、强互联数据中心网络,构建大带宽、低时延的集群内互联通道,消除单节点算力吞吐瓶颈。同时,深化光电融合技术应用,以全光交换替代传统电中继转发,降低光电转换过程中的节点处理时延和设备转发功耗,实现算力与能耗的双重优化。此外,利用毫秒级光路切换能力,根据业务负载与计算任务的实时变化,动态完成网络拓扑的任务级调整,突破固定组网模式的限制。在接入层面,面向大模型推理与多智能体并发的弹性需求,打造弹性敏捷的组网能力,以支持带宽的动态调整。在广域层面,算间互联网络引入网络切片和超低时延传输技术,大幅压缩跨地域算力的协同时延,同时面向不同SLA要求的广域Token传送场景,提供不同服务质量等级的网络保障。三级网络架构通过层次化协同,共同为Token的高效生产服务提供坚实的运力支撑。
广域网络确定性与传输保障技术
针对KV Cache广域同步对网络提出的极低丢包率与确定性时延要求,重点部署广域无损网络传输方案,通过租户级精准流控与流量调度算法,确保大规模KV Cache数据在长距链路中的完整性与有序性。在此基础上,引入广域确定性网络与切片技术,为Prefill、Decode及缓存同步流量开辟独立的逻辑通道,规避复杂业务场景下的链路拥塞风险。通过上述技术的多维协同,构建支撑算力纵深协同的高品质广域承载底座。
云网内生的安全可信防护体系
为应对Token全生命周期中的安全风险,须构建端、边、云、网深度融合的多维内生防御机制。首先,强化全链路可信度量机制,通过深度包检测与语义分析技术,实现对恶意提示词注入及异常数据流的实时感知与阻断;其次,引入隐私计算与密态传输技术,在数据流转过程中实现“可用不可见”,防止推理过程中的敏感信息泄露,保障用户数据的所有权与隐私权;最后,依托区块链与可验证计算技术,建立不可篡改的Token计量账本及版权确权协议体系,确保每一单位Token在生成、流转及消费环节的可追溯性与公平性。
中国电信的实践与验证案例
中国电信依托“算力、平台、数据、模型、应用”五位一体智能云体系,全面推进从“流量经营”向“Token经营”的升级。其中“息壤”算力互联调度平台纳管异构算力达91 EFLOPS,实现了“资源无关、框架无关、工具无关”的Triless架构,构建了高效、灵活、可扩展的跨域算力调度体系。星辰TokenHub运营服务中枢平台采用全链路加密传输认证,提供模型任务统一分发、统一计量、统一运维能力,使Token经营实现全程可视可管。此外,中国电信自研了异构算力评测与优化平台“翼芯”,首创“自动化测试、流程化适配、智能化调优”体系,攻克异构算力难兼容、模型适配周期长等痛点。平台统一了算力选型标准,支持20余款国产芯片及50余个模型全维度测试,通过流水线迁移与高性能算子库实现新模型周级适配,开箱性能提升50%以上。目前已在中国电信集团及10个省级分公司规模应用,并在上海、珠海等地算力中心建设及多个标杆项目中发挥了重要作用。
在网络技术创新上,中国电信采用广域智算无损网络完成了业界首个基于DeepSeek-671B满血模型的PD分离推理拉远现网试验,以及业界首个行业模型Hi-Dolphin32B 110 km分层推理拉远现网试点,百千米级跨数据中心推理性能可达同场景的99%以上。基于上述验证成果,中国电信目前已为江苏国信、中远海科、安贞医院等行业用户提供了定制化的云网一体化服务。除此之外,还完成了全球电信运营商首个光电协同的智算中心组网试验,昇腾算卡点到点通信时延降低14%,集群网络功耗下降19%,同时支持多代际算卡无缝接入。
面向未来的智能体业务场景,中国电信发布了智能体原生网络体系白皮书,牵头开展了智能体跨域互联及协同试验,突破智能体跨域互联瓶颈;打通多个跨省数据中心,实现超千个智能体的统一标识与协同编排,验证了大规模智能体协作的可行性和稳定性。
行业未来展望
尽管运营商在支撑Token规模化运营方面已取得阶段性进展,但在异构算力与网络协同、内生安全等方面仍需要持续深入思考与探索。云网基础设施必须超越传统的被动承载逻辑,从单纯的数据传输向Token的主动生产、智能缓存与精准分发演进。随着中国电信《云网融合技术白皮书》所擘画的云网技术蓝图逐步落地,Token运营最终将成为用户无感接入、算力随取随用、价值实时兑现的泛在智能服务底座,确立运营商在AI价值链中的重要地位。
责编/版式:朱文凤
审校:梅雅鑫
监制:刘启诚
212