2026年9月8日,Arm在中国上海举办了“Arm Everywhere China”年度大会,正式发布第二代移动终端计算子系统——Arm CSS for Mobile 2,这也是Arm首个面向 AI 时代的 AI 原生计算底座。
Arm CSS for Mobile 2 包含了全新的C2 CPU集群,其集成了第二代 Arm 可伸缩矩阵扩展(SME2)技术,为CPU上的端侧 AI 带来了更高水平的响应速度与能效;同时,Arm还带来了首个AI原生的GPU内核——Arm Mali G2-Ultra NX,首次在GPU内部集成了专用神经加速器,使神经图形(Neural Graphics)能够原生运行于 GPU 之上。
与此同时,Arm还面向中国市场推出了其最新的面向云数据中心的AGI CPU。联想和火山引擎成为首批在中国采用AGI CPU的厂商。Arm还宣布与新紫光集团深化战略合作,共同推动中国下一代 AI 基础设施的发展。据悉,双方的合作将涵盖Arm AGI CPU和Arm计算子系统(CSS)等 Arm 技术。
联想还在现场展示了其HR650a V3 2U Arm AGI CPU 服务器系统,该系统搭载了双AGI CPU 处理器。
同时,Arm还面向中国市场推出了全新的Neoverse CSS N4计算子系统。据介绍,Neoverse CSS N4 单颗裸片(die)最高可搭载 128 个内核,支持 LPDDR6 内存与 PCIe Gen 7 互连。与 Neoverse CSS N3 相比,其性能最高可提升至两倍,每瓦性能最高可达 1.25 倍,内存带宽最高可达 1.75 倍。
鸿钧微电子将首发推出基于Arm最新的Neoverse CSS N4计算子系统的服务器CPU。
Arm 执行副总裁兼首席商务官 Will Abbey 表示:“Arm 全球合作伙伴累计出货的基于 Arm 技术的芯片已超过 3,500 亿颗,中国创新者始终是这一全球创新历程中的重要力量。随着产业加速迈向智能体时代,Arm 依托覆盖云、边缘和物理应用的统一计算平台,以及不断壮大的软件生态系统,正携手中国合作伙伴加速创新成果落地,为下一代 AI 体验和智能应用构建坚实计算底座。”
这篇文章,我们先来详细介绍Arm最新发布的面向移动端的计算子系统Arm CSS for Mobile 2。
一、从“被动响应”到“主动执行”:智能体AI重塑计算需求
过去一年,AI的演进速度超出了许多人的预期。一年前,人们还在讨论生成式AI如何回答问题、生成图片;而今天,AI已经能够理解用户意图,自主拆解任务、调用工具、获取信息,并根据执行结果继续推理和决策。这意味着,AI正在从一个“响应式助手”,逐渐变成一个能够持续主动完成任务的“智能体(Agent)”。
Arm边缘AI智能终端计算副总裁James McNiven在数日前的Arm Tech Day 2026 闭门会议上也概括了这一转变:“我们正在从被动的响应式AI,走向主动的、持续运行的智能体AI。”
这一转变从根本上改变了智能手机等移动终端设备的计算方式。智能体AI不再是“提问-回答”的单次交互,而是一个持续运行的工作流——感知、记忆、推理、行动,再根据执行结果进入下一轮循环。在这个过程中,系统需要同时处理多个智能体、多个线程,在本地设备与云端之间动态调度任务,并在功耗和散热的严格约束下保持灵敏响应。在这一过程中,设备需要同时面对几类新的计算挑战。
首先,是更低的响应延迟。当AI只是回答一个问题时,几十毫秒甚至更高的延迟可能尚可接受;但当智能体需要连续调用多个工具、检索信息、执行应用操作时,每一个环节的延迟都会叠加。因此,CPU的单线程性能依然非常重要——它直接决定了智能体每一次决策和调度能够多快完成。
其次,是更多的并行计算需求。一个真正的端侧智能体可能同时进行语音识别、上下文检索、模型推理、应用调用以及后台任务。这意味着终端所需要的已经不是单纯追求峰值性能,而是能够让多个计算任务并行推进的多核CPU以及不同计算引擎之间更加高效的协同。
第三,是更高效的数据流动与任务调度。智能体AI的计算并不会固定发生在某一个处理器上。CPU可能负责任务编排和控制,GPU负责图形与部分AI计算,NPU承担高能效的神经网络推理,而内存系统则需要在这些计算资源之间持续提供数据。
因此,真正影响最终体验的,已经不再只是某个CPU、GPU或者NPU的峰值算力,而是这些计算资源能否被高效组织起来。这也解释了为什么,随着智能体AI走向终端,移动芯片的竞争正在从过去的“单项性能竞争”,逐渐转向系统级计算效率竞争。
James McNiven指出:“你不仅需要更强的单线程性能来降低单次决策的延迟,还需要多个CPU并行工作,并统筹GPU、NPU等异构计算资源,才能满足智能体在规划、推理和行动方面的全部需求。”
换言之,智能体AI重新定义了移动设备对计算能力的要求。过去,CPU、GPU、NPU多按各自功能独立设计与优化;如今,它们需作为一个整体,围绕一个完整的AI工作流协同运作。这正是Arm推出第二代移动终端计算子系统——Arm CSS for Mobile 2的背景。
二、CSS for Mobile 2:面向智能体AI的移动计算平台
因此,Arm CSS for Mobile 2并不是简单地推出新一代CPU或者GPU,而是试图从CPU、GPU、系统互联、物理实现到软件工具链,对整个移动计算平台进行重新重构,使其成为一个整体。其核心目标也由过去单纯追求“更高性能”,进一步转向让设备能够以更低的延迟、更高的能效和更高效的资源协同,持续执行越来越复杂的AI工作流。
具体来说,在 Arm CSS for Mobile 2 平台中,Arm C2 CPU 集群提供了支撑智能体 AI 从“意图”到“行动”所需的可编程算力与编排能力。通过融合 C2-Ultra CPU、C2-Pro CPU 以及第二代 Arm 可伸缩矩阵扩展(SME2)技术,该集群不仅提升了移动应用中的日常计算性能,还进一步增强了端侧 AI 能力,为语音处理、信息检索和模型执行等工作负载提供更强支持。
除了C2 CPU集群之外,Arm CSS for Mobile 2 还整合了最新的Mali G2-Ultra NX GPU、SI L2 系统互联、物理实现、软件及开发工具,对整体计算资源调度、数据在系统中的传输,以及日益复杂的 AI 和图形工作负载进行协同优化,使其能够在移动设备功耗限制内高效运行。
在这一完整平台中,Mali G2-Ultra NX 为 AI 原生图形功能提供了强力的支撑。Mali G2-Ultra NX不仅是专为桌面级图形设计的原生GPU,还首次将神经网络加速能力直接引入 GPU,通过将专用神经网络加速器(NX)紧密集成至着色器核心,并结合全新的执行引擎和第三代光线追踪单元(Ray Tracing Unit v3,RTUv3),为移动图形带来 AI 原生能力。
此外, CSS for Mobile 2 平台还采用了“SI L2” 系统互连,相比一代的“SI L1”的系统互连的硬件能力进一步增强,能够进一步减少延迟,并满足和支持未来的新内存技术需求。可以帮助管理和优化多个计算资源之间的任务调度与优先级分配,以满足智能体 AI 和日益复杂的图形工作负载对移动系统内计算资源协同及数据传输效率的更高要求。
与此同时,Arm还将系统优化延伸至物理实现阶段,使合作伙伴在开展SoC集成之前,便能够将功耗、性能和面积(PPA)与架构设计进行协同考量。这种“设计即优化”的理念,是CSS for Mobile 2区别于传统IP交付模式的关键所在。
三、C2 CPU集群:支持SME2,AI性能提升70%
在智能体AI时代,CPU不再仅仅是“执行单元”,更是整个系统的编排层——维护任务状态、整合上下文信息、决定工作流中每个阶段由哪个计算资源执行,并统一协调权限管理、任务决策和整体执行进程的核心。
在CSS for Mobile 2平台中,C2系列CPU集群正是专为智能体时代的旗舰移动设备所设计,带来了全面的性能提升。
Arm重点介绍了C2系列CPU集群中采用2颗C2-Ultra内核+6颗C2-Pro内核的典型配置的参考设计。其中,C2-Ultra主打最高单线程性能,用于应用启动、UI交互和突发响应;C2-Pro则基于C1-Pro的基础上进行优化,配合N3P制程演进,提供持续稳定的性能输出。
根据Arm官方公布的数据显示,C2 CPU集群其单线程性能最高提升15%,网页浏览速度提升15%,应用启动速度提升12%,集群级多线程性能提升12%,执行最新AI模型时的速度最高可以提升至上一代的1.7倍。
这些提升直接映射到用户可感知的体验上:更强的单线程性能降低了智能体每次交互决策的延迟;更快的应用启动和网页浏览速度,缩短了智能体调用工具和获取信息的时间;而更高的多线程性能,则让智能体在执行知识检索、模型处理等任务时能够并行推进,效率倍增;更高的AI模型运行速度可以使得端侧智能体更快的执行各种任务,降低延时。
1、SME2性能翻倍,AI性能最高提升70%
SME2是专门为现代AI工作负载(比如大语言模型LLM、图像识别)设计的“加速器”,通过专用的矩阵处理指令,可以让CPU能够高效处理AI推理中矩阵运算密集型的AI任务,将CPU本身变成一个强大的AI加速器,从而能够在设备端实现高效、响应迅速的AI体验。
虽然上一代的Arm C1 CPU集群就加入了对于第二代可伸缩矩阵扩展(SME2)的支持,但是C2 CPU集群的SME2的功能得到了进一步的优化和改善,实现了SME2能力相对上一代的翻倍,使得C2 CPU集群的AI性能达到了6 TOPS。
据介绍,集成SME2并深度优化的C2 CPU集群在执行最新AI模型时的速度最高可以提升至上一代的1.7倍。
根据Arm公布的数据显示,虽然同样都支持SME2,但是C2-Ultra在各类关键AI任务中表现相比C1-Ultra都实现了大幅提升。
比如,在运行最新的Moonshine和Parakeet语音转文本模型时,C2-Ultra延迟相比上一代C1-Ultra降低了40%。
在智能体工作流的“记忆”阶段,C2-Ultra的内存信息检索与搜索性能相比上一代提升了41%。
在小语言模型推理阶段,C2-Ultra生成结构化指令的速度相比上一代平均提升了25%。
在涵盖语音处理、记忆检索、推理、应用执行和网页浏览的完整智能体工作流中,C2-Ultra相比上一代实现了24%的整体速度提升。
James McNiven指出:“C2 CPU集群非常适合用于轻量级的设备端人工智能模型加速,并且通用性更强。不过,更大模型仍然需要通过GPU和NPU来进行支持。”
据介绍,支付宝、OPPO 和 vivo 等合作伙伴已采用 SME2 技术。
2、三大微架构+多核配置:可灵活应对多样化负载
Arm C2 CPU集群支持在一个集群内同时集成三种不同的微架构核心:面向峰值性能和密集型工作负载的C2-Ultra核心,兼顾性能与能效的均衡的C2-Pro核心,以及针对极致能效和轻量级任务优化Nano核心。这里需要指出的是,本次Arm C2 CPU集群并未发布C2-Nano核心,因此,可以搭配上一代的C1-Nano核心。
James McNiven解释称:“一般情况下,Arm是每两年推出一个新的架构版本。每一年我们都会推出一个新的Ultra微架构,每两年会考虑推出一个新的Pro核心,Nano核心则是每两到三年推出新一代。当然这只是目前的规划,如果未来市场竞争格局发生变化,这个节奏也会调整。”
这三种不同的CPU核心,使得芯片合作伙伴能够根据目标用例灵活配置核心组合,实现性能与功耗的最优平衡。更关键的是,三类核心可独立运行在不同的频率上。这意味着系统可以根据当前任务的实时需求,动态调整每类核心的频率——轻负载时让Nano核心以低频运行节省功耗,突发高强度任务时让Ultra核心瞬间拉升频率提供充沛算力。这种细粒度的频率控制,让集群在维持流畅体验的同时,将功耗控制在移动设备的散热预算之内。
虽然Arm此次介绍的是2颗C2-Ultra内核+6颗C2-Pro内核的参考设计,但在对于CPU性能和核数要求更高的智能体AI时代,合作伙伴可以根据目标应用决定核数和Ultra与Pro等不同核心的搭配比例。
James McNiven告诉芯智讯,随着智能体AI在端侧的发展,未来智能手机上只跑一两个智能体可能不是终局,因此可能会对于CPU的性能和核心数量带来更高的要求,目前我们的CPU集群最多支持14个CPU核心。我们将继续发挥CPU集群灵活性的优势,让合作伙伴根据实际工作负载选择所需的核心与核数。”
同样,如果看更具生产力的PC等端侧产品,那么未来必然需要更多、更强大的智能体AI。联想集团高级副总裁、全球创新总经理贾朝辉也指出,未来70%的Token都将在端侧产生。这也必然将带来对于端侧CPU性能和核心数量的更高需求。
3、私有L2缓存+共享L3缓存:低延迟的关键保障
在智能体AI工作流中,感知阶段的语音识别、记忆阶段的信息检索等任务都涉及大量频繁的轻量级数据访问。Arm C2集群中每个核心都拥有自己独立的私有L2缓存,使CPU能够以极低延迟访问高频使用的数据。
这一设计带来的直接收益是:当智能体需要快速响应用户的语音指令或检索本地个人信息时,CPU无需等待从系统级缓存或DDR中读取数据,从而大幅缩短了每个决策周期的时间。
Arm 边缘 AI CPU 产品管理总监Daniel Lu强调:“C2 CPU集群是为低延迟用例设计的,特别适合智能体编排这种需要快速响应的任务。”私有L2缓存正是实现这一目标的关键硬件基础。
除了私有的L2缓存外,C2 CPU集群还有一个大的共享L3缓存。对较大工作负载来说,私有L2缓存加共享的L3缓存的总有效容量和命中率提升后,可以帮助减少对于系统缓存(SLC)和DDR的访问,减少延迟,降低功耗。
虽然Arm并未公布新的C2-Ultra和C2-Pro的L2缓存规格以及C2集群的L3缓存规格,但预计都将高于上一代。
四、从渲染引擎到AI引擎:Mali G2-Ultra NX的AI原生之路
如果说CPU承担的是智能体AI的“编排”职能,那么GPU正在被赋予全新的使命:从传统的图形渲染引擎,进化为AI增强视觉体验的生成引擎。
据介绍,Mali G2-Ultra NX首次集成了“神经加速器”,带来了全新执行引擎,并且还引入了第三代光线追踪单元。Arm表示,Mali G2-Ultra NX正是Arm首款真正意义上的AI原生GPU。
根据Arm公布的数据显示,Mali G2-Ultra NX的传统图形处理与光线追踪性能与上代GPU相比大幅提升。比如,在跑分测试当中平均性能提升了20%,非AI游戏性能提升了14%,DRAM带宽最高节省了13%。
值得注意的是,小米最新发布的AI旗舰SoC——玄戒O3采用了16核的Arm G2-Ultra NX GPU。
1、GPU首次集成神经加速器
Mali G2-Ultra NX名称中的“NX”正是代表着集成了“神经加速器”——这并非一个独立的计算单元,而是被紧密集成到着色器内核之中的专用神经加速模块,仅需1-2W功耗即可实现高质量的神经图形处理,可实现业内最佳的每平方毫米能效表现。
具体来说,该“神经加速器”在硬件架构上就支持INT8/INT16精度的推理;在特定AI工作负载下,能以高达GPU核心2倍的时钟频率运行,实现性能提升;支持硬件加速的张量运算,并能直接处理压缩权重,减少内存占用与带宽消耗;集成光流引擎用于运动估计,提升帧生成等游戏体验。
同时,由于该“神经加速器”深度融入了GPU管线,使得其共享了GPU的内存子系统与控制结构,实现了缓存一致性,避免了传统“搬运数据”造成的延迟与功耗浪费,是其实现高能效神经图形处理的关键。
此外,该“神经加速器”还支持三种开源的神经图形技术——神经超级采样(Neural Super Sampling,NSS)、神经帧率超分(Neural Frame Rate Upscaling,NFRU)和神经超级采样加降噪(Neural Super Sampling and Denoising,NSSD)。
①NSS
NSS是通过将低分辨率色彩、运动向量、深度以及历史帧缓存输入到一个基于真实游戏内容训练的神经网络中,该网络重建出高质量的最终图像,从而减少生成高质量最终图像所需的传统渲染工作量。
与传统空间采样器不同,NSS采用神经网络方式,能够恢复精细细节、去除噪点并确保时间稳定性——这些都是顶级视觉效果的必备要素。开发者只需渲染四分之一的像素,即可呈现出与桌面级神经超分技术(如DLSS)相媲美的画质。
Arm 边缘 AI 高级产品经理Deyan Lazarov解释称:“我们只渲染四分之一的像素,就能实现帧率最高可达原来的2倍,同时对外部的内存需求减少了50%。传统的基于着色器的方法无法提供我们所需的顶级视觉效果。因此,我们参考了一些标准的、业界公认的桌面级神经超分技术(例如,已在数百款游戏中应用的DLSS),最终使得NSS的图像质量能够与这些桌面级神经技术相媲美。但关键区别在于,像DLSS这样的技术是为桌面端设计的,而NSS是专为移动端设计的,其功耗低于1瓦,成本非常低。”
②NFRU
NFRU是通过分析前后两帧渲染画面的运动轨迹,利用光流技术精确捕捉每个像素的移动,再由AI神经网络对两帧之间的画面进行高质量重建,从而生成最合适、质量最高的中间帧,使帧率翻倍,实现更流畅的游戏体验,同时显著降低GPU渲染负担和功耗。
“在特定场景中,NFRU可以帮助我们将帧率从60 FPS翻倍到了120 FPS,DRAM流量需求降低了33%,同时保持了稳定的移动端功耗。当然,如果屏幕并不是120Hz的,也可以放慢某些部分,让大家能更清楚、流畅地进行沉浸式游戏体验。”Deyan Lazarov说道。
③NSSD
NSSD技术是将基于神经网络的超分辨率(AI超分)重建与光线追踪降噪两大功能融合在同一个神经网络中,让开发者能以极低的额外成本同时实现分辨率提升和光追画质优化。
NSSD技术其核心价值在于解决了移动端光追的两难困境:要获得高质量的全局光照和阴影效果,需要追踪大量光线,这会导致功耗和算力开销过高;但若减少光线数量,画面又会充满噪点。NSSD通过对低分辨率、高噪点的光追输出进行AI推理,一次性完成2倍分辨率放大与智能降噪,在恢复精细细节的同时保持帧间稳定性。这使得开发者可以在移动设备上大胆使用更复杂的光照和阴影系统,而无需担心画质妥协或性能崩盘,是推动移动端实现桌面级光追体验的关键技术。
2、全新执行引擎,为应对桌面级内容渲染而生
Mobile G2-Ultra NX集成了全新执行引擎(EE),其设计的核心目标就是应对日益复杂的游戏渲染工作负载。它所集成的7年来最大的指令集架构(ISA)升级,直接回应了“虚幻引擎5”(UE5)中Nanite和Lumen等前沿技术对移动硬件提出的挑战——这些技术虽然在桌面端效果惊艳,但原生应用在移动端往往意味着巨大的性能压力。
这套新引擎通过以下三项关键技术来化解性能瓶颈:
更大的着色器与更少的寄存器溢出:新的ISA允许Shader使用更大的着色器程序,并通过优化编译策略,显著减少了寄存器溢出。这意味着GPU能更高效地处理UE5中复杂的材质着色器,无需频繁访问外部内存,从而节省了宝贵的带宽和功耗。
每个Warp高达2倍的寄存器数量:寄存器是GPU内核中最快的存储单元。新架构将每个Warp(线程束)的寄存器数量提升至2倍。这使得在执行复杂着色器时,GPU能在寄存器中保留更多中间数据,避免因数据溢出而频繁进行高延迟的内存读写,对Nanite这种包含海量几何数据的场景极为有利。
动态16-Warp宽寄存器分配:传统GPU使用固定的Warp大小,容易造成计算资源浪费。新引擎引入了动态的16-Warp宽寄存器分配机制,可以根据任务复杂度,在16线程范围内智能、动态地分配寄存器资源。这实现了“按需供给”,在处理复杂图形(如Lumen的光照计算)时能最大化计算吞吐量,在处理简单任务时又能避免资源浪费以节省功耗。
Mobile G2-Ultra NX在传统的图形处理性能到底有多大提升?根据Arm公布的游戏和Benchmark测试数据显示,其游戏性能相比上代提升了8%-14%;在关闭光线追踪的情况下下,Steel Nomad Light性能提升了17%,安兔兔v11的图形测试性能提升了20%;在打开光线追踪的情况下,Invitro 2性能提升了18%,Solar Bay Extreme性能提升了24%。
3、集成第三代光追单元
Mali G2-Ultra NX集成的第三代光追单元(RTUv3)支持全场景照明和阴影,配合神经降噪技术,可在有限光追计算量下实现高质量图像重建。
RTUv3核心设计目标是在几何复杂度持续飙升的今天,用更智能的算法来驯服数据量,确保光追性能不会因场景变复杂而崩溃。它的突破主要体现在以下两个方面:
①更智能的几何引擎技术
传统光追在处理复杂模型时,经常面临大量重复或冗余的几何数据,不仅浪费宝贵的缓存空间,也徒增DRAM带宽消耗。RTUv3相比上一代引入了三项关键优化:
通过“共享边缘”(Shared edges)技术,让相邻三角形共用同一条边的数据,避免同一顶点信息的重复存储,从源头压缩几何数据总量。
“重复边缘”(Repeated edges)技术,让同一模型的不同实例共享同一份底层几何数据,消除实例间的重复加载,大幅降低复杂场景的内存占用。
消除几何体复制(Eliminates geometry duplication)技术,可以在整个渲染流程中系统性地检测并移除所有形式的数据冗余,确保光追单元始终处理最精简的几何数据流。
这三项技术优化带来的直接结果,是在处理复杂游戏场景时,相同容量的缓存能容纳更多的几何数据,大幅降低了对系统内存(DRAM)的频繁访问。
根据Arm披露的数据显示,在主流光追基准测试中,RTUv3的DRAM通信流量(DRAM traffic)最高可减少13%。DRAM访问是移动GPU最大的功耗来源之一,这意味着同样的光追负载下,功耗更低,或者在相同功耗下能跑出更复杂的场景。
此外,由于降低了带宽瓶颈并提升了缓存命中率,光追单元的总体吞吐量(Higher RT throughput)也得到了显著提升,为流畅运行Lumen等全场景动态全局光照效果提供了坚实的硬件基础。
在MOKU游戏中,RTUv3最高可以降低 70% 的GPU光追工作负载,在某些场景下能带来高达 30% 的帧率提升。这使得在移动端实现 30FPS 的持续流畅游戏体验成为可能,让光追内容在功耗受限的设备上也能稳定运行。
②硬件级不透明度微贴图(OMM)技术
硬件级不透明度微贴图(Opacity Micromaps,OMM)技术是一项让移动端也能高效运行桌面级复杂场景的关键技术。它的核心作用可以概括为一句话:通过在硬件层面提供更精细的透明度信息,让光追单元在执行光线与不规则形状(如树叶、栅栏、毛发)求交时,能更快地“命中或错过”,从而以更低的性能成本渲染出更丰富、更逼真的半透明几何体。
在没有OMM的传统光追中,光线射向一片树叶时,往往需要深入计算树叶内部复杂的三角面,效率极低。OMM则提供了一个预计算的、多级细节的“透明度地图”,它类似于一张精细的掩码,向光线标识了哪些区域是不透明的(HIT,直接命中)、哪些是透明的(MISS,直接穿过),哪些是未知的(UNKNOWN,需要进一步计算)。
总结来说,OMM可以让GPU在必要时才对最复杂的区域进行精确计算,避免了大量无效的求交运算,从而大幅降低了整体的光追计算开销,让光追效果(如阴影、反射)的处理变得非常高效。这意味着游戏开发者可以在移动端放心地使用丰富的植被、更精细的织物纹理、多层材质表面以及其他复杂场景元素,让移动游戏可以呈现出更多细节、更逼真的场景,同时还能保持稳定的高帧率,而无需担心性能崩溃。
在 Arm 的一项演示中,使用OMM技术可使帧率提升 30%,同时将光线追踪工作负载最多降低 70%,展示了该技术如何让复杂几何场景在移动设备上的应用更具可行性。
Arm 边缘 AI 高级产品经理Deyan Lazarov表示,硬件级OMM是Arm将桌面级光追体验引入移动设备的关键技术之一,它让“在手机上享受3A级游戏”这一目标成为可能。
4、《光影新生》游戏首发支持
作为Arm首款原生支持AI的Mali GPU,Mali G2-Ultra NX通过NSS、NFRU和NSSD的NX硬件加速技术,帧率可提高至原来的4倍,每帧动态能量效率也提升到了原来的4倍,DRAM流量需求降低了70%。基于新的执行引擎和RTUv3技术支持,Mali G2-Ultra NX实现了桌面级的传统图形渲染能力,基准测试性能提升了24%,非AI游戏性能提升了14%,光线追踪工作量减少了70%。
虽然Mali G2-Ultra NX的能力非常的强悍,但是用户要想在游戏中充分体验到它的能力,还需要游戏开发者对其相关技术的支持。
据介绍,Arm 与 Sumo Digital 基于虚幻引擎联合打造《光影新生》游戏,已经将其神经网络、光线追踪和先进光照技术整合至实际游戏开发流程中。这款游戏从设计之初就将神经网络技术融入图形渲染策略,可让开发者在功耗限制下拥有更大的发挥空间,并实现其艺术目标。比如,NFRU和NSSD 对于在 Mali G2-Ultra NX 上实现桌面级的视觉效果至关重要。
Deyan Lazarov指出,结合NSSD和NFRU技术,《光影新生》依托Mali G2-Ultra NX只需渲染1/8像素,其余7/8像素由算法重建,这将极大地降低渲染工作负载,提升渲染效率,并降低功耗,在移动设备有限的功耗和散热限制下支持更丰富的光照、更复杂的场景以及更流畅的动态效果。
5、加速支持Mali G2-Ultra NX的应用落地
早在 Mali G2-Ultra NX 发布的前两年,通过 Arm 神经网络技术(Neural Technology)和一套面向神经图形的开放开发套件的推出,Arm 便已着手布局软件生态。这使内容创作者、工具开发者和游戏引擎提供商能够提前接触神经网络技术,并在硬件就绪之前开始将其集成到现有工作流中。
目前Arm Neural Graphics Development Kit(神经图形开发套件)提供了推动相关工作迈向量产所需的软件和工具,可支持主流图形应用程序编程接口(API)、游戏引擎以及定制化开发流程。
据介绍,开发者工具栈包含 NSS 和 NFRU,以及面向 Vulkan 的机器学习扩展和包括虚幻引擎在内的主流游戏引擎插件。相关神经图形模型全部在Hugging Face和GitHub上开源。软件开发套件支持与自定义引擎集成,而性能分析、图形优化、训练和模型优化工具则可帮助开发者评估并微调神经图形工作负载。这种开放策略,与移动设备市场设备种类繁多、功耗预算各异的现实高度契合。
这些资源共同提供了一条从实验探索迈向实际应用的路径,使游戏工作室无需构建定制化研究基础设施,也无需改变现有工作流。
Arm在大会上宣布,其与腾讯游戏、叠纸游戏、网易、Unity 中国以及虚幻引擎(Unreal Engine)等合作伙伴共同推进神经网络技术的发展。结合 Arm 的软件生态系统,CSS for Mobile 2 为芯片合作伙伴和开发者提供了灵活的计算基础,帮助他们规模化打造下一代移动 AI 体验。
五、全新SI L2系统互联硬件能力
在上一代的Lumex CSS平台中,Arm带来了全新的SI L1和MMU L1等系统IP,专为满足高要求 AI 和其他计算密集型工作负载的带宽与延迟需求而优化。
在CSS for Mobile 2当中,为应对智能体AI和日益复杂的图形工作负载,对系统内计算资源协同和数据传输效率提出的更高要求,Arm进一步增强了系统的硬件互联能力,带来了SI L2,它能够进一步减少延迟,并满足和支持未来的新内存技术需求。
具体来说,SI L2完整支持LPDDR5、LPDDR5X和LPDDR6内存,实现统一内存高带宽访问,帮助管理和优化多个计算资源之间的任务调度与优先级分配。同时实现了设备端安全保障、DSU优化,并实现了单位面积功耗的进一步降低。更重要的是,它满足了进一步降低延迟的需求,并且能够进一步提升现有整体的服务质量表现。
据介绍,SI L2还能够帮助实现CPU访问DRAM的负载延迟,相比上一代降低了45%,这对智能体AI工作流中频繁的数据查找和模型推理而言意义重大。尽管这里只是减少了纳秒级的延迟,但其实在内存访问过程中每一纳秒都非常重要。
六、从KleidiAI到Arm AI Portal,打造开箱即用的软件生态
Arm CSS for Mobile 2 拥有完善的软件生态支持。依托 Arm 数十年的软件投入及全球超过 2,200 万的 Arm 开发者社区,开发者可通过熟悉的框架和开发环境轻松调用其平台能力。
Arm KleidiAI 于 2024 年推出,旨在为Arm CPU 上运行的 AI 推理工作负载提供软件性能优化,开发者无需进行任何额外的工作。目前该软件库已应用于移动端、云和数据中心等关键领域,包括 KleidiAI 已被集成到 ExecuTorch、Llama.cpp、MediaPipe、PyTorch、LightRT等超过12个主流AI框架,拥有超过200个优化微内核和100多个第三方集成。为 Arm CPU 提供了优化的软件执行路径,包括能够充分利用 SME2 特性的 AI 工作负载。
这意味着开发者无需改变现有开发流程,即可通过正在使用的软件栈充分释放 Arm CPU 的底层能力。
此外,Arm还为 AI 开发者打造的统一在线入口Arm AI Portal ,旨在解决“模型发现、评估与部署”的难题,让 AI 应用在 Arm 平台上能开箱即跑,且性能更优。它也是 Arm 在软件生态布局中的关键一环,让开发者能更简单直接地释放 Arm CPU(特别是支持 SME2 的新款)和 GPU(如 Mali G2-Ultra NX)的硬件潜力。
Arm AI Portal 的核心作用体现在以下几个方面:
1、开箱即用的优化模型库:提供一组预先优化好的 AI 模型。这些模型针对 Arm 的 CPU(如支持 SME2 的 C2)和 GPU 做了专门适配,开发者可以直接下载使用,省去了自己编译和调优的麻烦,实现“开箱即用”。例如,你可以直接获取针对 SME2 优化的轻量化模型(如 2-bit 压缩模型)来快速集成。
2、性能优化工具箱:除了现成的模型,AI Portal 也提供了工具,帮助开发者对自己的模型进行量化、压缩等操作,以在 Arm 硬件上获得更好的运行速度和能效。
3、加速开发流程:它简化了从“发现一个模型”到“集成进应用”再到“部署上线”的整个流程。开发者可以在这里评估模型性能,获取代码示例和部署资源,从而显著缩短开发时间。
4、面向智能体(Agent)的接口:AI Portal 还计划提供 Arm MCP 服务器,这使得 AI 智能体(Agent)也能通过这个入口,自主地去发现和使用合适的模型与工具,顺应了“智能体 AI”的自动化趋势。
对于面向 CSS for Mobile 2 平台进行开发的开发者而言,Arm AI Portal 提供了一条直接利用 Arm 平台能力的路径,帮助开发者充分调动 CPU 端 SME2、GPU 端神经网络加速器等能力,将经过优化的 AI 模型与高端移动设备所提供的性能优势紧密结合。
James McNiven表示,“在Arm AI Portal中,我们会提供一组预先优化好的模型——能够更好地支持SME2,也包括支持G2-Ultra NX上的一些预优化模型,还有像Ethos-U这样微型的NPU,以及云端CPU的需求。同时,我们在AI Portal上提供了一些工具,能够帮助解决一些非常实际的问题——包括模型如何做得更加轻量化、如何具有更强的一致性。”
总结来说,KleidiAI、主流 AI 框架集成以及 Arm AI Portal 共同打通了从硬件到软件的开发链路,将 Arm CSS for Mobile 2 的平台能力与开发者所使用的 AI 模型和软件工具紧密连接,帮助开发者打造更加强大、更智能的端侧 AI 体验。
七、移动端NPU的策略:把创新空间留给合作伙伴
众所周知,Arm一直有自己的NPU内核,在物联网领域有很多芯片厂商都有采用Arm的NPU内核,但是在智能手机端一直其实没有客户采用,更多都是采用自研的NPU。那么,Arm是否是放弃了其NPU在智能手机市场的开拓呢?
对于这个问题,James McNiven向芯智讯回应称,市场上所有旗舰智能手机SoC都配备了NPU,Arm在智能手机市场的策略是把NPU创新留给合作伙伴,更专注于包含CPU集群和GPU的计算子系统的创新。不同AI计算引擎适合不同场景——SME2适合轻量级模型和标准化工作负载,但如果追求最高能效和持续低功耗,NPU仍然是不二之选,尤其是第一方应用。对于第三方应用,CPU和GPU的标准化程度更高,更适合广泛部署。
结语:从组件升级到AI系统革命
移动AI的下一个时代,将不再由单一跑分或单一加速器决定,而是取决于整个移动AI系统将用户意图转化为实际行动的综合能力。
Arm CSS for Mobile 2正是为这一转变而打造。它围绕响应速度、能效与持续执行能力,对计算资源、系统IP、物理实现和软件生态进行一体化协同优化——既为芯片合作伙伴提供了可灵活配置的基础平台,助力其打造差异化产品,也为开发者搭建了从平台能力到应用落地的更直接路径。
正如James McNiven在演讲结尾所说:“我们过去谈论的是CPU和GPU的升级,现在我们谈论的是,计算本身正在被重新定义。”
作者:芯智讯-浪客剑
789
