• 正文
  • 相关推荐
申请入驻 产业图谱

Arm边缘AI新动作:CPU里住进双SME2,GPU里藏了一个“NPU”

原创
6小时前
423
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

随着端侧大模型与智能体AI(Agentic AI)从概念走向落地,智能手机算力需求正面临一场前所未有的结构性变革。传统由单一芯片(如NPU)孤军奋战的AI模式,已难以满足“持续运行、快速响应、极致视觉”的复杂需求。

在最新举办的Arm Everywhere China年度大会上,这家芯片架构巨头正式推出第二代移动终端计算子系统(CSS for Mobile 2)。这是一套专为新一代AI工作负载打造的计算平台,通过异构计算将CPU、GPU和系统IP紧密整合。

图 | Arm Everywhere China年度大会现场

在随后的媒体沟通会上,Arm高管与技术专家围绕这套硬件架构背后的设计考量与产业未来,进行了深度解密。

CPU升级“调度总管”,SME2释放端侧大语言模型潜力

在智能体AI的时代,AI不再只是拍张照、修个图的单一指令,而是需要持续维护上下文、调度不同模型、甚至自主执行任务。

Arm边缘AI智能终端计算副总裁James McNiven表示:“随着AI从执行单一任务逐步演进为管理日益复杂的工作流,CPU正成为整个系统的编排引擎。它负责维护上下文、调度工作负载,并协调更广泛计算系统中的各类任务,以确保 AI 智能体在推理、规划和执行过程中始终保持高响应性。”

图 | Arm边缘AI智能终端计算副总裁James McNiven答记者问(右)

全新的Arm C2 CPU集群结合了其性能最强大的移动CPU——C2-Ultra、面向能效优化的C2-Pro以及双SME2(可缩放矩阵扩展)单元配置。相较于上一代,C2-Ultra实现了高达1.7倍的AI性能提升,在相同性能下,功耗降低了38%;而翻倍的SME2计算能力,更让最新小语言模型(SLM)的运行速度提升高达70%。

谈到将SME2部署在CPU集群中的技术考量,James McNiven解释道:“SME2最独特的一点在于,它的编程方式和CPU保持一致。开发者无需采用独立且复杂的加速器编程模式,通过熟悉的指令就能直接调用矩阵计算能力。这不仅带来了极低的延迟与快速响应能力,还能充分利用 CPU 已有的安全模型与安全机制,大幅降低开发门槛。”

GPU首次引入专用神经网络加速器,打破能效天花板

移动端图形技术正在从“传统渲染”走向“AI原生图形技术”,通过神经网络进行画面细节的重建、增强与生成。此次发布的Arm Mali G2-Ultra NX正是业界首款集成专用神经网络加速器的移动GPU。

在媒体问答环节中,针对“为什么将神经网络加速器放在GPU里面,而不是放在NPU里面”的提问,James McNiven表示:“我们认为,不同类型的AI工作负载需要不同形式的加速能力,而异构计算正是满足各类计算需求的最佳方式。”

James McNiven指出,在GPU中集成的神经网络加速器,专门用于加速神经图形相关工作负载。更重要的是,这种设计能够让加速器共享执行引擎的内存和缓存资源(例如L1和L2缓存)。

这使得AI图形工作负载能直接在GPU内高效完成,让AI加速功能与图形渲染管线紧密协同、并行处理。结合Arm神经网络技术,Mali G2-Ultra NX在神经网络处理场景下可实现最高4倍的“每瓦性能”提升。

而针对市场关心的精度问题,James McNiven补充道,该加速器原生支持INT8和INT16数据格式以最大化能效,而包括FP16在内的浮点格式运算,则由执行引擎中的标准着色器核心来处理,从而在专用AI加速与通用计算能力之间取得最佳平衡。

直面硬件成本提升,用全链路优化化解产业痛点

近年来,全球存储价格与晶圆成本持续走高,给移动终端产业带来了巨大的成本压力。大模型动辄数GB的内存占用,成为端侧AI普及的最大阻碍。

对此,Arm边缘AI 执行副总裁Chris Bergey坦言:“移动产业当前确实正承受着来自多个方面的成本压力,比如存储、晶圆价格的提升,我们正与合作伙伴共同努力,全力推进全链路优化。”

图 | Arm边缘AI 执行副总裁Chris Bergey答记者问(左)

Chris Bergey透露,Arm应对挑战的关键策略之一,是推动AI模型向更小、更高效的方向演进。例如,Arm已经与阿里巴巴通义千问合作,展示了最新的Qwen-Audio家族如何在SME2上实现2-bit量化模型。由于模型规模非常小,成功在性能、成本和能效之间取得了更好的平衡。此外,在图形领域,Arm联合腾讯游戏等伙伴推进的“神经纹理压缩(Neural Texture Compression)”也是一大亮点,能在画质不变的前提下大幅缩小文件体积,直接为设备节省宝贵的内存资源。

双模式调度,破解智能体AI“持续运行”功耗难题

智能体需要持续调用工具并保持运行状态,这对手机的电池功耗与散热带来了极大挑战。

James McNiven认为,理解这个问题的关键在于如何定义“持续运行”。他指出,全时段高强度占用整个系统,与按周期进行调度,这两者之间是有区别的。许多智能体可以周期性触发运行,并不需要微秒级不间断工作,任务的运行强度才是决定功耗的关键。

Chris Bergey则从日常使用场景出发,提出了创新的双模式调度美学。他指出,可以将设备理解为两种不同的运行模式:“电池供电模式”与“充电供电模式”。

“当您晚上给手机充电时,设备可以利用充电供电执行大量的KV缓存(KV Cache)优化和上下文预处理等高负载任务。”Chris Bergey解释。通过这种在充电状态下的前置处理,就能让设备在白天处于电池移动使用阶段时,拥有更高的词元(Token)生成效率与更低的功耗负载。

开源与生态协同,加速移动端图形体验革命

在技术落地方面,James McNiven强调,Arm始终将能效放在核心位置。例如在与桌面端帧生成技术的对比中,移动端的神經幀率提升(NFRU)目前聚焦于单次额外帧生成(即实现帧率翻倍),其NSS模型因能效设计而更为精简。未来,Arm计划进一步拓展至多帧生成能力,并布局全局光照、辐射缓存等前沿技术。

同时,Chris Bergey特别强调了Arm在生态圈中的开放立场:“我们一直非常积极地推动开放模式的生态。开发者可以直接前往Hugging Face下载模型权重,并结合我们提供的工具进行实验和开发。”

目前,这套由CSS for Mobile 2引领的AI生态圈正在迅速壮大。从KleidiAI软件库到全新的AI Portal,Arm为开发者提供了开箱即用的神经图形能力。

据悉,包括Unity中国(团结引擎)、网易(《燕云十六声》计划推出支持神经超级采样NSS的版本)、腾讯游戏(《暗区突围:无限》技术演示)、以及支付宝、OPPO、vivo 等行业巨头,均已深度加入这一开放协作的产业生态。

来源: 与非网,作者: 夏珍,原文链接: https://www.eefocus.com/article/2086263.html

Arm

Arm

ARM公司是一家知识产权(IP)供应商,主要为国际上其他的电子公司提供高性能RISC处理器、外设和系统芯片技术授权。目前,ARM公司的处理器内核已经成为便携通讯、手持计算设备、多媒体数字消费品等方案的RISC标准。公司1990年11月由Acorn、Apple和VLSI合并而成。

ARM公司是一家知识产权(IP)供应商,主要为国际上其他的电子公司提供高性能RISC处理器、外设和系统芯片技术授权。目前,ARM公司的处理器内核已经成为便携通讯、手持计算设备、多媒体数字消费品等方案的RISC标准。公司1990年11月由Acorn、Apple和VLSI合并而成。收起

查看更多

相关推荐

与非网主分析师 通信专业出身,从事电子研发数余载,擅长从工程师的角度洞悉电子行业发展动态。