在当前的芯片设计中,云端大模型主要依赖超大规模的万卡或十万卡集群来提供近乎无限的算力支撑。然而,在与日常交互息息相关的端侧设备上,AI的部署则必须在严格的功耗与温度边界、电池能源以及沉重的“内存墙与带宽墙”限制下进行。
在WAIC 2026上,安谋科技(Arm China)CPU产品总监朱晓鸣分享的主题《STAR CPU、Helium及Ethos赋能万物AI》,本质上探讨的就是一个典型的芯片工程问题:让嵌入式设备在有限的功耗和算力下尽可能多地释放AI计算潜力。

图 | 安谋科技(Arm China)CPU产品总监朱晓鸣;来源:与非网摄制
AIoT计算架构转变的四个驱动力
从传统IoT到AIoT,系统的核心正从“连接万物”转向“认知万物”,计算架构也随之发生转变。过去的芯片只负责数据采集,计算全数回传云端;而现在,边端侧必须承载一定程度的自主计算与决策。
朱晓鸣指出,这一变革背后有四个明确的工程原因:
第一点,感知数据的重心转向边端。物理世界直接产生的高频、海量数据如果全数回传,在经济成本与网络带宽上都难以支撑。
第二点,隐私与数据主权的要求,敏感数据必须在数据产生的源头本地化处理。
第三点,毫秒级的实时交互需求,云端模型可以接受思维链数秒钟的推导延迟,但端侧控制系统的闭环决策要求毫秒级响应,任何网络延迟都会直接破坏用户体验。
第四点,低功耗轻量级芯片技术的成熟,毫瓦级的NPU已经能在MCU级别的功耗预算内输出TOPS级的算力。
此外,算法的演进也在同步加速这个趋势。数据显示,两年前要在MMLU测试中达到60%的商用最低标准线,模型规模动辄需要数百个B(Billion)的参数;而到了2026年,由于算法优化,1B左右体量的小模型(例如阿里巴巴的Qwen3 1.7B)已能跨过这道商用门槛,大模型“瘦身”让端侧芯片承载大模型运行成为了现实。
异构架构的技术演进路径
为了解决边缘侧市场需求与受限资源的博弈,架构设计通常有三条演进路径:CPU 指令扩展(通用和推理计算的高效结合)、通用小算力 NPU(易于泛化,生态友好),以及 SRAM 存内计算(针对算法可提供更高能效比)。
朱晓鸣透露,安谋科技在硬件布局上将“通用计算”与“推理计算”进行融合,走的是 CPU 指令扩展路线,原因是这种设计确保了通用CPU既能维持不可或缺的控制与逻辑能力,又能兼顾AI推理加速。
这条路线的关键在于Arm Helium 矢量扩展技术(MVE,M-Profile Vector Extension)。它基于v8.1-M 32位通用架构,提供了固定长度为128-bit的向量处理能力,并为端侧AI额外增加了近150条专用指令,其中包含8位向量点积与复杂数学支持。
从朱晓鸣演示的实测数据来看,Arm Helium技术对效能的提升非常直观:
在音频编解码(LC3)场景下,以经典的Cortex-M4为基准线,最轻量级的Cortex-M52性能提升了30%,而高端的Cortex-M85则提升达65%。
在机器学习(ML)模型推理中,相较于工业MCU广泛使用的Cortex-M7,支持Arm Helium的M55与M85在关键字检测、视觉唤醒词等典型TinyML测试案例中,展现出了平均3倍、特定案例甚至超过8倍的性能增幅。

图 | Arm Helium技术在机器学习场景下的性能测试;来源:与非网摄制
自研“星辰”CPU路线图与“星辰300”原型平台验证
作为这套架构基因的本地化传承者,安谋科技自研的“星辰”(STAR)系列CPU IP正沿着这条时间线演进。
2019年,公司发布基于v8.0-M架构的第一代STAR-MC1。而从第二代的STAR-MC2(对应Cortex-M52)开始,其M核CPU已全面继承对Arm Helium技术的支持。随后发布的STAR-MC3进一步针对AHB总线进行了优化。
朱晓鸣强调,为了解决复杂、重度矩阵计算或大模型执行对CPU的过度占用,公司研发团队采取了异构协同的设计思路。他们将自研的STAR-MC2 CPU与Arm Ethos-U55 NPU整合,部署在FPGA原型验证平台上进行系统级验证,推出了 “星辰300”AIoT原型平台。

图 | 安谋科技“星辰300”AIoT原型平台;来源:与非网摄制
在这个异构系统中,Ethos NPU主要承担“算力补充”的角色,负责将特定任务从CPU中卸载出来,提供最高达4TOPS的高能效算力支持。
在目前的平台实测中,该异构平台已成功跑通了包括人脸探测(实时与预录)、语音识别(Wav2letter、Conformer)、关键字检测及图像超分辨率在内的6大典型端侧AI用例。
在实际的演示互动中,异构卸载机制的优势相当明显:在智能门禁系统中,如果仅靠单颗CPU进行边缘运算,系统通常只能勉强检测单个人脸;而当“星辰300”平台接入Ethos NPU后,算力卸载效应显著。现场即使面对5-6个人脸,系统通过摄像头采集并经网线传输后,依然能精准、实时地检测并标记所有人脸信息,并最终在LCD屏幕上进行实时画面呈现。
写在最后
在端侧AI的设计开发中,芯片架构的迭代本质上是功耗、芯片面积与总线带宽之间的约束平衡。
对此,朱晓鸣指出,通过自研星辰CPU的指令集扩充,配合外部专用NPU的硬件动态卸载,这套异构计算体系能够让轻量级TinyML算子在处理器内部就近执行,同时将重度矩阵运算交由专用加速单元处理。这种基于实际负载特性的动态调配,可为下一代嵌入式门禁、边缘感知芯片以及各类微型端侧模型的工程化落地,提供一种低成本且兼顾实时性的硬件架构参考。
来源: 与非网,作者: 夏珍,原文链接: https://www.eefocus.com/article/2053947.html
564
