• 正文
  • 相关推荐
申请入驻 产业图谱

边缘AI MCU选型地图:从瑞萨RA8D1画起,进口四家对国产三家

09/23 09:44
671
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

瑞萨官网上,RA8D1 的产品页写着"支持高分辨率显示和视觉 AI 应用"。但把 Features 从头翻到尾,你找不到 NPU——这颗 480MHz Cortex-M85 的图形 MCU,靠的是 Helium 向量扩展在"软跑"AI。

这不是文案事故。瑞萨的边缘 AI 布局本来就是两条腿:一条是 Helium 软件路线(RA8D1,以及最新一代 1GHz 的 RA8D2),另一条是 Ethos-U55 硬件加速路线(RA8P1,单芯 256 GOPS,我们此前深评过)。

两条腿之间的分界线,就是边缘 AI MCU 选型的第一道题:你的模型,到底需不需要一颗 NPU?

把这道题摊开,就得到 2026 年这张边缘 AI MCU 选型地图:进口线四家,对国产线三家,外加两条不挂 NPU 的软件路线。

一、先画边界:什么算"边缘 AI MCU"

市面上打着"AI"旗号的芯片可以铺满一张 A4 纸,先把边界画清楚(图1)。

图1 边缘AI芯片三条路线分界图:软件路线、MCU+NPU、外挂DDR视觉SoC,判据是"模型装不装得进片上存储"

路线一:软件路线(向量指令,不挂 NPU)。 靠 CPU 的向量扩展跑推理:瑞萨 RA8D1/RA8D2 用 Arm Helium,乐鑫 ESP32-P4 用自研的 XespV 指令扩展,国产的先楫、极海也各有自己的向量 / DSP 扩展。共同点:不新增硬件、模型几百 KB 到 1MB 级、功耗最友好。

路线二:MCU + NPU(本文主战场)。 在 MCU 里真正挂上神经网络加速器,算力从个位数 GOPS 到 600 GOPS,模型和帧缓冲装进片上或封装内存储,不用外挂 DDR。这是 2024–2026 年增长最快的品类。

路线三:外挂 DDR 的视觉 SoC。 RK3588、Jetson、瑞萨 RZ/V2H 这些 TOPS 级选手。它们很强,但那是 MPU 的地盘,本文出图不进图。

判据一句话:把模型权重加帧缓冲加激活值算一下,装不装得进片上存储。 装得下、又不想为 AI 单独加一颗芯片,走路线二;模型只有几百 KB、还想省 BOM,路线一就是答案。

还有一个地图事实要先摆出来:国产通用 MCU 大厂(兆易、先楫、灵动、极海)的公开产品线里,截至本文写作还没有集成 NPU 的量产通用 MCU 料号——兆易已经公开宣布 2026 年要推集成 NPU 的 AI MCU,但眼下还没有能下单的料号。所以国产线的主角,更多来自跨界选手,以及一家不太被提起的老牌 MCU 厂商。

顺带把紫光也说清楚,因为它最容易被误判:紫光展锐的 N9 端边 AI 平台是内置 5~30 TOPS 的 SoC(还可以外扩到百 TOPS 级),那已经是路线三往上、跑端边大模型的物种;紫光国微的 THA6 Gen2 是 Cortex-R52+ 内核的 ASIL-D 车规 MCU,但没有 NPU。紫光体系在这张 MCU+NPU 的图里是缺位的——不是做不了,是没做在这一档。

二、进口线四颗

STM32N657X0(意法半导体):算力天花板

M55 @800MHz,3360 CoreMark;Neural-ART 加速器 @1GHz、600 GOPS(288 MAC/cycle),ST 官方口径平均能效 3 TOPS/W。4.2MB 连续 SRAM,ISP(三并行管道)、H.264 编码(1080p15)、Neo-Chrom 2.5D GPU 一条龙,是 NPU 派里多媒体最全的一颗。

两个采购前必知的坑:全系列没有片上 Flash,程序必须放外置存储(XSPI/FMC),选它就是选"准 MPU"玩法;NPU 只在 N6x7 子档有(STM32N657X0/A0/B0 这些),N6x5 档没有,下单看料号尾段。

RA8P1(瑞萨):NPU 旗舰,双核分工

1GHz M85 + 250MHz M33 双核版,Ethos-U55 @500MHz 下 256 GOPS;0.5/1MB MRAM(免擦写、字节寻址),2MB SRAM;千兆以太网 + TSN 交换机,CSI-2 摄像头接口。同为官方口径:RA8P1 跑 7300 CoreMarks,STM32N657 跑 3360——CPU 侧余量给前处理/后处理留得很足。工具链是 RUHMI 平台,与 e² studio 集成。

PSE846G(英飞凌 PSoC Edge E84):双域待机王

这颗的架构最讲究"分而治之":高性能域是 M55(最高 400MHz,部分 SKU 320MHz)配 Ethos-U55-128 打推理;低功耗域是 M33 @200MHz 配英飞凌自研 NNLite,守 always-on 唤醒。最高 6MB SRAM + 512KB RRAM,2.5D GPU 带 MIPI-DSI。

注意一个口径细节:英飞凌官方没有公布这颗的 GOPS 数值。采购时别接受任何"等效 X GOPS"的说法,直接要目标网络的实测 fps。

MCX N947(恩智浦):价格带守门员

双 M33 @150MHz + eIQ Neutron N1-16 NPU,4.8 GOPs——在这张表里算力垫底,但定位本来就不是视觉,而是"控制 + 轻 AI":预测性维护、传感融合、家电。NXP 官方知识库口径:NPU 使机器学习吞吐较 CPU 软件推理最高提升约 42 倍。FRDM 开发板官网 25 美元,是整张地图里试错成本最低的入口。

三、国产线三颗

K230(嘉楠):RISC-V 全能生

嘉楠(Canaan,NASDAQ: CAN)是矿机起家的芯片公司——全球首个交付 ASIC 区块链计算设备的厂商(嘉楠官方口径),上市时按 Frost & Sullivan 的数据是全球第二大比特币矿机厂商;2018 年发布 K210,是全球首款 RISC-V 架构的商用边缘 AI 芯片,K210 加 K510 两代累计出货超过 200 万颗。它不做通用 MCU,客户是智能门锁、词典笔、3D 结构光模组这类整机与模组厂,渠道与 MCU 圈平行。

双玄铁 C908——大核 1.6GHz 支持 RVV 1.0(官方口径:全球首款支持该标准的商用 SoC),小核 800MHz。第三代 KPU 支持 INT8/INT16。

K230 最值得说的是算力口径:嘉楠官方不给 TOPS,只给典型网络帧率——ResNet50 ≥85fps@INT8、MobileNetV2 ≥670fps、YOLOv5s ≥38fps。这是比 TOPS 诚实得多的口径(后面第五节展开)。

独门武器是 DPU(3D 结构光深度引擎,最大 1920×1080),最高 4K 视频输入配 H.264/H.265 硬编解码,另有 3 路 MIPI CSI;跑 Linux + RT-Smart 双系统。注意它需要外挂 LPDDR4(参考设计板载 128MB),形态上已经在路线二和路线三之间。

RV1106G2(瑞芯微):IPC 专用跨界

Cortex-A7 @1.2GHz + 300MHz MCU,NPU 0.5 TOPS(INT4/INT8/INT16)。杀手锏是集成度:SiP 封装内直接埋 128MB DDR3L,QFN128 只有 12.3mm 见方,片内还有百兆以太网 PHY 和音频 codec。BOM 能砍到极简,是电池摄像头/AOV 设备的主粮芯片。

CCR4001S(国芯科技):被漏掉的那颗国产 NPU MCU

严格说,这一颗才最贴本文"MCU + NPU"的定义:自研 RISC-V 内核 CRV4H @230MHz,片上集成 0.3 TOPS@INT8 的 NPU,支持 MobileNet / ResNet / VGG / YOLO 一类网络;内置 256KB SRAM,封装内合封 8/16/32MB DDR,带 MIPI CSI 与 DVP 摄像头输入——不需要外挂内存。

它的出处不在产品页,在公告里:苏州国芯科技(688262)的《2026 年半年度报告》(2026-08-28)逐条写了这颗的 NPU 与合封存储规格;2024 年 7 月发布,2025 年已经在新一代商用空调上落地。

0.3 TOPS 在这张表里不算高。它的意义在于证明一件事:国产 MCU 厂商不是做不出 NPU MCU,而是还没把它做成货架上的主流货。

顺带回答:用 GD、先楫的人现在能选什么

如果你手上跑的是兆易、先楫这条线,这张地图给不出"换一颗就有 NPU"的答案——因为那一颗现在还不存在。能选的在软件路线上:

兆易 GD32H78D:Arm Cortex-M7,主频 750MHz,CoreMark 3736,2MB + 8MB Flash、1.2MB SRAM(其中 640KB TCM 与 CPU 同频),全新集成 MIPI DSI。

没有 NPU,M7 本身也没有 Helium——靠高主频和大 TCM 硬扛。兆易已在投资者关系活动中明确:2026 年计划推出集成 NPU 的 AI MCU。

先楫 HPM6P00:RISC-V 双核 600MHz,带双精度浮点与 DSP 扩展,6780 CoreMark / 3420 DMIPS,双核各 256KB 零等待 ILM/DLM。同样没有 NPU。

极海 G32R501:Arm Cortex-M52 双核,最高 250MHz(典型 200MHz),官方 datasheet 明写 Helium MVE 向量扩展——本文已核的国产型号里,唯一带 Arm 向量扩展的 MCU,硬件底子最接近瑞萨 RA8D1 那条路。

把 GD32H78D 和 STM32N657 摆一起看很有意思:3736 对 3360,国产这颗的 CPU 跑分反而更高,但它一块 NPU 都没有。缺的不是算力,是那颗 NPU。

软件路线的国产代表是乐鑫 ESP32-P4:双核 RISC-V @400MHz,自定义 AI/DSP 扩展 XespV,无 NPU——思路与 RA8D1 同款:靠指令集扩展软跑,封内 16/32MB PSRAM 兜底,MIPI 摄像头/显示接口照给。

再往前排一位致敬:ADI 的 MAX78000(2020 年,M4F + CNN 加速器,442KB 权重存储,官方称推理能耗微焦耳级)证明"MCU 跑神经网络"这条路六年前就通了;嘉楠 K210 则是把这件事带出圈的前浪。

四、七颗一字排开

图2 边缘AI MCU参数横评表:进口四家与国产三家,算力口径各按官方公布值标注

看表之前先立一块警示牌:GOPS/TOPS 数字不可直接横比。

各家 NPU 架构、量化位宽、稀疏支持、频率口径都不同——600 GOPS 的 Neural-ART 和 0.5 TOPS 的瑞芯微 NPU 跑同一个 YOLO,胜负完全取决于模型-工具链匹配度。这张表里的算力列,一律按各家官方公布口径原样标注;两家不公布的(嘉楠、英飞凌),就写"官方未公布",不做任何推算。

五、地图怎么读

图3 边缘AI MCU选型地图:横轴AI加速能力(对数轴,口径见警示),纵轴形态自包含度

把七颗芯片放上二维地图:横轴是 AI 加速能力(对数轴),纵轴是形态自包含度(纯片上存储 → 封装内/SiP DRAM → 外挂 DDR)。三个读图结论:

第一,算力最高的 STM32N657 把 Flash 让了出去。 4.2MB SRAM 全留给数据和模型,程序外置——算力和形态自包含度,在 MCU 里就是一对跷跷板。

第二,国产三颗全都靠"在封装里塞内存"解决问题。 RV1106G2 是 SiP 内 128MB DDR3L、CCR4001S 是合封 8/16/32MB DDR、K230 干脆外挂 LPDDR4——纯片上大容量 SRAM/MRAM 的 MCU+NPU 高地,目前仍由进口线占着。这是先进工艺下大容量片上存储的成本问题,不是设计能力问题。

第三,算力最不可比的地方,恰恰是营销最爱比的地方。 两家不公布 TOPS/GOPS 的厂商,反而把典型网络的实测帧率摆上了官网。看 demo fps 选型,比看峰值算力数字靠谱。

六、真正影响选型的暗线:NPU 阵营分裂

图4 NPU两大阵营:Ethos-U55开放阵营两家共享工具链 vs 自研阵营各自绑定

这张地图上还有一条不在参数表里的暗线:七颗芯片的 NPU,分成两个阵营。

开放阵营:Arm Ethos-U55。 RA8P1、PSE846G 两家用同一颗 Arm NPU IP,共享 Vela 编译器和 TFLM 生态——模型在两家之间迁移,重编译为主,基本不用重训。

自研封闭阵营。 ST Neural-ART 绑 ST Edge AI Suite,NXP Neutron 绑 eIQ,嘉楠 KPU 绑 nncase,国芯的 NPU 走多框架直转,瑞芯微 NPU 绑 RKNN——性能上限和差异化握在自己手里,但工具链绑定深,换平台约等于模型工程重做一遍。

PM 的取舍逻辑就一句:选开放阵营,是给供应链留退路;选自研阵营,是赌这家原厂的工具链长期投入。

七、场景速查

图5 三类场景选型速查:视觉HMI、always-on语音传感、预测性维护对应三条路径

把地图压成三句话:

视觉 HMI、门禁、可视门铃:先算模型大小。几百 KB 级别的分类/检测,RA8D1/RA8D2 这类"软件路线 + 图形外设"反而是性价比答案,还能省掉 NPU 的芯片差价;到 YOLO 级实时检测,直接上路线二,进口看 RA8P1/STM32N657,国产看 K230/RV1106G2。

always-on 语音唤醒、传感监测:优先双域设计(PSE846G 的 M33+NNLite)或超低功耗软件路线,别拿高性能 NPU 硬扛待机功耗——大算力 NPU 关不掉,待机电流就是灾难。

电机控制 + 轻 AI(预测性维护、振动分析):MCX N947 是最对位的进口答案,国产侧 CCR4001S 的 0.3 TOPS 也够跑振动 / 电流的轻量模型。

国产线目前的最优解在整机成本账上:K230/RV1106G2/CCR4001S 都是带着封装内存储、视频编解码甚至摄像头接口上车的——单芯片参数不如进口旗舰能打,BOM 总账更容易赢。

边缘 AI 的选型从来不是"谁算力高买谁",而是"你的模型在哪个存储边界里活着"。这张地图,2027 年大概率要重画——到时候国产线会不会补上纯片上存储的那块高地,是比算力数字更值得盯的信号。

相关推荐