前言:
不少客户说之前的项目想上大模型,让我们推荐一个适配好的算力卡。但端侧 AI 算力卡这两年型号满天飞,技术路线各异,算力功耗各不相同,算法环境生态与适配场景天差地别,实在不敢拍胸脯说”这张卡在你的板子上一定能跑起来”。
既然是客户需求痛点,我们仔细筛选各类适合端侧AI应用场景落地的M.2算力卡,干脆把主流的几款卡都买回来,在眺望电子RK3588核心板平台上上逐一适配、验证、写文档。
目前我司已深度适配调通如下四款:
●瑞芯微 RK1828
●Hailo-8


●DEEPX DX-M1
●爱芯元智 AX-M1
一、四款算力卡基本参数对比
•RK1828:瑞芯微自研协处理器,20TOPS,片内 5GB 高带宽 DRAM,官方评估 Qwen2.5-7B int4 约 3.5GB,是四款里唯一能官方备书跑 7B 的。
•Hailo-8:26TOPS,无 CPU 无 DRAM、全靠片上 SRAM,功耗低至 2.5W,视觉推理全家桶,走极致低功耗路线。
•DX-M1:25TOPS + 4GB LPDDR5,4.5W,特色是 PPU 硬件后处理和 systemd 服务化驱动,面向多路摄像头场景友好。
•AX-M1:24TOPS,自带八核 A55 和 8K 编解码 VPU,8GB 内存,LLM、多模态、语音、文生图都能跑,上手较为全能的一张。
| 维度 | RK1828 | Hailo-8 | DX-M1 | AX-M1 |
| 品牌 | 瑞芯微RK182X | 以色列Hailo | 韩国DEEPX | 爱芯元智AX8850 |
| NPU | 20TOPS@INT8 | 26TOPS@INT8 | 25TOPS@INT8 | 24TOPS@INT8 |
| 内存 | 片内 5GB DRAM | 片上 SRAM | 4GB LPDDR5 | 8GB LPDDR4x |
| 接口 |
|
|
|
|
| 功耗 | 外接 12V/3A + 3.3V/3A | 2.5W | 4.5W | ≤8W |
| 定位 | 大模型协处理器 | 纯视觉推理、低功耗 | 摄像头边缘推理 | 端侧多模态一体化 |
| 温度 | -10℃ ~ 55℃ |
|
|
0°C 至 70°C |
| 价格 | ¥1999 | ¥1199 | ¥999 | ¥1619 |
二、链路联调实测
2.1 模型支持与验证
| 卡/模型 | RK1828 | Hailo-8 | DX-M1 | AX-M1 |
| 多模态模型 | FastVLM
GME-Qwen2-VL InternVLM MiniCPM-V-4 Qwen2.5-VL Qwen3-VL Qwen3-VL-LoRA Gemma4 SmolVLM SmolVLM2 |
CLIP
YOLOWorldv2 |
CLIP | InternVL3
Qwen2.5-VL SmolVLM2 CLIP YOLOWorldv2 Lcm-lora-sdv1-5 Janus-Pro-1B LivePortrait |
| 大语言模型 | Qwen2.5-Omni
Qwen3-ASR Qwen3-TTS vits zipformer |
- | - | DeepSeek-R1-Distill
Qwen3 Qwen2.5 MiniCPM4 SmolLM3 Llama3.2 Gemma2 Phi3 StableDiffusionv1.5 |
| 视觉模型 | mobilenet_v1
mobilenet_v2 resnet yolov5 yolov6 yolov8 |
Depth-AnythingV2
SCDepthv3 FastDepth StereoNet YOLO11 YOLOv7-Face YOLO11-Seg YOLOv8 YOLOv8-Seg YOLO11-POSE YOLOv5 YOLOv6 YOLOv9 YOLOv10 YOLOX SSD CenterNet Real-ESRGAN 低光增强 图像去噪 人脸检测 人脸属性 人脸关键点 实例分割 语义分割 人体属性 行人重识别 手部关键点 3D 目标检测 文本检测识别 视频分类 |
AlexNet
DenseNet121/161 EfficientNetB2/V2S HarDNet39DS MobileNetV1/V2 RegNetX/Y 系列 RepVGGA1 ResNet18/34/50/101 ResNeXt26/50 SqueezeNet1_0/1_1 VGG11/13/19(含 BN) WideResNet50/101 YOLOv5(N/S/M/L) YOLOv7(E6/W6) YOLOv8 YOLOv9 YOLOX SSD(V1/V2 Lite) YOLOv3 YOLOv7-Face YOLO11-Seg YOLOv8-Seg DeepLabv3 PIDNet BiSeNetV1/V2 YOLO11-POSE Real-ESRGAN DnCNN 人脸识别 人脸属性 人脸关键点 手部关键点 3D 目标检测 PPOCR v4/v5 视频分类 低光增强 |
Depth-AnythingV2
MixFormerV2 YOLO11 YOLOv7-Face YOLO11-Seg YOLOv8 YOLOv8-Seg YOLO11-POSE Real-ESRGAN LivePortrait |
| 语音模型 | Qwen2.5-Omni
Qwen3-ASR Qwen3-TTS vits zipformer |
Whisper | - | Whisper
SenseVoice MeloTTS |
2.2 实测FAQ
| 卡/模型 | 最硬的坑 |
| RK1828 | ●PCIe 和 USB3.0 是 Combo PHY,只能二选一;
●必须外接 12V(12V/3A + 3.3V/3A); ●片内 5GB vs 7B int4 约 3.5GB,跑 7B 时空间逼近上限 |
| Hailo-8 | ●跑 demo 前修改 /etc/security/limits.conf,必须从 1024 改 4096,否则起不来;
rockit sdkak_rockit_demo无法运行,可以修改/etc/hailo_integration_tool/input.json文件选择测试项。 |
| DX-M1 | ●多路复用推荐转化成ppu模型进行加速,对性能会有质的提升,但2.2版本编译工具链转化为ppu模型转化需要python3.11以上 |
| AX-M1 | ●不同模型需要的opencv版本不一样,例如视觉模型需要4.6版本的opencv,其他模型4.5版本即可 |
2.3 交付的不是 demo,是确定能落地
1.Qwen3-VL在RK3588+RK1828已全链路跑通:RKNN3模型获取、RKNN模型转换、RK3588应用编译及RK1828运行环境部署。
2.Hailo-8配合RK3588 的 rockit SDK 负责视频解码上屏,Hailo-8 跑目标检测,最后 ak_rockit_demo 把 16 路画面 4×4 拼接,每路同时画人和车的框。
3.DX-M1 打通一条完整的摄像头实时推理链路,整包固件加预装编译器的虚拟机。每份文档都按真实踩坑记录写——环境几步走、量化怎么配、哪些坑我们已经替客户踩过,文档写不全的,技术支持来补。
4.AX-M1 把大模型跑成了服务。 Python tokenizer HTTP 服务加 C 推理程序的组合架构,KVCache 落盘可复用;按模型类别做了 6 个整包固件(CV、AUD、LLM、MLLM、T2T、BASE),要什么烧什么;
91