• 正文
  • 相关推荐
申请入驻 产业图谱

3D视觉抓取主控横评:RZ/V2H / Jetson / RK3588 谁更省MCU?

09/09 10:47
227
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

导语

散乱工件抓取的成功率,80% 不是卡在 AI 模型,而是卡在整个链路的时延和抖动。本文给你一张 RZ/V2H vs Jetson Orin Nano vs RK3588 的选型对比表,以及 7 步抓取流水图,看完能判断自己的项目该用哪种主控

做机器人抓取的工程师都知道:把流水线上排好的工件抓起来不值钱,把料箱里乱糟糟的金属件稳定抓出来才值钱。但 2025 年 IROS 上的一份研究显示,密集堆叠场景下端到端抓取成功率做到 89.2% 已经算顶尖。

问题在哪?我把它拆成三件事:看得准、跑得快、打不撞。瑞萨 RZ/V2H 的解法很特别——它把 Linux 决策核、实时控制核、AI 加速器、传统视觉加速器塞进了一颗芯片。下面从 datasheet 框图讲起,给你 7 步流水和 3 家平台横评。


一、先问:为什么无序抓取那么难?

bin picking(料箱无序抓取)难的并不是机器人本身,而是「信息不完整」。

三个现实痛点

    工件位姿未知:不像流水线上的工装夹具,堆叠件的位置、姿态、朝向全随机,需要 6D 位姿估计(位置 x/y/z + 旋转 r/p/y)。遮挡与反光:金属件反光、透明件折射、黑色件吸光,都会让 3D 相机点云出现空洞。失败率会被放大:单步抓取成功率如果是 85%,连续抓 10 个工件的整体成功率只剩 19.7%。工业现场通常要求单次成功率 95% 以上,才能把人从工位上真正替换下来。

学术 demo 的数据也反映了这一点: deformable 食品抓取在简单场景下 93.8%,但 clutter 场景掉到 75%;IROS 2025 的 Semantic-GraspNet 在密集堆叠场景下做到 89.2% 已经是头部水平。

这告诉我们:bin picking 拼的不是某一项算法,而是感知、决策、执行三条链路能否在 100 ms 以内闭环


二、RZ/V2H 的底牌:一芯四核,把「眼脑手」塞进一颗 19 mm 芯片

瑞萨 RZ/V2H 是 2024 年 2 月发布的视觉 AI MPU,官方定位就是机器人、AMR、工厂机器视觉。它的杀手锏不是算力最高,而是把四颗不同性格的核做进了一颗芯片

处理器分工

    Cortex-A55 ×4 @ 1.8 GHz:跑 Linux + ROS2 + 高级规划,负责决策。Cortex-R8 ×2 @ 800 MHz:跑实时运动控制,负责把轨迹变成关节指令。Cortex-M33 @ 200 MHz:系统管理、上电时序、安全监控。DRP-AI3:瑞萨第三代 AI 加速器,8 TOPS 稠密 / 80 TOPS 稀疏,负责神经网络推理。独立 DRP:动态可重构处理器,跑 OpenCV 等传统 CV,可和 DRP-AI3 并行。

这相当于用一颗芯片覆盖了传统方案里「视觉 SoC + CPU + 实时 MCU + 通讯 MCU」的多颗芯片角色。下面两张图都来自瑞萨官方 datasheet:图 1 是 flyer 彩色架构图,图 2 是 datasheet 第 14 页的 Block Diagram。

图1:RZ/V2H 异构架构框图

图2:RZ/V2H Datasheet Block Diagram

对 bin picking 最直接的接口红利

    4 路 MIPI CSI-2(4-lane):可接双目、结构光、ToF,做多视角融合。6 路 CAN-FD:直驱伺服驱动器,省掉一颗外置通讯 MCU。6 MB on-chip SRAM + LPDDR4/4X 外存:6D pose 网络 + 分割网络同时跑,内存够大。典型 AI 负载 < 4 W:无风扇即可,能直接贴在机械臂底座或 AGV 上。

三、从看见到抓稳:RZ/V2H 上的七步流水

把上面的硬件映射到软件,bin picking 在 RZ/V2H 上大致可以跑成下面七步。关键点是:预处理与 AI 推理走 DRP/DRP-AI3,运动控制走 Cortex-R8,互不抢资源

图3:从看见到抓稳的七步流水

每一步的职责

    多视角 3D 采集:4 路 CSI 接 3D 相机,结构光/双目/ToF 任选,必要时扩展 USB 相机补光。点云/图像预处理:独立 DRP 加速去噪、配准、深度对齐。瑞萨官方称 OpenCV 在 DRP 上比纯 CPU 快最高 16 倍。实例分割 + 6D 位姿:DRP-AI3 跑 Mask R-CNN、SAM-6D、PVN3D 等网络,输出每个工件的位置和姿态。抓取位姿评分:Cortex-A55 给候选抓取点评分,过滤不可行、不稳定的位姿。碰撞-free 路径规划:在 MoveIt / CHOMP / OMPL 里,基于点云生成安全轨迹。实时运动执行:Cortex-R8 跑 1–2 kHz 位置/力控环,经 CAN-FD 直驱伺服。失败检测 + 重试:力/视觉反馈判断抓没抓住,失败就换工件、换位姿再来。

这里没有一步是炫技,但每一步都对硬件提出了不同要求:第 2、3 步要 AI 和 CV 算力;第 4、5 步要 Linux 生态;第 6 步要实时性。RZ/V2H 的异构设计,正好把这三类负载分给了不同的核。


四、竞品横评:核心差异不是 TOPS,是「有没有实时核」

做视觉抓取的主控平台很多,工程师最常问的是:RZ/V2H 跟 Jetson Orin Nano、Rockchip RK3588 怎么选?

图4:三家视觉抓取主控平台横评

读表结论

    TOPS 都够:bin picking 的视觉模型对算力要求并不夸张,8–40 TOPS 都在可用区间。实时核才是分水岭:Jetson 和 RK3588 没有 Cortex-R 系列实时核,做机器人抓取必须外挂一颗 MCU 跑电机控制;RZ/V2H 单芯片省下 1–2 颗芯片。代价也要承认:RZ/V2H 的 CUDA / TensorRT 生态远不如 Jetson,算法栈要自己集成或借助 DRP-AI TVM、瑞萨 AI SDK

五、为什么抓不稳?问题不在软件,而在实时闭环

很多人以为 bin picking 的瓶颈是 AI 模型精度,其实工业现场最大的返工原因是:机械臂执行阶段的抖动和碰撞

Cortex-R8 在闭环里到底做什么

图5:Cortex-R8 在抓取闭环里的角色

    输入侧:A55 给出目标轨迹,编码器反馈实际位置,力/触觉传感器反馈末端力矩。R8 内部:跑位置环/力控环,周期 0.5–1 ms,抖动控制在 1 ms 以内。输出侧:经 6 路 CAN-FD 发关节指令给伺服驱动器,同时控制夹爪/吸盘开合,并监控急停/碰撞。

Linux(A55)上的 ROS2 只负责发「目标轨迹」,真正的高频闭环在 R8 上跑。这就是为什么纯 Linux SoC 做机器人抓取容易「看得见、够不着」——实时性抖动会直接传到机械臂末端,导致抓偏或打滑。


六、瑞萨不做视觉算法,它做的是「主控入口」

这里要划清一个边界:

    梅卡曼德、Photoneo、Zivid:卖的是「3D 视觉 + 抓取算法 + 路径规划」的完整视觉方案。RZ/V2H:卖的是运行这些算法的芯片平台,客户需要自己或第三方集成 6D pose、grasp planning、ROS2 控制栈。

换句话说,瑞萨是 bin picking 系统的「底盘」,视觉算法商是「上层应用」。对 OEM 和机器人厂商来说,RZ/V2H 的价值在于:用一颗芯片把底盘的算力、实时性、工业接口都解决了,不用再搭一个多芯片控制板。


七、落地提醒:先想清楚三件事

    算法栈不是开箱即用:瑞萨提供 AI SDK、AI Apps(50+ 预训练例程)、DRP-AI TVM,但具体 bin picking 模型要自行训练或购买第三方视觉方案。6D pose 精度决定抓取成功率:±0.5 mm / ±1° 是常见门槛,金属反光件还要做专门的点云增强。末端执行器比芯片更重要:夹爪、吸盘、力控 fingertips 的选型,往往比主控芯片更能决定单次抓取成败。

八、结论

无序堆叠抓不稳,本质上是「感知-决策-执行」三条链路的时延和确定性问题。瑞萨 RZ/V2H 的解法不是把某一项算力堆到最高,而是用一颗芯片把四类负载分开跑:DRP 做传统 CV、DRP-AI3 做神经网络、A55 做决策、R8 做实时控制。

对工程师选型来说,这意味着:

如果你要做的是机器人/机械臂本体,RZ/V2H 能帮你省掉外挂 MCU,缩短 BOM 和开发周期。如果你已经有成熟视觉算法团队,想换一颗集成度更高的主控芯片,RZ/V2H 是 Jetson/RK3588 之外的有力选项。如果你连 AI 模型都没选好,不要指望买一块 RZ/V2H 评估板就能直接上线 bin picking——芯片只是底盘,算法和夹爪才是胜负手。

 

声明:本文技术参数来自瑞萨官方 datasheet 与新闻稿,行业数据标注了来源与置信度。Jetson / RK3588 的功耗为公开规格或估算值,具体以各厂商最新文档为准。

相关推荐