• 正文
  • 相关推荐
申请入驻 产业图谱

作品展示|基于RK3588的多模态婴儿智能监测系统

5小时前
189
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

当婴儿睡着、家长暂时离开、家人轮替照护时,谁来替我们 "盯住" 那几秒钟的安全?

同济大学 "大葱明向前葱队" 的 "基于RK3588的多模态婴儿智能监测系统"填补了这时间段看护的空白,并在“2026年全国大学生嵌入式芯片与系统设计竞赛”瑞芯微&飞凌嵌入式赛题中斩获国赛一等奖。

该参赛项目覆盖婴儿睡眠、短时无人看护、多人轮替照护等典型场景,可持续监测婴儿的情绪与安全状态,并在危险发生时及时报警、自动安抚。系统采用边缘计算架构,低网络依赖、可局部部署,不仅适用于家庭,也能帮助月子中心等半集中照护环境的护理人员同时掌握多名婴儿的舒适度与安全状态。

从一间婴儿房起步,这套系统未来还将接入云端,拓展至儿童健康管理、睡眠分析与智能家居联动。一起来看看他们的成果。

项目介绍

院校名称:同济大学

团队名称:大葱明向前葱队

团队成员姓名:蒲天蓝、张馨邈、李佳凝

指导老师:徐和根、张志明

这是一套基于【RK3588】ELF 2开发板的多模态婴儿智能监测系统。系统通过视觉与听觉模态感知婴儿状态,经模型推理后进行情绪融合分析与危险判定。依据识别结果,系统选择性驱动机械安抚机构或触发警报响应。同时系统将状态数据写入日志,并在显示界面实时呈现当前与历史状态,为看护者提供全面的智能监护支持。

软件整体介绍 

本项目的软件系统采用“模型推理+状态评分+JSON数据交换+本地Qt展示+App原型扩展”的结构。

软件架构基于RK3588芯片与Ubuntu操作系统的边缘计算平台,采用主程序与多线程协同运行模式。

1)主线程:负责系统初始化与整体调度,完成各功能模块的启动、运行管理、状态汇总和数据交互控制。

2)子线程:主要包括模型推理线程、多模态状态分析及评分线程、安全判断线程、数据存储及转换线程,Qt界面线程和移动端线程。

系统整体运行逻辑如下:摄像头和麦克风采集到的数据首先进入RKNN模型推理层,得到表情、声音、口鼻遮挡等识别结果;随后由情绪评分与安全判断模块进行5分钟窗口聚合、小时评分和安全事件检测;底层结果通过JSON文件进行交换和存储;状态转换器将底层数据整理为前端可直接读取的JSON文件;Qt/QML界面负责开发板本地显示,App原型用于移动端展示。

(1)人脸检测与框选模块

本模块采用RetinaFace作为人脸检测与框选模型。模型通过分类分支判断候选区域是否为人脸,通过边界框回归分支预测人脸 框坐标,并通过关键点分支定位眼睛、鼻尖、嘴角等关键点。系统再根据置信度筛选结果,并使用非极大值抑制去除重复框,最终在原图上绘制人脸矩形框。

(2)口鼻遮挡检测模型

该模型基于Yolov5s,用于对图像或视频画面中的婴儿面部区域进行自动检测,输出其口鼻是否被遮挡及其置信度。

数据集采用YOLO格式,设mask与face两类,共2000张图像,将数据集按照3:1:1的比例划分为训练集、验证集和测试集。

训练过程中,本模块采用迁移学习的方式进行模型优化。训练时加载YOLOv5s的预训练权重,在已有通用目标检测能力的基础上,进一步针对婴儿口鼻遮挡场景进行微调。

部署后,摄像头实时采集视频帧,经预处理后送入模型推理,输出目标类别、位置及置信度。

(3)面部情绪推理模型

本模块基于YOLOv8n‑cls构建婴儿面部表情分类模型,输出哭、笑、平静三类标签及其置信度。数据集按类别文件夹组织,含哭、笑、平静三类,共有训练集352张,验证集197张。

本模块训练采用迁移学习策略,加载YOLOv8n‑cls预训练权重,在通用分类能力基础上针对婴儿表情微调;训练前以RetinaFace进行人脸检测、对齐与裁剪,减少背景及姿态干扰。

部署后,实时视频流经人脸检测与裁剪后送入分类模型推理,输出情绪结果,实现端侧实时识别,为状态监测提供感知支撑。

(4)声音推理模块

声音推理模块基于DeepInfant开源架构,实现婴儿哭声、笑声、咳嗽及无声的四分类任务。模块采用CNN-BiLSTM混合架构,以梅尔频谱图(Mel Spectrogram)作为输入特征,在自定义数据集上完成训练与评估。

数据集融合了自采样数据与婴儿声音公开数据集。针对样本总量不足且类别间分布不均衡的问题,对样本较少的类别实施数据增强,通过时间拉伸、音高偏移、白噪声注入及增益提升扩充样本量,增强后的文件与原始文件一同参与后续数据集划分,共计3005个音频文件。此外,为强化模型对无声场景的判别能力, 批量生成纯静音音频文件,并入无声类别参与训练。

预处理阶段,将所有音频统一重采样至16 kHz单声道,按类别进行编码映射并打标,以8:2比例随机划分训练集与验证集,生成csv元数据文件供训练数据加载器读取;训练时以梅尔频谱图作为学习特征,梅尔频谱图提取使用librosa库的标准接口、在数据加载时在线完成。

模型由三部分组成:CNN特征提取前端(3层卷积块)、BiLSTM时序建模后端(双层双向LSTM)、以及分类头。

(5)情绪融合评分模块

该模块作用为将视觉模型和声音模型输出进行融合映射输出最终结果,实现多模态判断,并根据五分钟聚合规则,通过窗口内状态投票,将连续识别结果聚合成过程指标,而非只看单帧识别结果,增强统计鲁棒性,降低存储开销。根据状态评分公式生成时段状态,增强统计鲁棒性。高光系统自动抓拍并保存情绪峰值时刻的图像。

(6)安全事件判断模块

该模块用于对模型输出的安全事件及标签进行处理,引入滤波与冷却机制,避免环境杂音误触发和短时间内重复触发。

(7)转换模块

该模块负责将多路JSON数据统一整合为Qt/QML及App可直接读取的current_state.json。模块由run_state_converter.py与convert_emotion_state.py组成。

run_state_converter.py作为常驻程序运行在baby-converter.service中,每隔约1秒检测输入文件变化,并自动选取当日情绪日志JSON文件,当情绪日志、实时状态、安全事件或高光记录更新时触发转换。

convert_emotion_state.py起到数据加工作用,通过读取每日情绪评分、5分钟窗口状态、实时识别结果、咳嗽/哭闹/遮挡事件及高光索引,进行格式统一、时 间轴整理、舒适度计算、情绪占比统计、事件归类及跨天过滤。最终输出的JSON文件包含当前情绪、舒适度、今日记录时长、小时评分、时间轴、最近事件、视频流地址及安全状态等字段。

该模块实现模型端与界面端的解耦,使得模型端可以专注采集识别,Qt前端仅需读取稳定数据文件,既降低前端复杂度,又便于后续扩展新字段;同时,按日期读取过滤可避免历史数据混淆,确保当日监护记录展示的准确性。

(8)Qt模块

该模块用于端侧液晶屏展示,实现人机交互界面显示。

(9)手机App模块

该模块为移动端展示,便于使用者随时随地查看婴儿状态、确认婴儿日志。该模块包含手动记录功能,为婴儿进食及睡眠状态进行可视化记录,并可以记录哭闹的具体原因。

瑞芯微电子

瑞芯微电子

瑞芯微专注于移动互联网、数字多媒体芯片设计,是专业的个人移动信息终端SOC解决方案供应商。瑞芯微在移动互联网领域有多个较完整的自主创新的知识产权群,为中国电子业发展做出积极努力。目前产品涵盖Android平板电脑、Android电视机顶盒(智能电视)、电子书、WIFI/蓝牙音频解决方案等,目前已发展为领先的物联网(IoT)及人工智能物联网(AIoT)处理器芯片企业。

瑞芯微专注于移动互联网、数字多媒体芯片设计,是专业的个人移动信息终端SOC解决方案供应商。瑞芯微在移动互联网领域有多个较完整的自主创新的知识产权群,为中国电子业发展做出积极努力。目前产品涵盖Android平板电脑、Android电视机顶盒(智能电视)、电子书、WIFI/蓝牙音频解决方案等,目前已发展为领先的物联网(IoT)及人工智能物联网(AIoT)处理器芯片企业。收起

查看更多

相关推荐

让嵌入式学习释放无限可能