• 正文
  • 相关推荐
申请入驻 产业图谱

搭载Gemma大模型:树莓派离线AI语音助手!

11小时前
151
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

一款免手持语音助手,语音识别、本地大语言模型、语音合成全部在树莓派本地运行,无需云端联网。

本项目所用器材

硬件

树莓派 4B × 1

树莓派 5 ×1

手工工具 / 加工设备

micro:bit python.microbit.org

https://www.hackster.io/microbit/products/python-microbit-org?ref=project-f128d5

项目介绍

本项目基于树莓派 4 或 5 打造全离线语音助手。你直接对它说话,设备调用本地部署的大模型进行推理思考,再通过扬声器语音回复。整套语音处理链路完全在树莓派硬件内完成,配置完成后全程无需连接互联网。 我制作它的初衷是想要一台真正能放心放在家中使用的语音设备,而整个硬件开发过程也十分有趣。

这款树莓派离线语音助手能实现什么功能

整套设备分为三大连续处理流程,全部本地运行:

触发后,通过 USB 麦克风录制数秒人声音频;

使用 Whisper 语音识别将音频转文字,再通过 Ollama 工具把文本送入本地大模型,获取文字回复;

借助 Piper 语音合成工具,把文字回答转换为自然人声,由扬声器播放输出。

最终成品就是一台桌面小设备,说出问题后约 10~20 秒就能语音回复,所有数据不会上传至任何远程服务器。市面上商用智能音箱标榜的本地交互,实际上根本做不到这一点,它们的计算推理全部依赖云端服务器。

搭建树莓派语音助手所需硬件

无需稀有昂贵配件,也是这个项目的一大亮点,绝大多数创客手边都备有这些零件。核心硬件清单及作用说明:

组件

树莓派 4/5 主控板:核心计算单元

微型 SD 存储卡存储系统、模型与程序

USB 麦克风:录入人声

扬声器:播放语音回复

配套电源适配器:稳定供电

最关键的指标是内存(RAM),因为它决定了你能运行哪个语言模型。2GB 的树莓派只能跑 1B 级别的模型,保持响应迅速。4GB 或以上可以上更大的模型,用速度换明显更聪明的回答。

软件方面全部开源免费:Raspberry Pi OS Bookworm 64 位、Ollama(语言模型)、Whisper(语音转文本)、Piper(语音合成)。只在初始下载阶段需要网络,之后完全离线运行。

本地大语言模型如何在无云端的树莓派上运行

最让人惊讶的是:这么便宜的板子上居然能跑真正的语言模型。Ollama 让这件事变得毫无痛苦,它和笔记本上用的是同一个工具,在树莓派的 ARM CPU 上运行,不需要 GPU。模型拉取一次,之后全部本地回答。

之所以能在这么 modest 的硬件上运行,是因为模型本身设计得很小。1B 级别的模型不会帮你写论文,但对于语音助手来说,处理短问题和快速查事实已经够用了,毕竟语音助手场景下速度比聪明更重要。

关于哪些模型适配哪些板子、如何用 Ollama 提供服务的完整拆解,我在本系列上一篇《如何用 Ollama 在树莓派上运行本地大语言模型》中已详细说明。

https://rootsaid.com/embedded-systems/ai-assistant-raspberry-pi/

三个组件之间交接干净,但它们都在争夺同一块有限的内存,这才是搭建过程中真正有意思的地方。

搭建流程与必知坑点

整套项目并非即插即用,下面是完整搭建步骤,按我调试的先后顺序整理:

更新系统、安装 Ollama,下载适配本机内存大小的大模型;

配置并测试 USB 麦克风与扬声器,确保音频输入输出正常;

安装 Whisper、Piper 配套 Python 库,下载语音音色模型;

将录音、语音转文字、大模型问答、语音播报四大功能整合为循环程序;

可选:添加唤醒词识别,实现免手持语音触发。

真正花费我时间的问题几乎都在音频和内存方面。 我的麦克风录制的采样格式和我预期的不一样,导致每次转写都返回空结果。我花了好一阵才意识到录音本身没问题,问题出在格式假设上。同时加载三个组件也把 2GB 的板子推到了极限,需要配置一些喘息空间才能稳定运行。添加始终监听的唤醒词功能还会占用额外内存,2GB 的树莓派几乎挤不出来。这些一旦知道了都不难,但有现成的解决方案写在面前确实省心。

自制树莓派离线语音助手优缺点

客观对比利弊,只讲优势的项目参考价值有限:

优点

1.完全离线、数据零上传,隐私安全性拉满,这也是制作本设备的核心目的;

2.搭建完成后无任何使用成本,硬件配件廉价且可重复利用;

缺点

1.响应速度远慢于商用音箱,单次问答等待 10~20 秒;

2.轻量化模型实用性尚可,但辨别信息真伪能力有限,不可用于关键决策场景;

3.Linux 音频配置繁琐,前期调试十分考验耐心。

对于爱好者来说,速度慢、调试繁琐反而算是一种收获,你能完整吃透每一步处理逻辑,而非直接买一台内部黑箱的成品音箱。

语音助手后续拓展方向

基础问答循环搭建完成后,可在此框架上拓展丰富功能,全部难度适中易实现:

语音唤醒词:直接喊话启动助手,完全免手持;GPIO 硬件控制:语音指令控制灯光、继电器等外设;搭配摄像头 + 轻量化视觉模型:实现物体识别;多语言支持:Whisper 内置数十种语言识别能力;

3D 打印外壳:组装成完整桌面成品设备。

所有拓展功能都复用同一套离线本地处理链路,全程保留离线、隐私安全的核心特性。

如果你想要完整复刻本项目(包含音频格式参数、内存优化方案、各型号树莓派适配模型推荐、唤醒词完整代码),完整教程发布在 RootSaid 博客《基于 Whisper 与 Piper 语音合成搭建树莓派全离线语音助手》,文中包含全部执行命令与配置参数。

https://rootsaid.com/embedded-systems/ai-assistant-raspberry-pi/

相关推荐