一款免手持语音助手,语音识别、本地大语言模型、语音合成全部在树莓派本地运行,无需云端联网。
本项目所用器材
硬件
树莓派 4B × 1
树莓派 5 ×1
手工工具 / 加工设备
micro:bit python.microbit.org
https://www.hackster.io/microbit/products/python-microbit-org?ref=project-f128d5
项目介绍
本项目基于树莓派 4 或 5 打造全离线语音助手。你直接对它说话,设备调用本地部署的大模型进行推理思考,再通过扬声器语音回复。整套语音处理链路完全在树莓派硬件内完成,配置完成后全程无需连接互联网。 我制作它的初衷是想要一台真正能放心放在家中使用的语音设备,而整个硬件开发过程也十分有趣。
这款树莓派离线语音助手能实现什么功能
整套设备分为三大连续处理流程,全部本地运行:
触发后,通过 USB 麦克风录制数秒人声音频;
使用 Whisper 语音识别将音频转文字,再通过 Ollama 工具把文本送入本地大模型,获取文字回复;
借助 Piper 语音合成工具,把文字回答转换为自然人声,由扬声器播放输出。
最终成品就是一台桌面小设备,说出问题后约 10~20 秒就能语音回复,所有数据不会上传至任何远程服务器。市面上商用智能音箱标榜的本地交互,实际上根本做不到这一点,它们的计算推理全部依赖云端服务器。
搭建树莓派语音助手所需硬件
无需稀有昂贵配件,也是这个项目的一大亮点,绝大多数创客手边都备有这些零件。核心硬件清单及作用说明:
组件
树莓派 4/5 主控板:核心计算单元
USB 麦克风:录入人声
扬声器:播放语音回复
配套电源适配器:稳定供电
最关键的指标是内存(RAM),因为它决定了你能运行哪个语言模型。2GB 的树莓派只能跑 1B 级别的模型,保持响应迅速。4GB 或以上可以上更大的模型,用速度换明显更聪明的回答。
软件方面全部开源免费:Raspberry Pi OS Bookworm 64 位、Ollama(语言模型)、Whisper(语音转文本)、Piper(语音合成)。只在初始下载阶段需要网络,之后完全离线运行。
本地大语言模型如何在无云端的树莓派上运行
最让人惊讶的是:这么便宜的板子上居然能跑真正的语言模型。Ollama 让这件事变得毫无痛苦,它和笔记本上用的是同一个工具,在树莓派的 ARM CPU 上运行,不需要 GPU。模型拉取一次,之后全部本地回答。
之所以能在这么 modest 的硬件上运行,是因为模型本身设计得很小。1B 级别的模型不会帮你写论文,但对于语音助手来说,处理短问题和快速查事实已经够用了,毕竟语音助手场景下速度比聪明更重要。
关于哪些模型适配哪些板子、如何用 Ollama 提供服务的完整拆解,我在本系列上一篇《如何用 Ollama 在树莓派上运行本地大语言模型》中已详细说明。
https://rootsaid.com/embedded-systems/ai-assistant-raspberry-pi/
三个组件之间交接干净,但它们都在争夺同一块有限的内存,这才是搭建过程中真正有意思的地方。
搭建流程与必知坑点
整套项目并非即插即用,下面是完整搭建步骤,按我调试的先后顺序整理:
更新系统、安装 Ollama,下载适配本机内存大小的大模型;
配置并测试 USB 麦克风与扬声器,确保音频输入输出正常;
安装 Whisper、Piper 配套 Python 库,下载语音音色模型;
将录音、语音转文字、大模型问答、语音播报四大功能整合为循环程序;
可选:添加唤醒词识别,实现免手持语音触发。
真正花费我时间的问题几乎都在音频和内存方面。 我的麦克风录制的采样格式和我预期的不一样,导致每次转写都返回空结果。我花了好一阵才意识到录音本身没问题,问题出在格式假设上。同时加载三个组件也把 2GB 的板子推到了极限,需要配置一些喘息空间才能稳定运行。添加始终监听的唤醒词功能还会占用额外内存,2GB 的树莓派几乎挤不出来。这些一旦知道了都不难,但有现成的解决方案写在面前确实省心。
自制树莓派离线语音助手优缺点
客观对比利弊,只讲优势的项目参考价值有限:
优点
1.完全离线、数据零上传,隐私安全性拉满,这也是制作本设备的核心目的;
2.搭建完成后无任何使用成本,硬件配件廉价且可重复利用;
缺点
1.响应速度远慢于商用音箱,单次问答等待 10~20 秒;
2.轻量化模型实用性尚可,但辨别信息真伪能力有限,不可用于关键决策场景;
3.Linux 音频配置繁琐,前期调试十分考验耐心。
对于爱好者来说,速度慢、调试繁琐反而算是一种收获,你能完整吃透每一步处理逻辑,而非直接买一台内部黑箱的成品音箱。
语音助手后续拓展方向
基础问答循环搭建完成后,可在此框架上拓展丰富功能,全部难度适中易实现:
语音唤醒词:直接喊话启动助手,完全免手持;GPIO 硬件控制:语音指令控制灯光、继电器等外设;搭配摄像头 + 轻量化视觉模型:实现物体识别;多语言支持:Whisper 内置数十种语言识别能力;
3D 打印外壳:组装成完整桌面成品设备。
所有拓展功能都复用同一套离线本地处理链路,全程保留离线、隐私安全的核心特性。
如果你想要完整复刻本项目(包含音频格式参数、内存优化方案、各型号树莓派适配模型推荐、唤醒词完整代码),完整教程发布在 RootSaid 博客《基于 Whisper 与 Piper 语音合成搭建树莓派全离线语音助手》,文中包含全部执行命令与配置参数。
https://rootsaid.com/embedded-systems/ai-assistant-raspberry-pi/
151