你对着手机喊了一声“Hey Siri”或“小爱同学”,屏幕亮起,语音助手回应:“我在。”这几秒钟里,手机到底经历了什么?为什么它能精准识别你的声音,而不是被电视里的广告或路人的闲聊误唤醒?这其实就涉及到了一个叫做语音唤醒的技术。
01、一直在听,但几乎不费电
如果你以为手机为了等你喊它,一直在全功率运行,那就错了。如果真是这样,那手机早没电了。手机里其实有一块独立的低功耗芯片(比如高通的Hexagon处理器、苹果的神经引擎、华为麒麟的NPU),它在手机待机时依然保持运行,专门负责处理麦克风传来的声音。
图片源自:网络这块芯片只做一件事,即持续监听音频流中是否出现唤醒词的声音特征。它不会把你的每句话都录下来,也不会把任何音频上传到云端。它就像一个高度专注的值班门卫,只认一张脸(唤醒词的声音特征),其他一概不理。整个过程在本地完成,功耗极低,单次唤醒的能耗甚至可以低于1毫焦。
02、手机怎么听懂唤醒词?
低功耗芯片持续采集声音后,接下来要做的是判断这段声音是不是唤醒词。手机里预置了一个极其精简的唤醒词声学模型。这个模型不关心你说了什么内容,只关心声音特征(如频谱、音素、韵律)是否与预设的唤醒词高度匹配。
当你说出“Hey Siri”时,声音被拆解成毫秒级的片段,提取声学特征,与模型进行比对。如果匹配度超过某个阈值,芯片就会触发一个信号。现代技术通常采用多阶段检测架构,即先用轻量级模型快速筛选候选片段,再用更复杂的模型精准验证。这种分层的设计,能在保证准确率的同时把误唤醒率降低90%以上。
03、声纹验证:只认你的声音
防止别人喊一声就能唤醒你的手机,手机厂商还做了另一件事,即声纹识别。你在第一次设置语音助手时,系统通常会要求你在安静环境下清晰朗读唤醒词三遍。这个过程就是在提取你的声纹特征,并构建本地声纹模型。
当系统检测到唤醒词后,会进一步验证这段声音是否来自你本人。只有当唤醒词匹配且声纹验证通过时,手机才会被真正唤醒。这些声纹模板会被加密存储在本地(通常是在TEE可信执行环境中),不会上传到云端。整个过程在本地完成,不会上传任何一个字节的音频到云端。
04、唤醒主系统,从待命到工作
验证通过后,低功耗芯片会向主处理器发送一个中断信号。手机屏幕亮起、语音助手给出反馈(比如“叮”的一声或“我在”)。此时,手机的主系统才正式启动,麦克风开始高精度收音,语音转文字、意图识别、多轮对话等高负载任务才被激活。
后续的指令解析通常由云端完成,但唤醒词和声纹这些生物特征始终留在本地。
05、2026年的新变化
2026年,语音唤醒技术正在从喊名字向无感对话演进。借助更强大的端侧AI芯片,设备可以实现低功耗持续音频分析,不再严格依赖关键词触发。
系统通过流式语音识别与意图识别模块,实时判断用户是否在对设备说话。荣耀V30等机型在无网络环境下,唤醒识别率已能持续高于96%;华为小艺的语音唤醒完全在设备本地完成;2026年4月,小艺Claw还通过了中国信通院的安全专项评测,成为国内首个拿到国家级认证的智能体。
一声Hey Siri背后,是一个低功耗芯片持续待命、本地模型精准匹配、声纹验证确保安全、主系统按需唤醒的完整链路。整个过程中,你的语音数据始终留在本地,不会被上传到云端。#语音助手
247