• 正文
  • 相关推荐
申请入驻 产业图谱

手机是怎么知道你在喊它的?

11小时前
247
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

你对着手机喊了一声“Hey Siri”或“小爱同学”,屏幕亮起,语音助手回应:“我在。”这几秒钟里,手机到底经历了什么?为什么它能精准识别你的声音,而不是被电视里的广告或路人的闲聊误唤醒?这其实就涉及到了一个叫做语音唤醒的技术。

01、一直在听,但几乎不费电

如果你以为手机为了等你喊它,一直在全功率运行,那就错了。如果真是这样,那手机早没电了。手机里其实有一块独立的低功耗芯片(比如高通的Hexagon处理器、苹果的神经引擎、华为麒麟的NPU),它在手机待机时依然保持运行,专门负责处理麦克风传来的声音。

图片源自:网络这块芯片只做一件事,即持续监听音频流中是否出现唤醒词的声音特征。它不会把你的每句话都录下来,也不会把任何音频上传到云端。它就像一个高度专注的值班门卫,只认一张脸(唤醒词的声音特征),其他一概不理。整个过程在本地完成,功耗极低,单次唤醒的能耗甚至可以低于1毫焦。

02、手机怎么听懂唤醒词?

低功耗芯片持续采集声音后,接下来要做的是判断这段声音是不是唤醒词。手机里预置了一个极其精简的唤醒词声学模型。这个模型不关心你说了什么内容,只关心声音特征(如频谱、音素、韵律)是否与预设的唤醒词高度匹配。

当你说出“Hey Siri”时,声音被拆解成毫秒级的片段,提取声学特征,与模型进行比对。如果匹配度超过某个阈值,芯片就会触发一个信号。现代技术通常采用多阶段检测架构,即先用轻量级模型快速筛选候选片段,再用更复杂的模型精准验证。这种分层的设计,能在保证准确率的同时把误唤醒率降低90%以上。

03、声纹验证:只认你的声音

防止别人喊一声就能唤醒你的手机,手机厂商还做了另一件事,即声纹识别。你在第一次设置语音助手时,系统通常会要求你在安静环境下清晰朗读唤醒词三遍。这个过程就是在提取你的声纹特征,并构建本地声纹模型。

当系统检测到唤醒词后,会进一步验证这段声音是否来自你本人。只有当唤醒词匹配且声纹验证通过时,手机才会被真正唤醒。这些声纹模板会被加密存储在本地(通常是在TEE可信执行环境中),不会上传到云端。整个过程在本地完成,不会上传任何一个字节的音频到云端。

04、唤醒主系统,从待命到工作

验证通过后,低功耗芯片会向主处理器发送一个中断信号。手机屏幕亮起、语音助手给出反馈(比如“叮”的一声或“我在”)。此时,手机的主系统才正式启动,麦克风开始高精度收音,语音转文字、意图识别、多轮对话等高负载任务才被激活。

后续的指令解析通常由云端完成,但唤醒词和声纹这些生物特征始终留在本地。

05、2026年的新变化

2026年,语音唤醒技术正在从喊名字向无感对话演进。借助更强大的端侧AI芯片,设备可以实现低功耗持续音频分析,不再严格依赖关键词触发。

系统通过流式语音识别与意图识别模块,实时判断用户是否在对设备说话。荣耀V30等机型在无网络环境下,唤醒识别率已能持续高于96%;华为小艺的语音唤醒完全在设备本地完成;2026年4月,小艺Claw还通过了中国信通院的安全专项评测,成为国内首个拿到国家级认证的智能体。

一声Hey Siri背后,是一个低功耗芯片持续待命、本地模型精准匹配、声纹验证确保安全、主系统按需唤醒的完整链路。整个过程中,你的语音数据始终留在本地,不会被上传到云端。#语音助手

相关推荐

深耕智能驾驶、自动驾驶领域技术、资讯等信息,解读行业现状、紧盯行业发展、挖掘行业前沿,致力于助力无人驾驶落地与普及!

微信公众号