我被噪音折磨了三年,直到遇见这颗“会思考”的语音芯片
大家好,我是一名硬件工程师。过去三年,我做的最多的一件事,就是跟“噪音”死磕。那段被客户“骂醒”的日子事情是这样的。我们团队做了一款主打免提通话的会议音箱。样机出来的时候,大家都觉得音质不错,挺满意的。结果产品一上市,差评就来了。“对方根本听不清我在说什么,全是你们风扇的声音。”“我这边放着音乐,通话就跟炸了一样。”
“语音助手叫了五六遍都唤不醒,尴尬死了……”说实话,那段时间我特别沮丧。我们明明用了不错的麦克风,也做了基础的降噪处理,怎么一到真实环境就翻车?后来我带着机器去了一趟客户说的咖啡馆。我自己用了一下,才发现问题——在实验室里安静的测试环境,跟真实的嘈杂世界完全是两码事。我开始寻找真正的解决方案从那天起,我几乎翻遍了市面上所有的语音处理方案。有的降噪效果还行,但回声消除一塌糊涂,对方能听到自己的回声,感觉像在跟山谷对话。有的回声消除做得不错,但功耗高的吓人,放便携设备里电池半天就没了。还有的体积太大,我们那小巧的产品根本塞不进去。我一度怀疑,是不是我的要求太高了?既要强降噪,又要好的回声消除,还要低功耗、小体积……这好像是个不可能三角。转机来得有点突然直到今年年初,一个做供应链的朋友给我推荐了一颗芯片,型号叫 NR2048-P。说实话,刚开始我没抱太大希望。但看完数据手册,我承认我有点小激动了。我先说一个最打动我的数字:回声消除能力高达85dB。这是什么概念?简单来说,就算你那边的喇叭声音开得很大,对方也不会听到自己的回声。之前我们用过的方案,能做到60dB就已经很吃力了。85dB,真的是免提通话的“天花板”级别。其次是它的波束成形技术。我之前一直没搞明白,为什么有时候讲话的人稍微偏个头,对方就听不清了。后来才知道,很多方案只是简单地把几个麦克风的信号混在一起,没有“定位”讲话的人。NR2048不一样。它会实时追踪正在说话的人,然后把这个方向的语音增强,其他地方的声音当作噪音滤掉。也就是说,不管你是正对着设备讲,还是歪着头跟旁边的人**,它都能把你“锁定”住。还有一个让我觉得很实用的功能——自动麦克风校准。做过硬件的人都知道,麦克风这东西是有个体差异的。同一批麦克风,灵敏度可能差个正负3dB。你设计的再好,实际装上去,左右声道或者波束成形的效果就会打折扣。NR2048可以在线自动校准,把这些差异给补回来。这个功能,真的省了我们产线上很多麻烦。真正让我放心的是它的“灵活性”你可能觉得,这么多强大的功能,集成起来一定很复杂吧?恰恰相反。它的灵活度让我有点意外。它支持多种数字音频接口,PCM、I2S、TDM、PDM全都有。最多可以接3路PDM输入(6个麦克风) 和4路PDM输出(8个扬声器)。我们这次想做一个360度拾音的会议设备,之前还担心接口不够用。看到这个配置,我心里就有底了。而且它可以通过I2C接口实时发送命令,动态调整参数。比如根据不同的场景(音乐模式、通话模式、语音搜索模式),一键切换不同的处理策略。不需要重新烧录固件,这在产品开发阶段真的太方便了。一些实实在在的改变用上NR2048之后,我们拿新的样机去那个咖啡馆又试了一次。结果怎么样?对方说:“你是不是换了个地方?怎么这么安静?连旁边那个磨豆机的声音都没了。”我把音乐开到最大,然后对着设备说话。对方说:“能听到你说话,音乐声变小了,但没有那种嗡嗡的回声了。”我试着连续叫了十次语音助手——全中。一次都没漏。那一刻,我真的有种如释重负的感觉。如果你也正在被噪音困扰我知道,很多人可能正在经历我之前那种痛苦。产品什么都好,就是通话质量不行。或者语音识别率一直上不去,怎么调都没用。其实不是你的问题,而是没有一个足够好的前端处理芯片。NR2048不敢说是唯一的方案,但它确实帮我们解决了困扰三年的问题。如果你也在选语音处理的方案,真心建议你花点时间看看这颗芯片。它的封装只有 2.966×2.966mm²,跟一颗绿豆差不多大。功耗也低,双麦克风模式下典型工作电流只有 15mA 左右。小体积、低功耗、高性能——这一次,我终于不用再做取舍了。让产品听懂世界,也从被别人听清开始。希望我的这段经历,能对你有一点帮助。
页:
[1]