不用出声也能聊天?苹果公开一项无声语音识别专利

地铁里、会议室中、医院病房内——很多场合我们都需要“说点什么”,却又不便发出声音。

苹果公司近日公开了一项专利申请(WO2026159706A1),提出一种默声语音检测方案:用户在不发声的情况下靠面部肌肉运动“默念”,设备读取面颊皮肤微动后将其解码为文字、再合成为语音,并以不超过100毫秒的延迟把音频回放给用户自己,用于确认与沟通。

不用出声也能聊天?苹果公开一项无声语音识别专利

默声(silent speech)指肺不送气、声带不振动,但面部、喉部、口腔肌肉仍按说话方式运动,带动面部皮肤产生微小位移。苹果的解决方案就是将这类位移翻译成可理解的词句,系统由三部分组成:非接触光学传感 + 神经网络解码 + 低延迟音频反馈。

光学传感:隔空读取面部皮肤的微运动

设备在耳塞或眼镜腿上集成一个光学传感头,包含发射与接收两个模块。

发射端用红外激光二极管等光源,向面颊等区域发射多束相干光,形成一组光斑。接收端则用宽视场角的CMOS图像传感器阵列,接收从皮肤反射回来的光。

当面部肌肉微动时,皮肤表面发生微小位移,反射回来的二次相干光图案(即散斑图案)随之变化。接收模块感测这些散斑图案的变化并输出信号。

根据专利文件表述,整个传感过程完全非接触:传感头距皮肤至少5毫米,典型距离为1~2厘米,甚至更远。接收模块的视场角通常不小于60°、可达90°以上,对应面部覆盖区域一般不小于1平方厘米,优选不小于2平方厘米或更大。

在系统空闲时,设备以较低的帧率(例如 20 fps)工作以节省功耗,同时监测是否有说话意味的面部运动;一旦检测到运动,帧率提升到 100–200 fps,进入活跃捕获状态。

神经网络解码:将皮肤微动翻译成完整词句

光学传感头输出的散斑图像不会直接变成文字,识别链路由穿戴设备本地完成:

第一步特征提取(FE):处理电路对散斑图像运行FE算法,输出特征;

第二步神经网络推理(NN):特征送入预训练神经网络,输出包含词序列的语音数据;

第三步I²S 音频转换:语音数据通过设备I²S总线接口转换为数字音频,随后经蓝牙片上系统(BSoC)的侧音(sidetone,自我监听)处理、自动增益控制(AGC)、数模转换(DAC)和功放,最终送入扬声器播放。

神经网络模型参数由云端服务器结合散斑图像、对应真值文本、词汇词典、语言模型完成训练,再下发至本地穿戴设备使用。

不用出声也能聊天?苹果公开一项无声语音识别专利
低延迟音频反馈处理链路。从散斑图像输入到扬声器播放,依次经过特征提取(FE)、神经网络(NN)、I²S接口、BSoC音频处理、AGC、DAC和功放,总延迟控制在100ms以内。

专利中提供了两级算力部署方案:

  • 一体化方案:特征提取、NN推理、音频生成全部在耳机内部完成,不依赖手机。断连时仍可完整运行,适合完全离线的私密使用场景。
  • 分布式拆分架构:将任务拆分给多个配对设备。专利中举例提到,可将光学采集、特征提取交由第一穿戴设备,神经网络推理分配至另一耳机、充电仓、手机或云端。好处是单只耳机体积更小、发热和功耗更低,算力也可灵活扩容。

低延迟音频反馈:让用户听见自己“无声”说的话

传统无声识别方案普遍缺少实时反馈,用户无法快速确认系统识别结果,本专利将本地实时音频回放作为核心改进点。

神经网络推理完成后,合成语音经由I²S接口直接送往耳机扬声器,总延迟控制在100毫秒以内,使用体感接近人正常出声时听见自身语音的效果。

专利还做了一项差异化处理:回放给用户自己的音频,保真度可以适当降低,满足听清识别内容即可;对外通话、消息发送所需的高保真音频,则由手机等外接设备生成。这种策略既保证了反馈的实时性,又避免了算力和功耗的浪费。

两种硬件落地形态

专利附图给出了两套可量产的硬件方案,对应苹果现有穿戴产品线:

形态一:耳挂式无线耳机(适配 AirPods 系列)

耳机外侧延伸短支架,末端搭载光学传感头,悬停在用户脸颊前方,不接触皮肤。机身集成扬声器与触控按键,用户可通过按键或触摸传感器切换工作模式,闲置时自动切回低功耗待机。

形态二:智能眼镜集成方案(适配 Vision Pro / 苹果智能眼镜)

传感模块整合在眼镜镜腿。除光学探头外,可额外加装鼻部、颞部体表肌电电极,采集面部肌肉电活动信号,作为光学传感的补充信息源;镜架内置扬声器,可独立支持全套低延迟音频反馈功能。

写在最后

本文解读文件为已公开 PCT 国际申请 WO2026/159706A1,优先权为美国临时申请 US 19/032,536(2025-01-21),该专利尚未获得授权。

国际检索报告将 US 2024/221719 A1 列为 X 类对比文件,意味着“光学散斑+神经网络解码语音”这一基础技术路线已被他人在先公开,非苹果首创。这份专利具备新颖性的核心创新组合集中在:100 毫秒以内本地音频反馈、I²S 低延迟音频通路、适配默声识别的分布式硬件架构。

专利最终保护范围、权利稳定性以各国正式授权文本为准,公开技术方案不代表苹果已有明确量产计划。

版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。

(0)

相关推荐