在实时通信、语音交互和音频修复等场景中,语音超分辨率(Speech Super-Resolution, SR)技术扮演着重要角色——它能够从低采样率的语音信号中重建丢失的高频成分,从而提升语音的清晰度、自然度和可懂度。
然而,如何在极低延迟(即不依赖未来信息,实现流式处理)的前提下,同时保证高保真音质和低计算负载,一直是该领域的一大挑战。
近日,中国科学技术大学语音及语言信息处理国家工程研究中心的研究团队在这一问题上取得进展。他们提出的 StreamWSR 模型,通过一种全因果的波形域处理架构,在满足零前瞻流式推理的同时,取得了与代表性波形域及频谱域方法相当或局部更优的重建质量,参数量与计算量均控制在轻量范围内。
研究成果目前发表于arXiv预印本平台。

现有技术路线
当前主流的语音超分方法大致分为两派。一派在频谱域工作,经典方案先预测丢失的频谱,再借助神经声码器合成波形。这类方法效果不错,但管线复杂,且声码器本身会引入额外延迟和不确定性。
另一派直接在波形域操作,虽然理论上信息保留更完整,但传统架构下处理长序列信号的计算量往往高得惊人,难以满足实时要求。
StreamWSR 模型核心架构
StreamWSR采用波形域路线,但在处理方式上有所不同。
模型先对输入波形做 sinc 插值上采样,得到高频缺失的粗波形,再用步长因果卷积压缩为帧级表征。该表征经一组因果模块处理,每模块结合因果空洞卷积与带掩码自注意力,分别捕捉局部结构与长程历史依赖;全部操作仅利用当前及过去信息,不依赖未来帧。
最后,帧级表征通过因果转置卷积还原为波形残差,与上游上采样的低分辨率波形相加输出。这一残差连接保留输入低频成分,使网络专注于高频恢复。整个流程在波形域内完成,既避免了频谱域方法对声码器的依赖,也通过帧级压缩缓解了波形域方法的计算压力。
训练策略:频谱辅助监督
StreamWSR虽为波形域模型,但训练阶段引入了频谱层面的辅助监督,以弥补波形损失对高频感知不足的问题。研究团队设计了一个多分辨率频谱判别器,基于改进离散余弦变换(MDCT)在多种时频尺度上判别生成结果,通过对抗训练促使生成器产出更真实的高频分量。此外还加入 MDCT 谱损失(高频带赋略高权重)与梅尔谱损失(L1+L2 距离),提供感知相关的频谱约束。
上述频谱相关计算仅在训练阶段发挥作用。模型投入推理时,判别器与频谱损失被全部剥离,因此StreamWSR在推理时保持纯粹的波形域前向传播,不引入额外开销。
实验验证结果
研究团队在VCTK数据集上进行了实验,涵盖8kHz、4kHz和2kHz到16kHz的三种上采样任务(对应扩展因子2、4、8),并与UDM+(扩散模型)、TRAMBA(Transformer-Mamba架构)、FLowHigh(流匹配+声码器)和AP-BWE(双路幅相预测)等现有方法对比。
语音质量与可懂度
StreamWSR在LSD、ViSQOL、WER和STOI等指标上取得了与最优基线相近或略优的结果。在2kHz到16kHz(8倍扩展)任务中,StreamWSR的ViSQOL得分为3.81,高于UDM+的3.35和FLowHigh的2.98,与AP-BWE的3.76接近;STOI为87.14%,WER为39.33%,同样处于较为靠前的位置。


计算效率与流式能力
StreamWSR的参数量为9.03M,FLOPs为2.12G(生成1秒16kHz语音)。作为参照,UDM+的FLOPs为189.54G,FLowHigh为212.93G,AP-BWE为5.97G。在上述对比方法中,StreamWSR是唯一支持零前瞻流式推理的方案,这在延迟敏感的应用场景中具有一定优势。
消融实验:核心模块有效性验证
研究团队进一步验证了关键设计的作用。移除步长卷积模块(即取消帧级压缩)后,FLOPs 升至 78.4G(约为原版的 37 倍),同时 ViSQOL 略有下降,说明帧级压缩对控制计算量有较为明显的作用。将多分辨率频谱判别器替换为普通波形域判别器后,ViSQOL 从 3.81 降至 3.78,WER 从 39.33% 升至 43.49%,表明训练阶段引入频谱监督对性能有一定提升作用。

小结与展望
StreamWSR在波形域内完成端到端、全因果、可流式的重建,模型规模与计算量控制在9M参数和2G FLOPs量级。这对实时通信、编解码增强以及算力受限的可穿戴与助听设备(如 TWS 耳机、骨传导设备)等时延敏感场景,具有现实意义。
研究团队也指出了这项研究的局限:实验仅在VCTK英文数据集、16kHz目标采样率下进行,跨语种、跨采样率及真实噪声环境下的鲁棒性尚待检验。后续工作将围绕泛化能力和鲁棒性继续展开,并探索其在更多实时语音与音频任务中的应用。
论文信息:
Tian, Y., Ai, Y., Du, H.‑P., & Ling, Z.‑H. (2026). StreamWSR: Streamable and lightweight waveform‑domain neural speech super‑resolution. arXiv preprintarXiv:2609.03381. https://arxiv.org/abs/2609.03381
版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。