近年来,单通道语音分离技术犹如一场精彩的接力赛,从 Conv-TasNet 的精巧卷积,DPRNN 的深度循环,到 SepFormer 和 MossFormer 的 Transformer 革命,再到 TF-GridNet 与 SPMamba 的持续探索,模型对于“多个说话人分别说了什么”的建模能力一路高歌猛进。
然而,在这条演进之路上,一个核心矛盾始终存在:模型如何才能既拥有像素级的“显微镜”,又能手持跟踪全局的“望远镜”?
但“局部细节”与“全局上下文”始终像鱼和熊掌。局部上,模型必须如庖丁解牛般,精准识别谐波结构、音素级变化等细枝末节;全局上,它又必须跨越整段语音,维持说话人身份的连贯性与句子上下文的关联性。传统卷积虽是局部建模的好手,却常因“视野”受限而丢失长时信息;而标准的 Transformer 虽能“一览众山小”,却容易在处理局部精细模式时显得“大而化之”。这场“局部”与“全局”的拉锯战,正是该领域最核心的挑战。
阿里团队的最新研究 TF-MossFormer 正是为解决这一问题而提出 ,论文(标题:TF-MossFormer: Integrating Convolution Gated Local-Global Attentions for Enhanced Time-Frequency Domain Monaural Speech Separation)目前已被语音顶会 Interspeech 2026 接收。它是一个面向时频域单通道语音分离的混合 Transformer 框架,通过将自适应局部注意力与全局注意力统一到同一套时频建模架构中,实现对短程细节和长程依赖的协同捕获,同时配合卷积门控机制,在语谱图二维结构上更好的管控时间轴与频率轴信息流动。

为什么语音分离不能只靠“全局建模”?
Transformer 近年来在语音分离中取得显著成功,原因在于自注意力天然适合捕捉长程依赖,让模型能够在整段语音上聚合上下文信息。但全局注意力也有一个常见问题:
它很擅于“看得远”,却不擅长“看得细”对于语音分离而言,很多关键线索其实藏在局部连续结构中,比如:
- 邻近帧之间的时域平滑过渡
- 谐波在频率方向上的连续分布
- 瞬态和辅音等短时细节
- 同一发声器官造成的局部时频纹理
如果模型过度依赖全局注意力,容易在大范围上下文中稀释这些细粒度模式。相反,如果只用卷积或局部算子,又容易忽略长距离依赖,导致说话人一致性和全局组织能力不足。TF-MossFormer 的核心判断是:真正有效的单通道语音分离,需要同时建模“局部连续性”和“全局依赖性”。
TF-MossFormer 做了什么?
TF-MossFormer 选择在时频域而不是纯时域上完成这一整合。与基于 chunk 的时域双路径方法不同,它直接在 STFT 得到的二维语谱图上进行建模,同时沿着时间维和频率维交替进行建模,从而更充分地利用语音在时频空间中的几何结构。它的核心设计可以概括为三点:
- 局部 + 全局注意力联合建模
- 内容感知的滑动窗口局部注意力
- 注意力之间加入卷积门控机制,增强特征筛选和信息流动

TF-MossFormer 的整体框架
给定单通道混合语音,TF-MossFormer 首先通过 STFT 将波形变换到时频域,得到复数谱的实部与虚部。随后:
- 使用 Conv2D + gLN 编码时频特征
- 堆叠多个 TF-MossFormer block
- 每个 block 包含:
- 频率建模块
- 时间建模块
- 最后通过 Deconv2D + iSTFT 重建分离后的波形
这种设计延续了时频域 separation 的经典 encoder–separator–decoder 范式,但其关键区别在于:separator 不再只是单纯的时序建模器,而是一个交替作用于时间和频率维度的局部-全局联合 Transformer。
换句话说,TF-MossFormer 不是只在时间上“看长程上下文”,而是在二维谱图空间中,沿不同方向不断细化表示。
核心模块一:局部注意力 + 全局注意力
TF-MossFormer 的核心在于 Local & Global MHSA。全局注意力全局多头自注意力负责捕捉整段序列中的长距离依赖。在时间路径上,它帮助模型跨越整句语音保持说话人一致性;在频率路径上,它帮助模型整合更宽频带范围的结构信息。全局注意力的优势在于:
- 能看到整个序列
- 擅长全局上下文建模
- 有利于长时依赖和说话人线索聚合
但代价是:
- 计算量高
- 对局部连续模式不够敏感
局部注意力为了解决这个问题,TF-MossFormer 引入了滑动窗口局部注意力。它限制每一帧只关注邻域内的一小段窗口,从而聚焦:
- 邻近时刻之间的局部连续性
- 局部频率区域内的谐波与纹理
- 短时瞬态与精细时频变化
这种局部注意力的复杂度从全局注意力的O(T^2D)降到 O(TwD),在固定窗口大小下能更高效地建模局部模式。更重要的是,它不是固定卷积核那样刚性的局部建模,而是基于内容的动态加权局部建模。也就是说,同样在局部窗口里,不同位置之间的交互强弱是由注意力机制自适应决定的,而不是卷积核一视同仁地处理所有邻域。

核心模块二:卷积门控,让局部与全局配合得更好
仅有局部注意力和全局注意力还不够,TF-MossFormer 进一步在它们之间加入了卷积门控(convolutional gating)机制。
这个设计的出发点很直接:
- 局部注意力擅长看细节
- 全局注意力擅长看整体
但两者之间的信息如何传递、筛选和融合,仍然需要一个高效桥梁。为此,TF-MossFormer 在注意力模块之间加入 Conv1D + Swish 组成的门控结构,让模型在特征传递时自动选择哪些信息更值得保留、哪些应该被抑制。这样做有两个好处:
增强特征选择能力:让模型更有效地区分与说话人、谐波、时频模式相关的重要特征。
改善信息流动:减少局部与全局建模之间的割裂,使表示更新更加顺滑。
论文中还比较了多种局部-全局注意力排列方式,最终发现:先做局部注意力,再做全局注意力的串联方式效果更好。这说明对于语音分离任务,先保留和强化局部连续性,再向更大范围聚合全局上下文,是更合理的建模顺序。
为什么选择时频域?
TF-MossFormer 没有沿用很多工作偏好的时域 chunk 路线,而是明确选择在时频域完成建模。这一点非常关键。
相比纯时域方法,时频域有一个天然优势:语音的结构本来就在二维语谱图上更容易表达。例如:
- 时间轴体现发音连续性和语速变化
- 频率轴体现谐波结构、共振峰和频带分布
- 说话人特征和发音模式往往在时频平面中更容易分离
TF-MossFormer 正是利用这一点,把 block 分为了频率建模模块和时间建模模块。两者结构相同,但交替工作在不同维度上。这样模型既能在频率维上理解频谱形状,又能在时间维上捕捉语音演进过程,从而逐步细化整个时频表示。
实验结果
TF-MossFormer 在经典单通道双说话人分离基准 WSJ0-2Mix 上做了系统评估,并提供了小、中、大三种模型规模。
- 小模型:TF-MossFormer (S)
参数量:6.0M
SI-SDRi:22.6 dB
SDRi:22.8 dB
在这一规模下,TF-MossFormer (S) 超过了同量级的 TF-Locoformer 和 SPMamba,并且在计算量上明显优于后者,体现出很好的效率-性能平衡。
- 中模型:TF-MossFormer (M)
参数量:16.9M
SI-SDRi:24.0 dB
SDRi:24.2 dB
相比 TF-GridNet 和 TF-Locoformer (M),TF-MossFormer (M) 取得了更高的分离指标,同时计算开销仍处于可接受范围。
- 大模型:TF-MossFormer (L)
参数量:25.4M
SI-SDRi:24.4 dB
SDRi:24.5 dB
这一配置达到了论文报告中的最佳性能,超过了 TF-Locoformer (L)、TF-GridNet,以及多种时域强基线,展示出 TF-MossFormer 的良好扩展性。

消融实验告诉了我们什么?
除了主结果,我们还做了几组非常有价值的消融实验。
- 局部窗口不是越大越好
在局部注意力中,我们测试了不同的时间窗口和频率窗口大小。结果发现,时间窗口WT = 31、频率窗口WF = 7是效果最好的组合。这说明局部建模需要一个“适中”的感受野:太小,看不够。太大,又会稀释局部模式,甚至退化得接近全局注意力。
- 全长窗口反而更差
如果直接用 full-length window,相当于弱化了“局部性”本身,结果性能反而下降。 这恰恰证明了论文的核心观点:局部连续性是语音分离中必须被显式建模的能力,不是全局注意力自然就能学好的东西。
- 局部先于全局最优
不同的注意力顺序对结果影响明显。 论文比较了:local → global、global → local、local/global parallel,以及去掉卷积门控等变体。结果显示 local → global + convolutional gating 的版本最好,说明局部细节的先验组织对于后续全局聚合非常重要。
TF-MossFormer 的价值在哪里?
TF-MossFormer 的意义,不只是“进一步获得了dB的提升”,而是在设计上给出了一个更清晰的方向:
- 语音分离不是只做长程依赖
Transformer 很强,但不能默认“全局建模就足够了”。 在语音这种高度连续的信号上,局部细节是同等重要的问题。
- 时频域依然非常有生命力
在时域模型不断演进的同时,TF-MossFormer 说明: 如果充分利用语谱图的二维结构,时频域方法依然可以做到非常强,甚至达到新的 SOTA 水平。
- 局部与全局的融合可以做得更精细
不是简单地“加一个卷积”或者“叠一层 attention”就够了。TF-MossFormer 展示了:局部窗口如何设计、局部和全局谁先谁后、如何用门控连接两者,这些都对后续的语音增强、分离、去混响等任务有直接启发。
结语
TF-MossFormer 提出了一种面向单通道语音分离的时频域混合 Transformer 框架。它的核心思想是,在二维语谱图上联合使用局部注意力与全局注意力,并借助卷积门控增强特征筛选和信息流动,从而同时捕捉语音中的细粒度连续结构与长距离依赖关系。
实验结果表明,TF-MossFormer 在 WSJ0-2Mix 上实现了跨多种模型规模的稳定提升,小模型高效,大模型达到新的 SOTA。更重要的是,它验证了一条非常有价值的设计路线:在语音分离中,最强的建模方式不是“只看全局”或“只看局部”,而是让局部连续性与全局上下文在时频域中协同工作。
如果说过去的很多模型是在“局部”和“全局”之间做取舍,那么 TF-MossFormer 更像是在告诉我们:这两者不该二选一,而应该被一起设计进模型的核心。
相关文献参考:
[1] Z.-Q. Wang, S. Cornell, S. Choi, Y. Lee, B.-Y. Kim, and S. Watanabe. TF-GridNet: Making Time-Frequency Domain Models Great Again for Monaural Speaker Separation. arXiv preprint, 2023.
[2] K. Saijo, G. Wichern, F. G. Germain, Z. Pan, and J. L. Roux. TF-Locoformer: Transformer with Local Modeling by Convolution for Speech Separation and Enhancement. In Proceedings of the 18th International Workshop on Acoustic Signal Enhancement (IWAENC), 2024.
[3] S. Zhao and B. Ma. MossFormer: Pushing the Performance Limit of Monaural Speech Separation Using Gated Single-Head Transformer with Convolution-Augmented Joint Self-Attentions. In Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2023.
[4] S. Zhao et al. MossFormer2: Combining Transformer and RNN-Free Recurrent Network for Enhanced Time-Domain Monaural Speech Separation. In Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2024.
[5] K. Li et al. SPMamba: State-Space Model Is All You Need in Speech Separation. arXiv preprint, 2024.
版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。