零样本语音转换旨在保留语音语言内容的同时,将源说话人音色迁移至任意未见过的目标说话人。随着实时通信、直播互动、在线会议、游戏语音等应用场景的发展,语音转换系统对低延迟、轻量化和高保真流式推理能力提出了更高要求。此前提出的 MeanVC 通过块级自回归去噪与均值流实现了轻量级流式零样本语音转换,但在更低延迟的小块设置、训练效率以及低质量参考音频鲁棒性方面仍存在进一步提升空间。
近期,西工大音频语音与语言处理研究组(ASLP@NPU)、WeNet 开源社区和新南威尔士大学合作论文“MeanVC 2: Robust Low-Latency Streaming Zero-Shot Voice Conversion”被语音研究顶级会议 INTERSPEECH 2026 接收。该论文提出了低延迟、鲁棒的流式零样本语音转换方法 MeanVC 2,通过未来感受野分块机制提升小块流式转换稳定性,并引入通用音色 Token 编码器增强低质量参考音频下的说话人建模鲁棒性,在保持轻量化的同时进一步降低系统延迟、提升转换质量。现对该论文进行简要的解读和分享。
论文题目:MeanVC 2: Robust Low-Latency Streaming Zero-Shot Voice Conversion
作者列表:马国斌*,夏宇轩*,姜月鹏,郭大可,解晗轲,胡景斌,王彦博,谢磊,朱鹏程
合作单位:WeNet开源社区,新南威尔士大学
样例展示:https://aslp-lab.github.io/MeanVC2
预印版:https://arxiv.org/pdf/2606.09050
项目代码:https://github.com/ASLP-lab/MeanVC2
预训练模型:https://huggingface.co/ASLP-lab/MeanVC2
Windows程序获取:https://drive.google.com/drive/folders/1Pfixxg0ShqkM_KZsVFTMg0DER2WE1fH4

背景动机
零样本语音转换(Zero-shot VC)近年来在电影配音、隐私保护、实时通信、直播互动、在线会议和游戏语音等场景中展现出广泛应用潜力。随着应用逐渐从离线处理走向实时交互,语音转换模型不仅需要保持较高的自然度和说话人相似度,还需要满足低延迟、低计算开销和稳定流式推理等实际部署需求。
我们此前提出的 MeanVC[1] 通过块级自回归去噪(CARD)与均值流(Mean Flows)[2] 结合,在轻量级流式零样本 VC 中取得了较好效果。然而,MeanVC 仍存在三方面限制:首先,CARD 训练时需要同时引入干净块和带噪块,使有效序列长度翻倍,增加显存消耗并降低训练效率;其次,MeanVC 在较小块大小下容易因声学上下文不足导致转换质量下降,限制了进一步降低延迟的空间;最后,其音色编码器直接依赖参考 Mel 频谱提取细粒度说话人信息,当参考音频质量较差时,说话人条件容易受到干扰,从而影响转换结果的相似度和自然度。
针对上述问题,MeanVC 2 从流式建模和音色建模两个方面进行改进:一方面,通过未来感受野分块机制(FRC)在扩散 Transformer 解码器的不同层中显式调度过去与未来上下文,提升小块流式转换的稳定性;另一方面,通过通用音色 Token 编码器(UTTE)基于全局说话人嵌入构建通用音色表示,并结合瓶颈特征(BNFs)检索细粒度音色线索,降低模型对参考音频质量的敏感性。由此,MeanVC 2 在保持轻量化和高效生成优势的同时,进一步提升了低延迟流式转换的质量与鲁棒性。
MeanVC 2
如图 1 所示,MeanVC 2 采用“识别-合成”框架[3],主要由流式自动语音识别(ASR)模块、说话人编码器、通用音色 Token 编码器(UTTE)、扩散 Transformer(DiT)[4] 解码器和声码器[5]组成。首先,预训练流式 ASR 模型从源语音波形中提取瓶颈特征(BNFs),说话人编码器从参考语音波形中提取全局说话人嵌入。随后,UTTE 将全局说话人嵌入转换为基于通用音色 Token 的 key-value 音色表示,并以 BNFs 作为 query,通过跨注意力机制检索细粒度、发音相关的音色信息,得到音色感知 BNFs。最后,DiT 解码器以音色感知 BNFs 为条件,在 FRC 机制下流式生成目标 Mel 频谱,并沿用 MeanVC 中的均值流训练方式,实现单次函数评估(1-NFE)的高效生成。

未来感受野分块机制
MeanVC 采用块级自回归去噪(CARD),利用干净 Mel 块作为提示来条件化带噪块。该设计有助于保持跨块一致性,但训练时需要将干净块和带噪块拼接成 2N 个块的序列,增加显存开销并使训练过程不够高效。
MeanVC 2 提出未来感受野分块机制( FRC),在带噪序列上使用块级注意力掩码进行训练,从而避免 clean-chunk teacher forcing。在相同训练配置下,该设计将峰值 GPU 显存占用降低约 60%。
具体而言,FRC 将时间序列划分为 N 个块,并在 DiT 解码器的每一层中显式控制当前块可以访问的过去和未来上下文。FRC 包含三类掩码:块内掩码允许块内完整注意力计算;后向掩码允许当前块访问有限数量的历史块;前向掩码允许当前块访问有限数量的未来块。通过逐层调度感受野,模型能够在短块设置下获得受控的上下文信息。
在论文实现中,DiT 解码器包含 4 层,过去感受野设置为 2、2、1、1,未来感受野设置为 1、0、0、0。因此,整体感受野覆盖 6 个历史块、当前块和 1 个未来块,共 8 个块。通过引入有限未来上下文,FRC 缓解了小块设置下声学上下文不足的问题,使 MeanVC 2 能够在 40 ms 块大小下稳定转换。

通用音色 Token 编码器
MeanVC 使用多参考音色编码器(MRTE)[6] 从参考 Mel 频谱中提取细粒度说话人特征,因此在参考音频质量较差时,说话人条件容易受到影响。为提升低质量参考音频下的鲁棒性,MeanVC 2 提出通用音色 Token 编码器(UTTE),将细粒度音色提取从参考 Mel 频谱中解耦出来。
UTTE 首先将说话人编码器提取的全局说话人嵌入映射为一组 key-value 形式的通用音色 Token。每个 Token 由两部分组成:一部分是由全局说话人嵌入经过 MLP 生成的说话人相关表示,另一部分是所有说话人共享的可学习先验。两者相加后得到最终的 key 和 value。
随后,UTTE 直接使用 BNFs 作为 query,对通用音色 Token 进行跨注意力计算,提取细粒度、发音相关的音色特征,并生成音色感知 BNFs,供后续 DiT 解码器进行频谱生成。该设计减少了对参考 Mel 频谱的直接依赖,从而提升了低质量参考音频下的说话人条件鲁棒性。
实验
- 实验数据:数据为Emilia,过滤掉时长短于 5 秒的音频,并随机采样 10,000 小时中文数据,所有音频均重采样至 16 kHz。
- 对比系统
- StreamVoice+[7]:端到端流式零样本语音转换系统;
- MeanVC(80 ms):采用 80 ms 块大小的 MeanVC;
- MeanVC(160 ms):采用 160 ms 块大小的 MeanVC。
零样本语音转换
如表 1 所示,MeanVC 2 在所有说话人相似度相关指标上取得最高结果,超过 StreamVoice+、MeanVC(80 ms)和 MeanVC(160 ms)。在语音质量指标方面,MeanVC 2 取得最高 DNSMOS。由于 MeanVC 2 和 MeanVC(80 ms)具有相同的 80 ms 输入块设置,该比较是公平的;在这一设置下,MeanVC 2 在五个质量与相似度指标上均优于 MeanVC(80 ms)。与 MeanVC(160 ms)相比,MeanVC 2 在 NMOS 和 CER 上略低,这主要是因为 160 ms 设置具有更丰富的上下文信息,有利于声学重建。
效率方面,MeanVC 2 仅包含 18M 参数,与 14M 参数的 MeanVC 接近,显著小于 153M 参数的 StreamVoice+。MeanVC 2 的端到端首包延迟为 109.88 ms,与 MeanVC(80 ms)的 111.64 ms 接近,但明显低于 MeanVC(160 ms)的 211.52 ms 和 StreamVoice+ 的 1258.56 ms。完整流水线的 RTF 为 0.114 + 0.371 + 0.148 = 0.633,小于 1.0,满足实时处理要求,其中三项分别对应 ASR 编码器、VC 模块和声码器。
虽然 MeanVC 2 的 VC 模块 RTF 高于 MeanVC(80 ms),即 0.371 对 0.177,但 MeanVC(80 ms)是延迟匹配基线,而非输出粒度匹配的计算参考。在相同 40 ms 输出粒度下,MeanVC 的 RTF 为 0.316,MeanVC 2 为 0.371,说明 MeanVC 2 仅带来适度计算开销。所有效率测试均未使用量化或算子融合等工程优化。

参考音频鲁棒性评估
如表 2 所示,当使用 MRTE 替换 UTTE 时,模型在所有指标上均出现下降。MeanVC 2 w/ MRTE 的 DNSMOS、CER 和 SSIM 分别为 1.39、7.64% 和 0.621;MeanVC 2 的对应结果为 1.87、6.55% 和 0.643。结果表明,在低质量参考音频条件下,UTTE 能够提取更可靠的说话人表示,从而提升输出语音质量和说话人相似度

消融实验
我们进一步对 MeanVC 2 的关键组件进行了消融实验,结果如表 1 所示。
移除 forward mask 后,模型性能下降最为明显,说明有限未来感受野对于小块设置下获取充分声学上下文非常关键。移除 UTTE 后,SSIM 明显下降,说明 UTTE 能够提供全局说话人嵌入之外的细粒度音色信息。值得注意的是,即使移除 UTTE 后模型参数量降至 13M,该变体仍在所有指标上优于 MeanVC(80 ms),表明 FRC 在小块设置下具有有效性。移除 tanh 激活后,相似度指标出现中等程度下降,说明 tanh 有助于正则化说话人级音色嵌入分布,并促进说话人表示的多样性。
Windows 一键运行程序
我们封装了 MeanVC2 的四个不同配置的版本,全部是单文件 .exe,无需部署环境,开箱即用,获取方式:https://drive.google.com/drive/folders/1Pfixxg0ShqkM_KZsVFTMg0DER2WE1fH4
更多样例敬请访问:https://aslp-lab.github.io/MeanVC2。
参考文献
[1] Ma G, Yao J, Ning Z, et al. Meanvc: Lightweight and streaming zero-shot voice conversion via mean flows[C]//ICASSP 2026-2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, 2026: 17347-17351.
[2] Geng Z, Deng M, Bai X, et al. Mean flows for one-step generative modeling[J]. Advances in Neural Information Processing Systems, 2026, 38: 75460-75482.
[3] Jing-Xuan Zhang, Zhen-Hua Ling, and Li-Rong Dai, “Nonparallel sequence-to-sequence voice conversion with disentangled linguistic and speaker representations,” IEEE ACM Trans. Audio Speech Lang. Process., vol. 28, pp. 540–552, 2020.
[4] William Peebles and Saining Xie, “Scalable diffusion models with transformers,” in ICCV. 2023, pp. 4172–4182, IEEE.
[5] Siuzdak H. Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis[J]. arXiv preprint arXiv:2306.00814, 2023.
[6] Jiang Z, Liu J, Ren Y, et al. Mega-tts 2: Boosting prompting mechanisms for zero-shot speech synthesis[C]//International Conference on Learning Representations. 2024, 2024: 57919-57939.
[7] Wang Z, Chen Y, Wang X, et al. Streamvoice+: Evolving into end-to-end streaming zero-shot voice conversion[J]. IEEE Signal Processing Letters, 2024, 31: 3000-3004.
版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。