近年来,基于大语言模型(LLM)的文本转语音技术快速发展,基于大语言模型(LLM)的TTS方案已经在自然度、音色相似度和零样本音色克隆(zero-shot voice cloning)等方面取得显著进展。然而,随着语音助手、实时语音对话、虚拟人和多模态交互系统的发展,TTS 的核心需求正在从“高质量离线合成”进一步转向“低时延实时生成”。理想的实时 TTS 系统不仅需要生成自然、稳定、音色一致的语音,还应能够直接接收上游 LLM 的流式文本输出,并持续产生可播放的流式语音。
然而,现有基于LLM的TTS 系统在实时对话场景中仍面临挑战。传统方法通常依赖句级文本缓冲,需要等待较完整的文本输入后才能开始合成;同时,自回归 speech token 逐步预测限制了生成吞吐率;此外,许多基于 Flow Matching 或扩散式声学解码的系统需要多步采样,从 speech token 到 mel-spectrogram 的解码过程进一步增加端到端延迟。这些因素共同导致现有系统难以充分满足真实语音对话对低首包延迟、输入流式和输出流式的要求。
近期, 西工大音频语音与语言处理研究组 (ASLP@NPU)的论文 “FlashTTS: Fast Streaming TTS with MTP Acceleration and X-pred Mean Flow Distillation” 被语音研究顶级会议Interspeech 2026 接收。该论文提出 FlashTTS —— 一个面向实时语音对话系统的开源低时延流式 TTS 框架。FlashTTS 通过滞后式多轨架构原生支持流式文本输入,避免传统句级缓冲;通过 Multi-Token Prediction(MTP)并行预测未来 speech tokens,缓解自回归生成瓶颈;并进一步设计 X-pred Mean Flow Distillation,将 token-to-mel 解码压缩到极少步数,实现高效声学生成。实验结果表明,FlashTTS 在保持较强 zero-shot 音色克隆和跨语言可懂度的同时,将 First-Packet Latency 降低至 325ms,为实时语音助手、虚拟人和低延迟语音对话系统提供了一个高效、可扩展的流式 TTS 基础框架。现对该论文进行简要解读。
作者列表:解晗轲,任夏明,郭大可,尤若楠,李文豪,胡景斌,马国斌,陈华康,徐科杰,黄睿,谭卫国,王先荣,谢磊
合作单位:华为
论文预印版:https://arxiv.org/abs/2606.09141
仓库地址:https://github.com/ASLP-lab/FlashTTS
Demo page:https://aslp-lab.github.io/flashtts_demo/
背景动机
随着大语言模型与语音生成技术的发展,Text-to-Speech(TTS)正在从传统的单句离线合成,走向面向真实交互场景的实时语音生成[1-5]。在智能语音助手、实时语音对话、虚拟人和多模态交互系统中,TTS 不仅要生成自然、相似的语音,还必须具备低时延和输入输出流式能力。
然而,现有 LLM-based TTS 系统仍面临三个关键瓶颈:
- 句级缓冲带来等待时间。真实对话系统中的文本通常由上游 LLM 逐 token 或逐片段生成,但许多 TTS 系统仍需要等待较完整的句子后再开始合成,导致首包延迟升高 [5]。
- 自回归 speech token 预测较慢。LLM-based TTS 通常逐 token 生成语音离散表征,虽然建模能力强,但长文本或多轮交互场景下容易形成推理瓶颈[3,5]。
- 多步声学解码增加端到端延迟。现有 Flow Matching 或扩散式声学解码器往往需要多步采样评估[5,12]。,才能从 speech token 生成 mel-spectrogram 或 waveform,这进一步限制了实时部署。
为解决这些问题,我们提出 FlashTTS:一个开源、低时延、面向流式输入输出的 LLM-TTS 框架。FlashTTS 从三个层面同时优化:通过滞后式多轨架构支持原生流式输入,通过 Multi-Token Prediction(MTP) 加速自回归 speech token 生成,通过 X-pred Mean Flow Distillation 将 token-to-mel 解码压缩到极少步数,从而显著降低实时语音合成延迟。
FlashTTS 的核心设计
FlashTTS 围绕三个目标展开设计:低时延、原生流式、高质量 zero-shot 语音生成。

如图1所示,整体系统框架包含两个训练阶段。Stage 1 训练基础流式 TTS 主干模型,使其基于 stacked multi-track 输入结构完成文本到语音 token 的生成,并通过 Mean Flow 模块重建语音。Stage 2 冻结基础 LLM 主干,仅训练额外的 MTP 分支,以提升 speech token 的生成吞吐率。
滞后式多轨架构:让 TTS 原生支持流式输入
传统 TTS 系统通常将文本 token 和语音 token 拼接或交错组织为单一序列。这类方式适合离线建模,但对流式输入并不友好,因为模型往往需要等待较完整的文本上下文后才能稳定合成语音[5]。

FlashTTS 采用 stacked and lagged track structure,如图2所示,将输入组织为多个并行轨道,主要包括:
- speech track:以说话人嵌入作为起始条件,随后逐步生成 speech token;
- text track:接收上游 LLM 或文本输入端流式传入的 text token;
- language track:持续提供语言条件信息,增强多语言和跨语言生成稳定性。
这种设计使 FlashTTS 不再依赖完整句子缓冲,而是可以随着文本输入逐步推进语音生成。换言之,FlashTTS 将 TTS 的工作模式从“等一句话完整输入后再合成”,推进到“边接收文本,边生成语音”。
Multi-Token Prediction:缓解自回归 token 预测瓶颈
在 LLM-based TTS 中,speech token 通常由语言模型自回归生成,每一步只能预测一个 token,推理速度因此受到限制。
FlashTTS 引入 Multi-Token Prediction(MTP) 机制,在基础 LLM 的 hidden states 上接入多个轻量级 MTP 模块。每个模块负责预测不同未来位置的 speech token,使模型不仅预测下一个 token,还能并行预测更远位置的 token,从而减少逐 token 生成带来的等待时间[9]。
为了保持训练稳定性,FlashTTS 在 Stage 2 冻结基础 LLM 主干,只训练额外的 MTP 模块。推理时,系统还利用冻结主干模型更稳健的概率分布,对 MTP 生成的 speculative tokens 进行验证,在加速的同时尽量维持语音质量。
X-pred Mean Flow Distillation:极少步完成 token-to-mel 解码
除了 speech token 生成,声学解码也是 TTS 延迟的重要来源。传统 Flow Matching 或扩散式解码器通常需要多步采样才能生成高质量 mel-spectrogram,这会显著增加首包延迟和实时因子。
FlashTTS 采用 X-pred Mean Flow Distillation 作为声学解码器。与直接预测 velocity field 不同,X-pred Mean Flow 让模型显式预测干净的 mel-spectrogram,再由该预测结果解析得到平均速度。这降低了高维空间中直接学习速度场的优化难度,也提升了少步生成时的稳定性。
在推理阶段,FlashTTS 能够以 2-NFE 完成高质量 token-to-mel 生成。相比需要 10 步甚至更多采样步骤的传统流匹配解码器,这一设计显著降低了声学解码延迟。
同时,FlashTTS 在 Mean Flow 模块中引入 block-wise streaming attention,使声学解码器在有限上下文内建模,避免依赖过长未来信息,从而兼顾流式输出、韵律连续性和合成质量。
实验
训练配置
FlashTTS 使用约 30 万小时开源语音数据训练,数据来源包括 Emilia、Emilia-Yodas、LibriHeavy 和 WenetSpeech4TTS [11]。
模型采用 Qwen2.5-0.5B 作为语言模型主干,隐藏维度为 896,包含 24 层 Transformer block 和 14 个 attention heads。声学解码部分采用 16 层 Diffusion Transformer 结构的 X-pred MeanFlow 模块,参数量约 159M,并接入 24 kHz HiFi-GAN vocoder 生成最终波形。
训练分为两阶段:Stage 1 训练完整主干模型,获得基础流式 TTS 能力;Stage 2 冻结主干,仅训练 MTP 加速模块,提升推理吞吐率。
延迟与质量评估
FlashTTS 的核心实验关注低时延与合成质量之间的平衡。论文在 MiniMax 多语言测试集上进行评估,并使用上游 Qwen2-7B 动态生成文本流,以模拟真实语音对话系统中的级联场景。

表1实验结果显示,CosyVoice2 baseline 在 10-NFE 设置下 First-Packet Latency(FPL)为 843ms。FlashTTS Stage 1 在 2-NFE 设置下将 FPL 降低到 377ms;进一步引入 MTP-3 后,FlashTTS 在 2-NFE 设置下将 FPL 降低到 325ms,同时 TPS 提升到 73,RTF 降低到 0.632。
这说明 FlashTTS 的加速并不只来自少步声学解码,也来自 MTP 对自回归 speech token 预测瓶颈的缓解。模型同时优化了“什么时候开始生成”和“生成得有多快”这两个关键问题。
从速度-质量权衡看,2-NFE 带来最低首包延迟,3-NFE 则通常具有更好的主观质量和 speaker similarity。MTP-3 在速度与质量之间取得较优平衡;MTP-5 虽然进一步提升 TPS,但会造成更明显的质量下降,说明过度激进的并行 token 预测可能影响声学稳定性。
多语言 Zero-shot 语音合成
FlashTTS 在中文、英文、日文、韩文、法文和德文等多语言 zero-shot 场景下进行评估。

表2 结果表明,FlashTTS 在保持低延迟的同时,仍具备较好的跨语言可懂度和 zero-shot 音色保持能力。
在 MiniMax 多语言测试集中,FlashTTS 在中文和英文上取得较低 WER,并相较 CosyVoice2 支持更广的语言覆盖范围,包括法语和德语。虽然部分语言上的 SIM 仍落后于大型离线商业模型,但考虑到 FlashTTS 的目标是实时流式生成,而非离线高成本合成,这种质量与速度之间的权衡是合理的。
消融实验
消融实验验证FlashTTS 各模块的必要性,如表3所示。

去除 X-pred Mean Flow 后,系统加速比例明显下降,说明少步 token-to-mel 解码是降低端到端延迟的关键。去除 MTP 后,模型质量指标相对稳定,但速度提升大幅降低,说明 MTP 是缓解自回归生成瓶颈的核心模块。
此外,去除 Language ID 会明显增加 WER,说明显式语言条件对于多语言和跨语言生成稳定性非常重要。完整 FlashTTS 架构通过 MTP、X-pred Mean Flow 和语言条件共同作用,在速度、可懂度和音色保持之间取得了较好的整体平衡。
技术意义
FlashTTS 的意义不仅在于提出了一个更快的 TTS 模型,更在于它针对实时语音对话系统重新组织了 LLM-based TTS 的推理链路。
- 推动 TTS 从句级离线合成走向原生流式生成。 通过 stacked and lagged multi-track 结构,FlashTTS 能够适配上游 LLM 的流式文本输出,减少句级缓冲带来的等待时间。
- 将 MTP 引入 speech token generation。 MTP 有效缓解了自回归语言模型逐 token 生成慢的问题,为 LLM-based speech generation 的低延迟推理提供了新的加速方向。
- 用 X-pred Mean Flow 降低声学解码步数。 FlashTTS 证明,高质量 TTS 不一定必须依赖多步扩散或多步流匹配采样。少步甚至一步式声学解码在实时场景中具有重要潜力。
- 为实时语音对话系统提供实用基础。 FlashTTS 在低延迟设置下仍保持了有竞争力的 zero-shot 音色保持和跨语言可懂度,可服务于语音助手、虚拟人、多模态对话和实时交互系统。
局限与展望
尽管 FlashTTS 已显著降低流式 TTS 的首包延迟,仍有一些方向值得继续探索。
- 质量与速度仍存在权衡。 2-NFE 可获得更低 FPL,3-NFE 通常带来更好的主观质量和相似度。未来可进一步研究自适应 NFE 或动态解码策略,使系统按场景自动选择速度优先或质量优先。
- MTP 分支数量需要更稳健的控制。 实验表明,MTP-3 能取得较好平衡,而更激进的 MTP-5 虽然提升速度,但可能损害声学质量。后续可探索更可靠的 speculative decoding 验证机制,提升多 token 并行预测稳定性。
- 多语言和跨语言音色保持仍可提升。 FlashTTS 已支持多语言生成,但部分语言上的 speaker similarity 和可懂度仍有提升空间。未来可通过更大规模多语言数据、更强 speech tokenizer 和更稳健的语言条件建模进一步增强泛化能力。
总体而言,FlashTTS 面向实时语音对话系统中的低时延合成需求,从输入流式、token 生成加速和声学解码少步化三个方面同时优化,显著降低了 LLM-based TTS 的端到端延迟。它为未来实时语音助手、虚拟人和多模态对话系统提供了一个高效、可扩展、开源的流式 TTS 基础框架。
参考文献
[1] A. Van Den Oord, O. Vinyals et al., “Neural discrete representation learning,” Advances in Neural Information Processing Systems, vol. 30, 2017.
[2] F. Mentzer, D. Minnen, E. Agustsson, and M. Tschannen, “Finite scalar quantization: VQ-VAE made simple,” arXiv preprint arXiv:2309.15505, 2023.
[3] C. Wang, S. Chen, Y. Wu, Z. Zhang, L. Zhou, S. Liu, Z. Chen, Y. Liu, H. Wang, J. Li et al., “Neural codec language models are zero-shot text to speech synthesizers,” arXiv preprint arXiv:2301.02111, 2023.
[4] A. Defossez, J. Copet, G. Synnaeve, and Y. Adi, “High fidelity neural audio compression,” Transactions on Machine Learning Research, vol. 2023, 2023.
[5] Z. Du, Y. Wang, Q. Chen, X. Shi, X. Lv, T. Zhao, Z. Gao, Y. Yang, C. Gao, H. Wang et al., “CosyVoice 2: Scalable streaming speech synthesis with large language models,” arXiv preprint arXiv:2412.10117, 2024.
[6] P. Anastassiou, J. Chen, J. Chen, Y. Chen, Z. Chen, Z. Chen, J. Cong, L. Deng, C. Ding, L. Gao et al., “Seed-TTS: A family of high-quality versatile speech generation models,” arXiv preprint arXiv:2406.02430, 2024.
[7] J. Bai, S. Bai, Y. Chu, Z. Cui, K. Dang, X. Deng, Y. Fan, W. Ge, Y. Han, F. Huang et al., “Qwen technical report,” arXiv preprint arXiv:2309.16609, 2023.
[8] A. Liu, B. Feng, B. Xue, B. Wang, B. Wu, C. Lu, C. Zhao, C. Deng, C. Zhang, C. Ruan et al., “DeepSeek-V3 technical report,” arXiv preprint arXiv:2412.19437, 2024.
[9] W. Tian, X. Zhu, H. Xie, Z. Ye, W. Xue, and L. Xie, “Llasa+: Free lunch for accelerated and streaming LLaMA-based speech synthesis,” arXiv preprint arXiv:2508.06262, 2025.
[10] Z. Geng, M. Deng, X. Bai, J. Z. Kolter, and K. He, “Mean flows for one-step generative modeling,” arXiv preprint arXiv:2505.13447, 2025.
[11] L. Ma, D. Guo, K. Song, Y. Jiang, S. Wang, L. Xue, W. Xu,H. Zhao, B. Zhang, and L. Xie, “Wenetspeech4tts: A 12,800-hour mandarin tts corpus for large speech generation model benchmark,” arXiv preprint arXiv:2406.05763, 2024.
版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。