从“能说话”到“会表达”:Qwen-Audio-3.0-TTS 发布

Qwen-Audio-3.0-TTS 实时语音合成模型发布。本次发布包含两个版本:

  • Flash:面向实时交互,首包延迟在 300ms 左右。
  • Plus:面向高质量生成,在自然度和音色还原度上表现更佳。

本次更新,我们把精力放在了开发者在生产环境中真正会遇到的四个问题上:更广的语言覆盖更自然的指令控制更精细的标签控制,以及在参考音频不清晰时的鲁棒性

目前,在全球第三方权威榜单 Artificial Analysis 中,Qwen-Audio-3.0-TTS-Plus 斩获冠军

从“能说话”到“会表达”:Qwen-Audio-3.0-TTS 发布

以下是具体的更新内容与数据表现。

核心亮点一:多语种与方言全面升级

无论是出海业务还是下沉市场,Qwen-Audio-3.0-TTS 都能提供完美融入当地语境的听觉体验。

多语种精准合成,指标全面领先

Qwen-Audio-3.0-TTS 面向全球多语种场景进行了专项优化,覆盖中文、英文、日语、韩语、德语等 16 种语言

  • WER/CER(越低越好)

Qwen-Audio-3.0-TTS 系列展现了最强的整体多语言可懂度,在 16 种语言中有 10 种取得了最佳的 WER/CER 表现。Flash 版本的平均 WER/CER 最低,仅为 3.87;Plus 版本也极具竞争力,得分为 3.96。两者在平均表现上均优于其他系统。

  • 说话人相似度(越高越好)

Qwen-Audio-3.0-TTS 在说话人相似度上展现出了显著且稳定的优势。其中 Plus 版本在所有 16 种语言中均排名第一,平均 SS(Speaker Similarity)达到了 82.75;Flash 版本紧随其后,得分为 80.44。这表明它们在多种语言环境下,都具备极强且鲁棒的音色还原能力。

中文方言正宗度显著提升

通过更高质量的方言数据、更丰富的种类覆盖,以及专门的方言强化训练阶段,Qwen-Audio-3.0-TTS 模型有效缓解了通用语音强化学习中容易出现的“方言特色弱化”问题。

目前模型支持 20 种高质量方言(覆盖广东、重庆、东北、甘肃、贵州、浙江、河北、河南、湖北、湖南、江西、宁波、宁夏、青岛、陕西、山西、山东、上海、四川、云南),使合成语音在韵律、声调和口语化表达上更接近母语者,还原各地语言的真实韵味。

核心亮点二:Free-style 自由指令,用自然语言“导演”声音

不同场景对语音风格的需求差异很大——客服需要温和耐心,直播需要热情感染,有声书需要角色代入。

Qwen-Audio-3.0-TTS 支持 Free-style 自然语言指令控制。无需掌握专业声学或标注知识,即可通过自然语言灵活定义情绪、角色、场景、语速等维度,让合成结果与预期高度一致。

核心亮点三:细粒度标签控制,精确到呼吸和情绪

除了自由文本指令,模型还支持在文本中直接嵌入结构化标签(如 [gasp][giggles][angry]),直接对语气、情绪和 breath 类细节进行精准调控。

这种方式特别适合需要精确控制非语言细节的叙事、游戏、影视配音等场景,标签与语音自然融合,可灵活组合构建复杂情感表达。

核心亮点四:复杂声学鲁棒性,无惧嘈杂环境的音色复刻

真实业务中,参考音频往往来自复杂环境。Qwen-Audio-3.0-TTS 对此做了专项优化,通过针对性的真实声学仿真训练,将语音增强能力原生注入复刻流程。

模型能够在嘈杂环境中自动“过滤干扰、保留音色”,复杂场景下的复刻清晰度和感知质量显著提升。即使参考条件不佳,合成语音依然保持高质量。

  • 高混响场景有效抑制混响干扰,合成更干净清晰。
  • 高噪声场景抗噪能力更强,语音质量显著优于前代。

Also in this release:精品音色库

Qwen-Audio-3.0-TTS 配套的精品音色库,将模型在多语种多方言指令控制细粒度表达上的能力沉淀为开箱即用的音色资源。音色库覆盖指令风格音色、20 种方言音色、细粒度控制音色以及 14+ 款小语种音色,帮助业务方快速上线不同场景的声音方案。

面向严肃创作场景,我们将音频输出品质从 24kHz 跃升至 48K。同时,单次语音合成支持长达 3 分钟,轻松满足长文本播报需求。

(注:部分方言、小语种精品音色及 48K 高清音频输出功能目前在阿里云百炼平台正陆续上线中,其中 48K 功能预计于 7月24日 正式开放,具体请以控制台实际展示为准。)

核心亮点

  • 可直接用自然语言描述角色、情绪、场景和语气,合成结果会随指令变化。
  • 支持上下文驱动的语气选择,同一句文本在不同场景下可以读出不同情绪。
  • 支持耳语、笑场、情绪转折等细粒度表达,声音更接近真实说话。
  • 长文本中能保持节奏、清晰度和音色一致性。
  • 角色化表达覆盖电台主持、心理咨询、科幻 AI 等场景。

Qwen-Audio-3.0-TTS 现已全面开放。

从“能说话”到“会表达”,技术的边界正在被不断拓宽。我们诚邀广大开发者接入体验,共同探索语音合成的更多可能性。如果您在应用落地中有任何反馈或建议,欢迎通过技术交流群与我们探讨。

Qwen-Audio-3.0-TTS-Plus:https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-plus?serviceSite=asia-pacific-china

Qwen-Audio-3.0-TTS-Flash:https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-flash?serviceSite=asia-pacific-china

Blog:https://funaudiollm.github.io/qwen-audio-3.0-tts/

版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。

(0)

相关推荐