Gradium AI 发布全新默认 TTS 模型:难例通过率 81.0%,首音频时间 216 毫秒

语音代理恰恰在通话中最重要的环节上掉链子:订单号、回拨数字、来电者必须记下的邮箱地址。Gradium AI 发布了一款全新的文本转语音(TTS)模型,并将其设为 API 和 Studio 全线的默认模型。该公司报告称,在一套涵盖五种语言的 500 句难例测试集上,人工评分通过率达到 81.0%,领先于 Cartesia Sonic 3.6 的 75.1% 和 ElevenLabs v3 Conversational 的 65.4%。在 Coval 上,P50 首音频时间为 216 毫秒,比其替代的旧模型快 170 毫秒。

Gradium AI 发布全新默认 TTS 模型:难例通过率 81.0%,首音频时间 216 毫秒
图片来自 Gradium

Gradium 已于 2026 年 8 月 31 日将该模型切换为 API 和 Studio 全线的默认模型。现有音色(包括自定义克隆音色)保持不变,继续正常工作。

准确率数据

Gradium 构建了一套 500 句的评估集,并以 CC BY 4.0 协议在 Hugging Face 上开源:涵盖五种语言(英、德、法、西、葡),10 项标准,每项 100 条。七项原子标准覆盖拼写、首字母缩写、字母数字混合标记、日期、常规数字、大数与浮点数,以及邮箱。三项复合标准(订单、IT 工单、理赔)将其中若干项叠加为一个真实的代理对话轮次。

评分由人工完成,标准严格。只有当独立的母语评分员听到每一个元素都发音正确且完整时,该句子才算通过;漏掉一个数字即判该句失败。音频经过响度归一化,顺序随机打乱,评分员每次最多进行 40 组对比,并强制执行休息。

将十项标准合并、五种语言等权平均后:Gradium TTS 81.0%,Cartesia Sonic 3.6 75.1%,ElevenLabs v3 Conversational 65.4%,Fish Audio S2.1 Pro 49.5%,Inworld TTS 1.5 Max 46.5%。全部于 2026 年 8 月使用默认设置生成。

延迟数据

在 Coval 的 TTS 基准测试中,Gradium 报告 P50 首音频时间为 216 毫秒,比其替代的旧模型快 170 毫秒。更有参考价值的是离散度:480 次运行中 p75-p25 四分位距仅为 30 毫秒,是被测五款模型中最紧凑的。Cartesia Sonic 3.6 中位数为 454 毫秒,离散度 165 毫秒,占其中位数的 36%—— 而来电者体验到的是尾部延迟,而非中位数。

Gradium 并非该榜单上最快的模型。Inworld TTS 2 中位数为 166 毫秒;Fish Audio S2.1 Pro(291 毫秒)和 ElevenLabs v3 Conversational(329 毫秒)落后于 Gradium。它所主张的是综合位置:在首音频低于 250 毫秒的前提下,拥有最低的难例失败率,且方差极小。

如何开始

现有用户无需任何操作。新团队安装 Python SDK,指向 WebSocket TTS 端点,复用现有音色 ID 即可。Gradium 正在其 Discord 上为完整的难例失败报告提供 100 万积分奖励。

关键要点

  • 全新 Gradium TTS 模型已于 2026 年 8 月 31 日上线并设为默认;无需迁移。
  • 在 500 句难例上人工评分通过率 81.0%,领先于 Cartesia、ElevenLabs、Fish Audio 和 Inworld。
  • 在 Coval 上 P50 首音频时间 216 毫秒,480 次运行中四分位距仅 30 毫秒。
  • 无需文本归一化即可正确朗读电话号码、邮箱、IBAN 和参考编号。
  • 基准测试由厂商自行运行,但 500 句评估集已以 CC BY 4.0 协议在 Hugging Face 上开源。

资料来源:
https://gradium.ai/blog/gradium-tts-latency-and-accuracy
https://huggingface.co/datasets/gradium/tts-eval-customer-support-202608

本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/zixun/71565.html

(0)

相关推荐