Cartesia 发布 Sonic-3.6:一款流媒体 TTS 模型,登顶 Artificial Analysis 语音竞技场

Cartesia 发布了 Sonic-3.6,这是其实时文本转语音(TTS)模型的最新版本,距 Sonic-3.5 发布约三个月。这次的变化在于自然度,而且这一点是可以独立验证的。

Sonic 3.6 目前在 Artificial Analysis 的两个语音排行榜上均位列第一:Provider Voice 榜 1,283 Elo,Controlled Voice 榜 1,123 Elo。后者更有说服力:该榜单把所有模型克隆到同一组八个参考音色上,从而把合成引擎与音色库剥离开来。Sonic-3.6 领跑该榜,Sonic-3.5 位居第二,ElevenLabs Eleven v3 位列第三。该模型基于状态空间模型(SSM)而非 Transformer 架构,Cartesia 声称其首音频时延低于 90 毫秒。目前以 Beta 版本提供。

Cartesia 发布 Sonic-3.6:一款流媒体 TTS 模型,登顶 Artificial Analysis 语音竞技场

能否部署?

可以,以 Beta 版和托管 API 形式提供,但不提供自托管权重。

Sonic 是闭源商业模型,没有开放权重,也没有 Hugging Face 仓库。你只能按需租用。

  • 公司层级:独立开发者与初创公司(Free/Pro 各 5档)、运营客服中心的扩张期公司(Startup5档)、运营客服中心的扩张期公司(Startup49 / Scale $299)、以及需要 DPA、BAA 和 SSO 的受监管企业。
  • 行业:金融服务、医疗保健、零售与电商、物流、招聘、SaaS 客服、消费级陪伴类应用、媒体本地化。
  • 应用场景:呼入客服机器人、呼出筛选电话、IVR 替代、预约提醒、销售培训模拟器、音频本地化、产品内语音 UI。

架构

Sonic 基于状态空间模型而非 Transformer。Cartesia 的发布页将常见的权衡(速度与自然度、准确性与成本)框定为架构性问题,而非必然取舍。

实际的产出是首音频时延。Cartesia 声称 TTS 时延低于 90 毫秒,其语音转文字模型 Ink-2 的转写时延为 100 毫秒。两者都是厂商口径的模型时延,而非实测的端到端往返时间。

生产中重要的功能

Sonic 提供的控制项是为智能体对话文本而设计的,而非旁白:

  • 行内表情标签。像 [laughter] 这样的非语言表情可直接写进转写文本中。
  • 即时声音克隆。约 10 秒音频即可克隆音色。
  • 自定义发音词典,包括 IPA 覆盖写法,例如用 <<s|ə|ˈ|p|i|n|ə>> 来指定 subpoena 的发音。
  • 速度、音量和情感参数,可通过 API 以及 LiveKit Agents 插件等集成方式调用。
  • 原生字母数字支持。订单号、电话号码、确认码无需预处理即可正确朗读。

Cartesia 的发布演示展示了带自然停顿和语气词的英语,以及印地语与英语混说的 Hinglish 语码转换。

定价

Artificial Analysis 将 Sonic 3.6 归一化定价为每 100 万字符 49.00,是ElevenLabsElevenv3(49.00,是ElevenLabsElevenv3(100.00)的一半,但远高于 Speechify Simba 3.2($10.00,Elo 1,240)。

Cartesia 按额度而非字符售卖。Scale 档每月 299,约含10,667分钟TTS时长和15路并发请求。Line语音智能体按每分钟299,约含10,667分钟TTS时长和15路并发请求。Line语音智能体按每分钟0.06 单独计费。

要点总结

  • Sonic-3.6 在 Artificial Analysis 两个语音竞技场均排名第一:Provider Voice 榜 1,283 Elo,Controlled Voice 榜 1,123 Elo。
  • 赢得 Controlled 榜意味着引擎本身提升了,而非仅仅音色库的功劳。
  • 目前仅在 Cartesia API 上以 Beta 形式提供;文档中 Sonic 3.5 仍标注为稳定版,合作伙伴也仍搭载 3.5。
  • 以托管 API 形式部署,而非自托管权重;商用从 $5 的 Pro 档起。
  • 时延声明(sub-90ms TTFA)是厂商口径的模型时延,请自行实测端到端往返时间。

参考资料:
https://www.cartesia.ai/sonic
https://docs.cartesia.ai/build-with-cartesia/tts-models/latest
https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice

本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/jishu/71236.html

(0)

相关推荐