Cartesia 发布了 Sonic-3.6,这是其实时文本转语音(TTS)模型的最新版本,距 Sonic-3.5 发布约三个月。这次的变化在于自然度,而且这一点是可以独立验证的。
Sonic 3.6 目前在 Artificial Analysis 的两个语音排行榜上均位列第一:Provider Voice 榜 1,283 Elo,Controlled Voice 榜 1,123 Elo。后者更有说服力:该榜单把所有模型克隆到同一组八个参考音色上,从而把合成引擎与音色库剥离开来。Sonic-3.6 领跑该榜,Sonic-3.5 位居第二,ElevenLabs Eleven v3 位列第三。该模型基于状态空间模型(SSM)而非 Transformer 架构,Cartesia 声称其首音频时延低于 90 毫秒。目前以 Beta 版本提供。

能否部署?
可以,以 Beta 版和托管 API 形式提供,但不提供自托管权重。
Sonic 是闭源商业模型,没有开放权重,也没有 Hugging Face 仓库。你只能按需租用。
- 公司层级:独立开发者与初创公司(Free/Pro 各 5档)、运营客服中心的扩张期公司(Startup5档)、运营客服中心的扩张期公司(Startup49 / Scale $299)、以及需要 DPA、BAA 和 SSO 的受监管企业。
- 行业:金融服务、医疗保健、零售与电商、物流、招聘、SaaS 客服、消费级陪伴类应用、媒体本地化。
- 应用场景:呼入客服机器人、呼出筛选电话、IVR 替代、预约提醒、销售培训模拟器、音频本地化、产品内语音 UI。
架构
Sonic 基于状态空间模型而非 Transformer。Cartesia 的发布页将常见的权衡(速度与自然度、准确性与成本)框定为架构性问题,而非必然取舍。
实际的产出是首音频时延。Cartesia 声称 TTS 时延低于 90 毫秒,其语音转文字模型 Ink-2 的转写时延为 100 毫秒。两者都是厂商口径的模型时延,而非实测的端到端往返时间。
生产中重要的功能
Sonic 提供的控制项是为智能体对话文本而设计的,而非旁白:
- 行内表情标签。像 [laughter] 这样的非语言表情可直接写进转写文本中。
- 即时声音克隆。约 10 秒音频即可克隆音色。
- 自定义发音词典,包括 IPA 覆盖写法,例如用
<<s|ə|ˈ|p|i|n|ə>>来指定 subpoena 的发音。 - 速度、音量和情感参数,可通过 API 以及 LiveKit Agents 插件等集成方式调用。
- 原生字母数字支持。订单号、电话号码、确认码无需预处理即可正确朗读。
Cartesia 的发布演示展示了带自然停顿和语气词的英语,以及印地语与英语混说的 Hinglish 语码转换。
定价
Artificial Analysis 将 Sonic 3.6 归一化定价为每 100 万字符 49.00,是ElevenLabsElevenv3(49.00,是ElevenLabsElevenv3(100.00)的一半,但远高于 Speechify Simba 3.2($10.00,Elo 1,240)。
Cartesia 按额度而非字符售卖。Scale 档每月 299,约含10,667分钟TTS时长和15路并发请求。Line语音智能体按每分钟299,约含10,667分钟TTS时长和15路并发请求。Line语音智能体按每分钟0.06 单独计费。
要点总结
- Sonic-3.6 在 Artificial Analysis 两个语音竞技场均排名第一:Provider Voice 榜 1,283 Elo,Controlled Voice 榜 1,123 Elo。
- 赢得 Controlled 榜意味着引擎本身提升了,而非仅仅音色库的功劳。
- 目前仅在 Cartesia API 上以 Beta 形式提供;文档中 Sonic 3.5 仍标注为稳定版,合作伙伴也仍搭载 3.5。
- 以托管 API 形式部署,而非自托管权重;商用从 $5 的 Pro 档起。
- 时延声明(sub-90ms TTFA)是厂商口径的模型时延,请自行实测端到端往返时间。
参考资料:
https://www.cartesia.ai/sonic
https://docs.cartesia.ai/build-with-cartesia/tts-models/latest
https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice
本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/jishu/71236.html