语音智能体团队总会撞上同一堵墙:音色库里有 400 个声音,而需求偏偏要的是库里没有的那一个:为蒙特利尔经销商找一个魁北克法语口音的前台,找一个六十多岁、带着讲堂级权威感的男声解说。需求永远比音色库多,而克隆技术一次只能补上一位说话人,每位都牵扯到来源、授权和许可的流程。

总部位于巴黎的语音 AI 公司 Gradium(脱胎于 Kyutai 研究实验室)给出了另一种答案。Voice Design 读取一段文字描述,几秒钟内就能返回一个完整的新语音。无需参考音频、无需真人说话人、无需清理版权。
能直接上线用吗?能。Voice Design 已上线 Gradium API 和 Studio,所有套餐(包括免费档)均免费开放;保留下来的语音与音色库中的任何语音一样,走同一个流式文本转语音(TTS)端点,延迟和输出格式完全相同。
选角简报就是 API
描述是模型获得的唯一输入。Gradium 的文档列出了它能响应的属性,读起来就像一份选角通知:性别、年龄段、口音或地域、音高、语速、能量、音色与共鸣、语气与仪态,以及这个声音要承担的职责。描述长度限 1~500 个字符,支持英语、法语、西班牙语、葡萄牙语或德语。Gradium 建议在结尾写明预期用途,因为它引导的是表达方式和语气,而不仅是声音的 “颜色”。
一次请求返回 1~5 个候选,通常 3~5 秒就绪。这些候选是同一个角色的不同变体,所以要换角色就改写描述,而不是多要几个样本。
从候选到生产级语音
流程共四步调用:POST /voice-generator/generate 生成候选 ID(状态为 ready: false);GET /voice-generator/embeddings 轮询直到状态翻转;每个候选通过普通 TTS 端点试听,把候选 ID 当作 voice_id;POST /voices/from-embedding 把你选中的那个升级为正式语音。
候选语音有三条转换后语音没有的限制:试听文本上限 100 字符、仅支持 REST 调用、TTS WebSocket 和语音转语音(Speech-to-Speech)会拒绝它们。未转换的候选 30 天后删除。转换免费,会清除过期时限,并占用一个与克隆功能共享的自定义语音槽位 —— 免费档 5 个,付费套餐 1000 个。
采样刻意设计为非确定性。Gradium 团队会先扩展描述,而每次请求的扩展结果都不一样,所以即使固定随机种子(seed),同样的提示词得到的也是不同的语音。
基准测试,以及如何解读
Gradium 对可通过公共 API 触达的六个语音设计系统、五种语言做了口音提示的盲听成对测试。母语者听两段未标注的音频,选出更接近的那一个,或判平局。在 7,627 次比较中,Gradium 报告对全场的胜率为 72.6%,领先 ElevenLabs eleven_ttv_v3(59.0%)13.6 个百分点,其后依次是 Inworld(44.8%)、Fish Audio(36.7%)和 MiniMax(31.7%)。胜率等于胜场加一半平局,所以 50% 是基准线。Gradium 在全部五种语言中均排名第一。差距最大的是多数音色库会抹平的地域口音:魁北克法语 97%、拉普拉塔河西班牙语 86%、巴伐利亚德语 85%、哥伦比亚西班牙语和非洲葡萄牙语 83%。
同一组提示词下,模型裁判也得出了相同的结论。Gemini 3.1 Pro 为单条未标注片段打 1~5 分,排名一致:Gradium 4.06、ElevenLabs 3.86、Inworld 3.64、Fish Audio 3.51。另外,产品页面声称在 InstructTTSEval(TTS 指令遵循的学术基准)英语子集上提示词遵循度为 83.4%。(注:以上所有数字均为厂商自行设计并运行的结果。)
关键要点
- Voice Design 能把一段 500 字符的描述,在几秒内变成最多 5 个全新语音,无需参考音频。
- 已在 Gradium 所有套餐上线并免费开放,支持 API 和 Studio,覆盖 5 种语言。
- 厂商自测的盲听测试在 7,627 次比较中胜率 72.6%,5 种语言全部第一。
- 保留的语音会成为 REST、WebSocket 和语音转语音接口上的常规
voice_id。 - 采样是非确定性的,未保存的候选 30 天后将永久消失。
参考资料:
https://gradium.ai/blog/launching-voice-design
https://docs.gradium.ai/guides/voices/voice-design
本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/zixun/71849.html