AI 可以在几秒钟内生成对话,而语音技术则负责将这些文字转化为逼真的对话。当没有人能够预先预测确切的句子时,台词的发音方式就显得尤为重要。Inworld 最新的文本转语音技术正是围绕着赋予开发者更大的控制权而构建的。
以一句简单的台词“我就知道你会回来”为例。开发者可以控制配音演员用轻柔的语气说出这句话,仿佛是在表达等待数小时后如释重负的感觉。而同样的台词在另一个场景中,则可以传递出紧张激动的情绪,比如在句前加一口气,或者在句后加上一声轻笑。
Inworld 公司推出的新一代对话式文本转语音模型TTS-2,让开发者能够用自然语言描述语音内容。他们还可以添加停顿和非语言声音,例如笑声或叹息。语音可以根据文字描述设计,也可以从5到15秒的授权音频中克隆,并在保持相同语音特征的同时,跨越不同语言进行传播。

选择每种体验所需的内容
当用户与 AI 进行对话时,速度的重要性就显得尤为突出。Inworld 还提供第二种型号:实时 TTS-2 Flash,适用于处理大量交互或更注重快速响应和降低服务成本的产品。
Flash 保留了 TTS-2 的语音控制、克隆和语言覆盖范围。开发者可以向每个模型发送具有相同输出指令的相同语音行,选择 TTS-2 是因为它更注重语音质量,而选择 Flash 则适用于毫秒级延迟对用户体验影响较大的应用场景。
据报道,实时TTS-2 Flash的首字节响应时间为25毫秒。根据Inworld的发布数据,TTS-2在P99平台上的响应时间低于100毫秒。Coval是一个原生AI仿真、评估和生产监控平台,旨在测试和验证语音和聊天AI代理,该平台在其公布的基准测试条件和方法下,也测得Flash的响应时间为25毫秒。
实时语音 AI 如何赋予开发者更多交付控制权
语音模型之间的差异远不止于用户对某个语音样本的喜好程度。拥有超过500万用户的语言学习平台Talkpal对Inworld的实时语音技术进行了为期4周的测试。其A/B测试结果显示,功能使用率提升了7%,用户留存率提高了4%,同时文本转语音(TTS)成本降低了40%。
互动叙事对语音生成提出了不同的要求。ARX Media 首席执行官 Louis Muk 多年来一直致力于为《异世界零》寻找既技术精湛又令人信服的语音。他将 TTS-2 描述为让语音生成更接近角色说话的那一刻,使语音背后的技术不再引人注目。
LiveKit首席技术官David Zhao指出,响应速度是这种体验的另一个重要组成部分。实时对话在语音回复出现之前需要经过多个流程,因此,富有表现力的语音必须与交互本身的速度相匹配。LiveKit通过其Agents平台提供Inworld的实时语音产品。
无需重新构建应用程序即可更改模型
开发者还必须考虑模型发布后的后续流程。Inworld 表示,即使接口保持不变,语音模型更新在针对一位客户的 A/B 测试中也取得了中性结果。该客户可以通过其现有集成获得改进后的模型。
这种架构也让 Inworld 能够根据应用程序的需求在不同的模型之间路由请求。语音功能只是其业务的一部分,该业务还包括语言模型服务、路由、实时 API 以及面向消费者应用程序的计算。
实时 AI 为惊喜留下了充足的空间。对话可能在几秒钟内发生转变,语音也必须随之改变。TTS-2 通过赋予开发者更大的实时控制权,使这种自发性更容易实现。
本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/zixun/72167.html