Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS,支持基于提示词的语音设计

Google 发布了 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,这是其 Gemini Audio 家族中的两款全新文本转语音模型。Google 称它们是迄今为止表现力最强的音频生成模型。Flash TTS 面向创意导演与角色配音,Flash-Lite TTS 面向高并发、低成本的生产场景。两者都支持开发者用自然语言逐行指导语音表现。

Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS,支持基于提示词的语音设计
图片来自Google

能用了吗?可以。两款模型目前正通过 Gemini API 和 Google AI Studio 逐步开放。仅提供 API 访问方式,不开放权重供自行部署。通过 Gemini Enterprise 提供的企业级 API 访问标注为”即将推出”。

Google 这次发布了什么

本次发布把 TTS 拆成两个档位,共享同一套导演控制能力:

  • Gemini 3.8 Flash TTS 面向深度创意指导和角色设计。目标场景包括游戏、沉浸式有声书、播客和互动媒体。它提供对表演提示、节奏、口音切换和反馈性应答(backchanneling)的细粒度控制。
  • Gemini 3.8 Flash-Lite TTS 面向高并发、低成本的大规模场景。Google 将其定位用于配音、音频内容创作和表现力丰富的语音智能体。它提供对语气、节奏和表现力细节的精细控制。

在 AI Studio 中,试用页里使用的模型标识为 gemini-3.8-flash-tts 和 gemini-3.8-flash-lite-tts

用文本提示词设计音色

此前的 Gemini TTS 提供 30 个原创音色,3.8 版本转向了一个规模大得多的音色体系。

  • 生成式音色设计:Flash TTS 可根据描述角色、口音和声音特征的提示词创建全新音色,覆盖 100 多种语言和方言。Google 的演示包括墨尔本 DJ、单调机器人音和日本龙。
  • 音色库:开发者可使用 2,000 多个可直接用于生产的音色,覆盖墨西哥西班牙语、魁北克法语、苏格兰英语等地区变体。
  • 保存与复用:自定义音色可保存并复用,跨项目使用时音色漂移极小。
  • 音色混音(即将推出)​:用户将能通过提示词调整音色库中某个音色的音品、音高、语速和口音。

指导表演表现

两款模型都接受写在脚本中的舞台指示,Gemini 也能根据脚本中的自然语义线索来引导表现方式。

  • 长音频生成:在数小时的连续音频中,音质、节奏和音品保持稳定。
  • 原生双说话人编排:单个脚本即可驱动多轮对话,两个音色清晰区分、互不混淆。
  • 人声点缀(vocal bursts)​:<laughs><sigh><gasp> 等非语言提示可为对话增添真实质感。
  • 反馈性应答(backchanneling)​:|mhm||yeah| 等主动倾听式插入语可控制反应节拍与喜剧时机。

声音复刻与安全控制

声音复刻基于 30 秒音频样本构建稳定的声音档案。样本必须是本人的声音,或你拥有使用权利的声音。复刻需要声音所有者录制一段口头授权,并与参考说话人进行比对验证。

Gemini Audio 模型生成的每段音频都带有 SynthID 水印。这一不可感知的标记会直接嵌入音频输出中。复刻生成的声音还会附带 C2PA 内容凭证。Google 建议参考 Gemini 3.8 Audio 模型卡了解其更广泛的安全策略。

基准测试结果

Google 公布了新模型的以下成绩:

  • Hume AI Voice Design Benchmark:据 Hume AI 数据,Flash TTS 以 71.4 分位列第一。
  • 口音建模:Flash TTS 以 60.8 分领先。
  • Hume AI Overall Quality Index:Flash TTS 排名第一,Flash-Lite TTS 排名第二。
  • Voice Arena 盲测偏好:两款模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语中均位列前茅。

关键要点

  • Google 推出 Gemini 3.8 Flash TTS(面向创意工作)与 Flash-Lite TTS(面向规模化)。
  • Flash TTS 可通过提示词在 100 多种语言和方言中设计新音色。
  • 开发者可获得 2,000 多个生产级音色,此前为 30 个原创音色。
  • 声音复刻需要 30 秒样本,外加一份匹配的授权录音。
  • Flash TTS 以 71.4 分在 Hume AI Voice Design Benchmark 中排名第一。

常见问题

Gemini 3.8 Flash TTS 是什么? 它是 Google 的文本转语音模型,用于创意音色设计和逐行表演指导。可通过 Gemini API 和 Google AI Studio 使用。

Flash-Lite TTS 有何不同? Flash-Lite TTS 针对配音、语音智能体等高并发、低成本负载做了优化。它在 Hume AI Overall Quality Index 中排名第二。

可以复刻自己的声音吗? 可以,需要 30 秒样本和一份口头授权录音。该功能在包括英国、欧洲经济区和印度在内的多个地区的 AI Studio 中不可用。

更多详情请访问Google技术博客:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/

本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/zixun/72216.html

(0)

相关推荐