Google 发布了 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,这是其 Gemini Audio 家族中的两款全新文本转语音模型。Google 称它们是迄今为止表现力最强的音频生成模型。Flash TTS 面向创意导演与角色配音,Flash-Lite TTS 面向高并发、低成本的生产场景。两者都支持开发者用自然语言逐行指导语音表现。

能用了吗?可以。两款模型目前正通过 Gemini API 和 Google AI Studio 逐步开放。仅提供 API 访问方式,不开放权重供自行部署。通过 Gemini Enterprise 提供的企业级 API 访问标注为”即将推出”。
Google 这次发布了什么
本次发布把 TTS 拆成两个档位,共享同一套导演控制能力:
- Gemini 3.8 Flash TTS 面向深度创意指导和角色设计。目标场景包括游戏、沉浸式有声书、播客和互动媒体。它提供对表演提示、节奏、口音切换和反馈性应答(backchanneling)的细粒度控制。
- Gemini 3.8 Flash-Lite TTS 面向高并发、低成本的大规模场景。Google 将其定位用于配音、音频内容创作和表现力丰富的语音智能体。它提供对语气、节奏和表现力细节的精细控制。
在 AI Studio 中,试用页里使用的模型标识为 gemini-3.8-flash-tts 和 gemini-3.8-flash-lite-tts。
用文本提示词设计音色
此前的 Gemini TTS 提供 30 个原创音色,3.8 版本转向了一个规模大得多的音色体系。
- 生成式音色设计:Flash TTS 可根据描述角色、口音和声音特征的提示词创建全新音色,覆盖 100 多种语言和方言。Google 的演示包括墨尔本 DJ、单调机器人音和日本龙。
- 音色库:开发者可使用 2,000 多个可直接用于生产的音色,覆盖墨西哥西班牙语、魁北克法语、苏格兰英语等地区变体。
- 保存与复用:自定义音色可保存并复用,跨项目使用时音色漂移极小。
- 音色混音(即将推出):用户将能通过提示词调整音色库中某个音色的音品、音高、语速和口音。
指导表演表现
两款模型都接受写在脚本中的舞台指示,Gemini 也能根据脚本中的自然语义线索来引导表现方式。
- 长音频生成:在数小时的连续音频中,音质、节奏和音品保持稳定。
- 原生双说话人编排:单个脚本即可驱动多轮对话,两个音色清晰区分、互不混淆。
- 人声点缀(vocal bursts):
<laughs>、<sigh>、<gasp>等非语言提示可为对话增添真实质感。 - 反馈性应答(backchanneling):
|mhm|、|yeah|等主动倾听式插入语可控制反应节拍与喜剧时机。
声音复刻与安全控制
声音复刻基于 30 秒音频样本构建稳定的声音档案。样本必须是本人的声音,或你拥有使用权利的声音。复刻需要声音所有者录制一段口头授权,并与参考说话人进行比对验证。
Gemini Audio 模型生成的每段音频都带有 SynthID 水印。这一不可感知的标记会直接嵌入音频输出中。复刻生成的声音还会附带 C2PA 内容凭证。Google 建议参考 Gemini 3.8 Audio 模型卡了解其更广泛的安全策略。
基准测试结果
Google 公布了新模型的以下成绩:
- Hume AI Voice Design Benchmark:据 Hume AI 数据,Flash TTS 以 71.4 分位列第一。
- 口音建模:Flash TTS 以 60.8 分领先。
- Hume AI Overall Quality Index:Flash TTS 排名第一,Flash-Lite TTS 排名第二。
- Voice Arena 盲测偏好:两款模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语中均位列前茅。
关键要点
- Google 推出 Gemini 3.8 Flash TTS(面向创意工作)与 Flash-Lite TTS(面向规模化)。
- Flash TTS 可通过提示词在 100 多种语言和方言中设计新音色。
- 开发者可获得 2,000 多个生产级音色,此前为 30 个原创音色。
- 声音复刻需要 30 秒样本,外加一份匹配的授权录音。
- Flash TTS 以 71.4 分在 Hume AI Voice Design Benchmark 中排名第一。
常见问题
Gemini 3.8 Flash TTS 是什么? 它是 Google 的文本转语音模型,用于创意音色设计和逐行表演指导。可通过 Gemini API 和 Google AI Studio 使用。
Flash-Lite TTS 有何不同? Flash-Lite TTS 针对配音、语音智能体等高并发、低成本负载做了优化。它在 Hume AI Overall Quality Index 中排名第二。
可以复刻自己的声音吗? 可以,需要 30 秒样本和一份口头授权录音。该功能在包括英国、欧洲经济区和印度在内的多个地区的 AI Studio 中不可用。
更多详情请访问Google技术博客:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/
本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/zixun/72216.html