无需分词,即可实时克隆人声!VoxCPM 是一个开源TTS文本转语音系统,它在连续空间中建模语音,而不是使用离散 token。
大多数 TTS 系统会在生成前将语音转换为离散 token。这种量化带来了一个根本性的权衡:token 能提供稳定性,但会丢失呼吸声、声音质感和细微发音等声学细节。VoxCPM 完全跳过分词。
它基于 MiniCPM-4,采用端到端扩散自回归架构,直接在连续空间中建模语音。
该系统采用层次化语言建模,包含两个专门组件:用于捕捉高层韵律和结构的文本-语义语言模型,以及用于恢复细粒度声学细节的残差声学模型。
这种分离消除了对外部语音分词器的依赖,并避免了多阶段流水线中的误差累积。

两项强大的能力:
- 上下文感知语音生成:模型理解文本,从而推断合适的韵律和说话风格。解释内容会自然放慢,重点会出现在恰当位置,疑问句听起来像疑问句。
- 零样本声音克隆:仅需 3–10 秒参考音频,即可复现说话人的音色、口音、情感语调、节奏和语速。
主要特性:
- 无分词器架构,支持连续语音建模
- 无需手动调参的上下文感知韵律生成
- 基于短参考音频的零样本声音克隆
- 支持流式合成,适用于实时应用
- 支持 SFT 和 LoRA 微调
项目地址:https://github.com/OpenBMB/VoxCPM
版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。