HuggingFace 开源speech-to-speech,支持本地部署

HuggingFace发布语音到语音:使用开源模型构建语音智能体,用户可以在本地构建语音 AI 智能体!

HuggingFace的speech-to-speech 是一个完全模块化的语音智能体流水线,完全基于开源模型运行。每个组件都可以替换,每个阶段都在自己的线程中运行,并通过队列连接。

该流水线提供与 OpenAI Realtime 兼容的 WebSocket API。任何现有的 OpenAI Realtime 客户端都可以通过更改一个 URL,指向这台服务器而不是 OpenAI。

其工作方式如下:

1. 语音活动检测 – Silero VAD v5 检测语音边界和轮次切换

2. 语音转文本 – 转写用户的发言,并可选择提供实时部分转写结果

3. 语言模型 – 生成回复,流式输出文本和工具调用

4. 文本转语音 – 合成音频并将其流式传回客户端。

每个阶段都有多个可互换的后端,你可以通过 CLI 标志进行选择。对于完全本地化的设置,可通过 llama.cpp 运行 Gemma 4,并结合 Parakeet TDT 用于 STT、Qwen3-TTS 用于语音输出。无需 API 密钥。

HuggingFace 开源speech-to-speech,支持本地部署

主要功能:

  • 与 OpenAI Realtime 兼容的 WebSocket API – 可直接替代
  • 通过 llama.cpp + Parakeet TDT + Qwen3-TTS 实现完全本地运行,无需 API 密钥
  • STT:Parakeet TDT、Whisper、Faster Whisper、Paraformer
  • TTS:Qwen3-TTS、Kokoro、Pocket TTS、ChatTTS、MMS TTS
  • 多语言支持,自动语言检测
  • 四种运行模式:Realtime、Local、Raw WebSocket、TCP Socket

项目地址:

https://github.com/huggingface/speech-to-speech

版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。

(0)

相关推荐