想把真正的 AI 语音代理接入真实电话线路部署在用户自己的基础设施上,而不是黑盒SaaS吗?开源的模块可能解决这个痛点-mod_earshot。
如果用户的FreeSWITCH或者其他基于SIP协议栈,都可以考虑这个新的实现方式-mod_earshot,它可以通过单个 WebSocket 将实时电话通话桥接到用户的AI语音代理。
mod_earshot 通过单个 WebSocket 将实时电话通话桥接到你的 AI 语音代理——全双工,并且代理的声音会在同一条通话腿上清晰回放。这是一个即插即用的模块,回放功能是真正可用。

提供的功能支持包括:
• 7 种协议适配器:OpenAI Realtime、Deepgram、ElevenLabs、Gemini、Pipecat、Twilio,或你自己的WebSocket。只需改一个词即可切换供应商。
• 适用于任何代理的轮流发言机制:模块侧 VAD、就绪门控(不会“接通后陷入静音”),以及语音触发的打断插话。
• 代理可以控制通话:白名单式转接 / 挂断 / DTMF / 保持 / 桥接,每个动作都有审计记录。
• PCI/PII 屏蔽:在输入银行卡信息期间静音音频并脱敏 DTMF,在你自己的机器上完成,无需按分钟支付合规附加费。
• 多流工作:同一通通话中同时支持代理 + 实时转录 + 主管监听。
• 按会话扩展,而不是按线程扩展:共享的 libwebsockets 池每个会话约占用 1 MB,而不是约 17 MB,因此一台小型服务器即可承载数千路并发通话;相比之下,每流一个线程的模式在约 420 路时就会碰到瓶颈。
• 完全可观测:通过 FreeSWITCH 事件套接字(ESL)发送类型化事件 + 延迟 KPI:首段音频时间、每轮响应时间、WebSocket RTT。
项目地址:
https://github.com/wiringai/mod_earshot
版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。