NVIDIA 发布 NemotronLabs VoiceChat 11B:一款开放式全双工语音对语音模型

NVIDIA 发布了NemotronLabs VoiceChat 11B,这是一款开源的 11B 端到端语音模型,支持实时全双工对话。它无需像传统 ASR、LLM 和 TTS 那样串联,而是在一个统一的网络中完成流式语音理解和语音生成。这省去了级联技术栈所需的多模型编排和 API 切换,并显著降低了端到端延迟:在 Full -Duplex-Bench 1.0测试中,平滑的轮流发言延迟仅为 448 毫秒。该模型在发言的同时进行监听,因此用户可以在发言过程中突然插话,而代理会立即让出发言权,接管率在 480 毫秒时达到 1.00。此外,它还是首个支持在对话进行的同时调用工具的开源全双工模型,使用独立的输出通道来输出<TOOLCALL>脚本,并配合操作员定义的“保持”语音提示,在 API 运行时填补空白。

是否可部署?

部分功能目前可供试点用户部署,但尚未用于生产环境。权重和容器均已公开,且采用宽松的许可协议。但NVIDIA团队声明,该检查点“仅供研究用途”,并且代码库记录了实际的故障模式:音频上下文时长上限为两分钟,几轮后语音降级为无法恢复的乱码,回合结束后出现失控的自言自语,以及用户转录中出现单词丢失。

  • 适用公司:任何能够分配至少一块配备 80 GB 显存的 GPU(例如 A100、H100、RTX 6000 Pro 或 B200,运行于 x86_64 Linux 系统)的团队。这涵盖了人工智能初创公司、已获融资的成长型企业、企业研发和创新实验室、GPU 云服务提供商以及大学学术团队。目前该模型没有托管 API,也没有推理服务提供商,因此没有 GPU 访问权限的团队可能无法对其进行评估。
  • 行业:联络中心和客户体验平台、汽车座舱助手、零售和免下车点餐、电信 IVR 现代化、游戏和 NPC 对话以及辅助功能工具。
  • 应用场景:可插话的语音代理、基于内部 API 的语音前端、实时查询助手(天气、价格、订单状态)和双工延迟基准测试工具。

架构

该模型是一款混合型的 Mamba/Transformer 架构,由三个现有的 NVIDIA 组件以及一条新的输出路径组装而成:

  • 来自Nemotron-Speech-Streaming-En-0.6b的快速 Conformer 语音编码器,可连续编码输入的 16 kHz 流。
  • NVIDIA Nemotron Nano v2 LLM 主干网,用于处理音频标记并预测文本标记。
  • NVIDIA TTS 解码器和编解码器,可预测音频代码,渲染为 22.05 kHz 代理语音。
  • 一个独立的输出通道,专门用于工具调用脚本。

输出包括代理音频、代理文本和实时用户转录。训练使用了约 55 万小时的音频,涵盖真实语料库和合成语料库,基于SALM-Duplex和Audio Flamingo 3模型。

无静默的工具调用

工具调用以 <TOOLCALL> 代码块的形式通过侧信道发出;您的代码则通过 <TOOL_RESPONSE> 代码块返回结果。值得注意的是“暂停”消息:针对每个工具,操作员需定义一句由代理在模型生成触发调用的文本的瞬间说出的台词,从而确保在 API 运行期间对话不会陷入沉默。

限制条件明确。NVIDIA 建议每个会话最多使用五个工具,模型无法可靠地同时调用多个工具,且用户在工具执行期间无法打断代理。系统提示和工具响应必须仅使用 ASCII 字符,并支持文本转语音(TTS)。

性能

在 Full-Duplex-Bench 1.0 测试中:流畅交谈的 TOR 值为 0.82(448 毫秒),用户中断的 TOR 值为 1.00(480 毫秒),暂停处理的 TOR 值分别为 0.153(合成数据)和 0.255(Candor),数值越低越好。

在 AU Harness BFCL-v3 语音工具调用测试中:简单任务准确率为 58.5%,多任务准确率为 62.5%,并行任务准确率为 42.5%,并行多任务准确率为 27.5%,无关内容准确率为 89.6%,平均准确率为 56.1%。在 Full-Duplex-Bench v3 测试集上:工具选择准确率为 82.5%,论点准确率为 44.2%,通过率(pass@1)为 33%。

NVIDIA 报告称,该模型在 VoiceBench 上的开源全双工模型中排名第 2,在 Full-Duplex-Bench 1.0 上的开源模型中排名第 2。

要点总结

  • 一个 11B 模型取代了 ASR → LLM → TTS 链,测得的轮流延迟为 448 毫秒。
  • 首先,采用全双工模式,通过工具调用,使用侧信道和操作员定义的保持消息。
  • 权重符合 OpenMDW-1.1 的宽松标准,但 NVIDIA 将此检查点标记为仅供研究使用。
  • 需要一块 80 GB 的 GPU;目前没有托管 API。

参考资料:
https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B
https://github.com/NVIDIA-NeMo/Speech/tree/nemotron-labs-voicechat

本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/jishu/70952.html

(0)

相关推荐