ZEGO 云端语音实时识别新增支持 Qwen-Audio-3.0-ASR-Flash-Streaming 模型

2026 年 9 月 17 日,ZEGO 云端实时语音识别产品发布 v2.4.0 版本,新增支持 Qwen-Audio-3.0-ASR-Flash-Streaming 语音识别模型,并下架 qwen3-asr-flash-realtime 语音识别模型。

ZEGO 云端语音实时识别新增支持 Qwen-Audio-3.0-ASR-Flash-Streaming 模型

1. 新增支持 Qwen-Audio-3.0-ASR-Flash-Streaming 语音识别模型

为了提高不同场景下语音识别(或语音转文字)的识别准确率,新增该模型。

ASR.Vendor 为 AliyunQwenAudioASR,支持配置热词,支持中文(普通话及各地方言)、英语、日语等语种。

配置 ASR 方式:

在创建实时语音识别任务(StartRealtimeASRTask)时可以通过 ASR 参数设置需要使用的厂商、语种、热词等参数。

设置模型

通过 payload.model 参数设置模型,模型值为 qwen-audio-3.0-asr-flash-streaming

设置语种

通过 payload.parameters.language_hints 参数设置语种。如果无法提前确定语种,可不设置,模型会自动识别语种。

以下为设置语种为中文的示例。

// !mark(6:9)
{
  "RoomId": "rtc_room_id",
  "ASR": {
    "Vendor": "AliyunQwenAudioASR",
    "Params": {
      "payload": {
        "model": "qwen-audio-3.0-asr-flash-streaming",
        "parameters": {
          "language_hints": ["zh"]
        }
      }
    }
  }
}

配置详情请查看文档:https://doc-zh.zego.im/cloud-realtime-asr/configuring-asr

2. 下架 qwen3-asr-flash-realtime 语音识别模型

原 ASR.Vendor 为 AliyunQwenASR若仍在使用该模型,后续会被替换为 Qwen-Audio-3.0-ASR-Flash-Streaming。

关于 ZEGO 云端实时语音识别

将语音通话、视频直播、在线会议等实时音视频场景中的语音内容实时转为文字结果。 实现 1v1 语音通话实时字幕&翻译、在线会议实时字幕及会后纪要总结、全球直播字幕、直播间实时主播内容总结等场景。

本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/zixun/72088.html

(0)

相关推荐