2026 年 9 月 17 日,ZEGO 云端实时语音识别产品发布 v2.4.0 版本,新增支持 Qwen-Audio-3.0-ASR-Flash-Streaming 语音识别模型,并下架 qwen3-asr-flash-realtime 语音识别模型。

1. 新增支持 Qwen-Audio-3.0-ASR-Flash-Streaming 语音识别模型。
为了提高不同场景下语音识别(或语音转文字)的识别准确率,新增该模型。
ASR.Vendor 为 AliyunQwenAudioASR,支持配置热词,支持中文(普通话及各地方言)、英语、日语等语种。
配置 ASR 方式:
在创建实时语音识别任务(StartRealtimeASRTask)时可以通过 ASR 参数设置需要使用的厂商、语种、热词等参数。
设置模型
通过 payload.model 参数设置模型,模型值为 qwen-audio-3.0-asr-flash-streaming。
设置语种
通过 payload.parameters.language_hints 参数设置语种。如果无法提前确定语种,可不设置,模型会自动识别语种。
以下为设置语种为中文的示例。
// !mark(6:9)
{
"RoomId": "rtc_room_id",
"ASR": {
"Vendor": "AliyunQwenAudioASR",
"Params": {
"payload": {
"model": "qwen-audio-3.0-asr-flash-streaming",
"parameters": {
"language_hints": ["zh"]
}
}
}
}
}
配置详情请查看文档:https://doc-zh.zego.im/cloud-realtime-asr/configuring-asr
2. 下架 qwen3-asr-flash-realtime 语音识别模型
原 ASR.Vendor 为 AliyunQwenASR。若仍在使用该模型,后续会被替换为 Qwen-Audio-3.0-ASR-Flash-Streaming。
关于 ZEGO 云端实时语音识别
将语音通话、视频直播、在线会议等实时音视频场景中的语音内容实时转为文字结果。 实现 1v1 语音通话实时字幕&翻译、在线会议实时字幕及会后纪要总结、全球直播字幕、直播间实时主播内容总结等场景。
本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/zixun/72088.html