今天,讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了!
此次首发的Spark-Audio-1.0-Preview采用 0.65B(Dense结构)的音频编码器,搭配30B-A3B(MoE结构)的大语言模型,使用了1300万小时音频以及大量文本数据,基于纯国产算力集群训练完成,是地道的国产语音基座大模型;在同一个模型中可输入文本和语音两个模态,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等任务,让机器从“听清”进一步走向“听懂”。
Spark-Audio-1.0-Preview在各项语音评测任务上效果整体相当、部分超过,尤其在复杂场景高噪声、小声说等偏真实应用类任务上明显领先;与尺寸更大的闭源语音基座模型相比,Spark-Audio-1.0-Preview的表现也十分接近。与讯飞星火大模型的1+N体系类似,在语音基座大模型上也可进行微调,开发语音识别、语音同传、语音交互等专用模型或者系统,在相关语音业务中落地。
多语言、多方言、复杂场景表现优秀
Spark-Audio-1.0-Preview可支持99种语言及202种方言的识别。在多项任务中,与同尺寸的Qwen3.5-omni-flash(35B-A3B)相比在平均效果上表现出了多语言、多方言语音识别上的优势;与尺寸高一个数量级的Qwen3.5-omni-plus效果接近。
在Fleurs、Kespeech、LibriSpeech等中英文、多语言、多方言语音识别评测任务中,Spark-Audio-1.0-Preview得分高于Gemini-3.1 Pro;Fleurs-中文测试集中,Spark-Audio-1.0-Preview取得了SOTA。
面向更实际的应用场景,Spark-Audio-1.0-Preview在复杂场景的高噪声、小音量等复杂条件下的语音识别评测任务中也有较为明显的领先优势。
在文本相关的评测任务上“不降智”是语音基座大模型的难点之一。
此次发布的Spark-Audio-1.0-Preview在通用知识、数学与代码等任务上没有出现明显降智,同时在指令遵循、对话、音频理解等任务上仍有进步追赶空间。

Spark-Audio-1.0-Preview是怎样训练出来的?
Spark-Audio-1.0-Preview通过音频编码器预训练,逐步扩展音频编码器的表征能力;再通过预训练和后训练,提升了模型的基础能力、复杂场景泛化性以及多个任务效果,最终使得Spark-Audio-1.0-Preview在99种语言、202 种方言及高噪声、小音量等复杂场景下取得优异成绩。

同时,Spark-Audio-1.0-Preview是业界首个基于全国产算力训练的语音基座大模型,也证明了在国产算力上完全有能力训推出效果达到业界领先水平的语音基座大模型,再次证明了我们在全国产算力平台上训推大模型的实力。
版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。