SpaceXAI 发布了 Grok Voice Transcribe 2.0,这是其最新的语音转文字(STT)模型。开发团队称其在价格不变的前提下,准确率是 Grok Voice Transcribe 1.0 的两倍。该模型面向「难啃」的音频:嘈杂的电话线路、多人同时说话、地方口音,以及口头报出的凭证信息。它通过 Speech to Text API 同时支持批量与实时流式两种模式。
它能部署吗? 可以,以托管 API 的形式。今天已上线,模型 ID 为 grok-voice-transcribe-2.0。SpaceXAI 尚未公布开放权重,因此自托管不是选项。

Grok Voice Transcribe 2.0 是什么?
Grok Voice Transcribe 2.0 构建于 Grok Voice 背后的音频基础模型之上。SpaceXAI 团队表示,Grok Voice 目前每天已处理数万通客服电话,同时转写数百万小时的视频旁白,并驱动特斯拉车辆中的 Grok 助手。
训练数据是在多样化环境中录制的真实、嘈杂、多语言音频。SpaceXAI 随后通过后训练(post-training)对模型进行了精调。
基准测试:SpaceXAI 公布了什么
SpaceXAI 称,在公开的 Artificial Analysis 榜单上,该模型在 32 个流式模型中位列准确率第一。该基准名为 AA-WER Streaming,使用约 8 小时音频,权重为 AA-AgentTalk 占 50%、VoxPopuli 占 25%、Earnings22 占 25%。详见方法论说明。
SpaceXAI 还在 4 个来自生产流量的内部数据集上测量了词错误率(WER):
- 电话(8 kHz):英语客服通话
- 对话:与 Grok 的英语对话
- 凭证:英语的电话号码、邮箱和地址
- 短句:19 种语言的语音助手话语
2.0 版本在全部 4 个数据集上均优于 1.0。在电话场景下,SpaceXAI 称其领先于公司测试过的所有模型。这些内部结果由厂商自行报告,未经独立复现。
多语言转写与语言切换
该模型可转写数十种语言,并自动检测语种。它还能在单次处理中跟随录音中途的语言切换。SpaceXAI 团队称多语言准确率是相比 1.0 提升最大的一项。
像车载指令这样的短句,能给模型用于判断语言的上下文非常有限。在该数据集上,WER 从 20.6% 降至 6.8%,相当于词错误减少了约 67%。
文档列出了 25 种语言支持数字、货币和单位的书面形式格式化。
面向开发者的关键特性
以下每项功能都在同一个 API 中提供:
- 批量与流式:转写文件和 URL,或通过 WebSocket 在
wss://api.x.ai/v1/stt流式传输音频 - 词级时间戳:每个词的开始与结束时间,以及置信度分数
- 说话人分离(diarization):说话人标注,不额外收费
- 多通道转写:最多 8 个通道独立转写
- 关键术语偏置:每次请求最多 100 个领域术语,每个最长 50 个字符
- 文本格式化:数字、日期、货币、电话号码和邮箱以书面形式返回
- 填充词移除:默认移除「um」和「uh」
- 智能轮次检测:由机器学习模型预测语音智能体的对话轮次结束
批量端点支持最大 500 MB 的文件、涵盖 12 种音频格式。流式模式还支持 Opus,约 4 KB/s,相比之下 24 kHz 原始 PCM 为 48 KB/s。
定价
定价与 1.0 版本完全一致。批量转写为每音频小时 0.10 美元,流式为每小时 0.20 美元。说话人分离、时间戳和关键术语均包含在内。换算下来约为每 1000 分钟 1.67 美元和 3.33 美元。
Atlassian Loom 采用 Grok Voice Transcribe 2.0
Atlassian Loom 现已使用 Grok Voice Transcribe 2.0 转写每一个视频。Atlassian 发现它比现有方案更准确。
SpaceXAI 描述的工作流是「录制、转写、然后编码」。用户在 Loom 中录下行动方案,转写文本被送入 Cursor,由 Cursor 完成代码更新。Atlassian 团队协作产品集(Teamwork Collection)高级副总裁 Sanchan Saxena 将其描述为「从上下文到代码的闭环」。
关键要点
- Grok Voice Transcribe 2.0 声称在价格不变的情况下准确率是 1.0 的 2 倍。
- 批量为每音频小时 0.10 美元,流式为每小时 0.20 美元。
- SpaceXAI 称其在 Artificial Analysis 上于 32 个流式模型中排名第一。
- 19 种语言的短句 WER 从 20.6% 降至 6.8%。
- 仅提供 API,因此目前需显式设置
model=grok-voice-transcribe-2.0。
了解更多详细信息,请访问 https://x.ai/news/grok-voice-transcribe-2
本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/jishu/72095.html