S1-mini:Superwhisper 发布 462MB 开源权重文本规范化模型,将原始 ASR 转录转为整洁书面文本

Superwhisper 发布了 S1 系列模型:S1-Voice、S1-Language 和 S1-mini。S1-Voice 是云端语音转文本模型,S1-Language 是用于文本清理和格式化的云端指令跟随模型。其中在应用之外最值得关注的是 S1-mini,它以开源权重形式发布在 Hugging Face 上。S1-mini 是一个 0.6B 参数的文本规范化模型,不是转录器,也不是聊天模型。它位于自动语音识别之后,将原始转录文本重写为整洁的书面文本:移除语气词、将自我修正解析为说话者最终表达的意图、应用标点和大小写,并将口语化的数字、日期、货币和邮箱地址渲染为书面形式。它基于 Qwen/Qwen3-0.6B 微调而来,v1 版本仅支持英语,完全由放置在转录文本上方的一条三轴控制线来驱动。Superwhisper 报告称,在 7,519 条留出测试用例上,使用量化版本贪心解码,token 准确率达到 94.8%。

能否部署?

可以,但仅限 S1-mini。S1-mini 以 Apache 2.0 加命名条款的许可发布在 Hugging Face 上。S1-Voice 和 S1-Language 是 Superwhisper 托管的服务,可以调用,但无法自托管。

公司层面: 任何规模都可部署。Q4_K_M GGUF 构建仅有 462MB,可在笔记本 CPU 上运行。独立开发者可以将其集成到桌面应用中,企业则可在 VPC 内运行,确保音频转录数据不离开网络。

行业: 医疗和临床文档、法律、金融服务、客户支持、开发者工具、无障碍和实时字幕。

应用场景: 听写应用、会议记录工具、实时字幕、语音驱动的编辑器、语音录入 CRM,以及任何将原始 ASR 输出转化为人类可读文本的流程。

S1-mini 的工作原理

S1-mini 是文本规范化模型,不是转录器,也不是聊天模型。它位于自动语音识别之后:

audio → ASR (Whisper, Parakeet, …) → S1-mini → clean text

它移除语气词,将错误的开头和自我修正解析为说话者最终表达的值,应用标点和大小写,并将口语化的数字、日期、时间、货币和邮箱地址渲染为书面形式。比如说 “support at superwhisper dot com”,你会得到 support@superwhisper.com。

该模型基于 Qwen/Qwen3-0.6B 微调。它有 596M 个独立参数(0.44B 非嵌入参数),28 层,16 个查询头和 8 个键值头(采用 GQA),权重为 BF16。Hugging Face 页面侧栏显示为 0.8B,这是因为绑定的嵌入参数被存储了两次;模型卡片对此差异做了明确说明。v1 版本仅支持英语,建议输入约 1,000 个 token。

控制线就是全部接口

S1-mini 接收一个固定的系统提示词,然后是一条控制线,接着是原始转录文本:

[Styling: <value>] [Structure: <value>] [Context: <value>]
<raw transcript>
  • Styling(风格):casual(随意)、semi-casual(半随意)、semi-formal(半正式)或 formal(正式)。
  • Structure(结构):prose(散文)或 lists(列表)。
  • Context(上下文):general(通用)或 email(邮件)。

三个维度相互独立,每种组合都经过了训练。如果传入这些集合之外的值,或改写系统提示词,输出可能会退化或乱码。需要注意的是一个小的不一致之处:Superwhisper 应用暴露的是一个五档语调滑块,增加了 “balanced”(均衡)预设,而开源权重文档记录的是四个已训练的 Styling 值。

该模型在设计上也受到约束。它不会添加你没说的内容、纠正事实、弱化粗话或改写方言。仅含语气词的输入会返回空字符串,集成时应将其视为有效结果。

两个会搞垮大多数集成的设置

第一,必须启用 enable_thinking=False 聊天模板沿用 Qwen3 的原始模板,而 Qwen3 默认开启思考模式。S1-mini 在训练时关闭了思考模式,因此助手回合必须以一个空的 <think> 块开头。省略该标志通常完全得不到可用输出。

第二,贪心解码。 generation_config.json 出厂设置 do_sample: false。GGUF 构建仍带有 Qwen3 继承的 temp = 0.6top_p = 0.95 和 top_k = 20 元数据,因此每次请求都要显式传入 temperature 0。在 llama.cpp 中,使用 --jinja 配合 --chat-template-kwargs '{"enable_thinking":false}',而不是 --reasoning-budget 0——后者会导致输出质量下降。

报告的评估结果

Superwhisper 在 7,519 条留出用例、104 条转录文本上对 S1-mini 进行了评估。使用 Q4_K_M 构建贪心解码,token 准确率为 94.8%,文本编辑错误率为 11.6%。在邮件格式文本上,它 99.3% 的情况下能正确识别问候行,97.9% 能正确识别落款行。它 97.6% 的情况下能匹配正确的输出结构(列表 vs 段落),92% 的情况下能生成精确的邮箱地址。不到 1% 的生成出现循环或截断,且在不应转录任何内容时,模型 98.6% 的情况下能正确地不输出。这些是厂商在内部测试集上报告的数字,非第三方结果。

两个云端模型

S1-Voice 是托管的语音转文本模型。Superwhisper 报告称转录速度最高可达说话时长的 46 倍,大多数 30 秒以内的听写在你停止后 0.32 秒内完成。在包括会议音频和财报电话会议在内的八个数据集上,平均词错误率为 6.8%,在 LibriSpeech 上降至 2.2%。Superwhisper 表示 6.8% 的平均值是它测试的 15 个模型中最低的,且 S1-Voice 在其综合指标上得分 83,而 WisprFlow 得分为 76。

S1-Language 是托管的指令跟随模型,用于清理、格式化和摘要,与 Anthropic、OpenAI 和 Groq 的模型一起出现在模型选择器中。推荐的默认搭配是:Cohere Transcribe 加 S1-mini 离线,或 S1-Voice 加 S1-Language 云端。

关键要点

  • S1-mini 是一个 0.6B 开源权重 ASR 输出文本规范化模型,不是转录器或聊天模型。
  • Q4_K_M GGUF 仅 462MB,可在笔记本 CPU 上运行,设备端部署切实可行。
  • 固定系统提示词加三轴控制线是唯一的控制机制。
  • enable_thinking=False 和 temperature 0 是必选项;大多数集成 bug 都源于这两项配置。

参考资料:
https://huggingface.co/superwhisper/s1-mini
https://superwhisper.com/blog/s1

本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/jishu/71307.html

(0)

相关推荐