以 GPT-4o、Moshi、GLM-4-Voice、Qwen-Omni 为代表的端到端语音大模型(SLM)正在推动人机交互迈向“开口即对话”的新阶段。然而,在需要精确、结构化推理的场景下——尤其是口语数学问答——语音大模型的表现仍显著落后于纯文本 LLM。
根源在于语音模态自身的表达瓶颈、现有模态链方案的效率代价,以及简单降本的不可行。如何在保持推理能力的同时大幅压缩中间 Token 开销,成为 SLM 走向真正智能交互的核心问题。本文解读的 ECoM Reasoning 正是对这一问题的系统性回答。
三重挑战:语音大模型为什么”想不清楚”
语音大模型在处理口语数学问答等结构化推理任务时,面临三重递进式挑战:
第一重:语音模态自身的表达瓶颈。纯语音推理需要将数学表达式口语化(例如将”x+5y=0″读作”x加五y等于零”),这种表述远不如符号化文本直观,大幅增加了模型理解和推理的难度;
第二重:现有模态链方案的效率代价。当前的模态链(Chain-of-Modality, CoM)架构虽然通过在语音生成前插入文本推理来缓解这一问题,但完整的推理链带来了大量文本Token开销,直接导致语音首帧延迟过长;
第三重:简单降本的不可行。如果简单地在推理时截断推理来降低成本,模型的推理能力会急剧崩溃。实验表明,将CoM Reasoning的Token预算限制到30个时,在MultiArith数据集上的准确率从63.40%骤降至5.17%。
三重挑战叠加之下,让 SLM 既”想得清楚”又”说得快”,不再只是一个工程优化目标,而是语音大模型走向真正智能交互必须跨越的核心门槛。
ECoM Reasoning:首个将压缩推理引入 SLM 的端到端语音交互范式
本研究提出 Efficient Chain-of-Modality Reasoning(ECoM Reasoning),其核心思想是:与其让中间文本成为一段”完整思维链的转录”,不如让它成为一段”高信息密度的压缩推理表示”,同时服务于语音生成和问题求解。
从 CoM 到 ECoM Reasoning 的交互范式

如图,不加推理的 Standard CoM 范式,生成链路为:
系统与任务设定 + 用户语音 → 用户语音转写文本 → 回答文本 → 回答语音
在这一范式下,输入 SLM 的序列由”系统与任务设定”与”用户语音”拼接而成,模型自回归生成的序列则依次为”用户语音转写文本 → 回答文本 → 回答语音”,先把用户的语音转写成文本,再直接写出回答文本,最后合成用户真正听到的音频。
带完整推理链的 CoM Reasoning 范式,中间插入了完整推理文本:
系统与任务设定 + 用户语音 → 用户语音转写文本 → 完整推理文本 → 回答文本 → 回答语音
输入 SLM 的序列与 Standard CoM 保持一致,但模型生成的序列被扩展为“用户语音转写文本 → 完整推理文本 → 回答文本 → 回答语音”,即模型在写出回答文本之前,先显式地生成一段完整的自然语言推理,作为回答的中间监督与思考支撑。
而 ECoM Reasoning 则将 SLM 的生成链路重构为:
系统与任务设定 + 用户语音 → 压缩推理文本 → 回答文本 → 回答语音
在 ECoM Reasoning 中,模型自回归生成的序列则精简为”压缩推理文本 → 回答文本 → 回答语音”——用户语音转写这一步被整体省略,完整推理被压缩为一段高密度的关键 Token 序列,随后直接产出回答文本并合成语音。相较 CoM Reasoning,生成端少了一个环节(用户语音转写文本),并把最长的一段(完整推理文本)压至 40% 长度,从而实现”输入不变、生成更短”的推理链重构。
压缩数据是如何构造的
ECoM Reasoning 对两类中间文本采用不同的压缩策略:
- 用户文本 ( User Text ) :句子级压缩。经过渐进式训练后,模型已经具备鲁棒的口语理解能力,即使完全移除转写文本,语音理解性能也不会下降。
- 推理文本 ( Reasoning Text ) :Token 级保守压缩。采用 LLMLingua-2 作为 Token 重要性评估器(无需修改主干 LLM 架构),保留高重要性 Token,删除冗余 Token。
一个典型示例:
原始推理:The number of books in the bin is 41 − 33 = 8 books. After adding 2 books, the number of books in the bin is 8 + 2 = 10 books. The answer is 10.
压缩至 40%:bookstore sold 33, 41 − 33 = 8, put 2, 8 + 2 = 10. The answer is 10.
在保留核心推理骨架的同时,语言冗余被显著剥离。
训练策略是如何设计的
如果直接从零训练 ECoM Reasoning,模型需要同时学会”口语理解 + 语音生成 + 压缩文本上的推理”三件难事,收敛困难,性能显著下滑。

受课程学习启发,作者提出三阶段渐进式训练(如图):
- Stage 1 — Standard CoM:仅使用不含显式推理的语音对话与口语问答数据,建立基础的语音理解与语音生成能力。
- Stage 2 — CoM Reasoning:引入含完整推理链的监督信号,让模型先掌握”完整思考”的能力。
- Stage 3 — ECoM Reasoning:将完整的中间文本替换为压缩表示,将已有推理能力”蒸馏”到高密度的压缩形式中。
这种”先学会完整思考,再学会精炼表达”的顺序,被消融实验证明是最优课程编排。
实验结果:40% 的 Token,换来更高的准确率
那么,实际效果如何?作者在 AddSub、SingleEq、MultiArith、SVAMP 四个数学推理数据集上进行了系统对比实验,关键结论如下:

- 高准确率:ECoM Reasoning 相较不加推理的 Standard CoM 提升 21%,相较带完整推理链的 CoM Reasoning 也有所提升( 3%);
- 低成本:ECoM Reasoning 仅使用 CoM Reasoning 约 40% 的文本 Token 预算(30.21 vs 96.56);
- 低延迟:在流式推理模式下,ECoM Reasoning首个语音Token延迟从4.90秒降至1.60秒,满足口语对话的实时性;
消融实验进一步表明,40%的压缩率是最优选择——适度压缩去除了冗余Token,保留了核心推理路径;而过度压缩(如20%)则会导致关键推理信息丢失。研究还发现,渐进式训练有助于模型学习压缩推理,其使模型隐藏层与完整CoM模型保持高度相似。
方案价值:让 SLM 走向”高准确率 + 低成本 + 低延迟”
ECoM Reasoning 面向语音大模型在口语数学问答中的应用场景,通过压缩推理与渐进式训练,在保持甚至提升准确率的前提下,将文本 Token 用量减少至 40%,显著降低推理成本与延迟。具体解决:
- 纯语音推理难以处理结构化信息:通过引入高密度压缩文本,作为语音生成的引导表征与推理载体的”双重身份”,让符号级推理能力回到语音交互链路中。
- 传统模态链推理效率低下、成本高昂:将中间文本从”完整思维链转录”重构为”高信息密度压缩表示”,Token 消耗从 96.56 降至 30.21,首帧延迟从 4.90s 降至 1.60s。
- 直接训练压缩推理导致模型性能下降:通过 Progressive Compression 三阶段课程学习,先建立完整推理能力,再将其蒸馏到压缩表示中,使模型在压缩后仍保持稳定的推理表现。
结语
语音大模型的未来,绝不只是”能听清、能开口”,而是能在你说完话的一瞬间,把复杂的问题想明白,然后用最自然的语气告诉你答案。
ECoM Reasoning 想做的,正是给这些”会说话的 AI”装上一颗更轻、更快、更聪明的推理大脑,让它在实时对话中不再犹豫,不再啰嗦,不再答非所问。
这一步实现,人机对话的边界又会往前推进一点。
相关文献参考:
[1] Tongyi Fun Team, Qian Chen, Luyao Cheng, Chong Deng, Xiangang Li, Jiaqing Liu, Chao-Hong Tan, Wen Wang, Junhao Xu, Jieping Ye, et al. 2025. Fun-AudioChat Technical Report. arXiv preprint arXiv:2512.20156 (2025).
[2] Zhuoshi Pan, Qianhui Wu, Huiqiang Jiang, Menglin Xia, Xufang Luo, Jue Zhang, Qingwei Lin, Victor Rühle, Yuqing Yang, Chin-Yew Lin, et al. 2024. Llmlingua-2: Data distillation for efficient and faithful task-agnostic prompt compression. In Findings of the Association for Computational Linguistics: ACL 2024. 963–981.
[3] Ziyang Ma, Guanrou Yang, Wenxi Chen, Zhifu Gao, Yexing Du, Xiquan Li, Zhisheng Zheng, Haina Zhu, Jianheng Zhuo, Zheshu Song, et al. 2026. SLAMLLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing. IEEE Journal of Selected Topics in Signal Processing (2026).
[4] Wenxi Chen, Ziyang Ma, Ruiqi Yan, Yuzhe Liang, Xiquan Li, Ruiyang Xu, Zhikang Niu, Yanqiao Zhu, Yifan Yang, Zhanxun Liu, et al. 2025. Slam-omni: Timbrecontrollable voice interaction system with single-stage training. In Findings of the Association for Computational Linguistics: ACL 2025. 2262–2282.
[5] Ruiqi Yan, Xiquan Li, Wenxi Chen, Zhikang Niu, Chen Yang, Ziyang Ma, Kai Yu, and Xie Chen. 2025. URO-Bench: Towards Comprehensive Evaluation for End-to-End Spoken Dialogue Models. arXiv preprint arXiv:2502.17810 (2025).
版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。