论文解读|WavAlign:让语音模型既会“想”,也会“说”

端到端语音对话模型最让人头疼的地方,是“聪明”和“会说”常常互相拉扯。WavAlign 给出的答案很朴素:不要把同一个偏好奖励粗暴地砸到所有 token 上。把语义交给偏好优化,语音用 SFT 稳住,再通过 rollout 质量动态调权。

一句话总结:WavAlign 不是在语音上“更猛地做 RL”,而是让 RL 少管一点、管准一点。它把偏好优化限制在文本/语义通道,把语音 token 继续锚在监督学习分布里,从而减少 acoustic drift。

它到底想解决什么问题?

当前 spoken dialogue model 主要有两条技术路线:级联系统(ASR+LLM+TTS)稳定但体验割裂;端到端模型直接在语音输入、文本 token、语音 token 间联合建模,理论上更自然,也更容易保留语气、节奏、情绪等细粒度信息。

然而,端到端模型在做偏好优化时,奖励通常是稀疏的序列级信号,而语音生成却是密集的长 token 序列。把同一个奖励硬分给文本和语音,常见结果是:语义可能变好,但音色、韵律、自然度却开始漂移。

论文解读|WavAlign:让语音模型既会“想”,也会“说”
图1:统一 RL 目标在混合文本-语音输出上带来的三类失败模式

图1清晰展示了统一 RL 目标在混合文本-语音输出上的三类典型失败模式

  • 跨模态 trade-off:语义奖励和声学表现并不天然一致。一个回复可能“内容对”,但说出来的节奏、情绪、自然度变差。
  • 梯度能量不均衡:文本 token 的梯度能量更强,语音 token 得到的是弱而高方差的信号,共享参数更新时容易互相干扰。
  • 疏奖励被语音 token 稀释:语音 token 太密,序列级 reward 被摊薄后,credit assignment 很差,容易产生听感上的漂移。

图2进一步对比了 SFT 与 PO/RL 的 token 概率分布移动:SFT 能带来更大且更连贯的分布调整,而 PO/RL 更像是局部修正。这也正是 WavAlign 坚持保留 SFT 锚点的重要原因。

论文解读|WavAlign:让语音模型既会“想”,也会“说”
图2:SFT 带来更大且更连贯的分布移动;PO/RL 在稳定约束下更像局部修正

WavAlign 的做法:把任务分工拆开

WavAlign 的核心不是换一个更大模型,而是一套巧妙的后训练 recipe。它把训练目标清晰拆分:

  • SFT 负责所有 token:文本和语音都继续接受 teacher-forcing 监督,尤其确保语音分布维持在自然、可控的区域。
  • 偏好优化只管文本 token:GRPO 的偏好梯度被 mask 到语义文本通道,避免不可靠的声学奖励反向影响密集的语音 token。
  • 混合权重动态变化:只有当 rollout 中至少存在可接受样本,且候选之间有明显区分度时,才提高偏好优化的权重;否则继续更多依赖 SFT。

混合损失函数形式为:

L_hybrid(θ) = (1 – λ_t) × L_SFT(all) + λ_t × L_GRPO(text-only)

图3展示了 WavAlign 单阶段动态混合后训练的全貌:SFT 覆盖所有 token,GRPO 只覆盖文本 token;lambda gate 根据 reward 最大值和 reward 方差动态调节,并用 EMA 平滑。

论文解读|WavAlign:让语音模型既会“想”,也会“说”
图3:WavAlign 单阶段自适应混合后训练概览

动态 gate 怎么理解?

动态 gate 的设计非常务实:它通过两个信号控制 λt —— 一是 rollout 中是否至少有一个样本超过可接受质量阈值,二是候选样本的 reward 方差是否足够大。只有当候选有明显好坏差异时,RL 才值得更多参与。

论文设置 λmax=0.8,因此始终保留至少 20% 的 SFT 作为语音安全锚点,并使用 EMA(默认 α=0.9)平滑权重抖动。

图4、5、6进一步从奖励一致性、梯度几何关系、语义 vs 声学多样性等角度,验证了“语义偏好优化、语音监督锚定”这一分工的合理性。

论文解读|WavAlign:让语音模型既会“想”,也会“说”
图4:奖励模型在人类语义判断上的一致性强于声学判断,说明语义维度更适合承载偏好优化信号
论文解读|WavAlign:让语音模型既会“想”,也会“说”
图5:不同目标下文本与语音梯度的几何关系,支持“语义偏好优化、语音监督锚定”的分工
论文解读|WavAlign:让语音模型既会“想”,也会“说”
图6:重复采样中,语义维度的区分度通常高于声学维度,说明音频偏好信号更难稳定用于直接优化

实验结果:IQ 和 EQ 真的能一起涨吗?

该工作在两类端到端语音模型上验证:VITA-Audio 代表 interleaved 架构,KimiAudio 代表 parallel 架构。评价分成两条线:VoiceBench/OpenAudioBench 看智能与语义能力,VStyle 看表达力与声学控制。

论文解读|WavAlign:让语音模型既会“想”,也会“说”
论文解读|WavAlign:让语音模型既会“想”,也会“说”
表1:主实验的 IQ 结果。Ours(Dynamic)在 VITA 和 KimiAudio 两个架构上都拿到最强或接近最强的综合表现

消融实验:最关键的结论

最有说服力的还是消融实验(见表2)。只做动态权重不够,如果优化范围仍然是 all tokens,IQ/EQ 只有 48.84/2.50;把范围限制到 text tokens 后,固定 0.5/0.5 已经提高到 52.60/2.60;最终加入动态权重和 EMA,达到 55.24/2.92。

在 EQ 维度和消融实验上,论文给出了更细致的对比。下面三张表格完整呈现了相关结果:

论文解读|WavAlign:让语音模型既会“想”,也会“说”
表2:VITA 与 KimiAudio 两种架构上的 EQ 主结果。动态混合目标在四项表达力指标上取得更均衡的表现
论文解读|WavAlign:让语音模型既会“想”,也会“说”
表3:scope、固定/动态权重与 EMA 的消融结果。重点不是“RL 越多越好”,而是“什么时候让 RL 进来,以及它更新哪些 token”
论文解读|WavAlign:让语音模型既会“想”,也会“说”
表4:人工主观评测中,Ours 在 helpfulness 和 naturalness 上均显著优于 baseline

结语

WavAlign 的核心贡献,不是提出一个更激进的语音 RL 方案,而是重新划分不同训练信号的职责:偏好优化负责改善文本语义,SFT 负责维持语音生成的自然度和稳定性,再根据 rollout 是否可靠动态决定两者的混合比例。

这带来三点重要启示:

  • 优化范围比优化强度更重要:将偏好梯度限制在文本 token,能有效减少稀疏奖励对密集语音 token 的错误归因。
  • IQ 与 EQ 不必二选一:为不同模态保留合适的学习机制,语义能力和表达力可以同时提升。
  • 动态 gate 是稳定器:只有在 rollout 可靠且可区分时,才让偏好优化发挥更大作用。

更广义地看,WavAlign 为多模态后训练提供了一条值得借鉴的设计原则:在复杂模态混合场景下,不要假设同一个序列级奖励能同等指导所有 token。先判断奖励在哪个模态上更可信,再决定梯度应该作用在哪里,往往比简单扩大 RL 规模更有效。


相关文献参考:

[1] Rafailov, R. et al. 2023. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS.

[2] Lee, H. et al. 2023. RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.

[3] Guo, D. et al. 2025. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.

[4] Long, Z. et al. 2025. VITA-Audio: Fast Interleaved Cross-Modal Token Generation for Efficient Large Speech-Language Model. arXiv:2505.03739.

[5] Ding, D. et al. 2025. Kimi-Audio Technical Report. arXiv:2504.18425.

[6] Li, Y. et al. 2026. WavBench: Benchmarking Reasoning, Colloquialism, and Paralinguistics for End-to-End Spoken Dialogue Models. arXiv:2602.12135.

[7] Lu, J. et al. 2026. Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness. arXiv:2603.14889.

[8] Zhang, D. et al. 2024. SpeechAlign: Aligning Speech Generation to Human Preferences. NeurIPS 37.

版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。

(0)

相关推荐