
音频技术认证作者
-
StreamWSR:一种面向实时场景的轻量级语音超分辨率方案
在实时通信、语音交互和音频修复等场景中,语音超分辨率(Speech Super-Resolution, SR)技术扮演着重要角色——它能够从低采样率的语音信号中重建丢失的高频成分,…
-
Qwen Audio:复杂人声干扰下,如何让 ASR “听对人”
在安静环境里,语音识别的问题很直接:用户说什么,模型就转录什么。但在会议、车内或咖啡厅里,用户的声音经常会和旁人交谈一起进入麦克风。 假设用户说“打开导航”,旁边的人同时说“我们明…
-
面向语音与实时智能体的最低延迟推理 API:一份以首 Token 时间(TTFT)为先的基准测试
首 Token 时间(Time to first token,TTFT)是团队在为语音场景挑选推理 API 时使用的指标,也是最容易误导他们的指标。TTFT 标记的是生成开始的时刻…
-
VoxCPM:无需分词的开源 TTS 系统
无需分词,即可实时克隆人声!VoxCPM 是一个开源TTS文本转语音系统,它在连续空间中建模语音,而不是使用离散 token。 大多数 TTS 系统会在生成前将语音转换为离散 to…
-
FlexiSLM:支持 4-12.5Hz 可变、动态帧率的端到端语音大模型
FlexiSLM 带来的意义,并不只是“又做了一个更低帧率的语音模型”。我们觉得它的价值在于,为 Speech LLM 引入了一种新的部署范式。
-
AI 语音技术如何改变你的沟通方式
语音技术曾经给人一种噱头的感觉。你问手机一个问题,得到一个似是而非的答案,然后就结束了。如今,AI 语音工具正在重塑你的工作、学习、创造和沟通方式。这种转变意义重大,因为说话比打字…
-
不用出声也能聊天?苹果公开一项无声语音识别专利
地铁里、会议室中、医院病房内——很多场合我们都需要“说点什么”,却又不便发出声音。 苹果公司近日公开了一项专利申请(WO2026159706A1),提出一种默声语音检测方案:用户在…
-
论文解读|ECoM-Reasoning:让端到端的语音大模型学会轻量级推理
以 GPT-4o、Moshi、GLM-4-Voice、Qwen-Omni 为代表的端到端语音大模型(SLM)正在推动人机交互迈向“开口即对话”的新阶段。然而,在需要精确、结构化推理…
-
MeanVC 2:面向低延迟与鲁棒性的流式零样本语音转换
零样本语音转换旨在保留语音语言内容的同时,将源说话人音色迁移至任意未见过的目标说话人。随着实时通信、直播互动、在线会议、游戏语音等应用场景的发展,语音转换系统对低延迟、轻量化和高保…
-
缓解 TTS 的重复与漏读:用注意力引导消除语音合成中的稳定性幻觉
近年来,基于大语言模型的语音合成技术快速发展。在普通文本上,模型已经能够稳定生成自然度很高、音色也足够相似的语音。然而,一旦遇到复杂生僻词、排比句或连续重复结构,重复、漏读甚至无限…
-
以人为本的设备与始终在线的边缘 AI 音频的兴起
语音功能已正式突破智能音箱的局限。随着 AI 更深入地融入日常电子产品,音频已成为人机之间主要的、直接的交互界面。如今的消费者和企业用户期望设备能够自然地响应语音指令,即时适应复杂…
-
XMOS推出搭载先进AI语音处理的VocalFusion XVF3620
XMOS 发布了新一代语音处理器 VocalFusion XVF3620,它将 AI 降噪技术与完整的片上语音处理流程相结合,即使在嘈杂、混响和动态环境中也能提供可靠的语音采集。该…
-
FlashTTS:面向实时语音对话的低时延流式语音合成 | Interspeech 2026
近年来,基于大语言模型(LLM)的文本转语音技术快速发展,基于大语言模型(LLM)的TTS方案已经在自然度、音色相似度和零样本音色克隆(zero-shot voice clonin…
-
STAR-VAE:让音频潜在空间「按信息重要性」排列,重建与生成双双达到 SOTA
阿里团队的最新研究 STAR-VAE 已被机器学习顶级会议 ICML 2026 接收。这项工作聚焦音频生成中一个长期被忽视、却决定效果上限的底层环节——音频 VAE(连续 toke…
-
CoCoEmo:面向人类式复杂情感表达的可组合、可控语音合成框架 | ICML 2026
CoCoEmo是一种轻量、可组合、可控的情感语音生成框架。不同于重新训练模型或设计复杂 emotion prompt,CoCoEmo 直接在预训练 hybrid TTS 模型的中间激活空间中注入 emotion steering vector,从而引导模型生成目标情感表达。
-
【论文解读】BareWave:扔掉声码器,让 AI 语音复刻“一步到位”
近年来,零样本语音复刻技术快速发展,AI 已经能够仅凭一段文本和一小段参考音频,合成出自然度颇高的目标说话人语音。然而,在生成质量持续提升的同时,一个更基础的问题仍未被认真回答: …
-
Arxiv | MagiCodec:高斯噪声注入与多阶段训练实现高保真可建模音频编码
本文提出 MagiCodec,一个单层、流式Transformer音频编解码器,通过多阶段训练 + 高斯噪声注入 + 隐空间正则化,显式提升token的语义表达能力,同时保持高保真重建。
-
世界杯的音频挑战:一场比赛,一次混音
在澳大利亚,接线板被称为“tail board”。在英国,负责摄像机音频匹配的工程师通常被称为“racker”,而不是“shader”。 在国际足联世界杯上,这些差异会迅速消失。 …
-
AI 语音技术如何在数字娱乐领域崭露头角
AI 迅速重塑了科技世界,无论是在现代娱乐领域还是在数字文化领域。虽然大多数讨论都集中在 AI 生成的图像和文本工具上,但 AI 语音已成为一项新兴技术,正在改变人们创作、消费乃至…
-
Syntiant 确认收购 Orosound 和 AudioSourceRE,以推进边缘智能音频技术发展
2026年6月15日,Syntiant Corp. 确认了两项重要的战略收购。Syntiant 收购了 Orosound 和AudioSourceRE,为其机器学习模型组合增添了先…