技术文章
-
缓解 TTS 的重复与漏读:用注意力引导消除语音合成中的稳定性幻觉
近年来,基于大语言模型的语音合成技术快速发展。在普通文本上,模型已经能够稳定生成自然度很高、音色也足够相似的语音。然而,一旦遇到复杂生僻词、排比句或连续重复结构,重复、漏读甚至无限…
-
TF-MossFormer:鱼与熊掌亦可兼得?在单通道语音分离中同时捕捉“局部细节”与“全局依赖”
近年来,单通道语音分离技术犹如一场精彩的接力赛,从 Conv-TasNet 的精巧卷积,DPRNN 的深度循环,到 SepFormer 和 MossFormer 的 Transfo…
-
编码器的权利要求与标准必要性:为什么类别排除会失败
编码器权利要求是否属于标准必要专利(SEP)?本文分析阐述了标准必要性、FRAND义务、语法权利要求、优化权利要求以及对专利池的影响。
-
流媒体的下一个挑战不是视频质量,而是传输效率
在流媒体时代的大部分时间里,创新的衡量标准一直是观众能看到什么。多年来,整个行业致力于提升画质,并在各类屏幕上打造更丰富的观看体验,从标清到高清和4K,再到预定节目和直播内容。这一…
-
Black Forest Labs发布FLUX 3:用于图像、视频、音频和机器人动作预测的多模态流模型
Black Forest Labs (BFL) 发布了FLUX 3,这是一个多模态基础模型,可在单一架构内学习图像、视频和音频。它也是首个仅使用一组权重即可实现视频、音频和动作预测…
-
以人为本的设备与始终在线的边缘 AI 音频的兴起
语音功能已正式突破智能音箱的局限。随着 AI 更深入地融入日常电子产品,音频已成为人机之间主要的、直接的交互界面。如今的消费者和企业用户期望设备能够自然地响应语音指令,即时适应复杂…
-
QUIC作为WebRTC中的多路复用层-QUIC as Multiplexing Layer in WebRTC
本论文探讨了将QUIC协议用作 WebRTC统一传输层的潜力,以改善媒体流和数据流的共存方式。当前的 WebRTC 架构通常依赖相互独立且缺乏协调的协议栈来进行视频传输和文件共享,…
-
MediaCodec 异步编码 + Buffer 管理:Claude Code 写防抖生产者消费者模型
MediaCodec 异步模式性能好,但线程模型复杂——输入队列满导致丢帧、输出 Buffer 忘了 release 造成泄漏、停止时 crash。本文用 Claude Code …
-
论文解读|WavAlign:让语音模型既会“想”,也会“说”
端到端语音对话模型最让人头疼的地方,是“聪明”和“会说”常常互相拉扯。WavAlign 给出的答案很朴素:不要把同一个偏好奖励粗暴地砸到所有 token 上。把语义交给偏…
-
现代语聊房背后的技术栈:API、云基础设施与实时数据
很少有哪个面向消费者的行业能像语聊房一样把实时通信技术应用到极限。每一路音频流、每一个礼物动效、每一次实时互动背后,都隐藏着令任何实时音视频开发工程师都似曾相识的基础设施挑战:海量…
-
如何策略性地驾驭视频编码领域,最大限度地降低许可和诉讼成本:AV2 的最佳 IP 管理实践
大多数重大编解码器专利纠纷最终都以相同的方式告终:要么达成许可协议,要么私下和解。在最关键的问题得到解答之前,公开记录就已经结束了,而这个问题的关键在于,涉案专利是否经得起有效性挑…
-
阿里团队自研 AOQ 协议,为多模态 AI 构建确定性传输底座
随着大模型向多模态全面演进,AI 应用正从云端走向终端。端侧公网“最后一公里”的网络波动与 AI 推理所需要海量数据的实时传输需求之间,存在较大的冲突,会使得模型的推理效果以及用户…
-
ResULIC:语义残差编码与压缩感知扩散的超低码率图像压缩 | ICML 2025
图像压缩的核心目标是在尽可能低的码率下保留尽可能高的视觉质量。近年来,学习式图像压缩方法在客观指标和主观感知质量上取得了显著进展,但在极低码率场景下仍面临明显挑战:传统率失真优化方…
-
【技术前沿】音视频开发者如何看待英伟达推出合成视频检测器NIM?
英伟达推出合成视频检测器NIM,逐帧识别AI视频能否成为内容平台的可靠审核工具?站在视频开发的角度如何看待这个部分呢?
-
视频在线问诊解决方案 2026:完整功能指南与集成建议
视频在线问诊已成为远程医疗的基础设施,一套完整的解决方案应覆盖实时音视频通话、设备与网络检测、消息互动、屏幕共享和录制回放五大能力,选型时优先关注端到端延迟、弱网表现、音视频加密合…
-
WebRTC 如何悄然重塑了网络上的实时视频
实时视频曾经是一件既繁重又脆弱的事情。十年前,要在屏幕上实时显示两张脸,需要浏览器插件、专用服务器,还得忍受如今我们无法接受的延迟。那些曾经规划光纤路线、建模信号覆盖范围的工程师们…
-
FlashTTS:面向实时语音对话的低时延流式语音合成 | Interspeech 2026
近年来,基于大语言模型(LLM)的文本转语音技术快速发展,基于大语言模型(LLM)的TTS方案已经在自然度、音色相似度和零样本音色克隆(zero-shot voice clonin…
-
移动端视频编码参数速查:Claude Code Skill 一键查询最佳配置
编码参数选错,轻则画质下降,重则用户投诉「视频模糊」。但 iOS VideoToolbox 和 Android MediaCodec 的参数体系完全不同。本文写一个 Claude …
-
阿里通义Wan-Streamer v0.2:响应延迟仅550ms,让 AI 真正与你”面对面”
和 AI 打视频电话,卡顿、延迟、声画不同步,是常态。 这本质上就是“语音识别 ➡️ 大模型 ➡️ 语音合成 ➡️ 动画驱动”的流水线拼装。环节越多,延迟越高,割裂感越强。 但真正…
-
生成式通信 GenCom:面向 6G 网络的新范式
近期,上海交通大学张文军院士团队在IEEE Wireless Communications Magazine上系统性阐述了面向 6G 网络的生成式通信(Generative Com…