技术文章
-
Netflix 发布 VMAF v1:一场更接近“VMAF 2.0”的更新
如果只看命名,VMAF v1 很容易被误解成一次常规模型迭代。但结合 Netflix 官方技术博客《VMAF v1: Good Is Not Good Enough》和 Netfl…
-
使用基于 TLS 和 SRTP 的 SIP 协议保护 VoIP 通信
语音和视频通信承载着组织中最敏感的一些对话,但支持这些通信的系统通常被视为普通的网络流量,从而造成了攻击者可能利用的安全漏洞。 在后台,信令消息负责建立和控制会话,而独立的媒体流则…
-
AI 编码能否重塑压缩技术?探讨编解码领域的未来发展趋势
四十年来,视频编码一直沿用传统的编解码器,从MPEG 1和2,到H.264高清过渡,再到H.265的4K时代,以及后来的VVC/H.266。如今,AI 正在席卷广播电视领域,纯 A…
-
5G和低延迟云基础设施如何助力直播平台发展
第五代移动通信技术和去中心化云计算的结合,从根本上改变了实时数字内容的传输方式。过去,观众或许会接受几秒钟的延迟,而如今的基础设施已将延迟降低到毫秒级。 高带宽的5G网络与云服务器…
-
WebRTC在语音AI中的应用:2026年传输层的工作原理及其发展趋势
本文描绘 2026 年语音代理底层传输层的图谱:实际可选方案有哪些、当前参与者使用什么、WebRTC 目前的表现如何,以及目前尚未有人进行的调整将在哪些方面发挥作用。
-
CoCoEmo:面向人类式复杂情感表达的可组合、可控语音合成框架 | ICML 2026
CoCoEmo是一种轻量、可组合、可控的情感语音生成框架。不同于重新训练模型或设计复杂 emotion prompt,CoCoEmo 直接在预训练 hybrid TTS 模型的中间激活空间中注入 emotion steering vector,从而引导模型生成目标情感表达。
-
【论文解读】BareWave:扔掉声码器,让 AI 语音复刻“一步到位”
近年来,零样本语音复刻技术快速发展,AI 已经能够仅凭一段文本和一小段参考音频,合成出自然度颇高的目标说话人语音。然而,在生成质量持续提升的同时,一个更基础的问题仍未被认真回答: …
-
【音视频】AudioRecord + AudioTrack 低延迟采集
Android 音频 API 看似简单,实则暗藏杀机:回调线程搞错、Buffer 不归还导致无声、录制播放切换时 crash。本文用 Claude Code 写一个线程安全、支持低…
-
AI时代的大规模直播质量控制:与 Interra Systems 的 Anupama Anantharaman 的问答
与直播工作流中其他复杂且影响重大的环节一样,关于人工智能(AI)和机器学习(ML)在直播监控与质量控制中的应用、功能及局限性,存在诸多疑问。虽然在质量保证方面,某些环节仍无法替代人…
-
使用多画面流媒体技术,掌控全局
体育蕴含着千百种故事。无论哪项运动的粉丝,都能滔滔不绝地谈论那些“大卫与歌利亚”式的史诗对决、邪恶的对手,以及那些令我们着迷的“白手起家”式励志故事。这些故事在每一项赛事中都会上演…
-
LMM-VSC:基于语义理解的超低比特率视频压缩 | ISCAS 2026
近年来,超低码率视频压缩已成为一个关键的研究领域。然而,现有的视频压缩方法在超低码率下难以保持足够的性能,这通常表现为感知质量下降,包括细节丢失、纹理模糊和图像伪影,以及重建视频与…
-
Arxiv | MagiCodec:高斯噪声注入与多阶段训练实现高保真可建模音频编码
本文提出 MagiCodec,一个单层、流式Transformer音频编解码器,通过多阶段训练 + 高斯噪声注入 + 隐空间正则化,显式提升token的语义表达能力,同时保持高保真重建。
-
即构 ZIM 重磅推出社群(Community)能力!
社群(Community)是基于 ZEGO IM(ZIM) 新支持的即时通讯能力,可以协助开发者搭建类 Discord 的实时互动社区。满足游戏玩家、兴趣小组、粉丝运营、教育培训等…
-
【音视频】CameraX 预览帧率波动
CameraX 简化了 Android 相机开发,但也埋了不少坑——预览帧率莫名其妙掉到 15fps、分析帧堆积导致 OOM、后台回来画面卡死。本文用 Claude Code 帮你…
-
Meta:在实时通信(RTC)领域大规模采用 AV1
Meta在实时通信中采用AV1是一项历时数年的工作,本文将分享在部署 AV1 和扩大覆盖范围时遇到的技术和运营挑战,以及 Meta 如何解决这些挑战以实现实时通信。
-
Gradium推出stt-translate和s2s-translate,实时语音翻译模型在准确率和延迟方面均优于gpt-realtime-translate
Gradium 发布了两款实时语音翻译模型:stt-translate和s2s-translate。这两款模型均支持五种语言,并将结果实时显示在浏览器中。 Gradium 声称其准…
-
是否应该购买实时音视频云服务?2026 年 RTC 自建与采购决策指南
一句话总结:绝大多数 App 开发团队应该购买实时音视频云服务而不是自建。自建一套生产级的实时通信系统至少需要 8~12 个月和 10 人以上音视频团队,而采购成熟 SDK 最快 …
-
主流的开源 VoIP 计费软件讨论
基于开源的VoIP项目很多,眼花缭乱。这些开源软件包括协议栈,开发包,底层引擎,管理界面,测试工具,软电话终端等等形态,很多项目已经实现了产品化,但是开源计费项目始终不瘟不火。笔直…
-
如何使用 NVIDIA Canary-1B-v2 在 Python 中实现 ASR、翻译和自动 SRT 字幕导出
本文将使用NVIDIA Canary-1B-v2构建一个语音识别和翻译工作流程。首先,我们将设置所需的音频、NeMo、NumPy 和 SciPy 依赖项,然后在支持 GPU 的运行…
-
ZLMediaKit 接收/处理PS流分析
ZLMediaKit 接收/处理PS流分析:使用AI开发了一个安卓GB28181推流APP,采集手机音视频进行编码压缩然后封装为PS流遇到的问题分析。