技术文章
-
多人会议中如何突出某个发言人的声音:ZEGO 混流焦点语音方案详解
摘要:多人实时会议中,重要发言人的声音常被其他参会者淹没。本文介绍了ZEGO 实时音视频 SDK (ZEGO Express SDK) 的混流焦点语音(Focus Voice)方案…
-
ECCV 2026 | NeFIC:用“下一帧预测”重新定义超低码率图像解码
本文提出了一种面向超低码率图像压缩的新型生成式解码范式 NeFIC。与现有方法主要依赖图像扩散模型从高斯噪声出发、通过控制信号逐步生成重建图像不同,NeFIC 首先解码出一张保留场…
-
模型上新|Qwen-Audio-3.0-Realtime 如何让语音交互“懂倾听,更聪明”?
语音交互的下一个形态是什么?是毫秒级的快速响应?是深度思考的逻辑推理?还是能够感知情绪、像真人般对谈的情感共鸣?如何让语音交互跨越“机械感”走向了“自然和智能”?我们也在持续探索。…
-
如何在 Web 端搭建互动直播平台:推流、连麦、混流、聊天完整教程
在 Web 端搭建一个功能完整的互动直播平台,核心需要实现推流、拉流、连麦、混流、聊天五个模块。本教程以 ZEGO Express Web SDK 为例,从零开始逐步讲解实现流程。…
-
用 ONNX Runtime 在 WebRTC 客户端中集成实时的 AI 语音降噪与视频超分辨率
在实时通信(RTC)领域,传统的音视频处理算法(如基于经典信号处理的 WebRTC NS 降噪、双线性插值缩放)正逐渐遭遇瓶颈。随着端侧算力的释放与轻量级神经网络(轻量化 CNN/…
-
Interspeech2026 | MSU-Bench:多说话人对话理解评测基准
近年来,音频语言模型(Audio Language Model, ALMs)推动语音理解从传统单任务系统走向统一的音频到文本生成范式。在这一框架下,说话人验证、语音识别、说话人识别…
-
STAR-VAE:让音频潜在空间「按信息重要性」排列,重建与生成双双达到 SOTA
阿里团队的最新研究 STAR-VAE 已被机器学习顶级会议 ICML 2026 接收。这项工作聚焦音频生成中一个长期被忽视、却决定效果上限的底层环节——音频 VAE(连续 toke…
-
为什么每个机器人远程操作团队最终都会超越 WebRTC 的范畴
我们看到的几乎所有远程操作项目都是这样开始的:团队中的某个人找到 WebRTC 文档,让两台笔记本电脑之间连接网络摄像头,将其连接到机器人,然后在办公室演示远程操控。 但当机器人离…
-
CVPR 2026 | 重思基于扩散模型的视频超分辨率:利用对齐特征的稠密引导 DGAF-VSR
本文提出 DGAF-VSR,一种基于扩散模型的视频超分辨率方法,针对现有技术在感知质量、重建保真度和时序一致性之间难以兼顾的挑战,通过关键观察发现特征域比像素域更适合提供稳定的时序…
-
Janus WebRTC 服务器的扩展:构建媒体资源代理
Janus WebRTC 服务器扩展到多个实例并将会议室分布在服务器池中时,会面临新的挑战。本文将介绍如何构建媒体资源代理以及如何扩展其背后的实例池。
-
搜狐技术:未读消息数系统设计
在互联网海量信息传播的背景下,大数据量、高频率更新场景中的未读消息数计算与提醒,成为考验系统性能与用户体验的关键问题。 作者:赵勇来源:搜狐技术产品原文:https://mp.we…
-
阿里视频云:视频点播成本优化实战
为短视频、直播回放、在线教育等业务提供端到端的视频点播成本优化方案,覆盖转码模板配置、存储策略降冷、ABR 播放器集成,帮助在保证播放体验的前提下系统性降低账单支出。 作者:逸良来…
-
Vulkan 光线追踪:逐步弃用主机端加速结构构建
Vulkan® 正在逐步淘汰主机端光线追踪加速结构构建命令,转而采用单一的、基于设备地址的路径。这使得 Vulkan 光线追踪与 DirectX 光线追踪的发展方向、现代引擎架构以…
-
ICLR 2026 | 基于视觉自回归模型的前馈式主体驱动图像生成算法 EchoGen
中国科学技术大学与淘天集团-音视频技术团队在 ICLR 2026上提出的 EchoGen,作为首个基于视觉自回归模型的前馈式主体驱动图像生成框架,通过创新的双路径主体注入策略(解耦…
-
WebRTC SEI帧透传实现 + 高CPU负载深度优化
在WebRTC实时视频开发中,普遍存在两大痛点:无法传递帧级自定义元数据,难以实现视频溯源与精准帧对齐;高清高帧率编码场景下服务CPU占用过高,极易引发卡顿、延时抖动、服务不稳定等…
-
移动端视频裁剪/旋转/缩放:Claude Code 写跨平台 FFmpeg 封装
FFmpeg 是音视频瑞士军刀,但在移动端集成——交叉编译、JNI 桥接、Swift 封装,每一步都是坑。本文用 Claude Code 写一个双端统一的 FFmpeg 视频编辑封…
-
NVIDIA 发布 Audex (Nemotron-Labs-Audex-30B-A3B):一种统一的音频-文本大语言模型
NVIDIA 发布了Audex(Nemotron-Labs-Audex-30B-A3B),这是一个统一的音频-文本大型语言模型。它能够理解和生成音频和语音,并保留了其核心的文本智能…
-
多视角视频市场格局:流媒体架构如何决定成败
Multiview(多视角)即在同一屏幕上同时观看两路、三路或四路直播信号,正在成为体育直播中的核心能力。决定 Multiview 成败的关键并不只是“是否支持多画面”,而是采用怎…
-
如何降低流媒体服务的总拥有成本
如今,观众观看视频的频率比以往任何时候都高,视频领域的竞争也急剧加剧。这促使视频服务提供商不断创新,力求满足消费者对高质量、流畅流媒体体验的需求。 在此背景下,过去几年感受到的财务…
-
ICML 2026 Spotlight|快手联合中科院软件所提出业界首个隐喻视频理解基准与方法
在短视频与社交媒体盛行的今天,越来越多的创作者不再直白地表达观点,而是借助隐喻来传递深层意涵。一段画面里,一群身着燕尾服、戴着法官帽的猪在豪华宴会上大快朵颐,桌子底下的猫却在争抢残…