技术文章
-
WebRTC 不会改善你的通话质量,可观测性才会
WebRTC 的通话质量与其他 VoIP 协议相当,但真正的问题往往在于 WebRTC 可观测性,而非协议本身。可观测性让你能够快速定位问题,实现高效排障和更优质的服务。
-
为世界杯直播提供全球大规模技术支持需要什么:专访 Deltatre 首席运营官 Gilles Mas
今年的 FIFA 世界杯是有史以来观看人数最多的一届。在比赛进行的一个月里,全球数百万观众一场接一场地收看比赛,在本地和全球层面不断刷新收视纪录。 尽管收视率创下历史新高,并且有史…
-
VVC视频编码最新进展:JVET近10次会议的2843篇提案文档分析
本文基于JVET(联合视频专家组)官方文档管理系统:https://jvet-experts.org,对最近10次会议(2024.07~2026.10)共2843份技术文档进行了系…
-
音视频同步没那么简单
画面和声音对不上、嘴型比声音快 200ms、声音比动作早半秒,这些在音视频开发中太常见了。但 A/V 同步不是「调个参数」能解决的:它涉及采集时钟、编码延迟、网络抖动、渲染缓冲,每…
-
体育赛事直播的关键时刻:各方竞相寻求更优方案
如今,消费者几乎可以通过各种 OTT(over-the-top)服务观看到几乎所有类型的体育赛事直播。但问题是:服务提供商能否吸引到足够多的观众,让自己的体育赛事直播豪掷有所回报?…
-
论文解读|ECoM-Reasoning:让端到端的语音大模型学会轻量级推理
以 GPT-4o、Moshi、GLM-4-Voice、Qwen-Omni 为代表的端到端语音大模型(SLM)正在推动人机交互迈向“开口即对话”的新阶段。然而,在需要精确、结构化推理…
-
对讲方案选型、硬件链路、音频引擎、RTP/WebRTC,到弱网、AEC 与量产测试的完整技术拆解
本文从产品选型开始,逐层拆解端侧硬件、软件架构、网络协议和音频算法,并给出一套适合嵌入式 Linux 平台的推荐落地音频对讲方案。
-
GPT-Live 如何在六个月内构建响应式语音 AI 实时系统
OpenAI 推出 GPT-Live,实现与 AI 的连续语音交互。该系统采用无轮次语音模型和低延迟架构,使对话更快、更自然。GPT-Live 的构建耗时六个月,核心在于减少交互延…
-
超越转录:对话式语音识别 (CSR) 如何教会 AI 真正倾听
随着语音 AI 越来越深入地融入日常产品,一种新型技术正在悄然取代传统的语音系统。这种被称为对话式语音识别(CSR)的技术正在重新定义机器理解人类语言的意义。 多年来,语音识别技术…
-
将智能推向数据源:为何实时处理是边缘 AI 的核心
AI 正迅速融入日常设备,如智能手机、汽车、摄像头,甚至家用电器。传统上,这些系统依赖云服务器来发送、处理和分析数据,然后才能做出决策,这增加了延迟并拖慢了响应速度。然而,许多应用…
-
WebRTC Android 端 + iOS-Android 跨平台音频通话实战
iOS WebRTC 跑通了,但 Android 端的依赖、权限、Camera2 采集、前后摄切换,和 iOS 完全是两个世界。本文用 Claude Code 写 Android …
-
MeanVC 2:面向低延迟与鲁棒性的流式零样本语音转换
零样本语音转换旨在保留语音语言内容的同时,将源说话人音色迁移至任意未见过的目标说话人。随着实时通信、直播互动、在线会议、游戏语音等应用场景的发展,语音转换系统对低延迟、轻量化和高保…
-
【音视频】iOS AudioConverter + Android MediaCodec 双端封装
视频编码优化了无数轮,音频编码却还在用默认参数。结果是 VoIP 延迟高、录制文件体积大、低端机音频爆音。本文用 Claude Code 写双端音频编码封装,涵盖 AAC/Opus…
-
如何快速搭建音视频中台
到了落地层,核心问题不是”音视频中台好不好”,而是”能不能尽快用起来”。本文把搭建音视频中台的标准流程拆成五个阶段,每个阶段给出关键…
-
有哪些主流音视频中台解决方案
当前市场上的音视频中台方案大致可以分为三类:自研底层型、云厂商内置型、上层封装型。三类方案各有侧重,适合不同的企业需求。这篇不评优劣,而是把各类方案的特点、代表厂商和适用场景讲清楚…
-
CVPR 2026 | PixelDiT:用于图像生成的像素扩散变换器
潜空间建模已成为扩散 Transformer(DiT)的标准范式。然而,它依赖于一个两阶段的流程,其中预训练的自编码器会引入有损重建,导致误差累积并阻碍联合优化。为了解决这些问题,…
-
WebRTC 与实时应用开发的智能体工作流
本文借鉴在 WebRTC.ventures 开发实际系统过程中积累的经验。介绍在构建实时应用程序时使用的工作流程:作为项目核心的上下文文件、将会话上下文转化为测试和审查的自定义技能,以及在日常使用中养成的习惯。
-
ZEGO即时通讯SDK发布3.1.0版本,新增会话级消息定时销毁和消息回执新增已送达状态功能
近日,ZEGO 即时通讯SDK(ZIM) 3.1.0 版本发布,新增会话级消息定时销毁和消息回执新增已送达状态。 会话级消息定时销毁功能概述 设置会话消息定时销毁,指设置一个会话的…
-
CVPR 2026|Oxygen XR 团队在原生鱼眼高斯泼溅技术上带来新突破
Oxygen XR产品研发团队联合清华大学一起提出了 DirectFisheye-GS 框架,创新性地将鱼眼模型原生嵌入到3D高斯泼溅管线中,实现了对鱼眼图像的直接、无损处理。
-
基于 ZEGO SDK 实现微信小程序直播连麦
小程序直播连麦不是「开个 live-pusher 就完事」的功能。本文以 ZEGO 实时音视频 SDK(ZEGO Express SDK) 为主线,从架构到代码逐层拆解一条完整的直…