技术文章
-
Qwen-Audio-3.1:能听懂、能创作、能聊天
今天,阿里正式发布 Qwen-Audio-3.1 系列语音大模型。本次升级不仅对语音识别(ASR)、语音合成(TTS)和实时语音交互(Realtime)三大核心模型进行了全面进化,…
-
App 开发视频会议功能:从技术选型到上架的完整决策指南
App 开发视频会议有三条路线:集成第三方 RTC SDK、自研 WebRTC、采购现成源码。三者的成本结构与上线周期差别很大,选错路线往往要到上线后才暴露。 App 接入视频会议…
-
拆解 AVC/HEVC 转码阶梯:超大规模直播如何平衡质量、延迟和成本
一个码率阶梯画在白板上时看起来简单得具有欺骗性:几个分辨率,每个旁边配一个码率,再加一个能在其间切换的播放器。到了生产环境里,它就没那么整洁了。这个阶梯夹在源、编码器、封装器、CD…
-
用 WebRTC 与 Cloudflare Durable Objects 构建一个零知识 P2P 同步引擎
利用 WebRTC 和 Cloudflare Durable Objects 构建零知识 P2P 同步引擎:如何实现桌面端和移动端之间即时、无需账户、端到端加密的笔记同步,且无需任何云存储成本。
-
RTC 如何成为流媒体时代的实时基础设施
设想这样一个场景:直播间里主播喊出”3、2、1,上链接“,你看准时机点下去,页面却纹丝不动——半秒之后才告诉你”已抢完“。或者一场线上拍卖,锤子落下的画面比成交价刷新慢了整整一秒,…
-
用 Go 构建一个实时聊天服务器:一个 WebSocket 最小可行方案
如果你用 Go 写过 REST API,却从没碰过 WebSocket,那么构建一个聊天服务器是动手学习 Go 并发模型的最佳方式之一。不用框架,不用黑魔法,只有 goroutin…
-
Live Captioning Engineering:业界首个直播电商 AI 实时字幕系统的端到端实践
在快手电商直播间,大量用户会在通勤、办公或静音环境下观看直播,声音一旦缺失,主播口中的价格、规格、优惠也随之消失。我们花了半年多时间,把”主播说话到字幕上屏”…
-
ZEGO即时通讯SDK发布3.2.0版本,新增社群会话管理和社群加入前审核等功能
2026 年 9 月 18 日,ZEGO 即时通讯SDK(ZIM) 3.2.0 版本发布,新增社群会话管理、社群加入前审核和支持为所有成员删除消息等功能。 新增功能 会话列表新增社…
-
Zipper-LoRA:面向 Speech-LLM 多语种语音识别的动态参数解耦方法
本工作为 Speech-LLM 多语种参数高效微调提供了一种新的技术思路,可进一步推广至多语种语音识别、语音理解及其他基于大模型的参数高效微调任务,为大规模多语种语音模型的训练与部署提供了新的解决方案。
-
SpaceXAI 发布 Grok Voice Transcribe 2.0:一款语音转文本 API,每小时收费 0.10 美元
SpaceXAI 发布了 Grok Voice Transcribe 2.0,这是其最新的语音转文字(STT)模型。开发团队称其在价格不变的前提下,准确率是 Grok Voice …
-
2026 年 GitHub 上顶级的 WebRTC 开源媒体服务器
2026 年的 WebRTC 开源媒体服务器都有哪些,基于 GitHub 星标来看哪些最好。不同的工具适合不同的场景。也就是说,这里排位靠后的一款 WebRTC 媒体服务器,可能恰恰最适合你的需求。
-
EgoInteract:一种面向第一人称视觉理解、具备自纠正能力的交互式多模态智能体
第一人称视觉交互要求 Agent 在动态社会环境中通过多模态对话和工具使用解决真实世界任务。EgoInteract 将采样帧视为视觉假设,维护证据账本,并通过官方工具将可见实体规范…
-
浏览器实时娱乐背后的技术:毫秒为何重要,ZEGO RTC 如何守住这条底线
浏览器标签页内的实时娱乐,是现代 Web 日常解决的最棘手工程问题之一。用户点击一个按钮,期望得到近乎即时的反馈,而要做到这一点,需要网络、服务器和渲染管线之间的协同配合 —— 这…
-
IBC 2026 | 面向实时视频的低延迟交互系统
视频语言模型在时序推理、长视频理解和多模态评测方面进展迅速,使其在广播辅助、沉浸式媒体制作、可穿戴引导、移动监控和 PC 控制面等场景中具备应用潜力。这些场景要求系统在用户仍在操作…
-
自变量 X2-NativeCursor 开源:不用 ASR,TTS也能知道自己说到哪了
自变量机器人(X Square Robot)的 X2-NativeCursor 用一个约 2M 参数的进度模型,直接从 TTS 的原生语音 token 中估计原文位置,再由客户端结合播放时钟确定播报进度。
-
RocketMQ 已正式接入 AI,可以硬扛百万级 AI 会话!
RocketMQ 接入 AI,它自己并没有变成大模型,干的还是消息队列的老本行。变化主要在这套新的主题模型上,它是照着 AI 应用的通信特点做出来的。
-
白名单绕过:通过视频通话平台建立 WebRTC 隧道
本文来自:Darknet原文:https://www.darknet.org.uk/2026/09/whitelist-bypass-webrtc-tunnels-through-…
-
视频通话的 200 毫秒里发生了什么
有人在纽约说了句好笑的话,你在北京笑了出来,看起来就像同一瞬间发生的事。这背后没有任何一点是简单的。一对一视频通话底层的整套机制,是过去十五年里最不可思议的工程成就之一,而它运转得…
-
使用 eBPF 调试 WebRTC SFU:找出你的媒体服务器在哪里 “吞掉” 数据包
作者:Hector Zelaya原文:https://webrtc.ventures/2026/08/ebpf-webrtc-sfu-packet-loss-debugging/ …
-
如何搭多人会议系统(SFU 架构 / 多路流管理)
三个人以上的会议系统如何搭建?Mesh 还是 SFU?订阅哪几路流?大画面切谁?本文用 Claude Code 设计并实现一个可扩展的多人会议系统,从架构选型到多路流管理。 1、多…