技术文章
-
Jitsi 推出适用于浏览器会议的文档画中画功能
Jitsi 已经在 Electron 框架下支持视频画中画功能,当焦点离开会议窗口时,画中画会自动打开。这个GSoC 2026项目的目标是将交互式文档画中画功能引入浏览器会议,包括…
-
弱网 QoS 引擎(抖动缓冲 / 丢包恢复 / 码率自适应)
前面的推流/通话在理想网络下跑通了,但真实网络是「会抖、会丢、会变慢」的。地铁里卡成 PPT、WiFi 切 4G 断流、晚高峰卡顿——这些全靠 QoS 引擎兜底。本文用 Claud…
-
阿里最新开源丨语音分离、降噪、回声消除全覆盖:FLASepformer 与 JAEC 上线
语音交互和语音通信依赖清晰、可分辨的输入信号。真实环境中的风扇、道路、键盘等背景噪声会掩盖语音,扬声器回放进入麦克风会形成回声,多人同时讲话则会造成语音混叠。降噪、声学回声消除(A…
-
StreamWSR:一种面向实时场景的轻量级语音超分辨率方案
在实时通信、语音交互和音频修复等场景中,语音超分辨率(Speech Super-Resolution, SR)技术扮演着重要角色——它能够从低采样率的语音信号中重建丢失的高频成分,…
-
实时消息如何驱动客户互动与长期留存
实时消息对企业来说已不再是可选项,而是必需品。能够提供即时、个性化对话的企业,能建立客户关系、提升留存,并交付更好的整体客户体验。
-
避免 WebRTC getStats 的六个常见错误
一个出现故障的监控面板相对容易被发现。而一个数字看起来可信、实际却错误的监控面板,要危险得多。本文分享避免 WebRTC getStats 的六个常见错误。
-
RTP 抖动详解:语音 AI 平台如何解决它
实时传输协议(RTP)抖动,是互联网通话上一秒还清晰无比、下一秒就支离破碎的原因,它是互联网上唯一一种没有“第二次机会”的实时媒介。 网页加载慢 200 毫秒,没人会在意;视频卡顿…
-
H Company 发布 NeoMME 260M/800M 单塔多模态编码器,取消视觉塔和因果解码器
H Company 发布 NeoMME 系列多模态编码器,包含 260M 和 800M 两个双向 Transformer 模型,用单一塔处理多语言文本和 32×32 图像块,去掉了…
-
蚂蚁 inclusionAI 开源 6B 统一图像生成与编辑模型 LLaDA-Image
蚂蚁 inclusionAI 发布开源统一图像生成与编辑模型 LLaDA-Image,提供 50 步 Base 和 4 步蒸馏 Turbo 两类 checkpoint,均有 BF1…
-
美团智播:数字人直播技术创新与实践
一场 7×24 小时不间断的直播,对真人主播团队意味着高昂人力成本,对百万中小商家更是一道难以迈过的门槛;而“一眼假”的数字人——面部僵硬、动作循环、手势与语音脱节——又留不住观众…
-
Qwen Audio:复杂人声干扰下,如何让 ASR “听对人”
在安静环境里,语音识别的问题很直接:用户说什么,模型就转录什么。但在会议、车内或咖啡厅里,用户的声音经常会和旁人交谈一起进入麦克风。 假设用户说“打开导航”,旁边的人同时说“我们明…
-
谁有资格用 MOQ 构建产品?
谁有资格用 MOQ 构建产品?要选择 MOQ?问问自己这两个问题:你的用例有多独特?你的团队在直播媒体处理方面有多有经验?
-
TinySR:面向真实世界图像超分辨率的轻量级扩散模型
本文提出 TinySR,一种面向真实世界图像超分辨率的轻量级扩散模型,通过深度剪枝、动态块间激活以及扩张‑腐蚀策略实现高效推理。该模型在保持感知质量的前提下,实现了比教师模型 TS…
-
【音视频】剪辑 SDK(裁剪/旋转/变速)
采集、处理、编码、推流、播放全打通了,但用户真正的高频需求其实是一个字——「剪」。拍完的 3 分钟视频要裁掉开头 5 秒、转 90°、加 1.5 倍速。本文用 Claude Cod…
-
信也AI数字人直播间实践:从单条视频到可复用生产系统
从运营活动的真实需求出发,搭建一条由素材处理、动作迁移、视频生成、声音合成、口型驱动、直播编排和发布管理共同构成的多模态生产链路。
-
技术漫谈|ASR中的瑞士军刀:方言识别
方言识别之所以像 ASR 中的一把“瑞士军刀”,是因为它考验的不只是模型能否听清,还要求系统同时处理语言判断、语义转换、文本呈现与效果评价。
-
SIPPing:纯 Python 实现的 SIP 数据包伪造与探测工具深度解析
SIPPing 是一个用纯 Python 编写的 SIP 数据包伪造(packet forging)工具,其核心理念是:通过简单的文本模板 + 命令行变量替换,快速构造并发送任意 SIP 请求,同时以类似 ping 的方式等待并统计响应。
-
多模态 AI 带来重大变革及一些挑战
人工智能已经改变了人们使用软件的方式。我们可以向聊天机器人提问,用一句话生成图片,或使用语音指令完成简单任务。但人类交流从来都不只依赖一种形式。当有人在解释一个问题时,他们可能会同…
-
面向语音与实时智能体的最低延迟推理 API:一份以首 Token 时间(TTFT)为先的基准测试
首 Token 时间(Time to first token,TTFT)是团队在为语音场景挑选推理 API 时使用的指标,也是最容易误导他们的指标。TTFT 标记的是生成开始的时刻…
-
体育直播与游戏直播之间的差距正接近黄金时代
随着 EA Sports、广播公司 Sky 以及德国足球甲级联赛(Bundesliga)参与的测试推进,以动画和电子游戏版本直播体育赛事的能力又近了一步。 德甲正在探索将比赛数据直…