技术文章
-
以球迷为先:通过个性化的下一代体育流媒体体验,打造深度互动体验
据 Wurl 欧洲、中东及非洲(EMEA)区总经理 Keith Belford 近日在 Streaming Media Europe 博客发表的客座文章中称,2026 年夏季举办的…
-
低延迟音频播放:AudioUnit vs AudioQueue vs AudioTrack
视频渲染搞定了,声音播放呢?”就用系统默认的 AVAudioPlayer / MediaPlayer 呗”——但实时通话场景要求 <50ms 延迟,系…
-
Cartesia 发布 Sonic-3.6:一款流媒体 TTS 模型,登顶 Artificial Analysis 语音竞技场
Cartesia 发布了 Sonic-3.6,这是其实时文本转语音(TTS)模型的最新版本,距 Sonic-3.5 发布约三个月。这次的变化在于自然度,而且这一点是可以独立验证的。…
-
2026 金融双录服务商全景图:20 家厂商技术路线对比
2026 年国内双录系统市场规模预计突破 120 亿元,年复合增长率 25%+,服务商数量超过 200 家。按市场分布总体可分五大类:云平台厂商(阿里云、腾讯云、华为云等)、专注音…
-
为什么 4K 蓝光在画质上始终胜过 4K 流媒体
把同一部电影的 4K 流媒体和超高清蓝光碟放到同一台电视上,两者都能呈现 3,840 × 2,160 的画面。然而,这并不意味着电视接收到的画面信息量是相同的。分辨率描述的是屏幕上…
-
IndexTTS 2.5 让声音跨越语言
不赶进度、专注打磨!今天想和大家聊聊我们最新发布的 IndexTTS 2.5,支持中/英/日/西/阿五国语言零样本配音,推理速度翻倍升级,跨语言情绪还原更自然,同时也支持原声的语速…
-
SignalR:面向 .NET 应用程序的实时通信
ASP.NET Core SignalR 实用指南:用于为 .NET 应用程序添加聊天、实时通知、实时仪表板等实时功能的库,涵盖 Hub、传输协议、分组、横向扩展、身份验证及客户端…
-
从《牛来》到 DCP:一部电影是怎么走进电影院的?
借电影《牛来》聊聊银幕背后的 DCP、MXF、JPEG 2000、PCM、KDM,以及数字影院放映系统。
-
【音视频】视频播放器从 0 到 1
AVPlayer 播不了自定义码流?IJKPlayer 三年没更新了?自己写一个播放器,最难的其实是渲染层和 Seek 逻辑。本文用 Claude Code 从零搭建 Metal …
-
字节:把 AI 视频的钱花在刀刃上,不是每一刀上
AI 视频生成正在跨过一个清晰的分界线。 过去,它更像一个周末玩具。用户拿它尝鲜、娱乐,生成一条新奇的视频,看模型还能玩出什么花样。 但这个状态正在变化。Seedance 2.0 …
-
不用出声也能聊天?苹果公开一项无声语音识别专利
地铁里、会议室中、医院病房内——很多场合我们都需要“说点什么”,却又不便发出声音。 苹果公司近日公开了一项专利申请(WO2026159706A1),提出一种默声语音检测方案:用户在…
-
Liquid AI 发布 LFM2.5-VL-3B:一款 3B 视觉语言模型,可读取屏幕、识别物体并调用设备端工具
昨天,Liquid AI 发布了LFM2.5-VL-3B。这是一个拥有 31 亿参数的视觉语言模型,专为设备端部署而设计。该模型能够读取移动设备、网页和桌面设备上的数字屏幕。它可以…
-
让对话与执行真正并行:Qwen-Audio-Agent 架构解析
语音助理长期存在一处根本性割裂:当它转身去检索资料、调用工具或推进一段多步任务时,整场对话往往被迫悬停。用户只能干等,直到那句「好了,我查到了」姗姗来迟。Qwen-Audio-Ag…
-
在 Kubernetes 生产环境中运行 STUNner
STUNner 是一个原生 Kubernetes TURN 服务器,TURN 是一种中继协议,可为 WebRTC 客户端提供用于传输媒体的公共端点。它基于 Gateway API,…
-
AI 视频降本的三种做法,只有一种不牺牲画质
随着 AI 视频进入生产阶段,生产成本开始成为越来越多团队绕不开的问题。 旗舰模型不断提升画质上限,更轻量的模型不断推出。很多人曾以为,“视频生成成本”这道题,会随着算力效率提升和…
-
【音视频】RTMP 直播推流实战
编码搞好了,同步也搞定了,现在把流推到服务器。RTMP 听着简单(就一个推流 URL),但生产级推流器要考虑:自适应码率、断线重连、音视频交错复用、网络拥塞检测。本文用 Claud…
-
AI 在模拟视频问诊中挑战医生,结果令人震惊
一款基于 Gemini 的医疗 AI 将视觉、听觉与临床推理相结合,在模拟视频问诊的多项关键指标上达到或超越了医生水平,同时也揭示了人类连接与细微感知仍然重要的领域。 近期发表在 …
-
NDI 协议:它是什么以及如何用于直播
NDI(Network Device Interface,网络设备接口)正在变革视频制作领域,它使通过标准 IP 网络传输高清、低延迟视频成为可能,用大多数设施已有的以太网基础设施…
-
WebRTC Android 端 + iOS-Android 跨平台音频通话实战
iOS WebRTC 跑通了,但 Android 端的依赖、权限、Camera2 采集、前后摄切换,和 iOS 完全是两个世界。本文用 Claude Code 写 Android …
-
NVIDIA 发布 NemotronLabs VoiceChat 11B:一款开放式全双工语音对语音模型
NVIDIA 发布了NemotronLabs VoiceChat 11B,这是一款开源的 11B 端到端语音模型,支持实时全双工对话。它无需像传统 ASR、LLM 和 TTS 那样…