技术文章
-
服务端转码不求人:写 FFmpeg 分布式转码 + GOP 切片 + 缩略图
客户端编码好了、推流也通了,但服务端还得把用户上传的视频转成多码率、生成缩略图、GOP 对齐切片,这些「后端活」音视频开发也得会。本文用 Claude Code 写一套生产级转码脚…
-
基于互联网的 SRT 与基于云端的 SRT:运维差异从何而来
对许多广播机构而言,Secure Reliable Transport(SRT)几乎已经成了 IP 回传(contribution)的代名词。它与 RIST 一起,让广播机构能够用…
-
FlowLabs 基于浏览器的实时远程审片解决方案
FlowLabs 联合创始人 Marcus Oliver 介绍了公司基于浏览器的实时远程审片解决方案,以及它如何致力于让审片流程走向“平民化”。 请介绍一下 FlowLabs 的背…
-
Cohere 发布 Parse 5:一款把企业文档转成 Markdown 的 2.3B 视觉语言模型
Cohere 发布了 Parse(parse-v5.0),一款面向高吞吐企业文档摄取场景的文档解析模型。它是一个 2.3B 参数的视觉语言模型,拥有 8,192 token 的上下…
-
VINS-120K: 基于大规模4K数据集的超高清图像编辑 | CVPR 2026
4K+图像编辑新突破!针对数据匮乏与细节建模难题,vivo BlueImage Lab 发布首个指令式超高分辨率编辑数据集 VINS-120K(含12万精筛4K三元组)。
-
多人通话混音 + 3A 处理:写多路混音器 + 回声消除
一对一通话跑通了,但多人通话(视频会议、语音聊天室、K歌)才是真正的考验。多路 PCM 怎么混音不溢出?怎么消除回声?怎么自动调节各路音量?本文用 Claude Code 从混音算…
-
全栈 AI Agent 从 0 到 1 :智能播客平台开发全记录
Smart Podcast Platform 是一个端到端的智能播客制作平台。本文介绍该平台开发过程,从后端 Python 到前端 Vue 3,从 LangGraph Agent 编排到 pydub 音频处理,完整覆盖了一个 AI 音频应用的方方面面。
-
Meta AI推出MetaRoCE:专为AI规模以太网打造的全新RDMA传输协议
训练和部署前沿模型如今既是计算问题,也是网络问题。诸如 all-reduce 和 all-to-all 之类的集体操作会在训练过程中同步数千个加速器,而速度最慢的传输决定了整个任务…
-
把视频纠错搬进网卡: 让低时延视频服务更流畅
SmartFEC,一个基于智能网卡的自适应前向纠错框架。SmartFEC将冗余编码、带宽预测和冗余控制等关键功能部署到智能网卡侧,使视频系统能够在靠近数据包输入输出的位置完成实时处理。
-
音视频性能优化:启动速度 / 内存 / 功耗 / 编码延迟全链路调优
功能都跑通了,但产品抱怨「开摄像头太慢了」「推流 10 分钟手机发烫」「录 4K 视频内存飙到 800MB」。性能优化不是玄学,本文用 Claude Code 建立一套可复用的诊断…
-
FlexiSLM:支持 4-12.5Hz 可变、动态帧率的端到端语音大模型
FlexiSLM 带来的意义,并不只是“又做了一个更低帧率的语音模型”。我们觉得它的价值在于,为 Speech LLM 引入了一种新的部署范式。
-
NASA+ 与从月球及更远太空直播的独特运维挑战
NASA+ 在采集、编码和传输直播视频方面,与其他大型流媒体平台面临许多相同的困难,尤其是远程团队协作方面。但在数百万英里之外进行传输,也带来了其他流媒体从业者难以想象的复杂性。在…
-
安全摄像头的Webhooks和HTTP Push功能
本文介绍了部分安全摄像头产品中所支持的WebHooks和HTTP Push的第三方报警平台的功能,以及该功能实现的架构与通信流程最佳实践。 摄像头Webhooks和HTTP Pus…
-
CDN 之后,你便失去了视野:弥合流媒体质量的最后一公里差距
为什么最后一公里是流媒体最大的监控盲区?以及一个基于标准的单一质量分数如何让工程团队和管理层基于同一个数字进行讨论。 每个流媒体团队都经历过这样的事:仪表盘上全是绿灯,CDN 吞吐…
-
超越视频通话:架构下一代可编程实时互动
现代 CPaaS 基础设施如何在企业规模下解决毫秒级延迟、客户端解码瓶颈和易波动的网络丢包问题。 实时视频工程的根本挑战说起来简单、做起来却极其复杂:在不可预测的全球网络上扩展到数…
-
视频双录解决方案:即构智能双录用 AI 质检破解金融合规难题
在金融强监管时代,双录已从”可选项”变为不可逾越的合规红线。然而,传统双录模式下人工质检成本高、一次通过率低、客户体验差等问题日益突出。即构(ZEGO)基于…
-
Android Camera | 高通Camx AF对焦调试全攻略
AF(自动对焦)是 Camera 调优中最复杂的模块之一。用户对”对不上焦”、”对焦慢”、”跑焦”的容忍度极…
-
S1-mini:Superwhisper 发布 462MB 开源权重文本规范化模型,将原始 ASR 转录转为整洁书面文本
Superwhisper 发布了 S1 系列模型:S1-Voice、S1-Language 和 S1-mini。S1-Voice 是云端语音转文本模型,S1-Language 是用…
-
会议 ASR 的下一站:让大模型自己学会听懂会议
如果一个会议转写系统足够理想,用户体验应该非常简单:把一段原始会议录音丢进去,系统直接产出一份可靠的会议文本。不要求用户懂设备、懂前端、懂降噪,也不会在多人插话时把几个人的话揉成一…
-
在线问诊音视频方案:小程序RTC+IM集成与医疗合规要点(2026)
在线问诊的实时通信底座由 RTC(实时音视频)与 IM(即时通讯)两部分组成,微信小程序是目前触达患者成本最低的载体;选型与落地时,音视频质量、医疗数据合规、问诊留痕是三个绕不开的…