
大厂Animal认证作者
-
阿里最新开源丨语音分离、降噪、回声消除全覆盖:FLASepformer 与 JAEC 上线
语音交互和语音通信依赖清晰、可分辨的输入信号。真实环境中的风扇、道路、键盘等背景噪声会掩盖语音,扬声器回放进入麦克风会形成回声,多人同时讲话则会造成语音混叠。降噪、声学回声消除(A…
-
美团智播:数字人直播技术创新与实践
一场 7×24 小时不间断的直播,对真人主播团队意味着高昂人力成本,对百万中小商家更是一道难以迈过的门槛;而“一眼假”的数字人——面部僵硬、动作循环、手势与语音脱节——又留不住观众…
-
信也AI数字人直播间实践:从单条视频到可复用生产系统
从运营活动的真实需求出发,搭建一条由素材处理、动作迁移、视频生成、声音合成、口型驱动、直播编排和发布管理共同构成的多模态生产链路。
-
技术漫谈|ASR中的瑞士军刀:方言识别
方言识别之所以像 ASR 中的一把“瑞士军刀”,是因为它考验的不只是模型能否听清,还要求系统同时处理语言判断、语义转换、文本呈现与效果评价。
-
全栈 AI Agent 从 0 到 1 :智能播客平台开发全记录
Smart Podcast Platform 是一个端到端的智能播客制作平台。本文介绍该平台开发过程,从后端 Python 到前端 Vue 3,从 LangGraph Agent 编排到 pydub 音频处理,完整覆盖了一个 AI 音频应用的方方面面。
-
会议 ASR 的下一站:让大模型自己学会听懂会议
如果一个会议转写系统足够理想,用户体验应该非常简单:把一段原始会议录音丢进去,系统直接产出一份可靠的会议文本。不要求用户懂设备、懂前端、懂降噪,也不会在多人插话时把几个人的话揉成一…
-
IndexTTS 2.5 让声音跨越语言
不赶进度、专注打磨!今天想和大家聊聊我们最新发布的 IndexTTS 2.5,支持中/英/日/西/阿五国语言零样本配音,推理速度翻倍升级,跨语言情绪还原更自然,同时也支持原声的语速…
-
字节:把 AI 视频的钱花在刀刃上,不是每一刀上
AI 视频生成正在跨过一个清晰的分界线。 过去,它更像一个周末玩具。用户拿它尝鲜、娱乐,生成一条新奇的视频,看模型还能玩出什么花样。 但这个状态正在变化。Seedance 2.0 …
-
AI 视频降本的三种做法,只有一种不牺牲画质
随着 AI 视频进入生产阶段,生产成本开始成为越来越多团队绕不开的问题。 旗舰模型不断提升画质上限,更轻量的模型不断推出。很多人曾以为,“视频生成成本”这道题,会随着算力效率提升和…
-
实现视频“边播边改”,京东开源JoyAI-Video-Edit模型,性能全球领先
直播间里,服饰主播试完白色上衣,观众又想马上看到蓝色款是什么效果,可蓝色款不在身边怎么办?视频聊天时,和朋友畅想穿越到古代当侠客,怎么能让美好的想象瞬间变为精美视频呈现给大家?&n…
-
腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别
今天,腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview。 基于最新一代大语言模型 Hy3 的语言理解能力,Hy ASR 3.0 preview 融合高精度语…
-
CVPR 2026|Oxygen XR 团队在原生鱼眼高斯泼溅技术上带来新突破
Oxygen XR产品研发团队联合清华大学一起提出了 DirectFisheye-GS 框架,创新性地将鱼眼模型原生嵌入到3D高斯泼溅管线中,实现了对鱼眼图像的直接、无损处理。
-
TF-MossFormer:鱼与熊掌亦可兼得?在单通道语音分离中同时捕捉“局部细节”与“全局依赖”
近年来,单通道语音分离技术犹如一场精彩的接力赛,从 Conv-TasNet 的精巧卷积,DPRNN 的深度循环,到 SepFormer 和 MossFormer 的 Transfo…
-
阿里团队自研 AOQ 协议,为多模态 AI 构建确定性传输底座
随着大模型向多模态全面演进,AI 应用正从云端走向终端。端侧公网“最后一公里”的网络波动与 AI 推理所需要海量数据的实时传输需求之间,存在较大的冲突,会使得模型的推理效果以及用户…
-
阿里通义Wan-Streamer v0.2:响应延迟仅550ms,让 AI 真正与你”面对面”
和 AI 打视频电话,卡顿、延迟、声画不同步,是常态。 这本质上就是“语音识别 ➡️ 大模型 ➡️ 语音合成 ➡️ 动画驱动”的流水线拼装。环节越多,延迟越高,割裂感越强。 但真正…
-
模型上新|Qwen-Audio-3.0-Realtime 如何让语音交互“懂倾听,更聪明”?
语音交互的下一个形态是什么?是毫秒级的快速响应?是深度思考的逻辑推理?还是能够感知情绪、像真人般对谈的情感共鸣?如何让语音交互跨越“机械感”走向了“自然和智能”?我们也在持续探索。…
-
CVPR 2026 | 重思基于扩散模型的视频超分辨率:利用对齐特征的稠密引导 DGAF-VSR
本文提出 DGAF-VSR,一种基于扩散模型的视频超分辨率方法,针对现有技术在感知质量、重建保真度和时序一致性之间难以兼顾的挑战,通过关键观察发现特征域比像素域更适合提供稳定的时序…
-
搜狐技术:未读消息数系统设计
在互联网海量信息传播的背景下,大数据量、高频率更新场景中的未读消息数计算与提醒,成为考验系统性能与用户体验的关键问题。 作者:赵勇来源:搜狐技术产品原文:https://mp.we…
-
阿里视频云:视频点播成本优化实战
为短视频、直播回放、在线教育等业务提供端到端的视频点播成本优化方案,覆盖转码模板配置、存储策略降冷、ABR 播放器集成,帮助在保证播放体验的前提下系统性降低账单支出。 作者:逸良来…
-
ICLR 2026 | 基于视觉自回归模型的前馈式主体驱动图像生成算法 EchoGen
中国科学技术大学与淘天集团-音视频技术团队在 ICLR 2026上提出的 EchoGen,作为首个基于视觉自回归模型的前馈式主体驱动图像生成框架,通过创新的双路径主体注入策略(解耦…