
AIGC
-
ElevenLabs 发布 Music v2.5:AI 音乐质感升级,付费与版权规则同步明确
ElevenLabs 近日发布 ElevenMusic 最新模型 Music v2.5,官方称新版生成的歌曲听感更饱满、更自然,并公布了大规模盲测数据作为支撑。 据公司披露,在共计…
-
Runway 披露即时视频生成研究路线:从 “等待出片” 走向 “边提示边出片”
Runway 于 2026 年 9 月 10 日发布题为《Towards Instant Video Generation》的研究博客,披露其在实时视频生成方向的最新进展。该公司明…
-
Gradium 发布 Voice Design:写一段提示词,几秒生成一个全新合成语音
语音智能体团队总会撞上同一堵墙:音色库里有 400 个声音,而需求偏偏要的是库里没有的那一个:为蒙特利尔经销商找一个魁北克法语口音的前台,找一个六十多岁、带着讲堂级权威感的男声解说…
-
H Company 发布 NeoMME 260M/800M 单塔多模态编码器,取消视觉塔和因果解码器
H Company 发布 NeoMME 系列多模态编码器,包含 260M 和 800M 两个双向 Transformer 模型,用单一塔处理多语言文本和 32×32 图像块,去掉了…
-
蚂蚁 inclusionAI 开源 6B 统一图像生成与编辑模型 LLaDA-Image
蚂蚁 inclusionAI 发布开源统一图像生成与编辑模型 LLaDA-Image,提供 50 步 Base 和 4 步蒸馏 Turbo 两类 checkpoint,均有 BF1…
-
关于团体标准《信息技术 高效图形数据编码 第3部分:点云主观质量评价方法》(征求意见稿)意见征求的通知
各相关单位: AVS标准工作组已完成团体标准《信息技术 高效图形数据编码 第3部分:点云主观质量评价方法》(标准计划号:2023092503)的起草,输出了征求意见稿。标准征求意见…
-
Gradium AI 发布全新默认 TTS 模型:难例通过率 81.0%,首音频时间 216 毫秒
语音代理恰恰在通话中最重要的环节上掉链子:订单号、回拨数字、来电者必须记下的邮箱地址。Gradium AI 发布了一款全新的文本转语音(TTS)模型,并将其设为 API 和 Stu…
-
Cohere 发布 Parse 5:一款把企业文档转成 Markdown 的 2.3B 视觉语言模型
Cohere 发布了 Parse(parse-v5.0),一款面向高吞吐企业文档摄取场景的文档解析模型。它是一个 2.3B 参数的视觉语言模型,拥有 8,192 token 的上下…
-
S1-mini:Superwhisper 发布 462MB 开源权重文本规范化模型,将原始 ASR 转录转为整洁书面文本
Superwhisper 发布了 S1 系列模型:S1-Voice、S1-Language 和 S1-mini。S1-Voice 是云端语音转文本模型,S1-Language 是用…
-
Cartesia 发布 Sonic-3.6:一款流媒体 TTS 模型,登顶 Artificial Analysis 语音竞技场
Cartesia 发布了 Sonic-3.6,这是其实时文本转语音(TTS)模型的最新版本,距 Sonic-3.5 发布约三个月。这次的变化在于自然度,而且这一点是可以独立验证的。…
-
大语言模型 AI 对话系统市场规模预计将达到39.85亿美元(2026-2032年预测)
根据 QY Research 最新发布的市场研究报告,全球大语言模型 AI 对话系统市场正进入高速增长阶段,企业和个人用户正迅速采用对话式 AI 技术来提升客户互动、生产力、信息检…
-
Liquid AI 发布 LFM2.5-VL-3B:一款 3B 视觉语言模型,可读取屏幕、识别物体并调用设备端工具
昨天,Liquid AI 发布了LFM2.5-VL-3B。这是一个拥有 31 亿参数的视觉语言模型,专为设备端部署而设计。该模型能够读取移动设备、网页和桌面设备上的数字屏幕。它可以…
-
让对话与执行真正并行:Qwen-Audio-Agent 架构解析
语音助理长期存在一处根本性割裂:当它转身去检索资料、调用工具或推进一段多步任务时,整场对话往往被迫悬停。用户只能干等,直到那句「好了,我查到了」姗姗来迟。Qwen-Audio-Ag…
-
NVIDIA 发布 NemotronLabs VoiceChat 11B:一款开放式全双工语音对语音模型
NVIDIA 发布了NemotronLabs VoiceChat 11B,这是一款开源的 11B 端到端语音模型,支持实时全双工对话。它无需像传统 ASR、LLM 和 TTS 那样…
-
超越转录:对话式语音识别 (CSR) 如何教会 AI 真正倾听
随着语音 AI 越来越深入地融入日常产品,一种新型技术正在悄然取代传统的语音系统。这种被称为对话式语音识别(CSR)的技术正在重新定义机器理解人类语言的意义。 多年来,语音识别技术…
-
Krafton开源语音AI基础模型“A.X K2 Raon-Speech”,发力游戏角色语音交互
Krafton宣布在全球AI平台Hugging Face开源语音AI基础模型“A.X K2 Raon-Speech”。该模型结合SK Telecom的小型语言模型“A.X K2”与Krafton自研语音编码器、语音编解码器,可直接完成语音理解与生成,减少情感和语调信息损失。
-
Black Forest Labs发布FLUX 3:用于图像、视频、音频和机器人动作预测的多模态流模型
Black Forest Labs (BFL) 发布了FLUX 3,这是一个多模态基础模型,可在单一架构内学习图像、视频和音频。它也是首个仅使用一组权重即可实现视频、音频和动作预测…
-
论文解读|WavAlign:让语音模型既会“想”,也会“说”
端到端语音对话模型最让人头疼的地方,是“聪明”和“会说”常常互相拉扯。WavAlign 给出的答案很朴素:不要把同一个偏好奖励粗暴地砸到所有 token 上。把语义交给偏…
-
Interspeech2026 | MSU-Bench:多说话人对话理解评测基准
近年来,音频语言模型(Audio Language Model, ALMs)推动语音理解从传统单任务系统走向统一的音频到文本生成范式。在这一框架下,说话人验证、语音识别、说话人识别…
-
中国电信联合北京邮电大学、鹏城实验室完成基于知识库的高轨卫星跨模态语义通信试验
近日,中国电信(研究院、上海公司和中电信应急公司)联合北京邮电大学、鹏城实验室在中国电信研究院北京园区完成基于知识库的高轨卫星跨模态语义通信试验。 该试验依托中国电信云网融合中试平…