今天,字节跳动 Seed 正式推出原生音视频全双工大模型 SeedRealtime。
作为走向全模态交互的关键一步,SeedRealtime 用统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来“边看、边听、边说”的全新体验。它实现了以下三项核心突破:
- 音视频联合理解:原生支持声音、画面与时序信息的深度融合。模型既能结合场景消解同音词歧义,也能准确理解视觉中的时序指代,让所见、所闻与所说融为一体。
- 主动的交互能力:具备持续的环境感知与主动表达能力。模型能在察觉画面状态变化时(如关键目标出现)主动提醒,并能调用工具融入表达,让交互从被动响应升级为主动协作。
- 流畅的交互节奏:能够实时感知用户的对话状态与交流节奏,在适当时机自然接话、停顿与回应;同时具备较强的抗干扰能力,能分辨旁人闲聊与背景噪声,不因干扰误触发,保持沟通的流畅连贯。
端到端人工评测结果显示,相比级联模型,SeedRealtime 的音视频对话节奏问题减少了一半——模型对说话时机的把握更加自然,“话未说完被抢断、话音已落却回应迟缓、或是被背景杂音与闲聊误触发”等卡壳现象显著减少;同时,单次对话能够完整、顺畅交流的概率也有明显提升。
目前,SeedRealtime 已在豆包 App 全量上线,在业界率先实现了音视频全双工技术的规模化落地,欢迎大家体验。
项目主页:
https://seed.bytedance.com/seedrealtime
体验入口:
将豆包 App 更新至最新版本,在对话框内选择“打电话”,进入视频通话界面体验即可。
原生音视频交互,走向全模态;实现边看、边听、边说
音视频实时交互此前长期卡在两种形态之间:级联系统依赖 ASR、VLM、TTS 等多个模块串联,延迟层层叠加,信息逐级损耗;端到端模型虽更流畅,但不少方案仍依赖外置 VAD 判断轮次,本质上仍接近一问一答的半双工交互。
SeedRealtime 的核心突破,在于将声音、画面、时序与表达统一到同一个端到端模型中。它不是先听完、再看完、最后作答,而是在连续音视频流上,让感知、理解、决策与表达同步进行,使“听到的”和“看到的”能够共同参与每一次实时判断。
难点首先在于对话节奏。语音天然带有停顿,可以借此判断何时接话;视频却始终在线、持续变化。模型既要不断理解画面中正在发生什么,又不能因为背景噪声干扰而频繁介入,而是要持续判断该关注哪个对象、该听谁说话,以及此刻是否应该回应。
更深层的挑战在于音视频的联合建模与时序对齐。用户说“这个怎么弄”时,模型需要结合当前画面、手势、视线与历史动作,判断“这个”具体指向什么;遇到同音词或模糊语音时,也要借助视觉场景完成消歧。只有将声音、画面与时序信息统一建模,模型才能真正把所见、所闻与所说对应起来。当看、听、说被纳入同一套实时决策体系,模型便不再只是等待用户提问,而能持续理解场景变化,在合适的时机主动开口。
SeedRealtime 的推出,标志着音视频交互迈出了关键一步。通过统一架构原生融合音频、视频与文本,模型得以在连续的多模态流中持续理解场景、判断节奏并作出回应。由此,“边看、边听、边说”真正成为日常可用的交互体验。
然而,现实环境中的音视频交流复杂而连续:背景嘈杂,人声会重叠,画面会变化,用户也会随时停顿、补充或打断。面对这些真实场景中的挑战,未来我们将在以下几个方面继续突破:
- 更低的延迟与更自然的节奏:持续压缩“听到—理解—回应”的端到端时延,让打断、抢话、附和与停顿等真实对话中的微妙节奏被自然还原,不只是更快,而是更恰到好处。
- 更主动的感知与决策:基于对画面与声音的持续理解,主动判断何时提醒、何时补充、何时递上用户正需要的信息,让模型不仅能“该说话时说话”,也能“该出手时出手”。
- 更稳健的多人复杂场景:在嘈杂环境、多人同框与多方对话中,稳定识别“谁在说话、在看什么、该回应谁”,将能力带入更多真实生活与工作场景。
- 从“能对话”到“能行动”:打通工具调用与现实世界的连接,让模型不仅能交流与观察,更能协助用户完成查询、预订与任务办理,把实时多模态理解转化为具体行动。
本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/zixun/70769.html