阿里团队自研 AOQ 协议,为多模态 AI 构建确定性传输底座

随着大模型向多模态全面演进,AI 应用正从云端走向终端。端侧公网“最后一公里”的网络波动与 AI 推理所需要海量数据的实时传输需求之间,存在较大的冲突,会使得模型的推理效果以及用户体验大打折扣。为了解决这一问题,阿里团队自研了AOQ(AI Over Quic) 协议,它支持文本、音频、文件的全格式统一承载。并针对多模态模型的数据生产和消费特点,创新性地实现了“实时/非实时”双模自适应。目标很明确:在极端弱网环境下为多模态模型提供确定性的低延迟与高可靠体验,真正做到多模态模型体验的技术领先。

多模态 AI 双工交互对传输协议的“升维考验”

多模态大模型通话场景,迫使网络传输协议直面两个“近似冲突”的硬性挑战:

  • 端侧弱网低延时:地铁、电梯等场景下,高丢包、大抖动、带宽骤降成为常态。弱网导致的卡顿和连接中断,会瞬间击穿用户对 AI 交互的耐心。
  • 数据异构强对齐:AI 交互混合了指令、音视频、长文本等异构载体。传统实时协议为保流畅常牺牲可靠性,导致数据截断;同时,多通道独立传输缺乏协同,极易引发口型、声音与字幕脱节。

简言之,两个挑战分别要求网络传输具备实时性和可靠性、同步性,三者构成的“不可能三角”令经典传输协议顾此失彼:

弱网实时内容可靠有序多载体强同步用户感受
传统可靠协议“太慢太卡”
传统实时协议“能到,交互形式单一“
AOQ“能到,交互丰富”

AOQ基于QUIC协议的底层优势,参考传统实时协议的优化手段,针对AI多模态数据的复杂特性进行了深度定制与重构,实现了实时、可靠和同步的三者兼得。通过实测对比,AOQ相比于经典协议(如可靠协议WebSocket及实时协议WebRTC),展现了全方位能力提升。

阿里团队自研 AOQ 协议,为多模态 AI 构建确定性传输底座
(图1:实时通信协议体验对标。AOQ 在强弱网建连效率、弱网低延时、抗卡顿、切网无感与断网续播等维度全面领先 WebSocket 与 WebRTC)

AOQ的破局与核心优势

针对AI全双工业务,AOQ协议抽象出物理层、传输层、模型对接层与应用层,逐层深度优化适配,在全格式承载能力、AI业务模式适配、极致弱网对抗、多流协同同步等维度上实现了代际跨越。

阿里团队自研 AOQ 协议,为多模态 AI 构建确定性传输底座
图2:AOQ 四层架构

全格式原生承载:打破协议壁垒,实现“一链通传”

  • 混合流量一体化在单 QUIC 连接内,AOQ 原生支持文本指令、语音消息、图片、大体积文件、实时流媒体的并行传输。
  • 多模态时序强同步即使模型异步生成音频、视频、文本存在速度差异,AOQ 仍可依据全局时钟同步与关联映射机制,完成强制同步和映射,避免出现音画不同步、图文错位等现象。
  • 交互全链路加密全格式数据原生加密,无论控制指令、文本、文件,抑或实时音视频、图片,均全时段密文传输,确保端云双向的隐私安全与防劫持能力。

“实时+非实时”双模自适应:精准匹配AI生产节奏

针对大模型输出数据“快慢不均”的特性,AOQ 独创了双模式自适应机制:

  • 实时模式 (Real-Time Mode):专为对时效性极度敏感的流式数据设计,比如摄像头与麦克风的实时采集。秉持“新鲜度和流畅性优先”理念,保障音画同步与交互的即时响应。
  • 非实时模式 (Non-Real-Time Mode):面向对数据完整性与顺序有严格要求,以及数据可以提前发送并缓存的场景。秉持“可靠性优先和超前发送”的理念,端侧进行超前缓存,从而降低全链路延迟,并保证极强的网络韧性。

极致抗弱网能力:升级QUIC内核,引入流级容错

AOQ集成了专为实时媒体交互的弱网对抗增强技术,显著提升高铁、地下车库等极端环境下的生存能力:

  • 0-RTT极速建连增强QUIC的 0-RTT 特性,即使身处弱网环境仍可瞬间建立安全连接,保障AI助手即时响应。
  • 精准带宽估计动态分配内置改进智能带宽估计算法,敏锐感知网络瞬时波动,结合动态分配策略自动调节,确保核心交互不卡顿。
  • 流级冗余保护与快速重传各模态独立建流,实现流维度隔离的前向冗余机制,结合快速重传能力,不牺牲延时即可消除弱网环境“滋滋”声或画面马赛克。

全球化部署:智能就近接入,保障跨地域一致体验

  • 全球接入智能分配依托全球节点和智能调度策略,持续优化跨地域传输,无论身处何地,均能就近接入,获得稳定、低时延的一致对话体验。
  • 全链路质量监测从接入到传输、全程可观测,依据丢包、抖动等关键指标快速发现链路异常,实现全球网络链路动态优化和快速定位。

Realtime API业务案例

下面通过三个真实落地场景,看 AOQ 如何支撑多模态实时交互真正“跑起来”。

  • Realtime API + Qwen-Audio-3.0-Realtime 模型实现流畅音频通话

把麦克风采集的实时流与模型生成的音频回复统一承载在一条 AOQ 连接上,实现双向低延迟音频通话。即使画面与声音由模型异步生成,也能保持严格同步,弱网下依然流畅。

  • Realtime API + Qwen-ASR-3.0-Realtime模型实现语音输入法

端侧实时语音流通过 AOQ 稳定上传,模型边听边转写,低延迟返回文字结果。适合需要持续输入、对时延和可靠性要求高的语音输入场景。

  • Realtime API + Qwen 3.5-Livetranslate 实现实时翻译

源语言语音实时上传,翻译结果以文字或语音形式即时返回。AOQ 的多流同步与弱网抗性,保证翻译流与原声流在时序上对齐。

结语

‍模态 AI 交互真正走向终端,传输协议不再只是“管道”,而是决定体验上限的关键底座。AOQ 通过全格式原生承载、“实时/非实时”双模自适应、流级弱网对抗和全球智能接入,把实时、可靠、同步这三者从“不可能三角”变成了可落地的工程能力。

欢迎体验:
百炼Realtime API已正式对外发布,同时支持 WebSocket、WebRTC 与自研 AOQ 协议,欢迎前往体验。
API地址: https://help.aliyun.com/zh/model-studio/realtime-api-overview

版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。

(0)

相关推荐