ZEGO 实时互动 AI Agent 迎来 2.13.5 版本更新。本次版本核心亮点是新增实时播报数字人能力,一种区别于互动数字人的全新 Agent 类型,专注于单向内容输出场景,同时支持 CDN 拉流,满足客户将播报画面分发至第三方直播平台(如抖音、快手、YouTube等)的诉求。

为什么做实时播报数字人?
此前,如果有数字人播报需求(不需要双向互动,只需要数字人”念稿”),通常直接对接 ZEGO 数字人 API 。这在很多场景下可以满足需求,但随着客户业务复杂度的提升,几个问题逐渐暴露:
1. 音色受限。 数字人 API 在文本驱动模式下支持的音色较少,目前仅覆盖阿里和豆包旧模型的音色。如果客户想用更多厂商的音色,需要自己去对接。
2. 产品边界错位。 AI Agent 侧有更丰富的音色能力,但过去只有互动 Agent 模式,缺少单纯的播报模式。客户为了用上好音色,不得不按互动 Agent 的全套链路接入,明明只需要单向播报,却要搭一套互动架构,徒增对接成本。
3. 内部重复建设。 同一个音色服务,数字人 API 和 AI Agent 各做一套,资源浪费且维护成本翻倍。
4. 客户体验割裂。 如果客户同时需要数字人 API 和 AI Agent 的能力,就得对接两套产品、两套 API、两套鉴权体系,开发体验和业务视角上都难以统一。
一句话总结:客户想要一个”既能用上好音色、又不用背互动包袱”的播报方案。 实时播报数字人就是为这个需求设计的。
实时播报数字人:更轻、更快、更聚焦
与互动数字人相比,实时播报数字人的定位非常清晰:只做单向内容输出,不做双向互动。这意味着:
- 对接极简。 核心链路只有两步:创建播报实例 → 主动下发 TTS 播报文本。没有对话管理、没有意图识别、没有多轮交互逻辑,接入成本相比互动 Agent 大幅降低。
- 音色自由。 复用 AI Agent 已有的音色服务体系,不再受限于数字人 PaaS 的少量音色。更多厂商、更多音色选择,一次接入即可使用。
- 产品统一。 播报和互动两种模式收敛到 AI Agent 一个产品下。客户不需要在两套系统之间切换,一套 API、一套鉴权体系覆盖全部数字人场景。
典型适用场景包括:新闻播报、直播带货话术播报、虚拟客服引导、展厅讲解、教育培训录播等——任何”数字人单向输出内容”的场景,都可以用实时播报数字人快速实现。
CDN 拉流:让播报数字人走进全域直播
本次更新同步上线了实时播报数字人的 CDN 拉流能力。
这个功能解决的是一个非常实际的诉求:客户做播报,通常不只是在自己的 App 里展示,更需要把画面推送到第三方平台。比如:
- 把播报画面输出到抖音、快手等国内平台;Facebook Live、YouTube Live、TikTok Live 等海外主流直播平台。
- 接入自有 CDN 分发链路,实现业务侧的直播分发。
- 同步播出到多个平台,一份播报内容全渠道覆盖。
CDN 拉流让实时播报数字人从”端内展示”走向”全渠道分发”,打通了播报内容输出的最后一公里。
总结
ZEGO 实时互动 AI Agent 2.13.5 版本的核心脉络:
| 能力 | 解决的问题 |
|---|---|
| 实时播报数字人 | 用 AI Agent 的音色体系做纯播报,告别数字人 PaaS 音色少、对接重的痛点 |
| CDN 拉流 | 播报画面一键分发至第三方直播平台或自有 CDN,覆盖全域直播场景 |
互动有互动的 Agent,播报有播报的 Agent——场景分离,产品统一。
更多版本细节和技术文档,请访问 ZEGO 实时互动 AI Agent 官方文档。
本文为原创稿件,版权归作者所有,如需转载,请注明出处:https://www.nxrte.com/zixun/70732.html