Runway 于 2026 年 9 月 10 日发布题为《Towards Instant Video Generation》的研究博客,披露其在实时视频生成方向的最新进展。该公司明确将 “即时生成” 视为视频模型的演进方向,并提出一套以自回归因果扩散与两阶段蒸馏为核心的技术路线,使视频模型能够逐帧流式输出内容,将创作者从 “输入提示词后被动等待” 转向 “边提示边执导”。

从 “等待” 到 “即时”:回应生成与迭代的时间痛点
Runway 指出,当前视频生成本质上是静态的:输入提示词,等待数秒甚至数分钟,得到一段成品;若结果不符合预期,只能从头再来。团队反复听到用户反馈 —— 生成和迭代时间正是创作流程中最慢的一环。而即时反馈可以把大部分时间从 “被动等待” 转为 “主动执导”。
即时生成同时带来成本结构的改变:模型运行更快意味着占用更少的 GPU 时间。Runway 认为,在给定质量水准下,每个输出的成本决定了用例的可行性,即时生成将把这一门槛进一步推高,让原本不具备成本效益的用例进入可落地范围。
技术路线:首帧 + 提示词条件化,解码器因果流式输出
在实现路径上,Runway 选择对基础模型(如 Gen-4.5)进行后训练。每一个自回归步骤都以两样输入为条件:初始首帧和用户在开始时选择的提示词。模型随后逐帧生成,并将所有已生成的 latent 保留在上下文中以保证质量;视频与音频解码器以因果方式运行,在 latent 生成的同时流式输出结果。
研究关键:两阶段蒸馏,让模型实时运行
让基础模型达到实时运行需要两步。
第一步是 “教师强制”(teacher forcing),把整个模型架构改造成时间因果、逐帧自回归的生成器 ——Runway 称这证明同一架构可以干净地适配自回归设定而不损失原有能力。
第二步是 “学生强制”(student forcing),通过分布匹配蒸馏把每帧所需的去噪步数压缩到个位数,从而以可接受的延迟实现流式输出。
蒸馏分两个阶段:先离线策略(off-policy),再在线策略(on-policy)。离线策略下,学生基于真实上下文因果预测下一状态,由冻结的双向教师模型示范优质生成,训练内存与步时开销较低,但视频领域的错误会逐帧累积、迅速导致模型偏离分布;在线策略则在训练内部执行 rollout,让学生看到自己生成的上下文并主动纠正漂移,与推理阶段完全等价。此外,递增序列长度的课程训练被证明优于全程固定序列长度。
基础设施:计算瓶颈从训练转向推理
实时生成把计算瓶颈从训练转移到了推理:每一帧都必须以足够快的速度离开模型,以跟上播放节奏,且要在共享硬件上支撑并发会话。Runway 表示,正在沿用其生产系统的评估方式,通过内部评估与可观测性工具,并排对比不同 checkpoint 与硬件配置下的生成质量和延迟。
应用前景:交互式生成媒体与智能体模拟
Runway 认为,即时生成是交互式体验的基础,而交互式体验最终将成为生成式媒体最大的用例。教育、游戏、机器人等领域都将依赖响应速度跟得上观看者的视频;模拟场景同样如此:评估机器人、自动驾驶等物理智能体在真实世界中的行为,需要能够实时生成并对边缘情况即时响应的环境,数字智能体执行复杂计算机使用任务同理。这一判断正在驱动 Runway 当前的基础研究。
背景
上周,Runway 已发布 Solaris 与 GWM Worlds 2,并详细披露其在数字与物理世界中训练智能体的方法。公司表示,近十年来从零构建基础模型训练工具链的积累,是其视频模型与实时生成研究加速的共同基础。
关于 Runway:Runway 是一家专注于多模态生成式 AI 研究与应用的公司,旗下视频生成产品包括 Gen-4.5、Runway Characters 等。
本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/zixun/71900.html