基于 MiniMax H3 Max 的 24 小时 AI 直播网站上线了

Fal 工程师 Alex Koumpas 在 Twitch 直播频道里,把聊天室变成了一个编剧室。

有人敲下 Prompt,想让镜头切到街头;下一位观众想看一条上世纪 60 年代风格的木偶广告;还有人要求画面突然变成一张被无数电线缠住的机器人脸。聊天框里不断涌进英语、西班牙语、日语、俄语,中文等,来自全球各地用户的点子。

Koumpas 给直播频道起了一个简单易懂的标题,“Chat Directs the Show with MiniMax H3 Max”。

基于 MiniMax H3 Max 的 24 小时 AI 直播网站上线了
Twitch – koumpas 频道截图

这场直播,正是 H3 开源后开发者生态迅速生长的一个缩影。

H3 开源后,我们与生态伙伴围绕不同的使用场景,继续训练和优化模型,并在社区中开放,包括:

  • 与 Running Hub 打造 MiniMax H3 480P,满足多场景需求
  • 与 fal 选择面向实时生成做后训练和推理优化,推出了 H3 Max 768P、H3 Max 480P
  • 以及 FastVideo 通过稀疏化和硬件适配推出的 FastH3 等

今天,我们将 H3 Max 768P、H3 Max 480P 接入开放平台和 MiniMax Design 中。

H3 Max 生成一段长度 5 秒、768p 的音视频的时间不到 3 秒,已经跨过了实时直播所需的速度门槛,当上一段视频还在播放时,系统已经有时间把下一段视频准备好。

由此,海外开发者已经围绕 H3 Max 搭出了 Twitch 直播、24 小时“AI 电视台”,还有邀请观众实时改写剧情的创作实验。视频模型被接进一条持续运转的内容流,开始参与实时互动,观众的每一条指令都有可能改变接下来出现的画面。

3 秒生成,观众参与实时共创

这一轮 AI 直播热潮里,fal 工程师 Rehan Sheikh 的 Twitch 直播最早引爆全网。Rehan 把 H3 Max 接进直播流,做成了一个没有固定节目单的“跨维度电视”。模型在几秒间不间断生成新的画面和声音,并接进实时直播,这份创意在 X 上的观看量已经近 350 万次。

基于 MiniMax H3 Max 的 24 小时 AI 直播网站上线了

随后,知名开发者 Pieter Levels 上线了一个 24 小时 AI 直播网站。网站首页只有一条很简单的规则:The chat decides what airs next。观众在聊天室里输入内容,AI 尝试把新的要求和上一段画面接起来,再生成下一段视频。在这座只有几秒库存的微型电视台里,直播可能突然从动画切到真人访谈,再跳进某个荒诞广告。观众的下一句话,就会把故事带到另一个方向。

相比提前录好一段演示视频后播出,完成实时直播需要同时处理陌生提示词、视频生成、队列衔接和持续推流等工作。模型的速度、指令理解和音视频能力都被放进了同一条公开链路里,每个人的指令都可以被直接观察:观众发出指令,模型生成片段,片段进入直播,新的指令再跟上来。也正因如此,生成速度决定了直播能不能持续进行。

生成快过播放,解锁即时直播场景

H3 Max 能支撑这种直播玩法,首先是因为它跑得足够快。H3 Max 支持文生视频和图生视频,可生成 480p 或 768p、5 至 15 秒、24fps 的完整音视频。5 秒、768p 视频的生成时间不到 3 秒,15 秒视频也可以在约 15 秒内完成。通过后训练和推理引擎的协同优化,H3 Max 的吞吐量约为 MiniMax H3 的 35 倍,在 Artificial Analysis、Design Arena 图生视频榜单中位居第一。

fal 在 MiniMax H3 开源版本的基础上加入了新数据和可验证强化学习,持续优化提示词遵循和画面表现,同时针对自有推理基础设施适配,为实时生成场景定向优化。5 秒的视频内容在不到 3 秒内生成,理论上还能为排队、内容审核、编码和推流留出一点余量。尽管实时直播仍会受到并发和网络状况影响,偶尔出现卡顿的情况,但 H3 Max 已经满足了这类实时实验最基本的速度要求。

基于 MiniMax H3 Max 的 24 小时 AI 直播网站上线了

开发团队 FastVideo 沿着另一条路线改造了 H3。FastVideo、Nuva Lab 和 NVIDIA FastGen 联合发布的 FastH3,把原生 H3 的 49 次 Transformer Forward 压缩到 4 次,再结合 90%稀疏度的 VSA 加速。

FastH3 使用 8 张 B200,可以在 13 秒内生成一段 15 秒、768p 的视频;在单张 Blackwell GPU 上,相较同硬件运行的基础 H3,最高可获得 14 倍加速。目前,FastH3 已公开模型权重、LoRA 和推理方案,现有版本支持文生音视频。

开源开放,让创造力涌现

我们欣喜地看到,基于 H3 模型开源,新的视频生成、交互形式不断在社区里出现。而对 MiniMax 来说,开源社区不只是 H3 的使用者,也是模型继续向前演进、落地场景不断焕新的重要参与者。

今天的 24 小时 AI 直播仍处于早期阶段,并发和长时间运行还需要继续验证。人物声音的稳定,画面能不能长时间保持一致,推理接口是否适合持续调用,这些在直播场景中真实使用的反馈,将会回到下一轮模型和系统优化中。

重要的是,在这场 AI 直播里,视频生成不仅仅是一次性的内容工具,而开始成为可以实时响应、不断生长的内容系统。MiniMax 与开源社区正在一起,把视频模型的速度、交互和应用边界继续向前推。

随着模型的持续迭代,相信会有新的互动内容、新的创作者工具,以及人们尚未设想过、还没有被定义过的产品从社区中出现。期待开发者和创作者们把 H3 带进更多具体场景,探索过去难以成立,甚至还没有被想象过的可能。

H3 开源三个多星期以来,下载量已经超过 2400 万次,产生超过 300 个公开衍生模型,成为 2026 年全球下载量最高的模型。我们会继续与开源社区和生态伙伴携手探索,降低开发者和企业的使用门槛,让 H3 进入更多真实商用业务中,并解决过去难以完成的问题。

API 接入 H3 Max:platform.minimaxi.com/docs/api-reference/video-generation-v2-create

MiniMax Design 下载:design.minimaxi.com

版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。

(0)

相关推荐