Black Forest Labs (BFL) 发布了FLUX 3,这是一个多模态基础模型,可在单一架构内学习图像、视频和音频。它也是首个仅使用一组权重即可实现视频、音频和动作预测的 FLUX 模型。

Black Forest Labs(BFL)的研究团队认为,没有任何单一的模态能够完整地描述世界。图像捕捉的是某一瞬间的空间结构;视频还原了时间并揭示了物理动态;音频则揭示了机械事件与声音之间的因果关系。每一种模态都被视为对同一潜在现实的一种有损投射。
同时训练所有这些模式意味着它们之间会相互制约。声音必须与冲击力相匹配。运动必须符合质量。研究团队称 FLUX 3 是他们首个完全基于这一原理构建的模型。
底层方法:Self-Flow
FLUX 3 基于Self-Flow,这是 BFL 提出的将多模态生成和理解整合到同一架构中的方法。Self-Flow 结合了流匹配目标和自监督特征重构目标。GitHub上的参考实现采用 Apache-2.0 许可,并使用 SiT-XL/2 进行逐词时间步条件化。它以 25% 的逐词掩码比例进行训练,并采用自蒸馏方法,从第 20 层的 EMA 教师模型到第 8 层的学生模型。
此次发布的检查点是 ImageNet 256×256 研究模型,并非 FLUX 3。BFL 表示,他们采用相同的方法“显著扩展了计算和数据资源”,以便同时在视频、图像和音频上训练 FLUX 3。Self-Flow 本身于 2026 年 3 月推出,因此并非此次发布中的新内容。真正的新变化在于规模。
FLUX 3 视频的功能
FLUX 3 Video 一次生成即可制作长达 20 秒的视频片段,并带有原生音频。支持的模式包括文本转视频、图像转视频、从参考片段生成视频、用于控制转场的关键帧转视频,以及从输入的视频和音频生成视频音频连续片段。
BFL还列举了其多语言对话、将片段巧妙串联成多镜头序列以及运用动画设计生成精美字体等功能。BFL团队表示,他们在人类面部表情的刻画以及将声音与物理事件关联起来方面尤为出色。
表现
BFL团队公布了初步的用户体验偏好测试结果。测试设置是10秒的文本转视频片段,分辨率为720p,并带有音频。在93%的对比测试中,FLUX 3优于Luma Ray 3.2,在77%的对比测试中优于Runway Gen-4.5。与Grok Imagine Video相比,这一比例上升至69%,Kling v3 Pro为60%,Happy Horse v1为59%,Happy Horse 1.1为57%。与Seedance 2.0和Gemini Omni Flash相比,结果为52%,接近五五开。
要点总结
- FLUX 3 是一个流匹配主干网络,它联合训练图像、视频和音频。
- FLUX 3 视频一次生成即可生成长达 20 秒的原生音频视频。
- 视频预测消耗了超过 95% 的训练计算资源;音频仅占不到 0.5% 的词元。
- 同样的骨干网驱动着 FLUX-mimic,这是一个在单个 RTX 5090 上运行不到 80 毫秒的机器人策略。
- 访问权限受到限制:视频和动作内容优先开放,图像内容随后开放,公开内容最后开放。
参考资料:
FLUX 3 发布公告:https://bfl.ai/blog/flux-3
文档:https://bfl.ai/blog/flux-3-mimic
本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/jishu/70387.html