Black Forest Labs 发布 FLUX 3 多模态模型
Black Forest Labs 推出 FLUX 3
Black Forest Labs 宣布推出 FLUX 3,将其描述为一个面向 图像、视频、音频与动作预测 的多模态模型。其视频能力 FLUX 3 Video 已进入早期访问阶段。
这次发布的重点在于:FLUX 3 不是单一的视频生成模型,而是被定位为一个统一架构下的多模态系统。Black Forest Labs 表示,该模型经过联合训练,可扩展到多种模态任务,并生成更贴近真实世界、适配多种风格的内容。
统一架构与 Self Flow
发布材料中提到的核心概念是 Self Flow。从公开信息看,Self Flow 被用于覆盖多个模态能力,包括:
- 图像生成
- 视频生成
- 音频相关能力
- 动作预测
Black Forest Labs 强调,FLUX 3 采用统一架构进行联合训练,而不是为不同模态分别构建完全独立的模型。这一方向与当前生成式媒体模型的发展趋势一致:从单点能力走向跨模态生成与理解。
FLUX 3 Video 的意义
Black Forest Labs 在 2024 年推出 FLUX 1 时,就曾暗示未来会进入视频模型方向。两年后,FLUX 3 Video 的发布意味着该路线正式落地。
对于生成式媒体社区来说,这次发布值得关注的原因包括:
- FLUX 系列此前已在图像生成领域建立知名度;
- 视频生成是当前竞争最激烈的方向之一;
- FLUX 3 将视频与图像、音频、动作预测放在同一架构中讨论;
- 动作预测能力可能与机器人或具身智能任务相关。
不过,目前公开信息主要来自发布材料和演示内容,仍需要等待更多第三方评测、实际可用性反馈以及开发者体验来判断其真实能力边界。
与其他模型的竞争
围绕 FLUX 3 的讨论中,外界将其与 Seedance 2.0、Gemini Omni、Grok Imagine 等多模态或生成式媒体模型进行比较。Black Forest Labs 也在发布材料中提出了较强的偏好评测主张。
需要注意的是,这类比较往往依赖具体测试集、提示词、评测方式和人工偏好标准。对于开发者和研究者而言,更有价值的问题可能是:
- FLUX 3 Video 在复杂运动、镜头一致性和物理合理性上表现如何?
- 统一多模态架构是否带来更好的跨模态控制能力?
- 早期访问版本是否具备稳定 API、可控成本和足够低的延迟?
- 动作预测能力是否能迁移到实际机器人或仿真任务中?
论坛讨论点
FLUX 3 的发布说明,生成式媒体模型正在从“图像生成”“视频生成”的单项竞争,进入更综合的多模态系统竞争阶段。
如果其统一架构和 Self Flow 路线在真实使用中成立,那么未来同一个模型可能同时承担创意生成、视频制作、音频协同以及动作预测等任务。但在更多独立测试出现之前,仍应将当前结论视为发布方主张,而非最终行业定论。
