Black Forest Labs 发布 FLUX 3 多模态模型

Latent Space3 天前

Black Forest Labs 推出 FLUX 3

Black Forest Labs 宣布推出 FLUX 3,将其描述为一个面向 图像、视频、音频与动作预测 的多模态模型。其视频能力 FLUX 3 Video 已进入早期访问阶段。

这次发布的重点在于:FLUX 3 不是单一的视频生成模型,而是被定位为一个统一架构下的多模态系统。Black Forest Labs 表示,该模型经过联合训练,可扩展到多种模态任务,并生成更贴近真实世界、适配多种风格的内容。

统一架构与 Self Flow

发布材料中提到的核心概念是 Self Flow。从公开信息看,Self Flow 被用于覆盖多个模态能力,包括:

  • 图像生成
  • 视频生成
  • 音频相关能力
  • 动作预测

Black Forest Labs 强调,FLUX 3 采用统一架构进行联合训练,而不是为不同模态分别构建完全独立的模型。这一方向与当前生成式媒体模型的发展趋势一致:从单点能力走向跨模态生成与理解。

FLUX 3 Video 的意义

Black Forest Labs 在 2024 年推出 FLUX 1 时,就曾暗示未来会进入视频模型方向。两年后,FLUX 3 Video 的发布意味着该路线正式落地。

对于生成式媒体社区来说,这次发布值得关注的原因包括:

  1. FLUX 系列此前已在图像生成领域建立知名度
  2. 视频生成是当前竞争最激烈的方向之一
  3. FLUX 3 将视频与图像、音频、动作预测放在同一架构中讨论
  4. 动作预测能力可能与机器人或具身智能任务相关

不过,目前公开信息主要来自发布材料和演示内容,仍需要等待更多第三方评测、实际可用性反馈以及开发者体验来判断其真实能力边界。

与其他模型的竞争

围绕 FLUX 3 的讨论中,外界将其与 Seedance 2.0、Gemini Omni、Grok Imagine 等多模态或生成式媒体模型进行比较。Black Forest Labs 也在发布材料中提出了较强的偏好评测主张。

需要注意的是,这类比较往往依赖具体测试集、提示词、评测方式和人工偏好标准。对于开发者和研究者而言,更有价值的问题可能是:

  • FLUX 3 Video 在复杂运动、镜头一致性和物理合理性上表现如何?
  • 统一多模态架构是否带来更好的跨模态控制能力?
  • 早期访问版本是否具备稳定 API、可控成本和足够低的延迟?
  • 动作预测能力是否能迁移到实际机器人或仿真任务中?

论坛讨论点

FLUX 3 的发布说明,生成式媒体模型正在从“图像生成”“视频生成”的单项竞争,进入更综合的多模态系统竞争阶段。

如果其统一架构和 Self Flow 路线在真实使用中成立,那么未来同一个模型可能同时承担创意生成、视频制作、音频协同以及动作预测等任务。但在更多独立测试出现之前,仍应将当前结论视为发布方主张,而非最终行业定论。

评论

请登录后发表观点

暂无数据