FLUX 3:Black Forest Labs 的多模态模型与机器人野心

2026 年 7 月 23 日,Black Forest Labs(BFL)发布了 FLUX 3,这是这家德国 AI 实验室首个多模态基础模型。FLUX 3 将图像、视频和音频的训练统一到同一架构下,并能扩展到机器人动作预测。视频能力是这次发布的核心:单个提示词可生成最长 20 秒、带原生音频的 720p 视频片段。

FLUX 3 目前处于 Early Access(早期访问)阶段,通过 BFL 官网申请审核后获得使用资格。API 和合作伙伴渠道暂未开放,FLUX 3 Image 将在未来数周内逐步推出,后续还有开源权重的 FLUX 3 Dev 版本。

FLUX 3 生成的章鱼特写

Self-Flow:统一多模态的技术路线

FLUX 3 建立在 BFL 自研的 Self-Flow 方法之上。2026 年 3 月首次公开的 Self-Flow,核心思路是在同一底层架构内高效对齐多模态的生成与理解能力,而非为每种模态训练独立模型。

BFL 的实验数据显示,与传统的 Flow Matching(流匹配)方法相比,Self-Flow 在各模态上的生成误差(Fréchet distance)显著降低,同时在微调后的操控任务成功率上也表现更好。这意味着 FLUX 3 在训练阶段就同时学习图像、视频和音频,三种模态共享底层表示。

这种架构选择带来了一个关键推论:视频预测占据了 FLUX 3 总训练算力的 95% 以上。原因在于,要生成逼真的视频,模型必须学会接触、运动、重量、因果关系等物理常识——任何一个环节出错,画面都会显得不自然。学习精确渲染世界的过程,本质上就是学习世界运行的规律。

四条产品线

FLUX 3 划分为四个产品方向:

  • FLUX 3 Video:文字生成视频、图片生成视频、视频生成视频、视频音频续写。单个提示词输出最长 20 秒 720p 带原生音频的片段,支持关键帧过渡、多语言对话、文字排版和片段串联。
  • FLUX 3 Image:多风格、多宽高比、多分辨率的图像合成与编辑,在复杂提示词处理和多语言文字渲染上有明显提升。
  • FLUX 3 Action:基于 FLUX 3 骨干网络的动作预测能力,面向机器人和物理 AI 应用。
  • FLUX 3 Dev:计划在今年晚些时候发布的开源权重版本。

视频偏好对比

BFL 公布了 FLUX 3 Video 与 8 个竞品的初步偏好测试结果。测试条件为 10 秒、720p 带音频的文生视频片段,由人工评审进行对比选择。

竞品模型评审者选择 FLUX 3 的比例
Luma Ray 3.293%
Runway Gen-4.577%
Grok Imagine Video69%
Kling v3 Pro60%
Happy Horse v159%
Happy Horse 1.157%
Seedance 2.052%
Gemini Omni Flash52%

FLUX 3 视频偏好对比

50% 的基准线意味着两种选择持平。FLUX 3 在所有对比中都超过了 50%,但领先幅度差异很大:对 Luma Ray 3.2 和 Runway Gen-4.5 的优势最明显(93% 和 77%),这两者虽是成熟产品,但在独立视频排名中已非领跑者。对 Seedance 2.0 和 Gemini Omni Flash 的优势收窄到 52%,属于统计意义上的势均力敌。其中 Seedance 2.0 因 Netflix、Warner Bros.、Disney 等公司的版权诉讼威胁,ByteDance 已无限期暂停其国际版上线。

BFL 表示这些是初步评测结果,完整的基准数据和方法论将在更广泛可用性阶段发布。

从视频模型到机器人:FLUX-mimic

BFL 同时发布了 FLUX 3 x mimic,这是与瑞士机器人公司 Mimic Robotics 合作开发的视频动作模型。FLUX-mimic 基于 FLUX 3 骨干网络,在其上附加动作解码器,将视频模型学到的世界知识转化为可执行的操作指令。

测试结果显示,即便 FLUX 骨干网络完全冻结(不参与微调),仅训练动作解码器,FLUX-mimic 在操控任务上的成功率就已超越此前的视觉语言动作模型(VLA)。当骨干网络与动作解码器联合微调时,FLUX-mimic 达到了当前最优的成功率。

在推理速度方面,FLUX-mimic 的骨干网络可在单张 RTX 5090 GPU 上以不到 80 毫秒的速度完成从输入到世界表示的前向传播——接近人类视觉反应时间的量级。这使得实时机器人控制成为可能。

这一实验的核心意义在于:视频生成模型学到的不只是像素层面的画面预测,而是包含物理交互规律的可迁移世界知识。同一套表示既能用于内容创作,也能驱动物理世界中的机械臂。

公司背景与投资

Black Forest Labs 由 Robin Rombach、Andreas Blattmann 和 Patrick Esser 于 2024 年创立,三人均为 Stability AI 前员工,曾在 LMU Munich 参与 Stable Diffusion 的研发。公司总部位于德国弗莱堡,在旧金山设有办公室,团队规模约 100 人。

截至目前,BFL 估值 32.5 亿美元,累计融资超过 4.5 亿美元,投资方包括 a16z、NVIDIA、General Catalyst、Adobe Ventures、Figma Ventures、Canva、Salesforce Ventures 以及 Deutsche Telekom 的 T.Capital。

FLUX 系列模型已被集成到 Adobe Photoshop、Picsart 等创意平台的生产环境中。BFL 表示,今年晚些时候将发布更快的版本和开源权重版本的 FLUX 3,延续其一贯的开放策略。

当前局限

FLUX 3 目前尚未公布定价、服务等级协议、评测方法论、样本量和评审者人数。图像模型的基准数据完全缺席。企业客户暂时无法计算总体拥有成本,也无法独立复现视频对比结果。

访问渠道有限:仅接受官网申请审核,API 和合作伙伴渠道均未开放。FLUX 3 Image 尚未进入早期访问,FLUX 3 Dev 开源版本的发布时间也未确定。完整的基准测试结果将在 GA(General Availability)阶段随方法论一同公布。

推荐阅读