2026 年 7 月 23 日,Black Forest Labs(BFL)发布了 FLUX 3,这是这家德国 AI 实验室首个多模态基础模型。FLUX 3 将图像、视频和音频的训练统一到同一架构下,并能扩展到机器人动作预测。视频能力是这次发布的核心:单个提示词可生成最长 20 秒、带原生音频的 720p 视频片段。
FLUX 3 目前处于 Early Access(早期访问)阶段,通过 BFL 官网申请审核后获得使用资格。API 和合作伙伴渠道暂未开放,FLUX 3 Image 将在未来数周内逐步推出,后续还有开源权重的 FLUX 3 Dev 版本。

Self-Flow:统一多模态的技术路线
FLUX 3 建立在 BFL 自研的 Self-Flow 方法之上。2026 年 3 月首次公开的 Self-Flow,核心思路是在同一底层架构内高效对齐多模态的生成与理解能力,而非为每种模态训练独立模型。
BFL 的实验数据显示,与传统的 Flow Matching(流匹配)方法相比,Self-Flow 在各模态上的生成误差(Fréchet distance)显著降低,同时在微调后的操控任务成功率上也表现更好。这意味着 FLUX 3 在训练阶段就同时学习图像、视频和音频,三种模态共享底层表示。
这种架构选择带来了一个关键推论:视频预测占据了 FLUX 3 总训练算力的 95% 以上。原因在于,要生成逼真的视频,模型必须学会接触、运动、重量、因果关系等物理常识——任何一个环节出错,画面都会显得不自然。学习精确渲染世界的过程,本质上就是学习世界运行的规律。
四条产品线
FLUX 3 划分为四个产品方向:
- FLUX 3 Video:文字生成视频、图片生成视频、视频生成视频、视频音频续写。单个提示词输出最长 20 秒 720p 带原生音频的片段,支持关键帧过渡、多语言对话、文字排版和片段串联。
- FLUX 3 Image:多风格、多宽高比、多分辨率的图像合成与编辑,在复杂提示词处理和多语言文字渲染上有明显提升。
- FLUX 3 Action:基于 FLUX 3 骨干网络的动作预测能力,面向机器人和物理 AI 应用。
- FLUX 3 Dev:计划在今年晚些时候发布的开源权重版本。
视频偏好对比
BFL 公布了 FLUX 3 Video 与 8 个竞品的初步偏好测试结果。测试条件为 10 秒、720p 带音频的文生视频片段,由人工评审进行对比选择。
| 竞品模型 | 评审者选择 FLUX 3 的比例 |
|---|---|
| Luma Ray 3.2 | 93% |
| Runway Gen-4.5 | 77% |
| Grok Imagine Video | 69% |
| Kling v3 Pro | 60% |
| Happy Horse v1 | 59% |
| Happy Horse 1.1 | 57% |
| Seedance 2.0 | 52% |
| Gemini Omni Flash | 52% |

50% 的基准线意味着两种选择持平。FLUX 3 在所有对比中都超过了 50%,但领先幅度差异很大:对 Luma Ray 3.2 和 Runway Gen-4.5 的优势最明显(93% 和 77%),这两者虽是成熟产品,但在独立视频排名中已非领跑者。对 Seedance 2.0 和 Gemini Omni Flash 的优势收窄到 52%,属于统计意义上的势均力敌。其中 Seedance 2.0 因 Netflix、Warner Bros.、Disney 等公司的版权诉讼威胁,ByteDance 已无限期暂停其国际版上线。
BFL 表示这些是初步评测结果,完整的基准数据和方法论将在更广泛可用性阶段发布。
从视频模型到机器人:FLUX-mimic
BFL 同时发布了 FLUX 3 x mimic,这是与瑞士机器人公司 Mimic Robotics 合作开发的视频动作模型。FLUX-mimic 基于 FLUX 3 骨干网络,在其上附加动作解码器,将视频模型学到的世界知识转化为可执行的操作指令。
测试结果显示,即便 FLUX 骨干网络完全冻结(不参与微调),仅训练动作解码器,FLUX-mimic 在操控任务上的成功率就已超越此前的视觉语言动作模型(VLA)。当骨干网络与动作解码器联合微调时,FLUX-mimic 达到了当前最优的成功率。
在推理速度方面,FLUX-mimic 的骨干网络可在单张 RTX 5090 GPU 上以不到 80 毫秒的速度完成从输入到世界表示的前向传播——接近人类视觉反应时间的量级。这使得实时机器人控制成为可能。
这一实验的核心意义在于:视频生成模型学到的不只是像素层面的画面预测,而是包含物理交互规律的可迁移世界知识。同一套表示既能用于内容创作,也能驱动物理世界中的机械臂。
公司背景与投资
Black Forest Labs 由 Robin Rombach、Andreas Blattmann 和 Patrick Esser 于 2024 年创立,三人均为 Stability AI 前员工,曾在 LMU Munich 参与 Stable Diffusion 的研发。公司总部位于德国弗莱堡,在旧金山设有办公室,团队规模约 100 人。
截至目前,BFL 估值 32.5 亿美元,累计融资超过 4.5 亿美元,投资方包括 a16z、NVIDIA、General Catalyst、Adobe Ventures、Figma Ventures、Canva、Salesforce Ventures 以及 Deutsche Telekom 的 T.Capital。
FLUX 系列模型已被集成到 Adobe Photoshop、Picsart 等创意平台的生产环境中。BFL 表示,今年晚些时候将发布更快的版本和开源权重版本的 FLUX 3,延续其一贯的开放策略。
当前局限
FLUX 3 目前尚未公布定价、服务等级协议、评测方法论、样本量和评审者人数。图像模型的基准数据完全缺席。企业客户暂时无法计算总体拥有成本,也无法独立复现视频对比结果。
访问渠道有限:仅接受官网申请审核,API 和合作伙伴渠道均未开放。FLUX 3 Image 尚未进入早期访问,FLUX 3 Dev 开源版本的发布时间也未确定。完整的基准测试结果将在 GA(General Availability)阶段随方法论一同公布。