FLUX 3:Black Forest Labs 的多模态模型与机器人野心
2026 年 7 月 23 日,Black Forest Labs(BFL)发布了 FLUX 3,这是这家德国 AI 实验室首个多模态基础模型。FLUX 3 将图像、视频和音频的训练统一到同一架构下,并能扩展到机器人动作预测。视频能力是这次发布的核心:单个提示词可生成最长 20 秒、带原生音频的 720p 视频片段。
FLUX 3 目前处于 Early Access(早期访问)阶段,通过 BFL 官网申请审核后获得使用资格。API 和合作伙伴渠道暂未开放,FLUX 3 Image 将在未来数周内逐步推出,后续还有开源权重的 FLUX 3 Dev 版本。

Self-Flow:统一多模态的技术路线
FLUX 3 建立在 BFL 自研的 Self-Flow 方法之上。2026 年 3 月首次公开的 Self-Flow,核心思路是在同一底层架构内高效对齐多模态的生成与理解能力,而非为每种模态训练独立模型。
BFL 的实验数据显示,与传统的 Flow Matching(流匹配)方法相比,Self-Flow 在各模态上的生成误差(Fréchet distance)显著降低,同时在微调后的操控任务成功率上也表现更好。这意味着 FLUX 3 在训练阶段就同时学习图像、视频和音频,三种模态共享底层表示。
这种架构选择带来了一个关键推论:视频预测占据了 FLUX 3 总训练算力的 95% 以上。原因在于,要生成逼真的视频,模型必须学会接触、运动、重量、因果关系等物理常识——任何一个环节出错,画面都会显得不自然。学习精确渲染世界的过程,本质上就是学习世界运行的规律。
四条产品线
FLUX 3 划分为四个产品方向:
- FLUX 3 Video:文字生成视频、图片生成视频、视频生成视频、视频音频续写。单个提示词输出最长 20 秒 720p 带原生音频的片段,支持关键帧过渡、多语言对话、文字排版和片段串联。
- FLUX 3 Image:多风格、多宽高比、多分辨率的图像合成与编辑,在复杂提示词处理和多语言文字渲染上有明显提升。
- FLUX 3 Action:基于 FLUX 3 骨干网络的动作预测能力,面向机器人和物理 AI 应用。
- FLUX 3 Dev:计划在今年晚些时候发布的开源权重版本。
视频偏好对比
BFL 公布了 FLUX 3 Video 与 8 个竞品的初步偏好测试结果。测试条件为 10 秒、720p 带音频的文生视频片段,由人工评审进行对比选择。
| 竞品模型 | 评审者选择 FLUX 3 的比例 |
|---|---|
| Luma Ray 3.2 | 93% |
| Runway Gen-4.5 | 77% |
| Grok Imagine Video | 69% |
| Kling v3 Pro | 60% |
| Happy Horse v1 | 59% |
| Happy Horse 1.1 | 57% |
| Seedance 2.0 | 52% |
| Gemini Omni Flash | 52% |

50% 的基准线意味着两种选择持平。FLUX 3 在所有对比中都超过了 50%,但领先幅度差异很大:对 Luma Ray 3.2 和 Runway Gen-4.5 的优势最明显(93% 和 77%),这两者虽是成熟产品,但在独立视频排名中已非领跑者。对 Seedance 2.0 和 Gemini Omni Flash 的优势收窄到 52%,属于统计意义上的势均力敌。其中 Seedance 2.0 因 Netflix、Warner Bros.、Disney 等公司的版权诉讼威胁,ByteDance 已无限期暂停其国际版上线。
BFL 表示这些是初步评测结果,完整的基准数据和方法论将在更广泛可用性阶段发布。
从视频模型到机器人:FLUX-mimic
BFL 同时发布了 FLUX 3 x mimic,这是与瑞士机器人公司 Mimic Robotics 合作开发的视频动作模型。FLUX-mimic 基于 FLUX 3 骨干网络,在其上附加动作解码器,将视频模型学到的世界知识转化为可执行的操作指令。
测试结果显示,即便 FLUX 骨干网络完全冻结(不参与微调),仅训练动作解码器,FLUX-mimic 在操控任务上的成功率就已超越此前的视觉语言动作模型(VLA)。当骨干网络与动作解码器联合微调时,FLUX-mimic 达到了当前最优的成功率。
在推理速度方面,FLUX-mimic 的骨干网络可在单张 RTX 5090 GPU 上以不到 80 毫秒的速度完成从输入到世界表示的前向传播——接近人类视觉反应时间的量级。这使得实时机器人控制成为可能。
这一实验的核心意义在于:视频生成模型学到的不只是像素层面的画面预测,而是包含物理交互规律的可迁移世界知识。同一套表示既能用于内容创作,也能驱动物理世界中的机械臂。
公司背景与投资
Black Forest Labs 由 Robin Rombach、Andreas Blattmann 和 Patrick Esser 于 2024 年创立,三人均为 Stability AI 前员工,曾在 LMU Munich 参与 Stable Diffusion 的研发。公司总部位于德国弗莱堡,在旧金山设有办公室,团队规模约 100 人。
截至目前,BFL 估值 32.5 亿美元,累计融资超过 4.5 亿美元,投资方包括 a16z、NVIDIA、General Catalyst、Adobe Ventures、Figma Ventures、Canva、Salesforce Ventures 以及 Deutsche Telekom 的 T.Capital。
FLUX 系列模型已被集成到 Adobe Photoshop、Picsart 等创意平台的生产环境中。BFL 表示,今年晚些时候将发布更快的版本和开源权重版本的 FLUX 3,延续其一贯的开放策略。
当前局限
FLUX 3 目前尚未公布定价、服务等级协议、评测方法论、样本量和评审者人数。图像模型的基准数据完全缺席。企业客户暂时无法计算总体拥有成本,也无法独立复现视频对比结果。
访问渠道有限:仅接受官网申请审核,API 和合作伙伴渠道均未开放。FLUX 3 Image 尚未进入早期访问,FLUX 3 Dev 开源版本的发布时间也未确定。完整的基准测试结果将在 GA(General Availability)阶段随方法论一同公布。
- 腾讯玄武阿图因AI在CyberGym测试中超越Mythos7/3/2026
- OpenSEO:5800 Star 的开源 SEO 工具,10 美元/月挑战 Semrush 与 Ahrefs7/20/2026
- 华为开源 920 亿参数 openPangu-2.0-Flash 模型6/30/2026
- 美国政府要求 OpenAI 分阶段发布 GPT-5.66/26/2026
- Anthropic 获美国政府批准,恢复 Mythos 5 模型对关键基础设施组织的部署6/27/2026
- OmniRoute:日增 1300+ Star 的开源 AI 网关,一个端点接通 250 个模型提供商7/20/2026
- xAI 开源 Grok Build:Rust 编写的终端编程代理7/15/2026
- Gemini Omni Flash 登顶 Video Arena 盲测榜,领先第二名 101 分7/3/2026
- 华为天才少年的开源AI Agent全书:6700星、十章、可跑实验代码7/20/2026
- Voicebox:43K Stars 的开源 AI 语音工作室,7 引擎 TTS + MCP Agent 集成7/19/2026
- 6.4 万 Star 的开源全球情报平台:World Monitor 架构与能力全景7/21/2026
- Hallmark:一份写给AI编码助手的反AI味设计手册7/17/2026
- 27B 模型塞进手机:PrismML Bonsai 27B 把权重压到 1-bit7/18/2026
- Qwen3.8 发布:2.4T 参数、原生多模态、开放权重承诺7/19/2026
- Kronos:金融市场的第一个开源 K 线基础模型7/24/2026
- Block 开源 Buzz:Nostr 上的 AI 协作工作空间7/23/2026
- Gigatoken:比 HuggingFace 快 1000 倍的开源分词器7/22/2026
- KTransformers:单 GPU 跑 671B MoE 模型的清华方案7/21/2026
- B站在WAIC展出开源AI猫娘:能看懂屏幕、主动搭话的桌面伙伴7/18/2026
- Kimi K3 首登 DeepSWE v1.1:开源权重模型挤进前三7/18/2026
- jcode:用 Rust 重写的 AI 编码代理,内存占用仅为 Claude Code 的 1/147/22/2026
- AI 代码审查的 token 困境:code-review-graph 如何用代码图谱砍掉 98% 的上下文7/20/2026
- AI 连破三大数学猜想:Jacobian 猜想 87 年反例与形式化验证的新时代7/21/2026
- DeepSeek 联合北大开源 DSpark:半自回归推测解码,推理速度提升 57% 至 85%6/27/2026
- GPT-5.6用一段十页提示词,关闭凸优化30年的复杂性缺口7/19/2026
- Moonshine Micro:80美分芯片跑完整语音流水线,500KB内存装下VAD+STT+TTS7/18/2026
- LingBot-Map:用前馈3D基础模型做流式重建,20FPS跑完一万帧7/18/2026
- Claude Code 被指通过 system prompt 隐蔽传递代理与时区信息6/30/2026
- 梁文锋 4 小时投资人会议:DeepSeek 的 AGI 路线图与克制哲学7/24/2026
- 四个AI模型横扫IMO 2026满分:Claude Fable 5、GPT-5.6 Sol、Kimi K3的42分之战7/23/2026