Black Forest Labs 发布 FLUX 3:图像、视频、声音、机器人押在同一个模型上
- Black Forest Labs 发了 FLUX 3。同一个模型,一边生成最长 20 秒、画面和声音一起出的视频,一边在奥迪的产线上开机器人。他们说这两件事底下是同一套东西。
- 核心押注是:图像、视频、声音、动作都是同一个现实的侧面,各自都丢了一部分信息。分开学只能学到侧面,一起学它们互相约束,才逼模型去学那个共同的底层现实。训练算力的 95% 以上花在视频上,声音在带音频的 720p 视频里占不到 0.5% 的 token。
- 底下的方法叫 Self-Flow:给同一份数据的不同部分加不同强度的噪声,人为造出一个「看得清的老师」和一个「看得糊的学生」,逼模型自己教自己,不再外挂 DINOv2 这类现成的理解模型,因为外挂那条路在图像以外根本不管用。
- 现在能碰的只有视频,要申请审批。人评里跟 Gemini Omni Flash 打成 52% 平手,而那家现在就能用、$0.10 一秒。价格、图像 benchmark、开放权重的许可证,一个都还没公布。
同一个模型,既生成带声音的视频,也在奥迪产线上开机器人
德国公司 Black Forest Labs 做的 FLUX 系列,过去两年是很多人用来画图的东西。Adobe Photoshop 的生成功能、Picsart 的 AI 功能,底下跑的都有它。7 月 23 日他们发布 FLUX 3,同一个模型现在能生成最长 20 秒、画面和声音一起出的视频。
同一套模型的另一份用法,此刻装在奥迪产线的机器人上,抓密封条和线缆这类会变形的东西,这是传统自动化几十年都没碰下来的活。
公司在德国 Freiburg,创始团队里有当年做出 VQGAN、潜在扩散和 Stable Diffusion 的那批人。这是他们第一个公开的视频生成模型。
发布分成四条产品线,但今天能真正碰到的只有一条。下面三张卡标的是「你现在能不能用上」:
他们认为图像、视频、声音、动作是同一件事的四个侧面
要理解 FLUX 3 为什么长这样,得先接受它的前提。这个前提无关技术细节。它是一句关于世界的判断:没有任何一种模态能完整描述现实。
图像记下的是某一个瞬间的空间结构,什么东西在哪、跟什么挨着。视频把时间还回来了,于是能看出东西怎么动、有多重、碰一下会怎样。声音揭示的是机械现象和声学之间的因果,这层关系光看画面看不出来。语言则把这些感知连到目标、抽象和指令上。
每一种都是同一个现实的一次投影,由不同的传感器捕捉,每一次捕捉都在过程里丢掉了一些信息。只学其中一种,你得到的是那一种投影的好模型。四种一起学,它们的互相约束会告诉你更多:声音必须对得上撞击,运动必须服从质量,后面必须承接前面。约束一多,模型就没法只学表面,它得去猜那个能同时满足所有约束的底层东西。
你骗不了现实。只学图像的模型只能生成图像。但世界不是由静止画面组成的,它会动、会响、会变化、会回应。
Robin Rombach,Black Forest Labs 联合创始人兼 CEO,发布前提供给 VentureBeat 的书面表述
训练算力的 95% 花在视频上,声音几乎是搭车学会的
上面那段如果只停在说法层面,谁都可以讲。它落到具体处,是一笔算力账。
FLUX 3 从一开始就在图像、视频、音频上联合训练,其中最吃资源的部分是视频预测,占了训练总算力的 95% 以上。原因不复杂:要生成看起来对的视频,模型没有别的选择,必须学会接触、运动、重量、因果,其中任何一样搞错,人一眼就看出假。学会准确地渲染这个世界,等价于学会这个世界怎么运转。
声音反倒是这几样里最便宜的。它维度低、细节比视频少得多,在一段带音频的 720p 视频里,声音占的 token 不到 0.5%。模型把视频理解这关过了之后,它自己就会学到视频和音频之间的因果:说话对上口型,音效对上引发它的那个物理事件。
动作也是同一个形状:机器人状态是一个低维表示,紧紧绑在视觉观察上。画面、声音、动作都是同一个物理现实的局部表示。模型学完视频和音频背后的物理过程之后,预测动作算不上另起炉灶,它是同一个现实的又一个视角。
他们拿一次训练验证了这个说法
如果上面的框架成立,那么教 FLUX 3 预测动作就不该留下长期代价:模型会有一小段被打扰的时期,要学清楚动作空间的结构、把内部的世界表示对齐过去,然后回到原来的水平。
他们在一次大规模训练里把动作预测加进课程表,盯着视频生成质量看。文生视频和图生视频的人评一开始掉了最多 10%;3500 步之后,视频生成质量回到了加动作之前的水平,而此时模型还多会了预测动作。
模型确实得把动作接进自己的输入和输出,但这件事没有永久占走它的容量,它只是要弄明白这个新模态跟已有的世界模型是什么关系。弄明白之后,原有能力上的损失就消失了。
Self-Flow:让模型自己教自己,不再外挂一个理解模型
FLUX 3 底下那套训练方法叫 Self-Flow,是 Black Forest Labs 2026 年 3 月发的研究,作者里还有 MIT 的 Antonio Torralba。想看懂它改了什么,得先知道以前卡在哪。
旧办法:外面挂一个懂行的模型来带
做图像和视频的生成模型(扩散模型、流模型这一类)有个被反复验证的现象:模型内部的语义表示越强,收敛越快、生成质量越好。问题是这种表示不会自己长出来。模型的训练目标是去噪,从一团噪声一步步走到清晰画面,每一步只要预测该往哪走。而去噪这件事本身,几乎不需要理解画面里是什么,所以模型没有动力去学语义。
业内的通行解法是从外面借:挂一个已经训好的理解模型当参照(最常用的是 DINOv2),逼生成模型的内部表示向它看齐,这套做法叫 REPA。它有效,但带着三个麻烦:那个外挂模型要单独训练;它的目标跟生成目标对不上;放大规模之后表现不符合预期。
Self-Flow:在模型内部人为制造一个信息差
Self-Flow 的核心动作叫双时间步调度(Dual-Timestep Scheduling)。给一份干净数据,抽两个时间步和一个随机掩码,然后按各自分到的时间步给每个 token 加噪声,于是同一份数据里,有的地方糊得厉害,有的地方还比较清楚。
关键在这一步:其中一路(老师)用两个时间步里较小的那个加噪,看得更清楚;另一路(学生)看到的是混着不同噪声强度的版本。学生被要求同时干两件事:把自己手上这份去噪,以及从这个残缺的视图里,把老师看到的特征重建出来。
信息不对称就是驱动力。学生想补上自己缺的那部分,没法只盯着自己那一小块,它必须去看别处还剩什么、去理解画面和声音里的结构。补洞的过程本身,就在长出语义表示。生成能力和理解能力在同一套训练里一起出来,不需要任何外部模型和额外监督。
像拼图拼到一半,有人故意盖住了几块。你要把被盖住的部分猜出来,只能靠周围已经露出来的图案去推。推的这个过程本身,就在加深你对整幅图的理解,而这正是盖住它们的目的。
为什么这件事对多模态是必需的
研究里有两组结果,解释了为什么想做一个统吃三种模态的模型,外挂那条路走不通。
第一组是跨模态的失效。在视频上,最强的外部编码器居然还是 DINOv2 这个图像模型,它比 V-JEPA 2 这类视频专用编码器、比 Depth Anything 3 这类空间学习器都强。在音频上,挂 MERT 做对齐相比什么都不挂,没有带来任何好处。外部对齐这套方法没能走出以图像为中心的任务范围。
第二组是规模。参数量从 2.9 亿、4.2 亿、6.25 亿一路加到 10 亿,Self-Flow 和 REPA 之间的差距越拉越开:Self-Flow 能吃下增加的算力,REPA 出现收益递减。这一条直接决定了能不能拿它当 FLUX 3 这种量级模型的底座。
| 看什么 | Self-Flow | 普通 flow matching | 差多少 |
|---|---|---|---|
| 视频生成误差(FVD) | 66.3 | 72.9 | 低约 9.1% |
| 图像生成误差(FID) | 3.69 | 4.04 | 低约 8.5% |
| 音频生成误差(FAD) | 149.8 | 153 | 低约 2.1% |
| 机器人操控成功率 | 约 47% | 约 35% | 高约 12 个百分点 |
FVD、FID、FAD 都是「生成结果离真实数据有多远」的常用误差指标,分别对视频、图像、音频,读法一样:同一套设定下数字越低,通常表示生成结果越接近真实分布。右边那栏测的是另一件事,这套内部表示能不能被下游的动作模块用起来。成功率更高,说明它不只对「好看」有用,对「能动手」也有用。
现在能用的只有视频这一条
视频线的两个硬信息:单次生成最长 20 秒,每一条输出都自带原生音频。
「原生」这个词要拆开讲。多数视频模型是先出无声画面,声音另做一遍再对上去。FLUX 3 的输出里,画面和声音是同一趟生成出来的。20 秒这个长度在当下属于最长的一档,跟 OpenAI 已经停用的 Sora 持平。
能力清单官方列了九条。按「你往里丢什么」分组,看起来更清楚:
最后一条是它想解决的真问题
第九条能力叫 agentic 串联:把一个个短片段接成更长的多镜头序列。这些能力组合起来可以做出几分钟长的序列,靠视觉参考让角色在所有场景里保持像同一个人。
挡住生成视频进入商用管线的,从来不是单条片子好不好看。卡住的地方在跨镜头的连续性:第一个镜头里的那个人,到第二个镜头得还是那个人。这一点也是当前竞争最直接的地方:HappyHorse 1.1 的头号升级叫 R2V(参考图生视频),接受多张角色参考图来稳住身份,从输入端解同一个问题。两家都清楚战场在哪。
图像线还不能算数
图像这边,官方写的是既能从零合成也能编辑已有图片,风格、画幅、分辨率的覆盖面更宽,复杂提示的处理和多语言文字渲染比之前的 FLUX 版本有明显改进。
但这些是中期训练阶段做的初步评估,没有给出任何绝对数字,也没有发布任何图像 benchmark 或胜率。抢先试用还要再等几周。
人评数字里,打平的那两个比赢下的那几个更值得看
官方做了一轮两两对比的人工偏好测试:生成 10 秒、720p、带音频的文生视频,请人挑更喜欢哪一条。图上标着「早期 FLUX 3 候选版本的初步评估」,意思是这些数字描述的是一个发布前的检查点,不是现在进入抢先试用的那个模型。50% 表示两边分不出高下。
把这八条按信息量重排,是三层:
Luma Ray 3.2 和 Runway Gen-4.5 都是成熟产品,但都不是当下在独立视频排行榜上定调的那几个。这两场赢是真赢,同时也是最不会改变企业采购短名单的那种赢。
字节跳动在 Netflix、华纳兄弟、迪士尼、派拉蒙和索尼就涉嫌系统性侵犯版权发出法律威胁之后,无限期推迟了 Seedance 2.0 的国际发布,这个暂停至今没有解除。多数西方企业现在采购不到它。跟一个冻住的产品打平,既算不上有力的主张,也谈不上被打击。
Omni 是大平台里跟 FLUX 3 想做的事最接近的一个:多模态输入、能感知视频和音频的创作、对话式编辑。按 BFL 自己的测量,两者在 10 秒文生视频上分不出高下。
差别落在别处:Omni 已经通过 Google 的 Gemini API 普遍可用,720p 每秒 $0.10;FLUX 3 的视频线要申请审批,价格一个字没提。另有一处对德国公司的本土市场有影响:在欧洲经济区、瑞士和英国,Omni Flash 用户不能编辑上传的视频,只能编辑模型自己生成的内容。
顺带补一个主博文没解释的名字:Happy Horse 是 2026 年 4 月上线的视频模型,1080p 下最长 15 秒、带原生同步音频,4 月在第三方的 Artificial Analysis 视频竞技场拿到过文生视频和图生视频第一。知道这一点,那两条 59% 和 57% 才读得出分量。
放进价目表看,空白的那一列最显眼
| 模型 | 单次最长 | 最高分辨率 | 关键限制 | 10 秒 720p 价格 |
|---|---|---|---|---|
| FLUX 3 Video | 20 秒 | 未说明,评测跑在 720p | 抢先试用,需审批;无公开服务承诺 | 未公布 |
| Gemini Omni Flash | 10 秒(最短 3 秒) | 720p / 24fps | 预览版;欧洲经济区、瑞士、英国不能编辑上传视频 | $1.00 |
| HappyHorse 1.1 | 15 秒 | 1080p | 无 4K;权重未公开 | 未公布(1.0 分销价约 $1.82) |
| Veo 3.1 | 按秒计费 | 4K | 支持片段延长;预览版 | $4.00 |
| Veo 3.1 Fast | 按秒计费 | 4K | 预览版 | $1.00 |
另外,一共请了多少人、是不是盲测、用了哪些提示词,评测方法这一整块都没写。完整的 benchmark 结果和方法要等更广泛开放的时候再发。
机器人这一边,给了这个主张最硬的证据
把「内容生成和机器人共用一个底座」这句话变成可验证的东西,是 FLUX-mimic 干的事。这是 BFL 跟瑞士公司 mimic robotics 一起做的视频-动作模型,跑在 FLUX 3 的骨干上,已经在奥迪测试和部署。
做法不是另训一个机器人模型。他们的论点是:FLUX 3 为了能生成视频,内部必须已经学到了一套关于世界的表示。那么就在 FLUX 视频预测路径抽出来的中间特征上,训一个轻量的动作解码器,把动作从这套表示里解出来。
最能说明问题的一条是:把 FLUX 的骨干完全冻住不动,只训上面那个动作解码器,成绩就已经超过了此前的视觉-语言-动作模型(VLA),而那些模型在这种冻结设定下根本做不成。把骨干和解码器一起微调时,FLUX-mimic 达到当前最高的成功率。这说明两件事同时成立:规模化训练让骨干装下了足够多关于世界的知识,而 Self-Flow 让这些知识能从特征里直接解出来。
数据效率上还有一条来自方法本身:在 Self-Flow 的实验里,动作预测达到同样的成功率,所需训练步数只有没用 Self-Flow 的视频模型的一半。
奥迪那边测的是传统自动化碰不了的活
奥迪的生产网络自动化程度在汽车行业里数一数二,常规自动化的边界落在哪儿,它那边有一手的账。柔性零件和精细操作这类任务一直留给人手,主要是经济上的原因:高端车型的变体太多,按常规编程的机器人工位每换一个情况就要重新工程化一遍,成本压不下来。
FLUX-mimic 在真实产线和物流场景里跑的活包括:把零件配进结构化托盘、把电子控制单元插进紧配夹具、组装部件,以及处理密封条和线缆这类柔软易变形的材料,最后这一类是常规自动化从来没能碰的。
跟 mimic 合作期间,奥迪一直在测试和部署 FLUX-mimic。我们看到这些机器人完成了复杂的软体操作工作,这在传统机器人方案下根本不可能做到。这能在协助员工、提升效率、把柔性自动化扩展到生产和物流环节上产生重大影响。
Christoph Schneider,奥迪 Production Lab
没人教过它怎么补救
还有一个行为值得单独记一笔:FLUX-mimic 会自己从失败里恢复:机器人抓空了,它会纠正、重新抓一次、把任务做完。
没有哪套演示数据能覆盖一个任务出错的所有方式。既然没被演示过,这个补救动作只能来自别的地方:一个已经知道世界怎么运转的模型。
机器人最难的部分是数据。每个新任务通常意味着让机器人重复自己好几个小时。因为 FLUX-mimic 建在已经理解物理世界怎么运转的前沿视频模型之上,它学会一个新任务是几分钟的事,不是几天。这样我们就能越过机器人学习当前的技术水平。
Elvis Nava,mimic Robotics CTO
哪些已经确认,哪些还完全没公布
- 视频单次最长 20 秒,画面和音频同一趟生成
- 视频线抢先试用开放申请,人人可申,需 BFL 审批
- 底座是 Self-Flow,方法 2026 年 3 月已公开
- FLUX-mimic 在奥迪测试部署,骨干单卡不到 80ms
- 四条产品线的先后顺序
- Canva、Burda、Magnific、Krea、Picsart 已在测试
- 价格、配额、生产环境的服务等级承诺
- 评测方法、样本量、评分人数
- 图像模型的 benchmark,一个都没有
- 20 秒视频跑在什么分辨率(评测都在 720p)
- FLUX 3 Dev 的许可证、参数量、量化方案、硬件要求
开放权重排在最后,对 FLUX 来说不寻常
FLUX 这两年的行业位置,很大程度上是开放权重换来的。FLUX.1 Dev、FLUX.1 Kontext Dev 这些是紧跟着发布放出来的,研究者和创意工具开发者可以下载检查点、本地推理、接进 Hugging Face Diffusers 和 ComfyUI;2025 年底的 FLUX.2 Dev 是 320 亿参数的开放权重图像模型。
这一次,FLUX 3 Dev 描述的是一个横跨视频、音频、图像和动作预测的多模态骨干,比以往任何一次 Dev 发布的承诺都宽,但它排在四条线的最后。习惯了在大版本发布同时或不久后拿到本地可跑版本的开发者,这回要多等一阵。一张许可证会决定一家公司能不能在本地部署一个同时碰内容生产和物理机械的模型,而许可证、参数量、量化方案、硬件要求目前都还没有信息。
「世界模型」这套说法,现在两家都在讲
BFL 的论证是:只在图像上训练的模型无法理解一个会动、会响、会变化、会回应的世界,而对物理的理解正是生成出可信画面的原因。
Google 对 Gemini Omni 讲的几乎是同一套。它的开发者文档写「世界知识」,把对物理的理解和 Gemini 对历史、科学、文化语境的把握并列;6 月的对外表述更直接,说这个模型对「重力、动能、流体动力学这类力有直觉性的理解,因此动作更符合真实世界的逻辑」。
眼下三个领先的视频系统里有两个把物理理解当作核心优势在讲,而两家都没有发布过测量它的 benchmark。目前也没有标准测试能判断生成出来的水像不像水、一个掉落的物体下落速度合不合理、撞击声有没有在该到的时候到。人类偏好评分间接捕捉到一部分,此外没有别的工具能测。
Black Forest Labs 发布 FLUX 3:同一个模型,既生成带声音的视频,也在奥迪产线上开机器人
德国 FLUX 团队把图像、视频、声音、动作押在一个底座上,一页带图讲完它怎么训、今天能拿到什么。
↓ 一页读完 · 有一张会动的图
FLUX 是过去两年很多人用来画图的模型,Adobe Photoshop 和 Picsart 的生成功能底下跑的都有它。7 月 23 日,做它的德国公司 Black Forest Labs 发布 FLUX 3:同一个模型生成最长 20 秒、画面和声音一起出的视频,同一套骨干(模型里负责把输入变成内部表示的主体)此刻装在奥迪产线的机器人上,抓密封条和线缆这类会变形的东西。
✔ 一张图、一段参考视频、几个关键帧都能当输入,还能把短片段串成几分钟的多镜头序列,让角色在各场景里保持像同一个人
✔ FLUX-mimic 已在奥迪产线测试部署:零件配进托盘、电控单元插进紧配夹具、软材料操作
✘ 机器人线只走研究和商业伙伴通道,网页上申请不到
✘ 开放权重的 FLUX 3 Dev 排在四条线最后,许可证、参数量、硬件要求都没有信息
这次发布的地基是一句关于世界的判断:没有哪一种记录能完整描述现实。图像记下某一瞬间的空间结构,视频把时间还回来(东西怎么动、有多重),声音揭示撞击和声响之间的因果,动作对应伸手过去会发生什么。四种一起学,它们互相约束,声音要对得上撞击、运动要服从质量、后面要承接前面,模型就没法只学表面。
这套说法落到具体处是一笔算力账。要生成看着对的视频,模型必须学会接触、运动、重量、因果,错一样人一眼看得出,所以绝大部分算力砸在视频这一关;过了这关,声音几乎是搭车学会的。以下数字均由 Black Forest Labs 自己发布(含它与 mimic 的配套技术文),没有第三方复现。
生成模型有个被反复验证的现象:它内部对内容的理解越强,生成质量越好。但它的训练目标只是去噪,从一团噪声一步步走到清晰画面,这件事几乎不用看懂画面里是什么,所以理解不会自己长出来。以前靠外借,FLUX 3 换了个办法。
为什么这一步是做多模态的前提:外挂那条路走不出图像。视频上最强的外部参照仍是 DINOv2 这个图像模型,比视频专用的 V-JEPA 2 还强;音频上挂 MERT 相比什么都不挂没有收益。规模也是同一个方向:参数量从 2.9 亿加到 10 亿,Self-Flow 吃得下增加的算力,REPA 开始收益递减。
FLUX-mimic 是 Black Forest Labs 与瑞士公司 mimic robotics 一起做的视频-动作模型,跑在 FLUX 3 的骨干上,已经在奥迪测试部署。它没有另起炉灶:把骨干完全冻住不动,只在它抽出的中间特征上训一个轻量动作解码器,成绩就超过了此前的视觉-语言-动作模型(把画面和指令一起喂进去、直接输出动作的那类机器人模型),而那类模型在冻结设定下根本做不成。省下来的是数据。
还有一个没人教过它的行为:抓空了,它会自己纠正、重新抓一次、把任务做完。演示数据不可能覆盖一个任务出错的所有方式,这个补救动作只能来自一个已经知道世界怎么运转的模型。
Black Forest Labs 自己做了一轮两两对比的人工偏好测试:生成 10 秒、720p、带音频的文生视频,请人挑更喜欢哪一条,50% 表示分不出高下。赢得最多的 Luma Ray 3.2(93%)和 Runway Gen-4.5(77%)是名单上最软的两个对手。真正有信息量的是打平的那两个。
| 模型 | 人评:多少人更偏好 FLUX 3 | 现在能不能用上 | 10 秒 720p 价格 |
|---|---|---|---|
| FLUX 3 Video | , | 抢先试用,人人可申请,需 Black Forest Labs 审批 | 未公布 |
| Gemini Omni Flash | 52%,分不出高下 | Gemini API 已普遍可用(预览版) | $1.00($0.10 一秒) |
| Seedance 2.0 | 52%,分不出高下 | 字节因五家影视公司的版权法律威胁无限期推迟国际发布,至今没解冻 | 多数西方企业买不到 |
Gemini Omni Flash 是大平台里跟 FLUX 3 想做的事最接近的一个,也是同样在讲「模型懂物理」的那一个。按 Black Forest Labs 自己的测量,两边分不出高下,差别落在别处:一个现在就能刷卡调用并且明码标价,另一个还在等审批。
发布 FLUX 3
跑去开机器人?
一边在奥迪产线上抓密封条和线缆。
怎么会拧螺丝?
时间丢了
声音又丢了
- × 图像丢了时间
- × 视频丢了声音
- × 声音丢了空间
- × 动作丢了画面外的一切
谁编都圆不上
过了这关,声音基本搭车学会
让它自己教自己。
噪声给得少
每块糊的程度都不同
就长出了理解。
此前要 30 小时以上
也能开机器人?
两边分不出高下
要申请,等审批
价格:空着
现在就能调用
$0.10 一秒
冻住不动就能开机器人。