产品发布 · 小互解读

Black Forest Labs 发布 FLUX 3:图像、视频、声音、机器人押在同一个模型上

视频线开放申请审批,图像线还要几周,开放权重排在最后。人评是官方标的初步结果,价格未公布。
一分钟速览
  • Black Forest Labs 发了 FLUX 3。同一个模型,一边生成最长 20 秒、画面和声音一起出的视频,一边在奥迪的产线上开机器人。他们说这两件事底下是同一套东西。
  • 核心押注是:图像、视频、声音、动作都是同一个现实的侧面,各自都丢了一部分信息。分开学只能学到侧面,一起学它们互相约束,才逼模型去学那个共同的底层现实。训练算力的 95% 以上花在视频上,声音在带音频的 720p 视频里占不到 0.5% 的 token。
  • 底下的方法叫 Self-Flow:给同一份数据的不同部分加不同强度的噪声,人为造出一个「看得清的老师」和一个「看得糊的学生」,逼模型自己教自己,不再外挂 DINOv2 这类现成的理解模型,因为外挂那条路在图像以外根本不管用。
  • 现在能碰的只有视频,要申请审批。人评里跟 Gemini Omni Flash 打成 52% 平手,而那家现在就能用、$0.10 一秒。价格、图像 benchmark、开放权重的许可证,一个都还没公布。
本文的功能清单、人评数字和发售节奏来自 Black Forest Labs 自己的发布博文与两篇配套技术文。人评图上标注为「早期候选版本的初步评估」,测的不是现在放出的那个模型,也没有第三方独立复测。价格、评测方法、样本量、图像 benchmark 均未公布。
1发布

同一个模型,既生成带声音的视频,也在奥迪产线上开机器人

德国公司 Black Forest Labs 做的 FLUX 系列,过去两年是很多人用来画图的东西。Adobe Photoshop 的生成功能、Picsart 的 AI 功能,底下跑的都有它。7 月 23 日他们发布 FLUX 3,同一个模型现在能生成最长 20 秒、画面和声音一起出的视频。

同一套模型的另一份用法,此刻装在奥迪产线的机器人上,抓密封条和线缆这类会变形的东西,这是传统自动化几十年都没碰下来的活。

公司在德国 Freiburg,创始团队里有当年做出 VQGAN、潜在扩散和 Stable Diffusion 的那批人。这是他们第一个公开的视频生成模型。

FLUX 3 的官方演示片,画面和声音由同一次生成产出。来源:Black Forest Labs 发布博文

发布分成四条产品线,但今天能真正碰到的只有一条。下面三张卡标的是「你现在能不能用上」:

现在
视频
抢先试用开放申请,人人可申请,但要 BFL 审批。提供接口和私有权重。
再等几周
图像
官方写了复杂提示和文字渲染比旧版进步明显,但没放任何 benchmark,试用还没开。
伙伴通道
动作 / 机器人
走研究和商业合作,从瑞士的 mimic robotics 开始。网页上申请不到。
2前提

他们认为图像、视频、声音、动作是同一件事的四个侧面

要理解 FLUX 3 为什么长这样,得先接受它的前提。这个前提无关技术细节。它是一句关于世界的判断:没有任何一种模态能完整描述现实。

图像记下的是某一个瞬间的空间结构,什么东西在哪、跟什么挨着。视频把时间还回来了,于是能看出东西怎么动、有多重、碰一下会怎样。声音揭示的是机械现象和声学之间的因果,这层关系光看画面看不出来。语言则把这些感知连到目标、抽象和指令上。

每一种都是同一个现实的一次投影,由不同的传感器捕捉,每一次捕捉都在过程里丢掉了一些信息。只学其中一种,你得到的是那一种投影的好模型。四种一起学,它们的互相约束会告诉你更多:声音必须对得上撞击,运动必须服从质量,后面必须承接前面。约束一多,模型就没法只学表面,它得去猜那个能同时满足所有约束的底层东西。

现实 世界怎么运转 图像 某一瞬间的空间结构 丢了:时间 视频 怎么动、多重 丢了:声音 动作 伸手过去会发生什么 丢了:画面之外的一切 声音 撞击与声响的因果 丢了:空间
同一个现实被四种传感器各记下一个侧面,每个侧面都缺东西。一起学时它们互相约束:声音要对得上撞击、动作要服从质量、后面要承接前面(示意图,本站绘制)

你骗不了现实。只学图像的模型只能生成图像。但世界不是由静止画面组成的,它会动、会响、会变化、会回应。

Robin Rombach,Black Forest Labs 联合创始人兼 CEO,发布前提供给 VentureBeat 的书面表述
FLUX 3 一个模型多种能力示意
同一个底座模型往不同方向长出图像、视频、音频和动作预测。来源:Black Forest Labs
3算力账

训练算力的 95% 花在视频上,声音几乎是搭车学会的

上面那段如果只停在说法层面,谁都可以讲。它落到具体处,是一笔算力账。

FLUX 3 从一开始就在图像、视频、音频上联合训练,其中最吃资源的部分是视频预测,占了训练总算力的 95% 以上。原因不复杂:要生成看起来对的视频,模型没有别的选择,必须学会接触、运动、重量、因果,其中任何一样搞错,人一眼就看出假。学会准确地渲染这个世界,等价于学会这个世界怎么运转。

视频预测 95%+
其余
训练算力构成:绝大部分砸在视频这一关上

声音反倒是这几样里最便宜的。它维度低、细节比视频少得多,在一段带音频的 720p 视频里,声音占的 token 不到 0.5%。模型把视频理解这关过了之后,它自己就会学到视频和音频之间的因果:说话对上口型,音效对上引发它的那个物理事件。

动作也是同一个形状:机器人状态是一个低维表示,紧紧绑在视觉观察上。画面、声音、动作都是同一个物理现实的局部表示。模型学完视频和音频背后的物理过程之后,预测动作算不上另起炉灶,它是同一个现实的又一个视角。

95%+
训练算力花在视频预测上
<0.5%
音频在 720p 带声视频里占的 token
3500 步
加进动作预测后,视频质量恢复所需

他们拿一次训练验证了这个说法

如果上面的框架成立,那么教 FLUX 3 预测动作就不该留下长期代价:模型会有一小段被打扰的时期,要学清楚动作空间的结构、把内部的世界表示对齐过去,然后回到原来的水平。

他们在一次大规模训练里把动作预测加进课程表,盯着视频生成质量看。文生视频和图生视频的人评一开始掉了最多 10%3500 步之后,视频生成质量回到了加动作之前的水平,而此时模型还多会了预测动作。

加入动作预测后视频生成质量先降后回升的曲线
加入动作预测后,视频生成的人评先掉后回升。每条曲线都以它自己加动作之前的质量为基准归一化,越高越好。来源:FLUX 3 × mimic 配套文,不在主发布博文里

模型确实得把动作接进自己的输入和输出,但这件事没有永久占走它的容量,它只是要弄明白这个新模态跟已有的世界模型是什么关系。弄明白之后,原有能力上的损失就消失了。

4方法

Self-Flow:让模型自己教自己,不再外挂一个理解模型

FLUX 3 底下那套训练方法叫 Self-Flow,是 Black Forest Labs 2026 年 3 月发的研究,作者里还有 MIT 的 Antonio Torralba。想看懂它改了什么,得先知道以前卡在哪。

旧办法:外面挂一个懂行的模型来带

做图像和视频的生成模型(扩散模型、流模型这一类)有个被反复验证的现象:模型内部的语义表示越强,收敛越快、生成质量越好。问题是这种表示不会自己长出来。模型的训练目标是去噪,从一团噪声一步步走到清晰画面,每一步只要预测该往哪走。而去噪这件事本身,几乎不需要理解画面里是什么,所以模型没有动力去学语义。

业内的通行解法是从外面借:挂一个已经训好的理解模型当参照(最常用的是 DINOv2),逼生成模型的内部表示向它看齐,这套做法叫 REPA。它有效,但带着三个麻烦:那个外挂模型要单独训练;它的目标跟生成目标对不上;放大规模之后表现不符合预期。

Self-Flow:在模型内部人为制造一个信息差

Self-Flow 的核心动作叫双时间步调度(Dual-Timestep Scheduling)。给一份干净数据,抽两个时间步和一个随机掩码,然后按各自分到的时间步给每个 token 加噪声,于是同一份数据里,有的地方糊得厉害,有的地方还比较清楚。

关键在这一步:其中一路(老师)用两个时间步里较小的那个加噪,看得更清楚;另一路(学生)看到的是混着不同噪声强度的版本。学生被要求同时干两件事:把自己手上这份去噪,以及从这个残缺的视图里,把老师看到的特征重建出来

信息不对称就是驱动力。学生想补上自己缺的那部分,没法只盯着自己那一小块,它必须去看别处还剩什么、去理解画面和声音里的结构。补洞的过程本身,就在长出语义表示。生成能力和理解能力在同一套训练里一起出来,不需要任何外部模型和额外监督。

一份干净数据 抽两个时间步 + 随机掩码 老师 统一用较小的噪声 看得清 学生 每块噪声强度都不一样 有的地方糊得厉害 重建 学生要同时做两件事 ① 把手上这份去噪 ② 把老师看到的特征重建出来 它缺的信息,只能靠理解结构补回来 于是「会生成」和「懂内容」一起长出来
双时间步调度:同一份数据被加上不同强度的噪声,人为造出信息差,逼学生那一路去理解结构(本站按官方方法描述绘制的示意图)
打个比方

像拼图拼到一半,有人故意盖住了几块。你要把被盖住的部分猜出来,只能靠周围已经露出来的图案去推。推的这个过程本身,就在加深你对整幅图的理解,而这正是盖住它们的目的。

Self-Flow 方法架构图
官方方法图:给干净输入抽两个时间步和一个随机掩码,按各自时间步加噪;老师那一路用较小的噪声,跟学生之间形成信息差。来源:Self-Flow 研究页,不在主发布博文里

为什么这件事对多模态是必需的

研究里有两组结果,解释了为什么想做一个统吃三种模态的模型,外挂那条路走不通。

第一组是跨模态的失效。在视频上,最强的外部编码器居然还是 DINOv2 这个图像模型,它比 V-JEPA 2 这类视频专用编码器、比 Depth Anything 3 这类空间学习器都强。在音频上,挂 MERT 做对齐相比什么都不挂,没有带来任何好处。外部对齐这套方法没能走出以图像为中心的任务范围。

第二组是规模。参数量从 2.9 亿、4.2 亿、6.25 亿一路加到 10 亿,Self-Flow 和 REPA 之间的差距越拉越开:Self-Flow 能吃下增加的算力,REPA 出现收益递减。这一条直接决定了能不能拿它当 FLUX 3 这种量级模型的底座。

Self-Flow 与普通 Flow Matching 的对比
左边是各模态的生成误差(以普通 flow matching 归一为 100,越低越好),右边是操控任务的成功率(越高越好)。来源:Black Forest Labs
看什么Self-Flow普通 flow matching差多少
视频生成误差(FVD)66.372.9低约 9.1%
图像生成误差(FID)3.694.04低约 8.5%
音频生成误差(FAD)149.8153低约 2.1%
机器人操控成功率约 47%约 35%高约 12 个百分点

FVD、FID、FAD 都是「生成结果离真实数据有多远」的常用误差指标,分别对视频、图像、音频,读法一样:同一套设定下数字越低,通常表示生成结果越接近真实分布。右边那栏测的是另一件事,这套内部表示能不能被下游的动作模块用起来。成功率更高,说明它不只对「好看」有用,对「能动手」也有用。

口径提示:上面这张表来自 FLUX 3 发布页那张图,对照的是普通 flow matching。Self-Flow 研究页里的主要对手是 REPA(外挂 DINOv2 那套),两处的对照基准不同,不能混着读。两处都是方法层面的实验室对比,跟 FLUX 3 成品与其他厂商产品的比较是两回事。
5视频

现在能用的只有视频这一条

视频线的两个硬信息:单次生成最长 20 秒,每一条输出都自带原生音频

「原生」这个词要拆开讲。多数视频模型是先出无声画面,声音另做一遍再对上去。FLUX 3 的输出里,画面和声音是同一趟生成出来的。20 秒这个长度在当下属于最长的一档,跟 OpenAI 已经停用的 Sora 持平。

能力清单官方列了九条。按「你往里丢什么」分组,看起来更清楚:

只给文字
从零生成带声音的视频。
给一张图
从这一帧动起来,或者把图只当长相和风格的参考。
给一段参考视频
把里面的核心元素(比如同一个角色)带进新的场景和情节。
给几个关键帧
定住开头结尾或几个关键画面,让它补中间怎么过渡。
给已有的视频和音频
顺着往后续,不用每次从头开始。
另外三项
多语言对白;从家用摄像机毛片感到动画到电影感的多种风格与画幅;画面上的文字和动态排版。

最后一条是它想解决的真问题

第九条能力叫 agentic 串联:把一个个短片段接成更长的多镜头序列。这些能力组合起来可以做出几分钟长的序列,靠视觉参考让角色在所有场景里保持像同一个人。

挡住生成视频进入商用管线的,从来不是单条片子好不好看。卡住的地方在跨镜头的连续性:第一个镜头里的那个人,到第二个镜头得还是那个人。这一点也是当前竞争最直接的地方:HappyHorse 1.1 的头号升级叫 R2V(参考图生视频),接受多张角色参考图来稳住身份,从输入端解同一个问题。两家都清楚战场在哪。

图像线还不能算数

图像这边,官方写的是既能从零合成也能编辑已有图片,风格、画幅、分辨率的覆盖面更宽,复杂提示的处理和多语言文字渲染比之前的 FLUX 版本有明显改进。

但这些是中期训练阶段做的初步评估,没有给出任何绝对数字,也没有发布任何图像 benchmark 或胜率。抢先试用还要再等几周。

FLUX 3 图像样张
官方给的图像样张,用来展示风格覆盖面和文字渲染效果。来源:Black Forest Labs
6人评

人评数字里,打平的那两个比赢下的那几个更值得看

官方做了一轮两两对比的人工偏好测试:生成 10 秒、720p、带音频的文生视频,请人挑更喜欢哪一条。图上标着「早期 FLUX 3 候选版本的初步评估」,意思是这些数字描述的是一个发布前的检查点,不是现在进入抢先试用的那个模型。50% 表示两边分不出高下。

Luma Ray 3.2
93%
Runway Gen-4.5
77%
Grok Imagine Video
69%
Kling v3 Pro
60%
Happy Horse v1
59%
Happy Horse 1.1
57%
Seedance 2.0
52%
Gemini Omni Flash
52%
条长 = 有多少比例的人更偏好 FLUX 3。竖线是 50% 的位置,落在那里就等于分不出高下。

把这八条按信息量重排,是三层:

93% · 77%赢得最多的两个,也是最软的两个

Luma Ray 3.2 和 Runway Gen-4.5 都是成熟产品,但都不是当下在独立视频排行榜上定调的那几个。这两场赢是真赢,同时也是最不会改变企业采购短名单的那种赢。

52%Seedance 2.0:跟一个被冻住的产品打平

字节跳动在 Netflix、华纳兄弟、迪士尼、派拉蒙和索尼就涉嫌系统性侵犯版权发出法律威胁之后,无限期推迟了 Seedance 2.0 的国际发布,这个暂停至今没有解除。多数西方企业现在采购不到它。跟一个冻住的产品打平,既算不上有力的主张,也谈不上被打击。

52%Gemini Omni Flash:这个 52% 才有分量

Omni 是大平台里跟 FLUX 3 想做的事最接近的一个:多模态输入、能感知视频和音频的创作、对话式编辑。按 BFL 自己的测量,两者在 10 秒文生视频上分不出高下。

差别落在别处:Omni 已经通过 Google 的 Gemini API 普遍可用,720p 每秒 $0.10;FLUX 3 的视频线要申请审批,价格一个字没提。另有一处对德国公司的本土市场有影响:在欧洲经济区、瑞士和英国,Omni Flash 用户不能编辑上传的视频,只能编辑模型自己生成的内容。

顺带补一个主博文没解释的名字:Happy Horse 是 2026 年 4 月上线的视频模型,1080p 下最长 15 秒、带原生同步音频,4 月在第三方的 Artificial Analysis 视频竞技场拿到过文生视频和图生视频第一。知道这一点,那两条 59% 和 57% 才读得出分量。

FLUX 3 视频人评偏好率对比图
官方人评原图:10 秒 720p 带音频的文生视频两两对比,图上标注为早期候选版本的初步评估。来源:Black Forest Labs

放进价目表看,空白的那一列最显眼

模型单次最长最高分辨率关键限制10 秒 720p 价格
FLUX 3 Video20 秒未说明,评测跑在 720p 抢先试用,需审批;无公开服务承诺未公布
Gemini Omni Flash10 秒(最短 3 秒)720p / 24fps 预览版;欧洲经济区、瑞士、英国不能编辑上传视频$1.00
HappyHorse 1.115 秒1080p 无 4K;权重未公开未公布(1.0 分销价约 $1.82)
Veo 3.1按秒计费4K 支持片段延长;预览版$4.00
Veo 3.1 Fast按秒计费4K 预览版$1.00

另外,一共请了多少人、是不是盲测、用了哪些提示词,评测方法这一整块都没写。完整的 benchmark 结果和方法要等更广泛开放的时候再发。

7机器人

机器人这一边,给了这个主张最硬的证据

把「内容生成和机器人共用一个底座」这句话变成可验证的东西,是 FLUX-mimic 干的事。这是 BFL 跟瑞士公司 mimic robotics 一起做的视频-动作模型,跑在 FLUX 3 的骨干上,已经在奥迪测试和部署。

做法不是另训一个机器人模型。他们的论点是:FLUX 3 为了能生成视频,内部必须已经学到了一套关于世界的表示。那么就在 FLUX 视频预测路径抽出来的中间特征上,训一个轻量的动作解码器,把动作从这套表示里解出来。

30 分钟
教新任务所需的机器人数据,此前要 30 小时以上
<80ms
骨干在单张 RTX 5090 上从输入到世界表示
101ms
整机反应时间,跟人的视觉反应同一量级

最能说明问题的一条是:把 FLUX 的骨干完全冻住不动,只训上面那个动作解码器,成绩就已经超过了此前的视觉-语言-动作模型(VLA),而那些模型在这种冻结设定下根本做不成。把骨干和解码器一起微调时,FLUX-mimic 达到当前最高的成功率。这说明两件事同时成立:规模化训练让骨干装下了足够多关于世界的知识,而 Self-Flow 让这些知识能从特征里直接解出来。

数据效率上还有一条来自方法本身:在 Self-Flow 的实验里,动作预测达到同样的成功率,所需训练步数只有没用 Self-Flow 的视频模型的一半。

奥迪那边测的是传统自动化碰不了的活

奥迪的生产网络自动化程度在汽车行业里数一数二,常规自动化的边界落在哪儿,它那边有一手的账。柔性零件和精细操作这类任务一直留给人手,主要是经济上的原因:高端车型的变体太多,按常规编程的机器人工位每换一个情况就要重新工程化一遍,成本压不下来。

FLUX-mimic 在真实产线和物流场景里跑的活包括:把零件配进结构化托盘、把电子控制单元插进紧配夹具、组装部件,以及处理密封条和线缆这类柔软易变形的材料,最后这一类是常规自动化从来没能碰的。

跟 mimic 合作期间,奥迪一直在测试和部署 FLUX-mimic。我们看到这些机器人完成了复杂的软体操作工作,这在传统机器人方案下根本不可能做到。这能在协助员工、提升效率、把柔性自动化扩展到生产和物流环节上产生重大影响。

Christoph Schneider,奥迪 Production Lab

没人教过它怎么补救

还有一个行为值得单独记一笔:FLUX-mimic 会自己从失败里恢复:机器人抓空了,它会纠正、重新抓一次、把任务做完。

没有哪套演示数据能覆盖一个任务出错的所有方式。既然没被演示过,这个补救动作只能来自别的地方:一个已经知道世界怎么运转的模型。

机器人最难的部分是数据。每个新任务通常意味着让机器人重复自己好几个小时。因为 FLUX-mimic 建在已经理解物理世界怎么运转的前沿视频模型之上,它学会一个新任务是几分钟的事,不是几天。这样我们就能越过机器人学习当前的技术水平。

Elvis Nava,mimic Robotics CTO
8边界

哪些已经确认,哪些还完全没公布

已确认
  • 视频单次最长 20 秒,画面和音频同一趟生成
  • 视频线抢先试用开放申请,人人可申,需 BFL 审批
  • 底座是 Self-Flow,方法 2026 年 3 月已公开
  • FLUX-mimic 在奥迪测试部署,骨干单卡不到 80ms
  • 四条产品线的先后顺序
  • Canva、Burda、Magnific、Krea、Picsart 已在测试
未公布
  • 价格、配额、生产环境的服务等级承诺
  • 评测方法、样本量、评分人数
  • 图像模型的 benchmark,一个都没有
  • 20 秒视频跑在什么分辨率(评测都在 720p)
  • FLUX 3 Dev 的许可证、参数量、量化方案、硬件要求
现在
FLUX 3 Video
视频和音频的生成与编辑,走接口和私有权重,抢先试用已开放申请。
随后几周
FLUX 3 Image
图像合成与编辑,同样走接口和私有权重,先过一轮抢先试用。
伙伴通道
FLUX-mimic 与 FLUX 3 Action
动作预测,通过选定的研究和商业伙伴推进,从 mimic 开始。
最后
FLUX 3 Dev
开放权重的多模态骨干,覆盖内容生成和动作预测。具体时间没写死。

开放权重排在最后,对 FLUX 来说不寻常

FLUX 这两年的行业位置,很大程度上是开放权重换来的。FLUX.1 Dev、FLUX.1 Kontext Dev 这些是紧跟着发布放出来的,研究者和创意工具开发者可以下载检查点、本地推理、接进 Hugging Face Diffusers 和 ComfyUI;2025 年底的 FLUX.2 Dev 是 320 亿参数的开放权重图像模型。

这一次,FLUX 3 Dev 描述的是一个横跨视频、音频、图像和动作预测的多模态骨干,比以往任何一次 Dev 发布的承诺都宽,但它排在四条线的最后。习惯了在大版本发布同时或不久后拿到本地可跑版本的开发者,这回要多等一阵。一张许可证会决定一家公司能不能在本地部署一个同时碰内容生产和物理机械的模型,而许可证、参数量、量化方案、硬件要求目前都还没有信息。

「世界模型」这套说法,现在两家都在讲

BFL 的论证是:只在图像上训练的模型无法理解一个会动、会响、会变化、会回应的世界,而对物理的理解正是生成出可信画面的原因。

Google 对 Gemini Omni 讲的几乎是同一套。它的开发者文档写「世界知识」,把对物理的理解和 Gemini 对历史、科学、文化语境的把握并列;6 月的对外表述更直接,说这个模型对「重力、动能、流体动力学这类力有直觉性的理解,因此动作更符合真实世界的逻辑」。

眼下三个领先的视频系统里有两个把物理理解当作核心优势在讲,而两家都没有发布过测量它的 benchmark。目前也没有标准测试能判断生成出来的水像不像水、一个掉落的物体下落速度合不合理、撞击声有没有在该到的时候到。人类偏好评分间接捕捉到一部分,此外没有别的工具能测。

🧰 上手卡 · FLUX 3 Video(抢先试用)
门槛需提交申请并等 BFL 审批;图像线还要几周,开放权重的 FLUX 3 Dev 排在四条线最后
来源
FLUX 3 — Real World Models: Towards Multimodal Flow Models as the Backbone of Visual IntelligenceBlack Forest Labs·bfl.ai/blog/flux-3·2026-07-23
本站说明
人评数字与 Self-Flow 对比表按官方图定点抄录。95% 算力占比、0.5% 音频 token、3500 步恢复、30 分钟对 30 小时、80ms 与 101ms、奥迪任务清单与两段实名引述来自 FLUX 3 × mimic 配套文;双时间步机制、跨模态外部对齐失效、参数规模区间来自 Self-Flow 研究页;未公布项清单、竞品分层背景、Seedance 2.0 暂停原因、Gemini Omni Flash 定价与欧洲限制、Rombach 引述来自 VentureBeat 报道。两张示意图(四个侧面、双时间步)为本站按官方描述绘制,不是官方图。状态卡、输入分组、价目表为本站排版,不是新测数据。