プロダクト発表・小互解説

Black Forest Labs、FLUX 3を発表 画像・動画・音声・ロボットを1モデルに統合

動画系統は申請制で審査待ち、画像系統はまだ数週間先、オープンウェイトは最後に回される。人手評価は公式が「初期段階の結果」と明記したもので、価格は未公表。
1分でわかる要点
  • Black Forest LabsがFLUX 3を発表した。同じモデルが一方では最長20秒、映像と音声が同時に出る動画を生成し、もう一方ではアウディの生産ラインでロボットを動かしている。両者の根底は同じ仕組みだと彼らは言う。
  • 核心の賭けはこうだ。画像・動画・音声・動作はすべて同じ現実の側面であり、それぞれが情報の一部を失っている。個別に学習すれば側面しか学べないが、一緒に学習させれば互いに制約し合い、モデルはその背後にある共通の現実そのものを学ばざるを得なくなる。学習計算資源の95%以上が動画に費やされ、音声は音声付き720p動画の中でトークン全体の0.5%にも満たない。
  • この裏側にある手法はSelf-Flowと呼ばれる。同じデータの異なる部分に強度の違うノイズを加え、「はっきり見える教師」と「ぼやけて見える生徒」を人為的に作り出し、モデルに自分で自分を教えさせる。DINOv2のような既製の理解モデルを外付けする方式はもう使わない。なぜならその方式は画像以外ではまるで通用しないからだ。
  • 現時点で触れられるのは動画だけで、申請と審査が必要だ。人手評価ではGemini Omni Flashと52%で互角に持ち込んだが、あちらは今すぐ使えて1秒$0.10だ。価格、画像のベンチマーク、オープンウェイトのライセンス——どれもまだ公表されていない。
本稿の機能リスト、人手評価の数値、公開スケジュールは、Black Forest Labs自身の発表ブログと2本の関連技術文書に基づく。人手評価のグラフには「初期候補版の暫定評価」と明記されており、測定対象は現在公開されているモデルではなく、第三者による独立した再検証もない。価格、評価手法、サンプル数、画像のベンチマークはいずれも未公表。
1発表

同じモデルが音声付き動画を生成し、アウディの生産ラインでロボットも動かす

ドイツの企業Black Forest Labsが手がけるFLUXシリーズは、この2年間、多くの人が画像生成に使ってきたものだ。Adobe PhotoshopのAI生成機能やPicsartのAI機能も、裏側ではこれが動いている。7月23日、彼らはFLUX 3を発表した。同じモデルが今や最長20秒、映像と音声が同時に出る動画を生成できる。

同じモデルのもう一つの使い道は、いまアウディの生産ラインのロボットに組み込まれている。シール材やケーブルのような変形しやすいものを掴む作業で、従来の自動化技術が何十年も手を付けられなかった仕事だ。

同社はドイツのフライブルクを拠点とし、創業チームにはかつてVQGAN、潜在拡散(Latent Diffusion)、Stable Diffusionを生み出したメンバーが名を連ねる。今回が彼らにとって初めて公開する動画生成モデルとなる。

FLUX 3の公式デモ映像。映像と音声は同じ1回の生成で作られている。出典:Black Forest Labs発表ブログ

発表は4つの製品ラインに分かれているが、今日実際に触れられるのは1つだけだ。以下の3枚のカードは「今すぐ使えるかどうか」を示している。

今すぐ
動画
先行アクセスは申請制で誰でも申し込めるが、BFLの審査が必要。APIとプライベートウェイトを提供。
あと数週間
画像
公式は複雑なプロンプトの処理とテキストレンダリングが旧版より大きく進歩したと書いているが、ベンチマークは一切公表されておらず、試用もまだ始まっていない。
パートナー経由
動作/ロボット
研究および商業パートナーとの連携で進められ、スイスのmimic roboticsから始まる。ウェブサイトからは申請できない。
2前提

画像・動画・音声・動作は同じものの四つの側面だと彼らは考える

FLUX 3がなぜこういう形になったのかを理解するには、まずその前提を受け入れる必要がある。この前提は技術的な細部の話ではない。世界についての一つの判断だ。どのモダリティ(データの様式)も現実を完全には記述できない。

画像が記録するのは、ある瞬間の空間構造——何がどこにあり、何と隣接しているか——である。動画は時間を取り戻し、物がどう動くか、どれほどの重さか、ぶつかったらどうなるかを見せてくれる。音声が明かすのは、機械的な現象と音響の間の因果関係で、これは画面だけを見ていてはわからない層だ。そして言語は、これらの知覚を目的・抽象・指示へと結びつける。

そのどれもが、同じ現実を異なるセンサーで捉えた一つの投影であり、捕捉のたびに一部の情報が失われる。一種類だけを学習すれば、その投影に強いモデルが得られるだけだ。四種類を一緒に学習させれば、互いの制約がより多くを教えてくれる。音は衝突と一致していなければならず、動きは質量に従わなければならず、後の場面は前の場面を引き継がなければならない。制約が増えるほど、モデルは表面だけを学ぶわけにいかなくなり、すべての制約を同時に満たす背後の本質を推測せざるを得なくなる。

現実 世界の仕組み 画像 ある瞬間の空間構造 欠落:時間 動画 動きと重さ 欠落:音声 動作 触れたら何が起こるか 欠落:画面外の全て 音声 衝突と音の因果関係 欠落:空間
同じ現実を四つのセンサーがそれぞれ一つの側面として記録するが、どの側面にも欠落がある。一緒に学習させると互いに制約し合う——音は衝突と一致し、動作は質量に従い、後の場面は前の場面を引き継ぐ(模式図、本サイト作成)

現実を欺くことはできない。画像だけを学習したモデルは画像しか生成できない。だが世界は静止画像の集合ではない。動き、音を立て、変化し、反応する。

Robin Rombach(Black Forest Labs共同創業者兼CEO)、発表前にVentureBeatへ提供した書面コメントより
FLUX 3——1つのモデルが持つ複数の能力を示す図
同じベースモデルから、画像・動画・音声・動作予測が異なる方向に伸びていく。出典:Black Forest Labs
3計算資源の内訳

学習計算資源の95%が動画に使われ、音声はほぼついでに習得される

上の話が言葉のレベルにとどまるなら、誰にでも言える。だが具体的に見ると、それは計算資源の配分という一つの数字の話になる。

FLUX 3は最初から画像・動画・音声を統合して学習しており、その中で最も資源を食うのが動画予測で、学習総計算資源の95%以上を占める。理由は単純だ。見た目に正しい動画を生成するには、モデルは接触・運動・重さ・因果関係を学ぶしかない。そのどれか一つでも間違えれば、人は一目で偽物だと見抜いてしまう。この世界を正確にレンダリングできるようになることは、この世界がどう動いているかを学ぶことと同義だ。

動画予測 95%+
残り
学習計算資源の内訳:大部分が動画のこの一段階に注ぎ込まれている

音声はむしろこの中で最もコストが低い。次元が低く、動画に比べてディテールがはるかに少ない。音声付き720p動画では、音声が占めるトークンは0.5%にも満たない。モデルが動画の理解という関門を越えると、動画と音声の因果関係——話し声が口の動きと一致すること、効果音がそれを引き起こした物理現象と一致すること——を自然と学び取ってしまう。

動作も同じ構図だ。ロボットの状態は低次元の表現であり、視覚的な観察と密接に結びついている。映像・音声・動作は、いずれも同じ物理的現実の局所的な表現なのだ。モデルが動画と音声の背後にある物理過程を学び終えれば、動作の予測はゼロから始めることにはならない。それは同じ現実の、また別の視点にすぎない。

95%+
学習計算資源が動画予測に使われる
<0.5%
音声付き720p動画で音声が占めるトークン
3500ステップ
動作予測を追加後、動画品質が回復するまでに必要

彼らは一度の学習でこの主張を検証した

上の枠組みが成り立つなら、FLUX 3に動作予測を教えても長期的な代償は残らないはずだ。モデルは一時的に乱される短い期間を経て、動作空間の構造を理解し、内部の世界表現をそれに合わせて調整し、その後は元の水準に戻るはずである。

彼らは大規模な学習の途中で動作予測をカリキュラムに組み込み、動画生成品質を観察し続けた。テキストから動画、画像から動画への人手評価は当初最大10%低下したが、3500ステップ後には動作追加前の水準まで動画生成品質が回復し、その時点でモデルは動作予測もできるようになっていた。

動作予測追加後、動画生成品質が一度低下してから回復する曲線
動作予測を追加した後、動画生成の人手評価はいったん低下してから回復する。各曲線は、動作追加前の自身の品質を基準に正規化されており、高いほど良い。出典:FLUX 3×mimic関連文書(メインの発表ブログには未掲載)

モデルは確かに動作を自らの入出力に組み込む必要があるが、それが容量を永続的に食いつぶすわけではない。ただ、この新しいモダリティが既存の世界モデルとどう関係するのかを理解する必要があるだけだ。それが理解できれば、既存能力への影響は消える。

4手法

Self-Flow:モデルに自分で自分を教えさせ、理解モデルの外付けをやめる

FLUX 3の土台にある学習手法はSelf-Flowと呼ばれ、Black Forest Labsが2026年3月に発表した研究だ。著者にはMITのAntonio Torralbaも名を連ねている。何が変わったのかを理解するには、まず以前どこで行き詰まっていたかを知る必要がある。

旧来の手法:外部の「わかっている」モデルに先導させる

画像や動画を生成するモデル(拡散モデルやフローモデルなど)には、繰り返し確認されてきた現象がある。モデル内部の意味表現が強いほど、収束が速く、生成品質も高くなる。問題は、この表現は放っておいても育たないということだ。モデルの学習目標はノイズ除去であり、ノイズの塊から一歩ずつ鮮明な画像へと近づいていく。各ステップはただ「どちらに進むべきか」を予測するだけでよい。そしてこのノイズ除去という作業自体は、画面に何が写っているかをほとんど理解する必要がなく、だからモデルには意味を学ぶ動機が生まれない。

業界で一般的な解決策は外部から借りてくることだ。すでに学習済みの理解モデル(最もよく使われるのはDINOv2)を参照として外付けし、生成モデルの内部表現をそれに合わせさせる。この手法はREPAと呼ばれる。効果はあるが、三つの厄介な問題を抱えている。外付けするモデルは別途学習が必要なこと、その目標が生成の目標と噛み合わないこと、そして規模を拡大すると期待通りの性能が出ないことだ。

Self-Flow:モデル内部に人為的な情報格差を作り出す

Self-Flowの核となる操作は、デュアルタイムステップ・スケジューリング(Dual-Timestep Scheduling)と呼ばれる。1件のクリーンなデータに対して2つのタイムステップとランダムなマスクを抽出し、各トークンに割り当てられたタイムステップに応じてノイズを加える。すると同じデータの中に、ひどくぼやけた部分と、まだ比較的はっきりした部分が混在することになる。

肝心なのはこの部分だ。一方の経路(教師)は2つのタイムステップのうち小さい方でノイズを加えるため、より鮮明に見える。もう一方の経路(生徒)が見るのは、異なるノイズ強度が混在したバージョンだ。生徒には二つのことが同時に求められる。自分の手元のデータをノイズ除去することと、この欠損した視界から、教師が見た特徴を再構成することだ。

情報の非対称性そのものが駆動力になる。生徒が自分の欠けている部分を補おうとするとき、自分の狭い範囲だけを見ていては済まない。他の場所に何が残っているかを見て、画面や音声の中の構造を理解しなければならない。この穴埋めの過程そのものが、意味表現を育てていく。生成能力と理解能力は同じ学習の中で同時に生まれ、外部モデルや追加の教師信号は一切必要ない。

クリーンなデータ1件 2つのタイムステップ+ランダムマスクを抽出 教師 小さいノイズで統一 鮮明 生徒 ブロックごとにノイズ強度が違う ひどくぼやけた部分もある 再構成 生徒がすべき2つのこと ① 手元のデータをノイズ除去 ② 教師が見た特徴を再構成 欠けた情報は、構造の理解でしか補えない こうして「生成できる」と「理解できる」が同時に育つ
デュアルタイムステップ・スケジューリング:同じデータに異なる強度のノイズを加え、人為的に情報格差を作り出すことで、生徒側に構造の理解を強いる(公式の手法説明に基づき本サイトが作成した模式図)
たとえるなら

ジグソーパズルを途中まで組み立てたところで、誰かがわざと数ピースを隠したようなものだ。隠された部分を当てるには、周囲にすでに見えている絵柄から推理するしかない。この推理の過程そのものが、パズル全体への理解を深めてくれる。それこそが、ピースを隠した本当の狙いだ。

Self-Flow手法のアーキテクチャ図
公式の手法図:クリーンな入力に対して2つのタイムステップと1つのランダムマスクを抽出し、それぞれのタイムステップに応じてノイズを加える。教師側は小さいノイズを使い、生徒との間に情報格差が生まれる。出典:Self-Flow研究ページ(メインの発表ブログには未掲載)

なぜこれがマルチモーダルに不可欠なのか

この研究には二組の結果があり、三つのモダリティすべてをカバーするモデルを作ろうとするとき、外付け方式では通用しない理由を説明している。

一組目はモダリティを跨いだ失敗だ。動画において、最も強力な外部エンコーダーは意外にも画像モデルであるDINOv2で、V-JEPA 2のような動画専用エンコーダーや、Depth Anything 3のような空間学習器よりも優れていた。音声においては、MERTを外付けして整合を取っても、何も外付けしない場合と比べて何のメリットもなかった。外部整合という手法は、画像中心のタスク範囲から一歩も出られなかったのだ。

二組目は規模の話だ。パラメータ数を2.9億、4.2億、6.25億から10億まで引き上げていくと、Self-FlowとREPAの差はどんどん開いていく。Self-Flowは増加した計算資源を活かせるが、REPAには収益逓減が現れる。この点が、FLUX 3ほどの規模のモデルの土台として使えるかどうかを直接左右する。

Self-Flowと通常のFlow Matchingの比較
左は各モダリティの生成誤差(通常のflow matchingを100として正規化、低いほど良い)、右は操作タスクの成功率(高いほど良い)。出典:Black Forest Labs
評価項目Self-Flow通常のflow matching差分
動画生成誤差(FVD)66.372.9約9.1%低い
画像生成誤差(FID)3.694.04約8.5%低い
音声生成誤差(FAD)149.8153約2.1%低い
ロボット操作成功率約47%約35%約12ポイント高い

FVD、FID、FADはいずれも「生成結果が実データからどれだけ離れているか」を測る一般的な誤差指標で、それぞれ動画・画像・音声に対応している。読み方は同じで、同一の条件下では数値が低いほど、通常は生成結果が実際の分布に近いことを示す。右の列は別のことを測っている。この内部表現が下流の動作モジュールで使えるかどうかだ。成功率が高いということは、それが「見た目の良さ」だけでなく、「実際に手を動かせるか」にも役立つことを示している。

注記:上の表はFLUX 3の発表ページに掲載された図に基づき、比較対象は通常のflow matchingである。Self-Flow研究ページの主な比較対象はREPA(DINOv2を外付けする手法)であり、二つは比較基準が異なるため混同してはならない。いずれも手法レベルの実験室内比較であり、FLUX 3の完成品を他社製品と比較する話とは別物だ。
5動画

今使えるのは動画ラインだけ

動画ラインの確定情報は二つある。1回の生成で最長20秒、そしてすべての出力がネイティブに音声を内蔵していることだ。

「ネイティブ」という言葉は分けて説明する必要がある。多くの動画モデルは、まず無音の映像を生成し、音声は別途作って後から合わせる。FLUX 3の出力では、映像と音声は同じ1回の生成で作られる。20秒という長さは現時点で最長クラスに属し、OpenAIがすでに提供を停止したSoraと並ぶ水準だ。

公式が挙げる機能は9項目ある。「何を入力するか」でグループ分けすると、より整理して見える。

テキストのみ
ゼロから音声付き動画を生成する。
画像を1枚
その1フレームから動き出すか、あるいは画像を外見やスタイルの参考としてのみ使う。
参考動画を1本
その中の核となる要素(同じキャラクターなど)を新しい場面やストーリーに持ち込む。
キーフレームを数枚
冒頭・末尾やいくつかの重要な場面を固定し、その間の遷移を補わせる。
既存の動画と音声
続きを生成でき、毎回最初からやり直す必要がない。
そのほか3項目
多言語のセリフ、家庭用カメラの生々しい質感からアニメ・映画的な質感までの多様なスタイルとアスペクト比、画面上のテキストと動的なレイアウト。

最後の1項目こそ、彼らが本当に解決したい課題

9番目の機能はagentic連結(自律的な連結)と呼ばれ、短いクリップを繋ぎ合わせて、より長いマルチカットのシーケンスを作る。これらの機能を組み合わせれば数分間の長さのシーケンスを作ることができ、視覚的な参照によってキャラクターが全ての場面で同一人物に見えるよう保つ。

生成動画が商用パイプラインに入るのを阻んできたのは、そもそも1本の映像の見栄えの良し悪しではない。詰まっているのはカット間の連続性だ。1カット目に登場する人物は、2カット目でも同一人物でなければならない。ここは現在最も直接的な競争が起きているポイントでもある。HappyHorse 1.1の目玉アップグレードはR2V(参照画像から動画生成)と呼ばれ、複数のキャラクター参照画像を受け付けてアイデンティティを固定する、つまり入力側から同じ問題を解こうとしている。両社とも戦場がどこにあるかを正確に理解している。

画像ラインはまだ評価対象にならない

画像面では、公式はゼロからの合成も既存画像の編集も可能で、スタイル・アスペクト比・解像度のカバー範囲が広がり、複雑なプロンプトの処理と多言語テキストレンダリングが従来のFLUXバージョンより明らかに向上したと書いている。

だがこれらは学習の中間段階で行われた暫定評価であり、具体的な数値は一切示されておらず、画像のベンチマークや勝率も公表されていない。先行アクセスにはまだ数週間かかる。

FLUX 3の画像サンプル
公式が提供したサンプル画像。スタイルのカバー範囲とテキストレンダリングの効果を示すためのもの。出典:Black Forest Labs
6人手評価

人手評価の数字では、引き分けになった二つの方が勝った数字より読む価値がある

公式は1対1比較の人間による選好テストを行った。10秒・720p・音声付きのテキストから動画を生成し、どちらが好きかを人に選んでもらう方式だ。グラフには「初期FLUX 3候補版の暫定評価」と明記されており、この数字が示しているのは発表前のチェックポイントであって、現在先行アクセスに入っているモデルではないことを意味する。50%は両者に優劣がつかないことを表す。

Luma Ray 3.2
93%
Runway Gen-4.5
77%
Grok Imagine Video
69%
Kling v3 Pro
60%
Happy Horse v1
59%
Happy Horse 1.1
57%
Seedance 2.0
52%
Gemini Omni Flash
52%
バーの長さ=FLUX 3をより好んだ人の割合。縦線は50%の位置で、そこに落ちれば優劣がつかないことを意味する。

この8件を情報量の観点で並べ替えると、三つの層になる。

93% ・ 77%最も差をつけて勝った二つは、同時に最も手ごたえの弱い相手でもある

Luma Ray 3.2とRunway Gen-4.5はどちらも成熟した製品だが、現在の独立系動画ランキングで基調を作っている顔ぶれではない。この二つの勝利は本物の勝利であると同時に、企業の調達候補リストを最も変えにくいタイプの勝利でもある。

52%Seedance 2.0——凍結された製品との引き分け

バイトダンスは、Netflix、ワーナー・ブラザース、ディズニー、パラマウント、ソニーから組織的な著作権侵害の疑いで法的な警告を受けた後、Seedance 2.0の国際展開を無期限に延期した。この停止措置は現在も解除されていない。欧米企業の多くは現状これを調達できない。

凍結された製品と引き分けたところで、強い主張にもならなければ、痛手を受けたことにもならない。

52%Gemini Omni Flash——この52%こそ重みがある

Omniは大手プラットフォームの中で、FLUX 3が目指すものに最も近い存在だ。マルチモーダル入力、動画と音声を認識できる制作、対話形式の編集。BFL自身の測定によれば、両者は10秒のテキストから動画生成において優劣がつかない。

差は別の場所にある。OmniはすでにGoogleのGemini APIを通じて広く利用可能で、720pなら1秒$0.10。一方FLUX 3の動画ラインは申請と審査が必要で、価格については一言も触れられていない。もう一点、このドイツ企業の地元市場に影響する事情もある。欧州経済領域、スイス、英国では、Omni Flashのユーザーはアップロードした動画を編集できず、モデル自身が生成したコンテンツしか編集できない。

ここで、メインの発表ブログでは説明されていない名前を補っておこう。Happy Horseは2026年4月に公開された動画モデルで、1080pで最長15秒、ネイティブに同期した音声を備え、4月には第三者機関Artificial Analysisの動画アリーナでテキストから動画・画像から動画の両部門で1位を獲得したことがある。これを知って初めて、59%と57%という二つの数字の重みが読み取れる。

FLUX 3動画の人手評価による選好率比較図
公式の人手評価の元図:10秒・720p・音声付きのテキストから動画生成を1対1で比較したもの。図には初期候補版の暫定評価と明記されている。出典:Black Forest Labs

価格表に並べると、空白の列が一番目立つ

モデル1回あたり最長最高解像度主な制約10秒720p価格
FLUX 3 Video20秒未記載、評価は720pで実施 先行アクセス、審査が必要/公開サービスの確約なし未公表
Gemini Omni Flash10秒(最短3秒)720p/24fps プレビュー版/欧州経済領域・スイス・英国ではアップロード動画を編集不可$1.00
HappyHorse 1.115秒1080p 4K非対応/ウェイト非公開未公表(1.0の販売価格は約$1.82)
Veo 3.1秒単位課金4K クリップ延長対応/プレビュー版$4.00
Veo 3.1 Fast秒単位課金4K プレビュー版$1.00

さらに、評価に何人参加させたか、盲検で行ったか、どのプロンプトを使ったかといった評価手法全体が一切明かされていない。完全なベンチマーク結果と評価手法は、より広く公開される段階で発表されるという。

7ロボット

ロボットの側が、この主張に最も硬い証拠を与えている

「コンテンツ生成とロボットが同じベースモデルを共有する」という主張を検証可能な形にしたのが、FLUX-mimicだ。これはBFLとスイス企業mimic roboticsが共同で開発した動画-動作モデルで、FLUX 3のバックボーン上で動作し、すでにアウディでテストと実装が進められている。

やり方は別のロボットモデルを新たに学習させることではない。彼らの主張はこうだ。FLUX 3が動画を生成できるようになるためには、内部にすでに世界についての表現を学び取っているはずだ。ならば、FLUXの動画予測経路から取り出した中間特徴の上に、軽量な動作デコーダーを学習させ、動作をその表現から解き出せばよい。

30分
新しいタスクを教えるのに必要なロボットデータ(以前は30時間以上)
<80ms
バックボーンが単一のRTX 5090上で入力から世界表現を得るまで
101ms
システム全体の反応時間、人間の視覚反応と同じオーダー

最も説得力があるのは次の点だ。FLUXのバックボーンを完全に凍結したまま、上に載せた動作デコーダーだけを学習させても、従来の視覚-言語-動作モデル(VLA)を上回る成績を出す。しかも従来モデルは、この凍結という設定ではそもそも機能しない。バックボーンとデコーダーを両方微調整すると、FLUX-mimicは現時点で最高の成功率に達する。これは二つのことが同時に成り立っていることを示している。大規模な学習によってバックボーンが十分な世界の知識を蓄えたこと、そしてSelf-Flowがその知識を特徴量から直接取り出せるようにしたことだ。

データ効率についてはもう一つ、手法自体に由来する結果がある。Self-Flowの実験では、同じ成功率に達するのに必要な動作予測の学習ステップ数が、Self-Flowを使わない動画モデルの半分で済んだ。

アウディ側でテストしているのは、従来の自動化が手を出せなかった仕事

アウディの生産ネットワークは自動化率で自動車業界屈指の水準にあり、通常の自動化の限界がどこにあるかについて実地の知見を持つ。柔軟な部品や繊細な操作を要する作業がずっと人手に委ねられてきたのは、主に経済的な理由からだ。高級車のバリエーションが多すぎるため、通常のプログラミングによるロボットの作業ステーションは状況が変わるたびに再エンジニアリングが必要になり、コストを抑えられない。

FLUX-mimicが実際の生産ラインと物流現場でこなしている作業には、部品を構造化されたトレイに仕分けること、電子制御ユニットを精密治具に差し込むこと、部品を組み立てること、そしてシール材やケーブルのような柔らかく変形しやすい素材を扱うことが含まれる。最後の一つは、通常の自動化がこれまで一度も手を付けられなかった領域だ。

mimicとの協業の中で、アウディはFLUX-mimicのテストと実装を継続してきました。これらのロボットが複雑な柔軟物操作の作業をこなす様子を目にしましたが、従来のロボット方式ではまったく不可能なことでした。これは従業員の支援、効率の向上、そして柔軟な自動化を生産・物流の現場に広げていく上で、大きな影響を与えうるものです。

Christoph Schneider(アウディProduction Lab)

誰にも教わっていない立て直し方

もう一つ特筆すべき挙動がある。FLUX-mimicは失敗から自力で立ち直る。ロボットが掴み損ねると、修正し、もう一度掴み直し、タスクをやり遂げる。

どんなデモデータも、あるタスクが失敗しうるすべてのパターンを網羅することはできない。デモで教わっていない以上、この立て直しの動作は別の場所から来ているとしか考えられない。それは、世界の仕組みをすでに知っているモデルからだ。

ロボットにとって最も難しいのはデータです。新しいタスク一つひとつが、通常はロボットに何時間も同じ動作を繰り返させることを意味します。FLUX-mimicは、物理世界の仕組みをすでに理解している最先端の動画モデルの上に構築されているため、新しいタスクを学ぶのに数日ではなく数分しかかかりません。これにより、私たちはロボット学習の現在の技術水準を飛び越えることができるのです。

Elvis Nava(mimic Robotics CTO)
8境界線

何が確定していて、何がまったく未公表なのか

確認済み
  • 動画は1回あたり最長20秒、映像と音声は同じ1回の生成で作られる
  • 動画ラインの先行アクセスは申請制で誰でも申し込めるが、BFLの審査が必要
  • ベースとなる手法はSelf-Flowで、2026年3月にすでに公開されている
  • FLUX-mimicはアウディでテスト・実装されており、バックボーンは単一GPUで80ミリ秒未満
  • 4つの製品ラインの展開順序
  • Canva、Burda、Magnific、Krea、Picsartがすでにテスト中
未公表
  • 価格、利用枠、本番環境でのサービスレベルの確約
  • 評価手法、サンプル数、評価者数
  • 画像モデルのベンチマーク、一つも存在しない
  • 20秒動画がどの解像度で動作するか(評価はすべて720p)
  • FLUX 3 Devのライセンス、パラメータ数、量子化方式、ハードウェア要件
今すぐ
FLUX 3 Video
動画と音声の生成・編集。APIとプライベートウェイトで提供され、先行アクセスはすでに申請を受け付けている。
この先数週間
FLUX 3 Image
画像の合成と編集。同じくAPIとプライベートウェイトで提供され、まず先行アクセスの段階を経る。
パートナー経由
FLUX-mimicとFLUX 3 Action
動作予測。選定された研究・商業パートナーを通じて進められ、mimicから始まる。
最後
FLUX 3 Dev
オープンウェイトのマルチモーダルバックボーン。コンテンツ生成と動作予測をカバーする。具体的な時期は明言されていない。

オープンウェイトが最後に回されるのは、FLUXにとって異例

FLUXがこの2年間業界で築いてきた地位は、大部分がオープンウェイトによって得られたものだ。FLUX.1 DevやFLUX.1 Kontext Devは発表直後にリリースされ、研究者やクリエイティブツールの開発者はチェックポイントをダウンロードしてローカルで推論を行い、Hugging Face DiffusersやComfyUIに組み込むことができた。2025年末のFLUX.2 Devは320億パラメータのオープンウェイト画像モデルだった。

今回のFLUX 3 Devが描いているのは、動画・音声・画像・動作予測にまたがるマルチモーダルバックボーンで、これまでのどのDevリリースの約束よりも広範囲だ。だがそれが4つのラインの最後に回されている。大型バージョンの発表と同時か、その直後にローカルで動くバージョンを手にすることに慣れた開発者は、今回はしばらく待たされることになる。ライセンス一つで、ある企業がコンテンツ生成と物理的な機械操作を同時に扱うモデルをローカルに実装できるかどうかが決まるが、そのライセンス、パラメータ数、量子化方式、ハードウェア要件について、現時点では何の情報もない。

「世界モデル」という言葉を、今や二社が同時に語っている

BFLの主張はこうだ。画像だけで学習したモデルは、動き、音を立て、変化し、反応する世界を理解できない。そして物理現象への理解こそが、信じられる映像を生成できる理由なのだ。

GoogleがGemini Omniについて語る内容も、ほぼ同じ路線だ。開発者向けドキュメントには「世界知識」という言葉があり、物理現象への理解を、Geminiが歴史・科学・文化的文脈を把握する能力と並べて位置づけている。6月の対外的な発言はさらに直接的で、このモデルは「重力、運動エネルギー、流体力学といった力について直感的な理解を持ち、そのため動作がより現実世界の論理に沿ったものになる」としている。

現在、先端を行く3つの動画システムのうち2つが、物理理解を中核的な強みとして語っているが、どちらもそれを測定するベンチマークを公表していない。生成された水が水らしく見えるか、落下する物体の速度が妥当か、衝突音が然るべきタイミングで鳴っているかを判断できる標準的なテストも、今のところ存在しない。人間による選好評価がその一部を間接的に捉えてはいるが、それ以外に測る手立てはない。

🧰 実践カード・FLUX 3 Video(先行アクセス)
ハードル申請を提出しBlack Forest Labsの審査を待つ必要がある。画像ラインはまだ数週間先で、オープンウェイトのFLUX 3 Devは4つのラインの最後に位置する
出典
FLUX 3 — Real World Models: Towards Multimodal Flow Models as the Backbone of Visual IntelligenceBlack Forest Labsbfl.ai/blog/flux-32026-07-23
本サイトからの注記
人手評価の数値とSelf-Flow比較表は公式の図から該当箇所を転記した。95%という計算資源比率、0.5%という音声トークン比率、3500ステップでの回復、30分対30時間、80msと101ms、アウディのタスク一覧および二つの実名コメントはFLUX 3×mimic関連文書より。デュアルタイムステップ機構、モダリティ横断の外部整合の失敗、パラメータ規模の区間はSelf-Flow研究ページより。未公表項目のリスト、競合の階層分け背景、Seedance 2.0が国際展開を停止した理由、Gemini Omni Flashの価格設定と欧州での制限、Rombachのコメントは、いずれもVentureBeat記事より。二枚の模式図(四つの側面、デュアルタイムステップ)は本サイトが公式の説明に基づいて作成したもので、公式図ではない。ステータスカード、入力のグループ分け、価格表は本サイトによる構成であり、新たに測定したデータではない。