Black Forest Labs、FLUX 3を発表 画像・動画・音声・ロボットを1モデルに統合
- Black Forest LabsがFLUX 3を発表した。同じモデルが一方では最長20秒、映像と音声が同時に出る動画を生成し、もう一方ではアウディの生産ラインでロボットを動かしている。両者の根底は同じ仕組みだと彼らは言う。
- 核心の賭けはこうだ。画像・動画・音声・動作はすべて同じ現実の側面であり、それぞれが情報の一部を失っている。個別に学習すれば側面しか学べないが、一緒に学習させれば互いに制約し合い、モデルはその背後にある共通の現実そのものを学ばざるを得なくなる。学習計算資源の95%以上が動画に費やされ、音声は音声付き720p動画の中でトークン全体の0.5%にも満たない。
- この裏側にある手法はSelf-Flowと呼ばれる。同じデータの異なる部分に強度の違うノイズを加え、「はっきり見える教師」と「ぼやけて見える生徒」を人為的に作り出し、モデルに自分で自分を教えさせる。DINOv2のような既製の理解モデルを外付けする方式はもう使わない。なぜならその方式は画像以外ではまるで通用しないからだ。
- 現時点で触れられるのは動画だけで、申請と審査が必要だ。人手評価ではGemini Omni Flashと52%で互角に持ち込んだが、あちらは今すぐ使えて1秒$0.10だ。価格、画像のベンチマーク、オープンウェイトのライセンス——どれもまだ公表されていない。
同じモデルが音声付き動画を生成し、アウディの生産ラインでロボットも動かす
ドイツの企業Black Forest Labsが手がけるFLUXシリーズは、この2年間、多くの人が画像生成に使ってきたものだ。Adobe PhotoshopのAI生成機能やPicsartのAI機能も、裏側ではこれが動いている。7月23日、彼らはFLUX 3を発表した。同じモデルが今や最長20秒、映像と音声が同時に出る動画を生成できる。
同じモデルのもう一つの使い道は、いまアウディの生産ラインのロボットに組み込まれている。シール材やケーブルのような変形しやすいものを掴む作業で、従来の自動化技術が何十年も手を付けられなかった仕事だ。
同社はドイツのフライブルクを拠点とし、創業チームにはかつてVQGAN、潜在拡散(Latent Diffusion)、Stable Diffusionを生み出したメンバーが名を連ねる。今回が彼らにとって初めて公開する動画生成モデルとなる。
発表は4つの製品ラインに分かれているが、今日実際に触れられるのは1つだけだ。以下の3枚のカードは「今すぐ使えるかどうか」を示している。
画像・動画・音声・動作は同じものの四つの側面だと彼らは考える
FLUX 3がなぜこういう形になったのかを理解するには、まずその前提を受け入れる必要がある。この前提は技術的な細部の話ではない。世界についての一つの判断だ。どのモダリティ(データの様式)も現実を完全には記述できない。
画像が記録するのは、ある瞬間の空間構造——何がどこにあり、何と隣接しているか——である。動画は時間を取り戻し、物がどう動くか、どれほどの重さか、ぶつかったらどうなるかを見せてくれる。音声が明かすのは、機械的な現象と音響の間の因果関係で、これは画面だけを見ていてはわからない層だ。そして言語は、これらの知覚を目的・抽象・指示へと結びつける。
そのどれもが、同じ現実を異なるセンサーで捉えた一つの投影であり、捕捉のたびに一部の情報が失われる。一種類だけを学習すれば、その投影に強いモデルが得られるだけだ。四種類を一緒に学習させれば、互いの制約がより多くを教えてくれる。音は衝突と一致していなければならず、動きは質量に従わなければならず、後の場面は前の場面を引き継がなければならない。制約が増えるほど、モデルは表面だけを学ぶわけにいかなくなり、すべての制約を同時に満たす背後の本質を推測せざるを得なくなる。
現実を欺くことはできない。画像だけを学習したモデルは画像しか生成できない。だが世界は静止画像の集合ではない。動き、音を立て、変化し、反応する。
Robin Rombach(Black Forest Labs共同創業者兼CEO)、発表前にVentureBeatへ提供した書面コメントより
学習計算資源の95%が動画に使われ、音声はほぼついでに習得される
上の話が言葉のレベルにとどまるなら、誰にでも言える。だが具体的に見ると、それは計算資源の配分という一つの数字の話になる。
FLUX 3は最初から画像・動画・音声を統合して学習しており、その中で最も資源を食うのが動画予測で、学習総計算資源の95%以上を占める。理由は単純だ。見た目に正しい動画を生成するには、モデルは接触・運動・重さ・因果関係を学ぶしかない。そのどれか一つでも間違えれば、人は一目で偽物だと見抜いてしまう。この世界を正確にレンダリングできるようになることは、この世界がどう動いているかを学ぶことと同義だ。
音声はむしろこの中で最もコストが低い。次元が低く、動画に比べてディテールがはるかに少ない。音声付き720p動画では、音声が占めるトークンは0.5%にも満たない。モデルが動画の理解という関門を越えると、動画と音声の因果関係——話し声が口の動きと一致すること、効果音がそれを引き起こした物理現象と一致すること——を自然と学び取ってしまう。
動作も同じ構図だ。ロボットの状態は低次元の表現であり、視覚的な観察と密接に結びついている。映像・音声・動作は、いずれも同じ物理的現実の局所的な表現なのだ。モデルが動画と音声の背後にある物理過程を学び終えれば、動作の予測はゼロから始めることにはならない。それは同じ現実の、また別の視点にすぎない。
彼らは一度の学習でこの主張を検証した
上の枠組みが成り立つなら、FLUX 3に動作予測を教えても長期的な代償は残らないはずだ。モデルは一時的に乱される短い期間を経て、動作空間の構造を理解し、内部の世界表現をそれに合わせて調整し、その後は元の水準に戻るはずである。
彼らは大規模な学習の途中で動作予測をカリキュラムに組み込み、動画生成品質を観察し続けた。テキストから動画、画像から動画への人手評価は当初最大10%低下したが、3500ステップ後には動作追加前の水準まで動画生成品質が回復し、その時点でモデルは動作予測もできるようになっていた。
モデルは確かに動作を自らの入出力に組み込む必要があるが、それが容量を永続的に食いつぶすわけではない。ただ、この新しいモダリティが既存の世界モデルとどう関係するのかを理解する必要があるだけだ。それが理解できれば、既存能力への影響は消える。
Self-Flow:モデルに自分で自分を教えさせ、理解モデルの外付けをやめる
FLUX 3の土台にある学習手法はSelf-Flowと呼ばれ、Black Forest Labsが2026年3月に発表した研究だ。著者にはMITのAntonio Torralbaも名を連ねている。何が変わったのかを理解するには、まず以前どこで行き詰まっていたかを知る必要がある。
旧来の手法:外部の「わかっている」モデルに先導させる
画像や動画を生成するモデル(拡散モデルやフローモデルなど)には、繰り返し確認されてきた現象がある。モデル内部の意味表現が強いほど、収束が速く、生成品質も高くなる。問題は、この表現は放っておいても育たないということだ。モデルの学習目標はノイズ除去であり、ノイズの塊から一歩ずつ鮮明な画像へと近づいていく。各ステップはただ「どちらに進むべきか」を予測するだけでよい。そしてこのノイズ除去という作業自体は、画面に何が写っているかをほとんど理解する必要がなく、だからモデルには意味を学ぶ動機が生まれない。
業界で一般的な解決策は外部から借りてくることだ。すでに学習済みの理解モデル(最もよく使われるのはDINOv2)を参照として外付けし、生成モデルの内部表現をそれに合わせさせる。この手法はREPAと呼ばれる。効果はあるが、三つの厄介な問題を抱えている。外付けするモデルは別途学習が必要なこと、その目標が生成の目標と噛み合わないこと、そして規模を拡大すると期待通りの性能が出ないことだ。
Self-Flow:モデル内部に人為的な情報格差を作り出す
Self-Flowの核となる操作は、デュアルタイムステップ・スケジューリング(Dual-Timestep Scheduling)と呼ばれる。1件のクリーンなデータに対して2つのタイムステップとランダムなマスクを抽出し、各トークンに割り当てられたタイムステップに応じてノイズを加える。すると同じデータの中に、ひどくぼやけた部分と、まだ比較的はっきりした部分が混在することになる。
肝心なのはこの部分だ。一方の経路(教師)は2つのタイムステップのうち小さい方でノイズを加えるため、より鮮明に見える。もう一方の経路(生徒)が見るのは、異なるノイズ強度が混在したバージョンだ。生徒には二つのことが同時に求められる。自分の手元のデータをノイズ除去することと、この欠損した視界から、教師が見た特徴を再構成することだ。
情報の非対称性そのものが駆動力になる。生徒が自分の欠けている部分を補おうとするとき、自分の狭い範囲だけを見ていては済まない。他の場所に何が残っているかを見て、画面や音声の中の構造を理解しなければならない。この穴埋めの過程そのものが、意味表現を育てていく。生成能力と理解能力は同じ学習の中で同時に生まれ、外部モデルや追加の教師信号は一切必要ない。
ジグソーパズルを途中まで組み立てたところで、誰かがわざと数ピースを隠したようなものだ。隠された部分を当てるには、周囲にすでに見えている絵柄から推理するしかない。この推理の過程そのものが、パズル全体への理解を深めてくれる。それこそが、ピースを隠した本当の狙いだ。
なぜこれがマルチモーダルに不可欠なのか
この研究には二組の結果があり、三つのモダリティすべてをカバーするモデルを作ろうとするとき、外付け方式では通用しない理由を説明している。
一組目はモダリティを跨いだ失敗だ。動画において、最も強力な外部エンコーダーは意外にも画像モデルであるDINOv2で、V-JEPA 2のような動画専用エンコーダーや、Depth Anything 3のような空間学習器よりも優れていた。音声においては、MERTを外付けして整合を取っても、何も外付けしない場合と比べて何のメリットもなかった。外部整合という手法は、画像中心のタスク範囲から一歩も出られなかったのだ。
二組目は規模の話だ。パラメータ数を2.9億、4.2億、6.25億から10億まで引き上げていくと、Self-FlowとREPAの差はどんどん開いていく。Self-Flowは増加した計算資源を活かせるが、REPAには収益逓減が現れる。この点が、FLUX 3ほどの規模のモデルの土台として使えるかどうかを直接左右する。
| 評価項目 | Self-Flow | 通常のflow matching | 差分 |
|---|---|---|---|
| 動画生成誤差(FVD) | 66.3 | 72.9 | 約9.1%低い |
| 画像生成誤差(FID) | 3.69 | 4.04 | 約8.5%低い |
| 音声生成誤差(FAD) | 149.8 | 153 | 約2.1%低い |
| ロボット操作成功率 | 約47% | 約35% | 約12ポイント高い |
FVD、FID、FADはいずれも「生成結果が実データからどれだけ離れているか」を測る一般的な誤差指標で、それぞれ動画・画像・音声に対応している。読み方は同じで、同一の条件下では数値が低いほど、通常は生成結果が実際の分布に近いことを示す。右の列は別のことを測っている。この内部表現が下流の動作モジュールで使えるかどうかだ。成功率が高いということは、それが「見た目の良さ」だけでなく、「実際に手を動かせるか」にも役立つことを示している。
今使えるのは動画ラインだけ
動画ラインの確定情報は二つある。1回の生成で最長20秒、そしてすべての出力がネイティブに音声を内蔵していることだ。
「ネイティブ」という言葉は分けて説明する必要がある。多くの動画モデルは、まず無音の映像を生成し、音声は別途作って後から合わせる。FLUX 3の出力では、映像と音声は同じ1回の生成で作られる。20秒という長さは現時点で最長クラスに属し、OpenAIがすでに提供を停止したSoraと並ぶ水準だ。
公式が挙げる機能は9項目ある。「何を入力するか」でグループ分けすると、より整理して見える。
最後の1項目こそ、彼らが本当に解決したい課題
9番目の機能はagentic連結(自律的な連結)と呼ばれ、短いクリップを繋ぎ合わせて、より長いマルチカットのシーケンスを作る。これらの機能を組み合わせれば数分間の長さのシーケンスを作ることができ、視覚的な参照によってキャラクターが全ての場面で同一人物に見えるよう保つ。
生成動画が商用パイプラインに入るのを阻んできたのは、そもそも1本の映像の見栄えの良し悪しではない。詰まっているのはカット間の連続性だ。1カット目に登場する人物は、2カット目でも同一人物でなければならない。ここは現在最も直接的な競争が起きているポイントでもある。HappyHorse 1.1の目玉アップグレードはR2V(参照画像から動画生成)と呼ばれ、複数のキャラクター参照画像を受け付けてアイデンティティを固定する、つまり入力側から同じ問題を解こうとしている。両社とも戦場がどこにあるかを正確に理解している。
画像ラインはまだ評価対象にならない
画像面では、公式はゼロからの合成も既存画像の編集も可能で、スタイル・アスペクト比・解像度のカバー範囲が広がり、複雑なプロンプトの処理と多言語テキストレンダリングが従来のFLUXバージョンより明らかに向上したと書いている。
だがこれらは学習の中間段階で行われた暫定評価であり、具体的な数値は一切示されておらず、画像のベンチマークや勝率も公表されていない。先行アクセスにはまだ数週間かかる。
人手評価の数字では、引き分けになった二つの方が勝った数字より読む価値がある
公式は1対1比較の人間による選好テストを行った。10秒・720p・音声付きのテキストから動画を生成し、どちらが好きかを人に選んでもらう方式だ。グラフには「初期FLUX 3候補版の暫定評価」と明記されており、この数字が示しているのは発表前のチェックポイントであって、現在先行アクセスに入っているモデルではないことを意味する。50%は両者に優劣がつかないことを表す。
この8件を情報量の観点で並べ替えると、三つの層になる。
Luma Ray 3.2とRunway Gen-4.5はどちらも成熟した製品だが、現在の独立系動画ランキングで基調を作っている顔ぶれではない。この二つの勝利は本物の勝利であると同時に、企業の調達候補リストを最も変えにくいタイプの勝利でもある。
バイトダンスは、Netflix、ワーナー・ブラザース、ディズニー、パラマウント、ソニーから組織的な著作権侵害の疑いで法的な警告を受けた後、Seedance 2.0の国際展開を無期限に延期した。この停止措置は現在も解除されていない。欧米企業の多くは現状これを調達できない。
凍結された製品と引き分けたところで、強い主張にもならなければ、痛手を受けたことにもならない。
Omniは大手プラットフォームの中で、FLUX 3が目指すものに最も近い存在だ。マルチモーダル入力、動画と音声を認識できる制作、対話形式の編集。BFL自身の測定によれば、両者は10秒のテキストから動画生成において優劣がつかない。
差は別の場所にある。OmniはすでにGoogleのGemini APIを通じて広く利用可能で、720pなら1秒$0.10。一方FLUX 3の動画ラインは申請と審査が必要で、価格については一言も触れられていない。もう一点、このドイツ企業の地元市場に影響する事情もある。欧州経済領域、スイス、英国では、Omni Flashのユーザーはアップロードした動画を編集できず、モデル自身が生成したコンテンツしか編集できない。
ここで、メインの発表ブログでは説明されていない名前を補っておこう。Happy Horseは2026年4月に公開された動画モデルで、1080pで最長15秒、ネイティブに同期した音声を備え、4月には第三者機関Artificial Analysisの動画アリーナでテキストから動画・画像から動画の両部門で1位を獲得したことがある。これを知って初めて、59%と57%という二つの数字の重みが読み取れる。
価格表に並べると、空白の列が一番目立つ
| モデル | 1回あたり最長 | 最高解像度 | 主な制約 | 10秒720p価格 |
|---|---|---|---|---|
| FLUX 3 Video | 20秒 | 未記載、評価は720pで実施 | 先行アクセス、審査が必要/公開サービスの確約なし | 未公表 |
| Gemini Omni Flash | 10秒(最短3秒) | 720p/24fps | プレビュー版/欧州経済領域・スイス・英国ではアップロード動画を編集不可 | $1.00 |
| HappyHorse 1.1 | 15秒 | 1080p | 4K非対応/ウェイト非公開 | 未公表(1.0の販売価格は約$1.82) |
| Veo 3.1 | 秒単位課金 | 4K | クリップ延長対応/プレビュー版 | $4.00 |
| Veo 3.1 Fast | 秒単位課金 | 4K | プレビュー版 | $1.00 |
さらに、評価に何人参加させたか、盲検で行ったか、どのプロンプトを使ったかといった評価手法全体が一切明かされていない。完全なベンチマーク結果と評価手法は、より広く公開される段階で発表されるという。
ロボットの側が、この主張に最も硬い証拠を与えている
「コンテンツ生成とロボットが同じベースモデルを共有する」という主張を検証可能な形にしたのが、FLUX-mimicだ。これはBFLとスイス企業mimic roboticsが共同で開発した動画-動作モデルで、FLUX 3のバックボーン上で動作し、すでにアウディでテストと実装が進められている。
やり方は別のロボットモデルを新たに学習させることではない。彼らの主張はこうだ。FLUX 3が動画を生成できるようになるためには、内部にすでに世界についての表現を学び取っているはずだ。ならば、FLUXの動画予測経路から取り出した中間特徴の上に、軽量な動作デコーダーを学習させ、動作をその表現から解き出せばよい。
最も説得力があるのは次の点だ。FLUXのバックボーンを完全に凍結したまま、上に載せた動作デコーダーだけを学習させても、従来の視覚-言語-動作モデル(VLA)を上回る成績を出す。しかも従来モデルは、この凍結という設定ではそもそも機能しない。バックボーンとデコーダーを両方微調整すると、FLUX-mimicは現時点で最高の成功率に達する。これは二つのことが同時に成り立っていることを示している。大規模な学習によってバックボーンが十分な世界の知識を蓄えたこと、そしてSelf-Flowがその知識を特徴量から直接取り出せるようにしたことだ。
データ効率についてはもう一つ、手法自体に由来する結果がある。Self-Flowの実験では、同じ成功率に達するのに必要な動作予測の学習ステップ数が、Self-Flowを使わない動画モデルの半分で済んだ。
アウディ側でテストしているのは、従来の自動化が手を出せなかった仕事
アウディの生産ネットワークは自動化率で自動車業界屈指の水準にあり、通常の自動化の限界がどこにあるかについて実地の知見を持つ。柔軟な部品や繊細な操作を要する作業がずっと人手に委ねられてきたのは、主に経済的な理由からだ。高級車のバリエーションが多すぎるため、通常のプログラミングによるロボットの作業ステーションは状況が変わるたびに再エンジニアリングが必要になり、コストを抑えられない。
FLUX-mimicが実際の生産ラインと物流現場でこなしている作業には、部品を構造化されたトレイに仕分けること、電子制御ユニットを精密治具に差し込むこと、部品を組み立てること、そしてシール材やケーブルのような柔らかく変形しやすい素材を扱うことが含まれる。最後の一つは、通常の自動化がこれまで一度も手を付けられなかった領域だ。
mimicとの協業の中で、アウディはFLUX-mimicのテストと実装を継続してきました。これらのロボットが複雑な柔軟物操作の作業をこなす様子を目にしましたが、従来のロボット方式ではまったく不可能なことでした。これは従業員の支援、効率の向上、そして柔軟な自動化を生産・物流の現場に広げていく上で、大きな影響を与えうるものです。
Christoph Schneider(アウディProduction Lab)
誰にも教わっていない立て直し方
もう一つ特筆すべき挙動がある。FLUX-mimicは失敗から自力で立ち直る。ロボットが掴み損ねると、修正し、もう一度掴み直し、タスクをやり遂げる。
どんなデモデータも、あるタスクが失敗しうるすべてのパターンを網羅することはできない。デモで教わっていない以上、この立て直しの動作は別の場所から来ているとしか考えられない。それは、世界の仕組みをすでに知っているモデルからだ。
ロボットにとって最も難しいのはデータです。新しいタスク一つひとつが、通常はロボットに何時間も同じ動作を繰り返させることを意味します。FLUX-mimicは、物理世界の仕組みをすでに理解している最先端の動画モデルの上に構築されているため、新しいタスクを学ぶのに数日ではなく数分しかかかりません。これにより、私たちはロボット学習の現在の技術水準を飛び越えることができるのです。
Elvis Nava(mimic Robotics CTO)
何が確定していて、何がまったく未公表なのか
- 動画は1回あたり最長20秒、映像と音声は同じ1回の生成で作られる
- 動画ラインの先行アクセスは申請制で誰でも申し込めるが、BFLの審査が必要
- ベースとなる手法はSelf-Flowで、2026年3月にすでに公開されている
- FLUX-mimicはアウディでテスト・実装されており、バックボーンは単一GPUで80ミリ秒未満
- 4つの製品ラインの展開順序
- Canva、Burda、Magnific、Krea、Picsartがすでにテスト中
- 価格、利用枠、本番環境でのサービスレベルの確約
- 評価手法、サンプル数、評価者数
- 画像モデルのベンチマーク、一つも存在しない
- 20秒動画がどの解像度で動作するか(評価はすべて720p)
- FLUX 3 Devのライセンス、パラメータ数、量子化方式、ハードウェア要件
オープンウェイトが最後に回されるのは、FLUXにとって異例
FLUXがこの2年間業界で築いてきた地位は、大部分がオープンウェイトによって得られたものだ。FLUX.1 DevやFLUX.1 Kontext Devは発表直後にリリースされ、研究者やクリエイティブツールの開発者はチェックポイントをダウンロードしてローカルで推論を行い、Hugging Face DiffusersやComfyUIに組み込むことができた。2025年末のFLUX.2 Devは320億パラメータのオープンウェイト画像モデルだった。
今回のFLUX 3 Devが描いているのは、動画・音声・画像・動作予測にまたがるマルチモーダルバックボーンで、これまでのどのDevリリースの約束よりも広範囲だ。だがそれが4つのラインの最後に回されている。大型バージョンの発表と同時か、その直後にローカルで動くバージョンを手にすることに慣れた開発者は、今回はしばらく待たされることになる。ライセンス一つで、ある企業がコンテンツ生成と物理的な機械操作を同時に扱うモデルをローカルに実装できるかどうかが決まるが、そのライセンス、パラメータ数、量子化方式、ハードウェア要件について、現時点では何の情報もない。
「世界モデル」という言葉を、今や二社が同時に語っている
BFLの主張はこうだ。画像だけで学習したモデルは、動き、音を立て、変化し、反応する世界を理解できない。そして物理現象への理解こそが、信じられる映像を生成できる理由なのだ。
GoogleがGemini Omniについて語る内容も、ほぼ同じ路線だ。開発者向けドキュメントには「世界知識」という言葉があり、物理現象への理解を、Geminiが歴史・科学・文化的文脈を把握する能力と並べて位置づけている。6月の対外的な発言はさらに直接的で、このモデルは「重力、運動エネルギー、流体力学といった力について直感的な理解を持ち、そのため動作がより現実世界の論理に沿ったものになる」としている。
現在、先端を行く3つの動画システムのうち2つが、物理理解を中核的な強みとして語っているが、どちらもそれを測定するベンチマークを公表していない。生成された水が水らしく見えるか、落下する物体の速度が妥当か、衝突音が然るべきタイミングで鳴っているかを判断できる標準的なテストも、今のところ存在しない。人間による選好評価がその一部を間接的に捉えてはいるが、それ以外に測る手立てはない。
Black Forest Labs、FLUX 3を発表 画像・動画・音声・ロボットを1モデルに統合
ドイツのFLUXチームが画像・動画・音声・動作を一つの土台に賭けた。どう学習させたのか、今日何が手に入るのかを、図付き1枚で読み切る。
↓ 1枚で読み切る・動く図が1枚あります
FLUXはこの2年間、多くの人が画像生成に使ってきたモデルで、Adobe PhotoshopやPicsartの生成機能も裏側ではこれが動いている。7月23日、これを作るドイツ企業Black Forest LabsがFLUX 3を発表した。同じモデルが最長20秒、映像と音声が同時に出る動画を生成し、同じバックボーン(モデル内で入力を内部表現に変換する主体)が今まさにアウディの生産ラインのロボットに組み込まれ、シール材やケーブルのような変形しやすいものを掴んでいる。
✔ 画像1枚、参考動画1本、キーフレーム数枚のいずれも入力にでき、短いクリップを繋いで数分間のマルチカットシーケンスにすることもできる。キャラクターは各場面で同一人物に見えるよう保たれる
✔ FLUX-mimicはすでにアウディの生産ラインでテスト・実装済み:部品をトレイに仕分け、電子制御ユニットを精密治具に差し込み、柔軟な素材を操作
✘ ロボットラインは研究・商業パートナー経由のみで、ウェブサイトから申請はできない
✘ オープンウェイトのFLUX 3 Devは4ラインの最後に位置し、ライセンス・パラメータ数・ハードウェア要件について情報は一切ない
今回の発表の土台にあるのは、世界についての一つの判断だ。どんな記録方法も現実を完全には描写できない。画像はある瞬間の空間構造を記録し、動画は時間を取り戻す(物がどう動き、どれほどの重さか)。音声は衝突と音の因果関係を明かし、動作は触れたら何が起こるかに対応する。四つを一緒に学習させると互いに制約し合う——音は衝突と一致し、運動は質量に従い、後の場面は前の場面を引き継ぐ——ため、モデルは表面だけを学ぶわけにいかなくなる。
この考え方を具体的に見ると、計算資源の配分という一つの数字の話になる。見た目に正しい動画を生成するには、モデルは接触・運動・重さ・因果関係を学ぶしかなく、一つでも間違えれば人は一目で見抜く。だから計算資源の大部分がこの動画という関門に注ぎ込まれる。この関門を越えれば、音声はほぼついでに習得される。以下の数字はいずれもBlack Forest Labs自身が発表したもの(mimicとの関連技術文書を含む)で、第三者による再現はない。
生成モデルには繰り返し確認されてきた現象がある。内部でコンテンツへの理解が強いほど、生成品質は高くなる。だがその学習目標はノイズ除去だけで、ノイズの塊から一歩ずつ鮮明な画像に近づくこの作業は、画面に何が写っているかをほとんど理解しなくても済んでしまう。だから理解は放っておいても育たない。以前は外部から借りていたが、FLUX 3は別のやり方に切り替えた。
なぜこのステップがマルチモーダルの前提条件になるのか。外付け方式は画像の枠から出られない。動画において最も強力な外部参照は、依然として画像モデルであるDINOv2で、動画専用のV-JEPA 2よりも優れている。音声においてはMERTを外付けしても、何も外付けしない場合と比べて利益がない。規模についても同じ傾向だ。パラメータ数を2.9億から10億に引き上げると、Self-Flowは増加した計算資源を活かせるが、REPAは収益逓減が始まる。
FLUX-mimicはBlack Forest Labsとスイス企業mimic roboticsが共同で開発した動画-動作モデルで、FLUX 3のバックボーン上で動作し、すでにアウディでテスト・実装されている。ゼロから作り直したわけではない。バックボーンを完全に凍結したまま、そこから取り出した中間特徴の上に軽量な動作デコーダーを学習させるだけで、従来の視覚-言語-動作モデル(映像と指示を一緒に入力し、動作を直接出力するタイプのロボットモデル)を上回る成績を出す。しかも従来モデルは、この凍結という設定ではそもそも成立しない。浮いたのはデータだ。
誰にも教わっていない挙動もある。掴み損ねると、自ら修正し、もう一度掴み直し、タスクをやり遂げる。デモデータがタスクの失敗パターンをすべて網羅することはあり得ない。この立て直しの動作は、世界の仕組みをすでに知っているモデルからしか生まれ得ない。
Black Forest Labsは自ら1対1比較の人間による選好テストを実施した。10秒・720p・音声付きのテキストから動画生成で、どちらが好きかを人に選んでもらい、50%は優劣がつかないことを意味する。最も大差で勝ったLuma Ray 3.2(93%)とRunway Gen-4.5(77%)は、リストの中で最も手ごたえの弱い相手だ。本当に情報量があるのは、引き分けになった二つの方である。
| モデル | 人手評価:FLUX 3をより好んだ人の割合 | 今すぐ使えるか | 10秒720p価格 |
|---|---|---|---|
| FLUX 3 Video | 、 | 先行アクセス、誰でも申請可能、Black Forest Labsの審査が必要 | 未公表 |
| Gemini Omni Flash | 52%、優劣つかず | Gemini APIですでに広く利用可能(プレビュー版) | $1.00(1秒$0.10) |
| Seedance 2.0 | 52%、優劣つかず | バイトダンスは5社の映像会社からの著作権侵害の法的警告により国際展開を無期限延期、現在も解除されず | 欧米企業の多くは購入不可 |
Gemini Omni Flashは大手プラットフォームの中でFLUX 3が目指すものに最も近く、同じく「モデルは物理を理解している」と語っている存在でもある。Black Forest Labs自身の測定によれば両者は優劣がつかないが、差は別のところにある。一方はカードを切ればすぐ使え価格も明示されているが、もう一方はまだ審査待ちだ。
FLUX 3を発表
ロボットまで動かす?
もう一方でアウディの生産ラインでシール材やケーブルを掴んでいる。
なぜネジを締められる?
時間が欠落する
今度は音声が欠落する
- × 画像は時間を欠く
- × 動画は音声を欠く
- × 音声は空間を欠く
- × 動作は画面外の全てを欠く
誰も辻褄を合わせられない
ここを越えれば音声はほぼついでに習得できる
自分で自分を教えさせる。
ノイズは少なめ
ブロックごとにぼやけ方が違う
理解を育てる。
以前は30時間以上かかった
ロボットを動かせる?
優劣がつかない
要申請、審査待ち
価格:未定
今すぐ呼び出せる
1秒$0.10
凍結したままロボットを動かせる。