ブラックフォレスト・ラボが20秒の動画生成を可能にするFLUX 3 AIを発表

Key Takeaways
  • Black Forest Labs は木曜日に FLUX 3 をリリースし、初めて静止画ではなく動画を生成しました。
  • FLUX 3 は、同期した音声付きの 20 秒の動画クリップを生成し、77% の評価で Runway Gen-4.5 を上回りました。
  • Audi は、生産ラインで柔軟なドアシールを取り付ける用途で、FLUX 3 のエンジンで構築された FLUX-mimic をテストしています。

Black Forest Labsは木曜日にFLUX 3をリリースし、同社のフラッグシップモデルが静止画像ではなく動画を生成するのは初めてだと示した。ドイツのAIラボである同社は、FLUXシリーズの画像生成器で知られており、新システムは共有された1つのシステム内で画像・動画・音声を同時に学習させて構築した。このマルチモーダルな手法により、FLUX 3は、映像内のアクションに同期し、音声が画像とともに生成されることで、最大20秒のクリップを作り出せる。これには、セリフ、効果音、環境音などが含まれる。今回のリリースは、純粋な画像生成から動画機能への戦略的な転換を意味し、モデルはさらにFLUX-mimicも駆動する。FLUX-mimicはロボティクスのアプリケーションで、Audiがすでに量産ラインで、たとえば柔軟なドア用シールの取り付けといった作業のためにテストしている。

FLUX 3は同期した音声付きで最大20秒の動画クリップを提供

FLUX 3は、最大20秒の動画クリップを生成できる。音声は画面とともに生成され、画面上で起きていることに同期される。初期評価では、人間のレビュー担当者は、FLUX 3の出力をRunway Gen-4.5よりも77%の一対比較で好み、Luma Ray 3.2よりも93%の一対比較で好んだ。モデルはGemini OmniとSeedanceに対しても、評価の52%で上回った。これらの嗜好テストでは、評価者が2つのクリップを見比べ、見た目と聞こえ方がより説得力のある方を選ぶ。Black Forest Labsは、FLUX 3がどれだけ勝ったかの回数を計上している。

また、このモデルは、画像生成における系譜に続いて、静止画像を作る能力も示している。Black Forest Labsは、FLUX 3がフォトリアリスティックな見た目だけでなく、幅広いスタイルを生成できる多用途性を示す画像を共有した。共同創業者兼CEOのRobin Rombachは、「画像だけを学ぶモデルは、画像しか生成できない」と述べた。同社の見解では、動画を予測することを学ぶというのは、その下にある物理——重さ、接触、タイミング——を学ぶことも意味し、それこそ機械が物理世界を移動するために必要なものだ。

Audiは量産ラインでFLUX-mimicのロボティクスシステムをテスト

Zurich拠点のmimicロボティクスで作られたFLUX-mimicは、FLUX 3の動画予測エンジンに軽量なデコーダを追加する。デコーダは、モデル内部で物事の動きに関する感覚を、実際のロボットの動作へと翻訳する小型の追加コンポーネントだ。Audiは、柔軟なドア用シールの取り付けといった、従来の自動化が扱うのに苦労してきた作業でこれをテストしている。mimicの共同創業者であるStephan-Daniel Gravertは、「Audiは、私たちがFLUX-mimicのために作り上げた製造パートナーの代表例です」と述べた。AudiのChristoph Schneiderは、ロボットは今や「古い機械では手の届かなかった複雑なソフトボディの取り扱い作業を解決できる」と説明した。Black Forest Labsは、完全なシステムは約101ミリ秒で反応すると報告しており、人間の視覚的な反射の範囲に近いという。

Black Forest LabsはStable Diffusionの起源を経てFLUX 3を構築

Black Forest Labsは2024年8月に、Stable Diffusionの元モデルをStability AIで作るのを手伝った長期優良コピートレーダーの研究者たちによって設立された。同社は、MidJourneyを上回り、StabilityのStable Diffusion 3を凌駕するFluxモデルをリリースした。オープンソースのFlux DevおよびSchnellモデルは、AIアーティストがStable Diffusion 3.5に奪還されることを期待していた「最優秀のオープンソース画像生成器」の称号を獲得した。FLUX 1.1 Proは10月にArtificial Analysisの画像アリーナでトップになったが、そのバージョンはオープンソースではなかった。

Black Forest Labsは2025年11月にFLUX.2をリリースしたが、あまり人気が出なかった。元のFluxが保持していたオープンソースの王冠は、2025年後半にAlibabaのZ-Image Turboがそれを奪うまで続き、下位のエンドユーザー向けのGPUでも同等の品質を実現した。当時CivitAIのユーザー1人は、「これはSD3があるべき姿だった」と書き込んでいた。

2026年後半に向けて予定された開発版

動画とActionは現在、APIと一部のパートナー経由で早期アクセスが提供されており、その中にmimicロボティクスも含まれる。画像生成については「今後数週間」で行われると、Black Forest Labsは述べている。オープンウェイトのDev版は、Black Forest Labsがローカル利用向けにリリースする予定だという唯一のティアだが、提供予定は2026年後半まで待つ必要がある。

よくある質問

FLUX 3はどんな動画機能を提供していますか? FLUX 3は、最大20秒の動画クリップを生成できる。音声は画面とともに生成され、画面上で起きていることに同期される。これには、セリフ、効果音、環境音などが含まれる。初期評価では、人間のレビュー担当者は、FLUX 3の出力をRunway Gen-4.5よりも比較の77%で好み、Luma Ray 3.2よりも比較の93%で好んだ。

Audiは量産ラインでFLUX-mimicをどのように使っていますか? Audiは、柔軟なドア用シールの取り付けといった、従来の自動化が扱うのに苦労してきた作業でFLUX-mimicをテストしている。mimicロボティクスで作られたこのシステムは、FLUX 3の動画予測エンジンを実際のロボットの動作へと変換し、反応時間は約101ミリ秒だという。AudiのChristoph Schneiderは、ロボットは今や古い機械では手の届かなかった複雑なソフトボディの取り扱い作業を解決できると述べた。

FLUX 3のオープンウェイトDev版はいつ利用可能になりますか? オープンウェイトのDev版は、Black Forest Labsがローカル利用向けにリリースする予定だという唯一のティアで、提供予定は2026年後半まで待つ必要がある。動画とActionは現在、APIと一部のパートナー経由で早期アクセスが提供されており、画像生成は今後数週間で行われる。

免責事項:本ページの情報には第三者提供の内容が含まれる場合があり、参考目的のみで提供されています。これらはGateの見解や意見を示すものではなく、金融、投資、または法律上の助言を構成するものでもありません。暗号資産取引には高いリスクが伴います。意思決定を行う際には、本ページの情報のみに依存しないでください。詳細については、免責事項をご確認ください。
コメント
0/400
コメントなし