Black Forest Labs初の動画モデル:同期音声付きの20秒クリップ、最大10個の固定キーフレーム、実写からストップモーションまで幅広いルックに対応。下にプロンプトを入力して試してみましょう。
開発者
Black Forest Labs
タイプ
マルチモーダル(動画は今すぐ、画像は近日対応)
オーディオ
ネイティブ、同期済み、同じパスワード
期間
1パスあたり最大20秒
キーフレーム
最大10件のピン留め+最初/最後
重みを開く
開発予定、2026年後半
ここにティア
有料クレジット + 下書きモード
私たちの一行評価: ストーリーボード向けの選択肢。ショットで必ず押さえるべきフレームが正確にわかっているとき、または「シネマティックAI動画」ではない見た目にしたいときは、ここから始めてください。
FLUX 3 Freiburgラボ発で、その創設者たちはStable Diffusionの背後にあるアーキテクチャを構築しました。そしてこれは彼らにとって初めて動くモデルです: 画像、動画、音声、アクションで共同学習された1つのネットワークで、まず動画から提供されます。混み合ったこの月に際立つ点が2つあります — 最大10枚の正確なフレームを固定し、その間をモデルにアニメーションさせられること、そして出力が光沢のある「AIシネマ風」の見た目に固定されないことです。生々しい、懐かしい、手作り感のある、奇妙な: その幅こそが要点です。
テストレンダリングからの初期印象とBFLが公開した資料——BFL自身の注意事項もそのまま伝えています。独立した数値が出次第、改訂します。
• キーフレーム制御。
最大10個の正確なフレームに加えて最初と最後をピン留めすると、モデルがその間のモーション、カメラ、会話、音声を生成します。入力形式としてのストーリーボード—当社がホストしている他のサービスでは、これほど多くのアンカーを受け付けません。
• 美的範囲。
ストップモーション、マクロ、タイムラプス、懐かしいホームビデオ、意図的に奇妙—ほとんどの動画モデルがデフォルトで陥る均一な映画的な光沢から抜け出します。あなたのブランドルックが"映画予告編"ではないなら、これは重要です。
• 同じパスの音声。
同期されたサウンドトラックで最長20秒—セリフを含む—さらにクリップを延長するときに動き、カメラ、音声をつなぎ目の先まで引き継ぐ、つなぎ目を考慮した延長機能。
• ドラフトモードの経済性。
すべてのエンドポイントには、低コストのプレビュー用の高速ドラフト版があります。ドラフトで反復し、最終版で実際のクレジットを一度だけ使う — このサイト全体が提唱するワークフローが、モデルファミリーに組み込まれています。
• 画像部分はまだここにありません。
FLUXという名前は画像で有名ですが、FLUX 3の画像生成はまだ段階的に展開中です。画像を作りに来たなら、使えるようになるまであと数週間かかります—クレジットを消費して気づく前にFAQを確認してください。
• ベンチマークは番地です。
ローンチ時のチャートは初期候補の予備評価と位置づけられており、最も派手な勝率は、現在のペースを作っているわけではないモデルに対するものだった。BFLのその後の主張はより強いが、依然として内部のものだ。
• 20秒、30秒ではありません。
Wan 3.0とSeedance 2.5はいずれも1回のパスで30に到達します。FLUX 3は継ぎ目を尊重した延長で応えます—ただし、単一の途切れない半分間が要件なら、それは選択肢ではありません。
• Devの重み:計画済み、日付未定。
オープンウェイト版のリリースは2026年後半に予定されていると発表されていますが、日付やライセンス条件はありません。BFLのオープンソース実績は本当に優れていますが、計画はあくまで計画です。
見た目用に1つ、キーフレーム用に1つ、継ぎ目用に1つ。コピーして、括弧を入れ替え、レンダリング — まずはドラフトモードで。
"手作りのストップモーションシーン:粘土の[astronaut]が、小麦粉でできたキッチンテーブルの月に小さな紙の旗を立てる。粘土に見える指紋、少しぎこちない12fpsの動き、柔らかな窓明かり、フェルトの足音、そしてキーキーした声のくぐもった台詞。"
不完全さ—指紋、ぎこちないフレームレート—を名指しすることが、FLUX 3をデフォルトの光沢感から遠ざけます。ほとんどのモデルは「手作り」に抵抗しますが、これはそれをスタイルの目標として扱います。
アップロード: 4つのキーフレーム(箱入りの商品→開封済み→手に持った状態→ロゴカード)
"20秒の開封動画で、この4つのフレームを順番に、約5秒間隔で捉える。自然な手持ち感、紙を破る音とテープの音、3つ目のフレームで画面外の声が静かに喜ぶ。"
フレームが構図を担うため、プロンプトはタイミング、動き、音だけを指示すれば十分です。間隔のヒント(「およそ5秒間隔」)により、モデルがビートを急ぎすぎるのを防ぎます。これは、ストーリーボードファーストのチームが待ち望んでいたワークフローです。
開始位置: すでに生成したクリップ
"10秒延長:[dancer]がクリップの終わりのターンを完了し、カメラは同じ速度で左へ流れ続け、音楽は途切れずに続く—カットなし、リセットなし。"
拡張は最後のフレームの動きと音声を読み取るため、指示は新しいシーンではなく継続を説明するべきです。"クリップが終わるときのターンを完了させる"ことで、引き継ぐべき物理的な糸口を与えます;カメラ速度を明記すると、継ぎ目をまたぐドリフトが保たれます。
3つの音声ネイティブモデル、3つの制御思想。同じプロンプトを3つすべてで使い、私たちが出荷できる基準で評価しました—新しい2つについては暫定的に。ご自身で比較してください 1つのプロンプトボックスから。
7月23日発表:画像、動画、音声、アクションのための1つのアーキテクチャ。動画が最初に提供されました(20 s、ネイティブ音声、キーフレーム);画像生成は今後数週間で順次展開;オープンウェイトのDevリリースは年内後半に予定されています。このページのバージョン。
その名を知らしめた画像の時代:FLUX.1 devは、あらゆる場所で最も多くダウンロードされ、ファインチューニングされたオープンな拡散リリースの1つとなり、数え切れないほどのコミュニティワークフローの基盤となりました。
創設チームはStable Diffusionの背後にある潜在拡散アーキテクチャを構築しました。その歴史がもたらすオープンソースの信頼性こそ、"FLUX 3 Dev"が約束として、ほとんどのオープンウェイトの誓約よりも重みを持つ理由です。
Black Forest Labs初のマルチモーダル基盤モデル。2026年7月23日に発表されました—Stable Diffusionの基盤となるアーキテクチャを構築した創業者たちを擁するフライブルクのチームによる、画像、動画、音声、アクション予測を共同学習した単一のアーキテクチャです。今日生成に使える部分は動画です。テキスト、開始画像、固定されたキーフレーム、または延長したい既存クリップから、同じパスで同期サウンドトラック付きの最大20秒の動画を生成できます。
リアリスト。クリップが音声付きの実際の映像として通用する必要があるとき。
長回し。サウンドトラックに合わせてカットされた30秒のショット。
ドキュメントリーダー。スライド資料、PDF、スプレッドシートを入力して、動画を出力。