FLUX 3 AI影片生成器

Black Forest Labs首款影片模型:可產生帶同步音訊的20秒片段、最多10個固定關鍵影格,以及從真人實拍到定格動畫的多種風格。在下方輸入提示詞並試試看。

模型
上傳圖片
點擊或將JPG、JPEG、PNG或WEBP圖片拖放到此處,最大 10 MB
提示詞
0/5000
輸出長寬比
Auto
解析度
Auto
時長(秒)
Auto
影片範例
 

開發者

Black Forest Labs

類型

多模態(影片現已支援,圖片即將支援)

音訊

原生、已同步、相同密碼

時長

每次最多20秒

關鍵影格

最多10個釘選+第一個/最後一個

開啟權重

計劃開發,2026年末

此處為層級

付費點數 + 草稿模式

我們的一行結論: 故事板之選。當你確切知道鏡頭必須呈現哪些影格——或者想要一種不是「電影感AI影片」的效果——從這裡開始。

FLUX 3 來自Freiburg實驗室,其創辦人打造了Stable Diffusion背後的架構,而這是他們第一個會動的模型: 一個在影像、影片、音訊和動作上共同訓練的網路,並率先推出影片。它在這個擁擠的月份脫穎而出有兩點 — 你可以固定最多十個精確影格,讓模型在它們之間生成動畫,而且輸出不會被鎖定在光鮮的「AI電影感」外觀上。原始、懷舊、手作感、怪異: 範圍本身就是重點。

坦誠解讀

FLUX 3的優勢所在 — 以及不足之處

來自我們測試算圖的早期印象,加上BFL發布的資料——其自身的注意事項也完整轉述。隨著獨立數據出爐,我們會進行修訂。

真正強大

  • • 關鍵影格控制。

    最多固定10個精確影格以及首尾影格,模型會在它們之間生成動作、鏡頭、對白和音訊。以分鏡腳本作為輸入格式——我們託管的其他任何工具都不支援這麼多錨點。

  • • 美學範圍。

    停格動畫、微距、縮時攝影、懷舊家庭錄影、刻意怪異—它擺脫了大多數影片模型預設的統一電影質感。如果你的品牌外觀不是"電影預告片",這一點很重要。

  • • 同一輪中的音訊。

    最長20秒,配有同步音軌—包含對白—並提供感知接縫的延展功能,在延長片段時可將動作、鏡頭和音訊延續到拼接處之後。

  • • 草稿模式經濟性。

    每個端點都有一個快速草稿變體,用於低成本預覽。先在草稿上反覆調整,只在最終版上花費一次真實額度 — 這正是整個網站所倡導的工作流程,並已內建到模型系列中。

已知限制

  • • 圖片部分還不在這裡。

    FLUX這個名稱因圖片而聞名,但FLUX 3的圖片生成仍在逐步推出。如果你是來製作圖片的,還要等幾週—在耗光點數才發現之前,請先查看FAQ。

  • • 基準測試是門牌號碼。

    發布圖表被標示為對早期候選項的初步評估,而最亮眼的勝率來自對上那些並未引領當前步調的模型。BFL後來的說法更有力,但仍屬內部說法。

  • • 20秒,不是30秒。

    Wan 3.0和Seedance 2.5都能一次達到30。FLUX 3會以尊重接縫的延展來回應—但如果需求是單段不間斷的半分鐘,它就不是合適之選。

  • • Dev權重:已規劃,未定日期。

    開放權重版本已宣布將於2026年晚些時候發布,但沒有日期或授權條款。BFL的開源紀錄確實很好,但計畫終究只是計畫。

提示詞配方

三個提示詞, 顯示它的用途

一個用於外觀,一個用於關鍵影格,一個用於接縫。複製,交換括號,算圖——先用草稿模式。

反電影感 — 展示的風格範圍

"一個手工定格動畫場景:黏土[astronaut]在由麵粉做成的廚房桌面月球上插上一面小紙旗。黏土上可見指紋,略顯生硬的12fps動作,柔和的窗光,氈布腳步聲,以及一句用尖細嗓音說出的含糊台詞。"

為什麼有效

點明那些不完美之處——指紋、卡頓的幀率——正是讓FLUX 3擺脫預設光澤感的關鍵。大多數模型會抗拒「手工感」;而這個模型把它當作一種風格目標。

故事板鎖定 — 將關鍵影格作為腳本

上傳: 4個關鍵影格(產品盒裝→拆盒→手持→標誌卡片)

"一段20秒的開箱影片,按順序呈現這四個畫面,間隔約5秒。自然的手持拍攝感,撕紙和膠帶聲,第三個畫面時畫面外的聲音流露出安靜的喜悅。"

為什麼有效

畫面幀承載構圖,因此提示詞只需指示時機、動作和聲音。間距提示(「大約間隔5秒」)可防止模型匆忙推進節拍。這正是以分鏡優先的團隊一直在等待的工作流程。

無縫擴展

開始於: 你已經生成的剪輯

"延長10秒:[dancer]完成片尾的轉身,鏡頭以相同速度繼續向左移動,音樂無縫繼續—不剪接,不重置。"

為什麼有效

延伸功能會讀取最後幾幀的動作和音訊,因此指令應描述延續,而不是新場景。"完成片段結束時的轉向"為它提供了可延續的物理線索;註明相機速度可以保護銜接處的漂移。

正面對決

FLUX 3與Veo與Seedance 2.5比較

三款音訊原生模型,三種控制理念。三者使用相同提示詞,並依我們會發布的標準評判—較新的兩款暫為初步評判。請自行比較 從一個提示框。

JobFLUX 3VeoSeedance 2.5
關鍵影格 / 結構控制 10個釘選+第一個/最後一個 僅提示詞 第一/最後一幀
非電影風格 最佳 — 從定格動畫到奇異風格 一般
逼真影像 良好 (早) 最佳 良好 (早)
最大剪輯長度 20秒 + 接縫感知擴展 8秒 30 s原生
來自軌道的音訊驅動節奏
低成本迭代 內建草稿變體 沒有草稿層級 透過快速同級項目起草
開放權重路線圖 已規劃開發,記錄優秀
久經驗證的成功紀錄 週齡 已建立 週大
版本歷史

從圖像實驗室到多模態

2026年7月 · 至今

FLUX 3

7月23日發布:用於圖片、影片、音訊和動作的統一架構。影片率先推出(20 s、原生音訊、關鍵影格);圖片生成將在接下來幾週內逐步推出;開放權重Dev版本計劃於今年稍晚發布。本頁面上的版本。

較早

FLUX.2和FLUX.1系列

成就這個名字的圖像時代:FLUX.1 dev成為全球下載量與微調次數最多的開放擴散版本之一,是無數社群工作流程的支柱。

來源

FLUX之前

創始團隊構建了Stable Diffusion背後的潛在擴散架構。這段歷史帶來的開源可信度,正是"FLUX 3 Dev"作為一種承諾比大多數開放權重承諾更有分量的原因。

常見問題

FLUX 3個問題,直接解答

1. FLUX 3是什麼?

Black Forest Labs首個多模態基礎模型,於2026年7月23日發表——由弗萊堡團隊打造的單一架構,聯合訓練於影像、影片、音訊和動作預測;該團隊的創辦人曾打造Stable Diffusion背後的架構。你今天可以用來生成的部分是影片:可在同一次處理中,從文字、起始影像、固定的關鍵影格或你想要延長的現有片段,生成最長20秒且帶同步配樂的影片。

其他模型

不是合適的工具? 試試它的相鄰項

Veo

寫實派。當片段必須像真實影像一樣可信,且帶有音訊時。

Seedance 2.5

長鏡頭。根據你的配樂剪輯的30秒鏡頭。

Wan 3.0

文件閱讀器。匯入簡報、PDF和試算表,匯出影片。