Black Forest Labs首款影片模型:可產生帶同步音訊的20秒片段、最多10個固定關鍵影格,以及從真人實拍到定格動畫的多種風格。在下方輸入提示詞並試試看。
開發者
Black Forest Labs
類型
多模態(影片現已支援,圖片即將支援)
音訊
原生、已同步、相同密碼
時長
每次最多20秒
關鍵影格
最多10個釘選+第一個/最後一個
開啟權重
計劃開發,2026年末
此處為層級
付費點數 + 草稿模式
我們的一行結論: 故事板之選。當你確切知道鏡頭必須呈現哪些影格——或者想要一種不是「電影感AI影片」的效果——從這裡開始。
FLUX 3 來自Freiburg實驗室,其創辦人打造了Stable Diffusion背後的架構,而這是他們第一個會動的模型: 一個在影像、影片、音訊和動作上共同訓練的網路,並率先推出影片。它在這個擁擠的月份脫穎而出有兩點 — 你可以固定最多十個精確影格,讓模型在它們之間生成動畫,而且輸出不會被鎖定在光鮮的「AI電影感」外觀上。原始、懷舊、手作感、怪異: 範圍本身就是重點。
來自我們測試算圖的早期印象,加上BFL發布的資料——其自身的注意事項也完整轉述。隨著獨立數據出爐,我們會進行修訂。
• 關鍵影格控制。
最多固定10個精確影格以及首尾影格,模型會在它們之間生成動作、鏡頭、對白和音訊。以分鏡腳本作為輸入格式——我們託管的其他任何工具都不支援這麼多錨點。
• 美學範圍。
停格動畫、微距、縮時攝影、懷舊家庭錄影、刻意怪異—它擺脫了大多數影片模型預設的統一電影質感。如果你的品牌外觀不是"電影預告片",這一點很重要。
• 同一輪中的音訊。
最長20秒,配有同步音軌—包含對白—並提供感知接縫的延展功能,在延長片段時可將動作、鏡頭和音訊延續到拼接處之後。
• 草稿模式經濟性。
每個端點都有一個快速草稿變體,用於低成本預覽。先在草稿上反覆調整,只在最終版上花費一次真實額度 — 這正是整個網站所倡導的工作流程,並已內建到模型系列中。
• 圖片部分還不在這裡。
FLUX這個名稱因圖片而聞名,但FLUX 3的圖片生成仍在逐步推出。如果你是來製作圖片的,還要等幾週—在耗光點數才發現之前,請先查看FAQ。
• 基準測試是門牌號碼。
發布圖表被標示為對早期候選項的初步評估,而最亮眼的勝率來自對上那些並未引領當前步調的模型。BFL後來的說法更有力,但仍屬內部說法。
• 20秒,不是30秒。
Wan 3.0和Seedance 2.5都能一次達到30。FLUX 3會以尊重接縫的延展來回應—但如果需求是單段不間斷的半分鐘,它就不是合適之選。
• Dev權重:已規劃,未定日期。
開放權重版本已宣布將於2026年晚些時候發布,但沒有日期或授權條款。BFL的開源紀錄確實很好,但計畫終究只是計畫。
一個用於外觀,一個用於關鍵影格,一個用於接縫。複製,交換括號,算圖——先用草稿模式。
"一個手工定格動畫場景:黏土[astronaut]在由麵粉做成的廚房桌面月球上插上一面小紙旗。黏土上可見指紋,略顯生硬的12fps動作,柔和的窗光,氈布腳步聲,以及一句用尖細嗓音說出的含糊台詞。"
點明那些不完美之處——指紋、卡頓的幀率——正是讓FLUX 3擺脫預設光澤感的關鍵。大多數模型會抗拒「手工感」;而這個模型把它當作一種風格目標。
上傳: 4個關鍵影格(產品盒裝→拆盒→手持→標誌卡片)
"一段20秒的開箱影片,按順序呈現這四個畫面,間隔約5秒。自然的手持拍攝感,撕紙和膠帶聲,第三個畫面時畫面外的聲音流露出安靜的喜悅。"
畫面幀承載構圖,因此提示詞只需指示時機、動作和聲音。間距提示(「大約間隔5秒」)可防止模型匆忙推進節拍。這正是以分鏡優先的團隊一直在等待的工作流程。
開始於: 你已經生成的剪輯
"延長10秒:[dancer]完成片尾的轉身,鏡頭以相同速度繼續向左移動,音樂無縫繼續—不剪接,不重置。"
延伸功能會讀取最後幾幀的動作和音訊,因此指令應描述延續,而不是新場景。"完成片段結束時的轉向"為它提供了可延續的物理線索;註明相機速度可以保護銜接處的漂移。
三款音訊原生模型,三種控制理念。三者使用相同提示詞,並依我們會發布的標準評判—較新的兩款暫為初步評判。請自行比較 從一個提示框。
7月23日發布:用於圖片、影片、音訊和動作的統一架構。影片率先推出(20 s、原生音訊、關鍵影格);圖片生成將在接下來幾週內逐步推出;開放權重Dev版本計劃於今年稍晚發布。本頁面上的版本。
成就這個名字的圖像時代:FLUX.1 dev成為全球下載量與微調次數最多的開放擴散版本之一,是無數社群工作流程的支柱。
創始團隊構建了Stable Diffusion背後的潛在擴散架構。這段歷史帶來的開源可信度,正是"FLUX 3 Dev"作為一種承諾比大多數開放權重承諾更有分量的原因。
Black Forest Labs首個多模態基礎模型,於2026年7月23日發表——由弗萊堡團隊打造的單一架構,聯合訓練於影像、影片、音訊和動作預測;該團隊的創辦人曾打造Stable Diffusion背後的架構。你今天可以用來生成的部分是影片:可在同一次處理中,從文字、起始影像、固定的關鍵影格或你想要延長的現有片段,生成最長20秒且帶同步配樂的影片。
寫實派。當片段必須像真實影像一樣可信,且帶有音訊時。
長鏡頭。根據你的配樂剪輯的30秒鏡頭。
文件閱讀器。匯入簡報、PDF和試算表,匯出影片。