Google最新的日常影像模型,在推出當週接入:更好的基於遮罩的編輯和主體一致性、4K輸出,以及約為其所取代模型一半的價格。
開發者
Google DeepMind
已發布
2026年10月6日
基礎
Gemini 3.6 Flash
API ID
gemini-nano-banana-2.1
輸出
最高4K · 比例最高8:1
參考
最多14張圖片
思考中
最低 · 中等 · 高
我們的一句話結論: 新的預設選擇。更好的編輯、更寬的畫幅,以及價格約為上一款一半的4K——也是Google自身推薦用來替代Nano Banana 2的模型。
Nano Banana 2.1於10月6日推出,作為Google自2月以來預設模型的直接升級版,而其亮點相當不尋常:它更出色,成本卻約只有一半。Google表示,在視覺設計、基於遮罩的編輯、主體一致性以及全景構圖方面都有提升,並提供可設定的思考層級,可用延遲時間換取品質,以及可在繪製前對照Google Search和Image Search進行事實查核的接地能力。有一項時程比規格更重要:Google將於10月29日關閉前一代模型的API,並指定此模型作為替代方案,因此對任何仍使用舊ID的人來說,這並不是可選的升級。它才推出幾天,因此以下所有內容都應視為首週報導。
根據我們自己的算圖和公開記錄作出判斷,並隨事實變化而修訂——這是本頁面的特性,而不是免責聲明。
• 價格大約減半。
Google的開發者定價將1K圖像定在約$0.034,低於此前約$0.067,4K約為$0.076,低於$0.151,批次作業還有進一步折扣。這是少見的一代,便宜的選項同時也是更好的選項。
• 基於遮罩的編輯。
定義一個區域,並只變更其中的內容。Google將此稱為相較於上一版本的最大飛躍之一,而這項功能讓對話式編輯變得可預測,而不是只能寄望於結果。
• 寬幅和全景畫面。
最高支援8:1長寬比,而上一代模型對此處理不佳。橫幅、網站頁首和全景場景不再需要「裁切後祈禱」的工作流程。
• 十四個參考,錶盤上的思考。
最多14張參考圖片,提供最小、中等和高三種思考級別,讓你可以在重要之處投入延遲時間,在不需要時略過。
• 實際使用中,Pro看起來仍然更好。
Google將2.1定位為Nano Banana Pro的高效對應版本,而不是它的替代品—而發表時的並排評測指出,Pro的色彩和比例仍然顯得更自然。基準測試和肉眼判斷在這裡並不一致;相信你的眼睛。
• 基準測試數據是Google自己的。
回報的偏好分數——啟用思考為1,050,相比Nano Banana 2的990和Pro的935——來自Google自己的評估。獨立測試尚未完成,完成後我們將修訂此頁面。
• 天前。
10月6日發布。這裡的一切均可追溯至Google的模型卡、發布報導和我們的首批渲染圖。請將最高級表述視為暫定。
• SynthID始終開啟。
與整個Google系列一樣,每個輸出都帶有不可見的來源浮水印。
複製到上方的生成器中,替換括號,然後渲染。

"黃金時刻的8:1全景[廚房]場景:掛桿上的銅鍋、從鍋中升起的蒸汽、窗台上的香草、斜照過檯面的暖光。"
極端長寬比是最清晰可見的升級—請直接要求你實際需要的形狀,而不是生成16:9再裁切。生成器旁邊的示範就是這個提示詞。

產生或上傳,然後遮罩窗戶 → "將外面的景色改為冬天 — 光禿的樹木,灰色的光線。保持房間內的一切完全相同: 平底鍋、蒸氣、香草、檯面上的光線。"
遮罩承載位置,因此提示詞只承載內容,而指明要保留的內容會保護其餘部分。這就是2.1更新圍繞其建構的工作流程。

思考:最小下草稿 → 思考:高重新渲染保留項。
思考旋鈕是成本控制工具,不是應該一直開到最大的品質開關。先以低成本快速探索,然後只在你要保留的渲染上花一次延遲成本。
對標Google自家頂級模型和OpenAI目前模型的新預設選項。三者使用相同提示詞,並按我們會發布的標準評判——對新來者暫定如此。上方生成器中三者皆可選擇。
(gemini-nano-banana-2.1)—基於Gemini 3.6 Flash建構:基於遮罩的編輯、主體一致性、8:1全景圖、4K、可設定思考、Search grounding,價格約為先前的一半。上方生成器中的版本。
(Gemini 3.1 Flash Image) — Google自2月以來的預設版本,其API計劃於2026年10月29日關閉,並指定2.1作為替代版本。其頁面保留用於版本關鍵字流量。
(Gemini 3 Pro Image) — 仍然是最艱鉅專業工作的頂級選擇,而模型2.1的定位是高效對應版本,而非替代品。
Google最新的圖像生成與編輯模型,於2026年10月6日以API ID gemini-nano-banana-2.1發布,並基於Gemini 3.6 Flash打造。Google表示,其在視覺設計、基於遮罩的編輯、主體一致性和寬幅構圖方面都有所改進,支援最多14張參考圖像、4K輸出、最高8:1的長寬比、Search grounding以及三種思考層級。