Ang pangunahing modelo ng OpenAI para sa larawan: nag-iisip ito bago gumuhit — pinaplano ang layout at sinusuri ang nilalaman — at nagre-render ng tekstong puwede mong ipadala para i-print. Mag-type ng prompt sa ibaba at subukan ito.
Developer
OpenAI
Ipinapadala bilang
Mga Larawan ng ChatGPT 2.0 / gpt-image-2
Lagda
Native na mode ng pag-iisip
Teksto sa larawan
Handa para sa pag-print · maraming wika
Mga batch
8 larawan, consistent
Max na output
2K
Antas dito
Bayad na credits
Ang aming hatol sa isang linya: ang pili para sa layout. Kapag ang larawan ay talagang isang dokumento — isang menu, poster, UI mockup, o anumang bagay kung saan kailangang manatiling maayos ang mga salita at istruktura kahit masusing suriin — pinaplano muna ito ng modelong ito bago ito iguhit.
Dumating ang GPT Image 2 noong Abril at nakuha ang #1 na puwesto sa bawat kategorya ng Image Arena sa loob ng labindalawang oras — nang may lamang na 242 puntos, ang pinakamalaking agwat na naitala kailanman ng leaderboard. Ang arkitektural na dahilan ang kawili-wiling bahagi: ito ang unang image model ng OpenAI na may native reasoning, pinaplano ang layout at sinusuri ang content bago mag-render, kaya ang pambihirang kakayahan nito ay ang dating imposibleng gawin — isang menu ng restaurant kung saan tama ang baybay ng bawat putahe at nakaayon ang bawat presyo. Isang napapanahong tala: ireretiro ng OpenAI ang lumang DALL·E sa Agosto 30, at ito ang modelong pumalit dito.
Hinuhusgahan batay sa sarili naming mga render at sa inilathalang tala, nire-rebisa habang nagbabago ang mga katotohanan — iyon ay isang tampok ng pahinang ito, hindi isang pagtanggi sa pananagutan.
• Nag-iisip bago gumuhit.
Ang native na pangangatwiran ay nagpaplano ng komposisyon at nagbe-verify ng content bago ang rendering — mas madalas na nagtatagumpay sa unang subok ang mga kumplikadong layout, mga eksenang may maraming elemento, at mga stack ng instruksyon.
• Tekstong handa nang i-print.
Mga menu, poster, packaging, mga UI mockup — multilingual, wasto ang baybay, maayos ang pagkaka-format. Ang failure mode na nagtakda sa AI images sa loob ng maraming taon, itinuturing bilang nalutas na bahagi.
• Mga consistent na batch ng 8 larawan.
Isang request, walong variation na nagpapanatili ng karakter at estilo — ang iteration at A/B workflow ay nakapaloob sa model, hindi basta idinagdag lang.
• Ang lane ng larawan ng dokumento.
Anumang sa totoo lang ay dokumento pala — mga sertipiko, label, slide, kunwaring ad — ay kung saan kitang-kitang nahihigitan ng layer ng pangangatwiran ang mga karibal na umaasa sa pagtutugma ng pattern.
• Ang pag-iisip ay nangangailangan ng oras.
Nagdaragdag ng tunay na latency ang pangangatwiran kumpara sa mga karibal na klaseng flash. Para sa mabilis na pagbuo ng ideya, gumawa ng draft sa ibang lugar at dalhin dito ang pinal na layout.
• Limitasyong 2K.
Ang mga 4K na workflow at workflow sa pag-print na higit sa 2K ng Nano Banana ay nangangailangan ng upscaling o ibang modelo. Para sa karamihan ng mga screen, hindi mahalaga; para sa malaking format, mapagpasiya.
• Isang korona ng Abril sa isang pamilihan ng Agosto.
Sinukat ang +242 na lamang bago dumating ang Seedream 5.0 Pro at ang summer wave. Elite pa rin — pero ituring ang 'pinakamalaking lamang kailanman' bilang kasaysayan, hindi bilang kasalukuyang standings.
• Walang web grounding.
Nangangatuwiran ito mula sa kaalaman, hindi sa real-time na paghahanap — maaaring bumalik na luma ang visual ng kasalukuyang produkto o balita nitong umaga. Saklaw ng grounding ng Nano Banana 2 ang linyang iyon.
Kopyahin sa generator sa itaas, palitan ang mga bracket, i-render.

"Isang print-ready na menu ng bistro, A4 portrait: '[LUNE — Kusina ng Kapitbahayan]' bilang header, limang main course na may mga presyo ($14–$22, naka-align sa kanan), tatlong dessert, maikling listahan ng wine, salin sa French sa ilalim ng bawat pangalan ng putahe. Warm cream na papel, klasikong serif typesetting, walang maling spelling."
Ang siksik na nakaayos na text na may mga panuntunan sa pag-format ay eksakto kung para saan ang thinking mode — binabalangkas muna ng modelo ang layout bago mag-render ng isang pixel. Ang demo sa tabi ng generator ay ang prompt na ito.

Batch ×8 → "[Product] hero shot, ilaw sa studio: walong variation na sumusuri sa anggulo at kulay ng backdrop — parehong sukat ng produkto, parehong oryentasyon ng label, parehong lambot ng anino sa lahat ng walo."
Ang pagtukoy kung ano ang dapat manatiling magkapareho ang gumagawa sa isang batch na maging kontroladong eksperimento sa halip na walong loterya. Piliin ang panalo, pagkatapos ay i-render muli ito nang mag-isa sa buong laki.

"Isang malinis na screen ng mobile app para sa [isang habit tracker]: header na 'Today', apat na habit card na bawat isa ay may icon, pangalan at bilang ng streak, isang bottom tab bar na may limang icon na may label — lahat ng label ay nababasa at tama ang baybay, iOS-style na espasyo, light mode."
Ang mga interface ay mga dokumentong siksik sa teksto na nagbabalatkayo. Ang paglilista ng mga elemento ay nagpapagana sa tagaplano; 'nababasa at tama ang baybay' ang nagtatakda ng pamantayang talagang maaabot ng tagapag-render ng teksto.
Tatlong flagship, tatlong teorya: pangangatwiran muna, bilis muna, kakayahang i-edit muna. Parehong mga prompt sa lahat ng tatlo, hinusgahan batay sa kung ano ang ilalabas namin. Mapipili ang lahat ng tatlo sa generator sa itaas.
ChatGPT Images 2.0, inilunsad noong Abril 21: native na pag-iisip, #1 sa bawat kategorya ng arena na may +242 sa loob ng labindalawang oras, API bilang gpt-image-2. Ang bersyon sa generator sa itaas.
ang henerasyon ng kahusayan: mas mabilis at mas murang mga pag-edit na nagpapanatiling buo ang mga detalye; ang pinakamahusay na pampublikong modelo ng larawan ng OpenAI hanggang Abril.
ang pamilya ng mga modelong nagsimula ng mainstream na mga larawang AI ay umaalis sa ChatGPT; GPT Image 2 ang itinalagang kahalili nito. Kung napunta ka rito sa paghahanap ng DALL·E, dito humahantong ang daang iyon.
Ang pangunahing modelo ng larawan ng OpenAI, inilunsad noong Abril 21, 2026 bilang ChatGPT Images 2.0 (API name gpt-image-2). Ito ang unang modelo ng larawan ng OpenAI na may likas na kakayahang mangatwiran — pinaplano nito ang layout at sinusuri ang content bago mag-render — na may multilingual na tekstong handa para sa pag-print, magkakatugmang batch na 8 larawan at flexible na laki hanggang 2K. Nag-debut ito bilang #1 sa bawat kategorya ng Image Arena sa pinakamalaking lamang na naitala kailanman.