GPT Image 2.5 vs GPT Image 2: Jeg kjørte de samme promptene gjennom begge. Her skiller de seg faktisk

GPT Image 2.5 vs GPT Image 2: Jeg kjørte de samme promptene gjennom begge. Her skiller de seg faktisk

InnsiktPublisert på

OpenAI lanserte ChatGPT Images 2.5 den 8. september og oppsummerte det som "sharper details, more precise editing, and faster generation". På API-siden betyr det to nye modeller, GPT-Image-2.5 Flare og GPT-Image-2.5 Sunburst. ZOOOP hadde begge live dagen etter, som to versjoner av én modell i AI-bildegeneratoren.

Lanseringsinnlegg leser alltid godt. Genererer du bilder hver dag, er det bare ett spørsmål som fortjener svar: Jeg er fornøyd med GPT Image 2 — hva får jeg egentlig ved å gå til 2.5? Så jeg kjørte det samme settet med prompter gjennom begge generasjonene og endret ingenting annet enn modellen. Her er hva du kan se, og hva du ikke kan.

Hva GPT Image 2.5 er, og hva Flare og Sunburst er

Navnene først, for OpenAI slapp tre av dem på én gang.

ChatGPT Images 2.5 er produktnavnet inne i ChatGPT. Det finnes ingen API-modell kalt «2.5» — det er to: Flare og Sunburst. Ifølge OpenAI er Flare standarden for de fleste bruksområder og leverer bedre bilder enn GPT-Image-2 med halve ventetiden. Sunburst er bygd for premium arbeidsflyter som vil ha strammere kontroll over redigeringer, og den bruker lengre tid på å generere. De to deler samme prompter, parametere og bildeformater.

På ZOOOP har vi ikke listet dem som to separate modeller — det ville antyde at du velger mellom to forskjellige ting. De er to versjoner under GPT Image 2.5, én bryter fra hverandre. Derfor kjører alle sammenligningene i dette innlegget på Flare som standard; Sunburst får sin egen del lenger ned.

Sammenlignet med GPT Image 2 er tre ting endret på parameternivå: kvalitetsstigen går fra Low / Medium / High til fem trinn, med XHigh og Max på toppen; det er en ny 4K-oppløsning; og én forespørsel tar nå opptil 16 referansebilder i stedet for 10. Alt annet er likt — elleve bildeformater, prompter skrevet på samme måte.

Metode: samme prompter, bare modellen byttes

Fire prompter som dekker de fire tingene jeg bryr meg mest om. Stoff- og metalldetalj: et nærbilde av jakkeslaget på en marineblå fiskebeinsblazer med en kragenål i messing. Liten tekst i bildet: et bakeris håndmalte treskilt. Refleksjoner og materialer: en mattsvart tekanne på en polert steinbenk. Typografi: en vintage konsertplakat festet på en murvegg.

Hver prompt kjørte én gang på hver modell — 16:9, samme oppløsning, kvalitet Low. Low er trinnet jeg bruker mest, og det trinnet som avslører en modells bunn; på det øverste trinnet kan enhver modell stable detaljer. For stoffprompten la jeg til et High-par og én Max-rendering, som bare 2.5 tilbyr, for å se hvor langt stigen faktisk rekker.

Ikke testet her: redigering og komposisjon med flere referanser. Det er områdene OpenAI snakker mest om for 2.5, og de fortjener sitt eget innlegg.

Forskjell én: oppløst detalj

Kortversjonen: begge Low-renderingene er brukbare; gapet viser seg når du zoomer. GPT Image 2 har fiskebeinet, men det er mykt, som sett gjennom gas. GPT Image 2.5 reiser hver ribbe, og sømmen langs kanten av jakkeslaget er fastere. Det andre gapet er ikke tekstur men lydighet. Jeg ba om en kragenål i messing; 2.0 tegnet et lykteformet anheng, 2.5 en rund messingknapp med våpenskjold. Ingen av dem er lærebokeksempelet, men 2.5 er nærmere prompten.

Samme prompt, GPT Image 2 til venstre, GPT Image 2.5 til høyre, begge Low

Tekanneparet illustrerer tydeligst hva «oppløst detalj» betyr. Begge treffer kannens materiale; forskjellen er benken. 2.0s refleksjon er en vag mørk smørje. 2.5 speiler hank, kropp og lokk én for én på steinen, med marmorårene som skinner gjennom under. Det er det svake punktet jeg oftest støter på med enhver AI-bildegenerator — motivet er fint, ringen der motivet møter omgivelsene blir grøtete. 2.5 er merkbart tettere i den ringen.

Svart tekanne og refleksjonen dens, GPT Image 2 til venstre, GPT Image 2.5 til høyre

Når det gjelder tekst i bildet: «MORNING LOAF · est. 1987» på bakerskiltet og de tre linjene på plakaten kom bokstavrett ut på begge modeller. Lesbar typografi har alltid vært GPT Image-linjens kjennetegn; 2.5 går ikke tilbake på det, og drar heller ikke fra. Forskjellene ligger rundt bokstavene. 2.5s skilt er ekte forvitret tre hengt på jernkroker, og plakaten har bretter og nålehoder. 2.0s skilt ser nymalt ut, og plakaten la til en vintagebil som prompten aldri ba om.

Bakerskilt, GPT Image 2 til venstre, GPT Image 2.5 til høyre

Vintage konsertplakat, GPT Image 2 til venstre, GPT Image 2.5 til høyre

Forskjell to: tre kvalitetstrinn blir fem

Med GPT Image 2s tre trinn var regelen min: Low er nok, Medium tar travle komposisjoner, High sjelden. 2.5 legger XHigh og Max over High, og den første reaksjonen er «altså en dyrere High».

Det jeg fant var annerledes: å gå opp et trinn skjerper ikke det samme bildet — det genererer et nytt. Over Low-, High- og Max-renderingene skiftet nålen fra et rundt våpenskjold til en bladform, og laget under gikk fra hvit skjorte til kremfarget genser og tilbake. Komposisjonen flyttet seg; det eneste som steg jevnt var stoffet. Max sitt fiskebein er tett nok til å telle trådene, High kommer deretter, og Low er nesten umulig å skille fra High i webstørrelse. Så hvis planen var «lås komposisjonen på Low, og render samme bilde på Max til trykk», finnes ikke den veien. Gå opp stigen mens du fortsatt kan godta at komposisjonen endrer seg.

GPT Image 2.5, samme prompt på Low, High og Max

Rådet mitt er det samme som med 2.0, bare på en lengre stige: utforsk på Low, lås komposisjonen, løft bare bildet du faktisk leverer. Hvilket trinn avhenger av hvor stort det blir sett. En trykt plakat, en landingsside-hero, en 4K-plate — der hører XHigh og Max hjemme. Å løfte et innlegg til sosiale medier koster bare mer.

Forskjell tre: 4K widescreen og 16 referansebilder

4K er det håndfaste tillegget. GPT Image 2.5 leverer 3840×2160 og 2160×3840 direkte, ingen 2K-og-så-oppskalering — og native mot oppskalert er noe annet i høyfrekvente detaljer som blader og hår.

Én ting du bør vite fra start: 4K er bare tilgjengelig i fire brede og høye formater — 21:9, 16:9, 9:16 og 9:21. De andre sju bildeformatene stopper på 3K. Det er modellens pikseltak, ikke en ZOOOP-grense; vi gråer ut kombinasjonene du ikke kan velge, så du ikke betaler, venter et halvt minutt og får en feil.

At referansegrensen går fra 10 til 16 bilder er en reell bekvemmelighet for e-handelskomposisjoner og layoutarbeid: packshots, rekvisitter, et fargekart og en grov layout, alt i én forespørsel, med prompten som beskriver oppsettet. Jeg tok ingen sammenligning her, men «bedre til å bevare motivene i referansebildene dine» er en av hovedtrådene i OpenAIs kunngjøring, og det stemmer med det vi har sett i spredte tester i AI-bilderedigereren.

Forskjell fire: renderer Flare og Sunburst forskjellig?

Det var dette jeg helst ville avgjøre, fordi de to versjonene koster det samme på ZOOOP. Hvis Sunburst er tregere og ikke bedre, hva er den til?

Jeg kjørte jakkeslagprompten fra forskjell én gjennom Sunburst med identiske parametere. Side om side er stofftetthet, nålens metall og fallet i dybdeskarphet uavgjort; hver forskjell er tilfeldig — Flare ga en rund messingknapp, Sunburst en eikebladnål og la til et lommetørkle. Med andre ord: for generering fra bunnen er Sunburst ikke bedre enn Flare.

Samme prompt, begge Low: Flare til venstre, Sunburst til høyre

Tregere er den, men et tall kan jeg ikke gi deg. Jeg målte det samme settet med matchede par to ganger: i begge rundene ligger medianen til Sunburst bak Flare, men avstanden varierte mye mellom rundene, og enkelte celler snudde. Retningen holder, faktoren gjør det ikke. Det stemmer med OpenAIs posisjonering: Sunbursts styrke er redigering — den typen "endre bare denne ene tingen, la resten stå" — ikke text-to-image.

Så regelen er enkel. Flare som standard. Bytt til Sunburst bare når du gjør en presis redigering på et eksisterende bilde og endringen må lande nøyaktig der du peker. For text-to-image og batch-skisser får Sunburst deg bare til å vente.

Hva som bør flyttes til 2.5, og hva som kan bli

De fire forskjellene i én liste.

Flytt til GPT Image 2.5: alt som blir sett stort — trykte key visuals, landingsside-heroer, bakgrunner til store skjermer; alt med liten tekst eller tett typografi; alt som krever native 4K widescreen; alt som setter sammen et dusin eller flere referansebilder. I disse tilfellene er gapet synlig.

Ingen hast: hverdagsbilder til sosiale medier, bilder som bare ses på telefon, skisser for ren stilutforskning. På Low rettferdiggjør ikke forskjellen mellom generasjonene å kjøre et eksisterende sett om igjen. Har du en serie laget med GPT Image 2 og trenger noen flere som matcher, er det tryggere å bli på 2.0.

Start nytt arbeid på 2.5. I ZOOOPs AI-bildegenerator står den foran GPT Image 2 i listen, Flare er standardversjonen, og de fem kvalitetstrinnene og 4K ligger i samme panel. Kreditter deles mellom begge modellene, så å bytte fram og tilbake krever ikke et eget budsjett.

Del