
GPT Image 2.5 vs GPT Image 2: मैंने एक ही प्रॉम्प्ट दोनों में चलाए। यहाँ है असली फर्क
OpenAI ने 8 सितंबर को ChatGPT Images 2.5 जारी किया और इसे "sharper details, more precise editing, and faster generation" कहकर समेटा। API की तरफ इसका मतलब दो नए मॉडल हैं—GPT-Image-2.5 Flare और GPT-Image-2.5 Sunburst। ZOOOP ने अगले ही दिन दोनों को एआई छवि जनरेटर में एक ही मॉडल के दो वर्शन के रूप में लाइव कर दिया।
लॉन्च पोस्ट हमेशा अच्छी लगती हैं। अगर आप रोज़ इमेज बनाते हैं, तो एक ही सवाल जवाब के लायक है: मैं GPT Image 2 से खुश हूँ—2.5 पर जाकर मुझे सच में क्या मिलेगा? तो मैंने प्रॉम्प्ट का एक ही सेट दोनों पीढ़ियों में चलाया और मॉडल के अलावा कुछ नहीं बदला। यहाँ है जो दिखता है, और जो नहीं।
GPT Image 2.5 क्या है, और Flare और Sunburst क्या हैं
पहले नाम, क्योंकि OpenAI ने एक साथ तीन नाम छोड़े।
ChatGPT Images 2.5 ChatGPT के अंदर प्रोडक्ट का नाम है। "2.5" नाम का कोई API मॉडल नहीं है—दो हैं: Flare और Sunburst। OpenAI के अनुसार Flare ज़्यादातर कामों के लिए डिफ़ॉल्ट है और GPT-Image-2 से बेहतर क्वालिटी की इमेज आधी लेटेंसी में देता है। Sunburst उन प्रीमियम वर्कफ़्लो के लिए बना है जो एडिट पर ज़्यादा कसा नियंत्रण चाहते हैं, और इसे बनाने में ज़्यादा समय लगता है। दोनों के प्रॉम्प्ट, पैरामीटर और आस्पेक्ट रेशियो एक ही हैं।
ZOOOP पर हमने इन्हें दो अलग मॉडल के रूप में नहीं रखा—इससे लगता कि आप दो अलग चीज़ों में से चुन रहे हैं। ये GPT Image 2.5 के नीचे दो वर्शन हैं, बस एक स्विच की दूरी पर। इसीलिए इस लेख की हर तुलना डिफ़ॉल्ट रूप से Flare पर चली है; Sunburst का अपना हिस्सा नीचे है।
GPT Image 2 की तुलना में पैरामीटर स्तर पर तीन चीज़ें बदलीं: क्वालिटी सीढ़ी Low / Medium / High से पाँच स्तरों तक गई, ऊपर XHigh और Max के साथ; एक नया 4K रेज़ोल्यूशन आया; और एक रिक्वेस्ट में अब 10 की बजाय 16 रेफरेंस इमेज जा सकती हैं। बाकी सब वैसा ही है—ग्यारह आस्पेक्ट रेशियो, प्रॉम्प्ट उसी तरह लिखे जाते हैं।
तरीका: एक ही प्रॉम्प्ट, सिर्फ मॉडल बदलता है
चार प्रॉम्प्ट, उन चार चीज़ों के लिए जिनकी मुझे सबसे ज़्यादा परवाह है। कपड़े और धातु की डिटेल: नेवी हेरिंगबोन ब्लेज़र की कॉलर पर पीतल की कॉलर पिन का क्लोज़-अप। फ्रेम में छोटा टेक्स्ट: एक बेकरी का हाथ से पेंट किया लकड़ी का बोर्ड। रिफ़्लेक्शन और मटीरियल: पॉलिश किए पत्थर के काउंटर पर मैट काली केतली। टाइपोग्राफ़ी: ईंट की दीवार पर पिन किया विंटेज कॉन्सर्ट पोस्टर।
हर प्रॉम्प्ट हर मॉडल पर एक बार चला—16:9, एक ही रेज़ोल्यूशन, Low क्वालिटी। Low वह स्तर है जिसे मैं सबसे ज़्यादा इस्तेमाल करता हूँ, और यही मॉडल की ज़मीन दिखाता है; सबसे ऊपरी स्तर पर कोई भी मॉडल डिटेल का ढेर लगा सकता है। कपड़े वाले प्रॉम्प्ट के लिए मैंने एक High जोड़ी और एक Max रेंडर जोड़ा, जो सिर्फ 2.5 में है, यह देखने के लिए कि सीढ़ी सच में कहाँ तक जाती है।
यहाँ नहीं परखा: एडिटिंग और मल्टी-रेफरेंस कंपोज़िटिंग। यही वे क्षेत्र हैं जिनके बारे में OpenAI 2.5 के लिए सबसे ज़्यादा बात करता है, और वे अपने अलग लेख के हक़दार हैं।
फर्क एक: सुलझी हुई डिटेल
छोटा जवाब: दोनों Low रेंडर काम के हैं; फर्क ज़ूम करने पर दिखता है। GPT Image 2 में हेरिंगबोन है, पर नरम, जैसे जाली के पार से देखा हो। GPT Image 2.5 हर धारी को खड़ा करता है, और कॉलर की किनारी की सिलाई ज़्यादा पक्की है। दूसरा फर्क बनावट का नहीं, आज्ञाकारिता का है। मैंने पीतल की कॉलर पिन माँगी; 2.0 ने लैंटर्न जैसा लटकन बनाया, 2.5 ने प्रतीक वाला गोल पीतल का बटन। दोनों किताबी नहीं हैं, पर 2.5 प्रॉम्प्ट के करीब है।

केतली की जोड़ी सबसे साफ़ बताती है कि "सुलझी हुई डिटेल" का क्या मतलब है। दोनों केतली का मटीरियल ठीक पकड़ते हैं; फर्क काउंटर में है। 2.0 का रिफ़्लेक्शन एक धुँधला काला धब्बा है। 2.5 हैंडल, बॉडी और ढक्कन को पत्थर पर एक-एक करके दर्शाता है, और नीचे से मार्बल की नसें झलकती हैं। यही वह कमज़ोर जगह है जो किसी भी एआई छवि जनरेटर में मुझे सबसे ज़्यादा मिलती है—विषय ठीक है, पर जहाँ विषय माहौल से मिलता है वह घेरा गड्ड-मड्ड हो जाता है। 2.5 उस घेरे में साफ़ तौर पर ज़्यादा घना है।

फ्रेम के टेक्स्ट की बात करें तो बेकरी बोर्ड पर "MORNING LOAF · est. 1987" और पोस्टर की तीन पंक्तियाँ दोनों मॉडलों में अक्षर-दर-अक्षर सही निकलीं। पढ़ने योग्य टाइपोग्राफ़ी हमेशा GPT Image श्रृंखला की पहचान रही है; 2.5 इसमें पीछे नहीं हटता, और आगे भी नहीं निकलता। फर्क अक्षरों के आसपास है। 2.5 का बोर्ड सच में मौसम की मार खाई लकड़ी है जो लोहे के हुक पर टँगा है, और उसके पोस्टर में सिलवटें और पिन के सिरे हैं। 2.0 का बोर्ड ताज़ा पेंट किया लगता है, और उसके पोस्टर में एक विंटेज कार जोड़ दी गई जो प्रॉम्प्ट ने कभी नहीं माँगी।


फर्क दो: तीन क्वालिटी स्तर पाँच बन गए
GPT Image 2 के तीन स्तरों में मेरा नियम था: Low काफ़ी है, Medium भरी हुई रचनाओं के लिए, High कभी-कभार। 2.5 High के ऊपर XHigh और Max जोड़ता है, और पहली प्रतिक्रिया है "तो, एक महँगा High"।
जो मिला वह अलग था: एक स्तर ऊपर जाने से वही इमेज तेज़ नहीं होती—एक नई इमेज बनती है। Low, High और Max रेंडर में पिन गोल प्रतीक से पत्ती के आकार में बदल गई, और नीचे की परत सफ़ेद शर्ट से क्रीम स्वेटर और फिर वापस। रचना हिल गई; जो लगातार ऊपर गया वह सिर्फ कपड़ा था। Max का हेरिंगबोन इतना घना है कि धागे गिने जा सकते हैं, High उसके बाद, और Low वेब साइज़ पर High से लगभग अलग नहीं दिखता। तो अगर योजना थी "Low पर रचना लॉक करो, फिर वही फ्रेम प्रिंट के लिए Max पर दोबारा रेंडर करो", तो वह रास्ता मौजूद नहीं है। सीढ़ी तब चढ़ें जब आप अभी रचना बदलना स्वीकार कर सकते हों।

मेरी सलाह वही है जो 2.0 के साथ थी, बस सीढ़ी लंबी है: Low पर खोजें, रचना लॉक करें, सिर्फ उस फ्रेम को ऊपर ले जाएँ जो सच में डिलीवर करना है। कौन-सा स्तर, यह इस पर निर्भर है कि उसे कितना बड़ा देखा जाएगा। छपा पोस्टर, लैंडिंग पेज हीरो, 4K प्लेट—वहीं XHigh और Max की जगह है। सोशल पोस्ट को ऊपर करना बस ज़्यादा खर्च है।
फर्क तीन: 4K वाइडस्क्रीन और 16 रेफरेंस इमेज
4K ठोस जोड़ है। GPT Image 2.5 सीधे 3840×2160 और 2160×3840 देता है, 2K बनाकर बढ़ाना नहीं—और पत्तियों व बालों जैसी उच्च-आवृत्ति डिटेल में नेटिव बनाम बढ़ाया हुआ अलग चीज़ है।
एक बात पहले जान लें: 4K सिर्फ चार वाइड और टॉल रेशियो के लिए है—21:9, 16:9, 9:16 और 9:21। बाकी सात आस्पेक्ट रेशियो 3K पर रुक जाते हैं। यह मॉडल की पिक्सल सीमा है, ZOOOP की नहीं; हम न चुने जा सकने वाले संयोजनों को ग्रे कर देते हैं ताकि आप भुगतान करके, आधा मिनट रुककर, फ़ेल न पाएँ।
रेफरेंस सीमा 10 से 16 इमेज होना ई-कॉमर्स कंपोज़िट और लेआउट काम के लिए असली सुविधा है: पैकशॉट, प्रॉप, एक कलर कार्ड और एक मोटा लेआउट, सब एक रिक्वेस्ट में, और प्रॉम्प्ट व्यवस्था बताता है। इसके लिए मैंने तुलना नहीं ली, पर "आपकी रेफरेंस फ़ोटो के विषयों को बेहतर बचाना" OpenAI की घोषणा की मुख्य कड़ियों में से एक है, और एआई छवि एडिटर में हमारे बिखरे परीक्षणों से मेल खाता है।
फर्क चार: क्या Flare और Sunburst अलग रेंडर करते हैं?
यही सबसे ज़्यादा तय करना चाहता था, क्योंकि ZOOOP पर दोनों वर्शन की कीमत एक है। अगर Sunburst धीमा है और बेहतर नहीं, तो यह किसलिए है?
मैंने फर्क एक का कॉलर प्रॉम्प्ट एक जैसे पैरामीटर के साथ Sunburst में चलाया। आमने-सामने, कपड़े की घनता, पिन की धातु और डेप्थ-ऑफ़-फ़ील्ड का ढलान बराबर हैं; हर फर्क बेतरतीब है—Flare ने गोल पीतल का बटन दिया, Sunburst ने ओक पत्ती की पिन दी और पॉकेट स्क्वेयर जोड़ दिया। दूसरे शब्दों में, शून्य से बनाने में Sunburst Flare से बेहतर नहीं है।

धीमा यह है, पर कितना धीमा, इसका आँकड़ा मैं नहीं दे सकता। एक ही जोड़ियों के सेट को मैंने दो बार नापा: दोनों बार Sunburst का माध्यिका Flare से पीछे रहा, मगर दोनों के बीच अंतर काफ़ी बदल गया और कुछ सेल उलट भी गईं। टिकती है दिशा, गुणक नहीं। यह OpenAI की स्थिति से मेल खाता है: Sunburst की ताक़त एडिटिंग है—"बस यह एक चीज़ बदलो, बाकी छोड़ो" वाली—text-to-image नहीं।
तो नियम सीधा है। डिफ़ॉल्ट Flare। Sunburst पर तभी जाएँ जब आप किसी मौजूदा इमेज में सटीक एडिट कर रहे हों और बदलाव ठीक वहीं गिरना हो जहाँ आप इशारा करें। text-to-image और बैच ड्राफ़्ट के लिए Sunburst बस आपको इंतज़ार कराता है।
क्या 2.5 पर ले जाएँ, और क्या छोड़ दें
चारों फर्क एक सूची में।
GPT Image 2.5 पर ले जाएँ: जो कुछ बड़ा देखा जाएगा—छपे की-विज़ुअल, लैंडिंग पेज हीरो, बड़ी स्क्रीन के बैकड्रॉप; जिसमें छोटा टेक्स्ट या घनी टाइपोग्राफ़ी हो; जिसे नेटिव 4K वाइडस्क्रीन चाहिए; जिसमें दर्जन भर या ज़्यादा रेफरेंस इमेज जोड़नी हों। इन मामलों में फर्क दिखता है।
कोई जल्दी नहीं: रोज़मर्रा की सोशल इमेज, सिर्फ फ़ोन पर देखी जाने वाली इमेज, शुद्ध स्टाइल-खोज ड्राफ़्ट। Low पर पीढ़ियों का फर्क मौजूदा सेट दोबारा चलाने के लिए काफ़ी नहीं। अगर आपका एक बैच GPT Image 2 से बना है और कुछ और मिलती-जुलती चाहिए, तो 2.0 पर रहना ज़्यादा सुरक्षित है।
नए काम के लिए 2.5 से शुरू करें। ZOOOP के एआई छवि जनरेटर में यह सूची में GPT Image 2 से आगे है, Flare डिफ़ॉल्ट वर्शन है, और पाँच क्वालिटी स्तर व 4K एक ही पैनल में हैं। क्रेडिट दोनों मॉडलों में साझा हैं, तो आगे-पीछे बदलने के लिए दूसरा बजट नहीं चाहिए।