GPT Image 2.5 বনাম GPT Image 2: একই প্রম্পট দুটোতেই চালালাম। এখানেই আসল পার্থক্য

GPT Image 2.5 বনাম GPT Image 2: একই প্রম্পট দুটোতেই চালালাম। এখানেই আসল পার্থক্য

অন্তর্দৃষ্টিপ্রকাশিত

OpenAI ৮ সেপ্টেম্বর ChatGPT Images 2.5 ছেড়েছে আর এর সারসংক্ষেপ দিয়েছে "sharper details, more precise editing, and faster generation" বলে। API-এর দিকে তার মানে দুটি নতুন মডেল—GPT-Image-2.5 Flare আর GPT-Image-2.5 Sunburst। ZOOOP পরদিনই দুটোকে এআই ইমেজ জেনারেটর-এ একই মডেলের দুই সংস্করণ হিসেবে চালু করেছে।

লঞ্চের লেখা সবসময় ভালো পড়তে লাগে। প্রতিদিন ছবি বানালে একটাই প্রশ্ন উত্তরের যোগ্য: GPT Image 2-তে আমি খুশি—2.5-এ গিয়ে আসলে কী পাব? তাই একই সেট প্রম্পট দুই প্রজন্মে চালালাম, মডেল ছাড়া কিছু বদলাইনি। এখানে যা দেখা যায়, আর যা যায় না।

GPT Image 2.5 কী, আর Flare ও Sunburst কী

প্রথমে নামগুলো, কারণ OpenAI একসঙ্গে তিনটি নাম ছেড়েছে।

ChatGPT Images 2.5 হলো ChatGPT-র ভেতরের প্রোডাক্টের নাম। "2.5" নামে কোনো API মডেল নেই—আছে দুটি: Flare আর Sunburst। OpenAI-র মতে Flare বেশিরভাগ কাজের ডিফল্ট, GPT-Image-2-এর চেয়ে ভালো মানের ছবি অর্ধেক লেটেন্সিতে দেয়। Sunburst বানানো সেই প্রিমিয়াম ওয়ার্কফ্লোর জন্য যেখানে এডিটে আরও কড়া নিয়ন্ত্রণ চাই, আর এটি বানাতে বেশি সময় নেয়। দুটোরই প্রম্পট, প্যারামিটার আর অ্যাসপেক্ট রেশিও এক।

ZOOOP-এ আমরা এগুলোকে দুটি আলাদা মডেল হিসেবে রাখিনি—তাতে মনে হতো দুটি আলাদা জিনিসের মধ্যে বাছছেন। এগুলো GPT Image 2.5-এর নিচে দুই সংস্করণ, মাত্র একটা সুইচের দূরত্বে। সেই কারণেই এই লেখার সব তুলনা ডিফল্টে Flare-এ চলেছে; Sunburst-এর নিজের অংশ নিচে।

GPT Image 2-এর তুলনায় প্যারামিটার স্তরে তিনটি বদল: কোয়ালিটি সিঁড়ি Low / Medium / High থেকে পাঁচ স্তরে, ওপরে XHigh আর Max; নতুন 4K রেজোলিউশন; আর একটি রিকোয়েস্টে এখন ১০-এর বদলে ১৬টি রেফারেন্স ছবি। বাকি সব একই—এগারোটি অ্যাসপেক্ট রেশিও, প্রম্পট একইভাবে লেখা।

পদ্ধতি: একই প্রম্পট, শুধু মডেল বদলায়

চারটি প্রম্পট, যে চারটি বিষয় আমার সবচেয়ে গুরুত্বপূর্ণ। কাপড় আর ধাতুর ডিটেইল: পিতলের কলার পিন লাগানো নেভি হেরিংবোন ব্লেজারের ল্যাপেলের ক্লোজ-আপ। ফ্রেমে ছোট লেখা: এক বেকারির হাতে আঁকা কাঠের সাইনবোর্ড। প্রতিফলন আর উপাদান: পালিশ করা পাথরের কাউন্টারে ম্যাট কালো চায়ের কেটলি। টাইপোগ্রাফি: ইটের দেয়ালে পিন করা ভিনটেজ কনসার্ট পোস্টার।

প্রতিটি প্রম্পট প্রতিটি মডেলে একবার—16:9, একই রেজোলিউশন, Low কোয়ালিটি। Low আমি সবচেয়ে বেশি ব্যবহার করি, আর এটিই মডেলের ভিত দেখায়; সর্বোচ্চ স্তরে যে কোনো মডেল ডিটেইল জমাতে পারে। কাপড়ের প্রম্পটে একটি High জোড়া আর একটি Max রেন্ডার যোগ করেছি, যা শুধু 2.5-এ আছে, সিঁড়ি আসলে কতদূর যায় দেখতে।

এখানে পরীক্ষা করা হয়নি: এডিটিং আর মাল্টি-রেফারেন্স কম্পোজিটিং। এগুলো নিয়েই OpenAI 2.5-এর ব্যাপারে সবচেয়ে বেশি বলে, আর এগুলোর আলাদা লেখা প্রাপ্য।

পার্থক্য এক: স্পষ্ট ডিটেইল

সংক্ষেপে: দুটো Low রেন্ডারই কাজে লাগে; ফাঁক দেখা যায় জুম করলে। GPT Image 2-এ হেরিংবোন আছে, কিন্তু নরম, যেন গজের ভেতর দিয়ে দেখা। GPT Image 2.5 প্রতিটি দাগ দাঁড় করায়, আর ল্যাপেলের কিনারের সেলাই আরও দৃঢ়। অন্য ফাঁকটা টেক্সচার নয়, বাধ্যতা। পিতলের কলার পিন চেয়েছিলাম; 2.0 লণ্ঠন-আকৃতির ঝুলন্ত অলংকার আঁকল, 2.5 প্রতীকযুক্ত গোল পিতলের বোতাম। কোনোটাই পাঠ্যবইয়ের মতো নয়, কিন্তু 2.5 প্রম্পটের কাছাকাছি।

একই প্রম্পট, বামে GPT Image 2, ডানে GPT Image 2.5, দুটোই Low

কেটলির জোড়াটাই "স্পষ্ট ডিটেইল" কী বোঝায় তার সবচেয়ে পরিষ্কার উদাহরণ। দুটোই কেটলির উপাদান ঠিক ধরে; পার্থক্য কাউন্টারে। 2.0-এর প্রতিফলন অস্পষ্ট কালো দাগ। 2.5 হাতল, দেহ আর ঢাকনা একে একে পাথরে ফুটিয়ে তোলে, নিচ থেকে মার্বেলের শিরা ভেসে আসে। এটাই সেই দুর্বল জায়গা যা কোনো এআই ইমেজ জেনারেটরে আমি সবচেয়ে বেশি পাই—বিষয়বস্তু ঠিক, কিন্তু বিষয় আর পরিবেশ যেখানে মেলে সেই বৃত্ত ঘোলাটে হয়ে যায়। 2.5 সেই বৃত্তে লক্ষণীয়ভাবে ঘন।

কালো কেটলি আর তার প্রতিফলন, বামে GPT Image 2, ডানে GPT Image 2.5

ফ্রেমের লেখার কথা: বেকারির সাইনে "MORNING LOAF · est. 1987" আর পোস্টারের তিন লাইন দুই মডেলেই অক্ষরে-অক্ষরে সঠিক এসেছে। পড়ার মতো টাইপোগ্রাফি GPT Image সিরিজের চিরকালের সই; 2.5 এতে পেছায় না, এগিয়েও যায় না। পার্থক্য অক্ষরের চারপাশে। 2.5-এর সাইন সত্যিই আবহাওয়ায় ক্ষয়া কাঠ, লোহার হুকে ঝোলানো, আর পোস্টারে ভাঁজ আর পিনের মাথা। 2.0-এর সাইন সদ্য রং করা লাগে, আর পোস্টারে এক ভিনটেজ গাড়ি জুড়েছে যা প্রম্পট চায়নি।

বেকারির সাইন, বামে GPT Image 2, ডানে GPT Image 2.5

ভিনটেজ কনসার্ট পোস্টার, বামে GPT Image 2, ডানে GPT Image 2.5

পার্থক্য দুই: তিন কোয়ালিটি স্তর পাঁচ হলো

GPT Image 2-এর তিন স্তরে আমার নিয়ম ছিল: Low-ই যথেষ্ট, Medium ভরাট কম্পোজিশনের জন্য, High কমই। 2.5 High-এর ওপরে XHigh আর Max যোগ করে, আর প্রথম প্রতিক্রিয়া "তার মানে দামি High"।

যা পেলাম তা আলাদা: একধাপ ওপরে উঠলে একই ছবি ধারালো হয় না—নতুন ছবি তৈরি হয়। Low, High আর Max রেন্ডারে পিন গোল প্রতীক থেকে পাতার আকারে গেল, আর নিচের স্তর সাদা শার্ট থেকে ক্রিম সোয়েটার আর আবার শার্ট। কম্পোজিশন নড়ল; স্থিরভাবে ওপরে উঠল শুধু কাপড়। Max-এর হেরিংবোন এত ঘন যে সুতো গোনা যায়, High পরে, আর Low ওয়েব সাইজে High থেকে প্রায় আলাদা করা যায় না। তাই যদি পরিকল্পনা ছিল "Low-তে কম্পোজিশন লক করে একই ফ্রেম প্রিন্টের জন্য Max-এ আবার রেন্ডার", সে পথ নেই। সিঁড়ি বেয়ে উঠুন যখন কম্পোজিশন বদলানো এখনো মেনে নিতে পারেন।

GPT Image 2.5, একই প্রম্পট Low, High আর Max-এ

আমার পরামর্শ 2.0-এর সময়ের মতোই, শুধু সিঁড়ি লম্বা: Low-তে খুঁজুন, কম্পোজিশন লক করুন, যে ফ্রেম সত্যিই ডেলিভার করবেন শুধু সেটাই ওপরে তুলুন। কোন স্তর, নির্ভর করে কত বড় করে দেখা হবে। ছাপা পোস্টার, ল্যান্ডিং পেজের হিরো, 4K প্লেট—সেখানেই XHigh আর Max-এর জায়গা। সোশ্যাল পোস্ট ওপরে তোলা শুধু বেশি খরচ।

পার্থক্য তিন: 4K ওয়াইডস্ক্রিন আর ১৬টি রেফারেন্স ছবি

4K হলো বাস্তব সংযোজন। GPT Image 2.5 সরাসরি 3840×2160 আর 2160×3840 দেয়, 2K বানিয়ে বড় করা নয়—আর পাতা, চুলের মতো উচ্চ-কম্পাঙ্কের ডিটেইলে নেটিভ বনাম বড় করা আলাদা জিনিস।

একটা কথা আগে জেনে রাখুন: 4K শুধু চারটি প্রশস্ত ও লম্বা অনুপাতে আছে—21:9, 16:9, 9:16 আর 9:21। বাকি সাতটি অ্যাসপেক্ট রেশিও 3K-তে থামে। এটা মডেলের পিক্সেল সীমা, ZOOOP-এর সীমা নয়; বাছা যায় না এমন সমন্বয় আমরা ধূসর করে দেই, যাতে টাকা দিয়ে আধ মিনিট অপেক্ষা করে ব্যর্থতা না পান।

রেফারেন্সের সীমা ১০ থেকে ১৬ হওয়া ই-কমার্স কম্পোজিট আর লেআউটের কাজে সত্যিকারের সুবিধা: প্যাকশট, প্রপ, একটি কালার কার্ড আর মোটামুটি লেআউট, সব এক রিকোয়েস্টে, প্রম্পটে বিন্যাসের বর্ণনা। এর তুলনা আমি নেইনি, কিন্তু "রেফারেন্স ছবির বিষয়বস্তু আরও ভালো ধরে রাখা" OpenAI-র ঘোষণার মূল সূত্রগুলোর একটি, আর এআই ইমেজ এডিটর-এ আমাদের বিচ্ছিন্ন পরীক্ষার সঙ্গে মেলে।

পার্থক্য চার: Flare আর Sunburst আলাদা রেন্ডার করে?

এটাই সবচেয়ে বেশি মেটাতে চেয়েছিলাম, কারণ ZOOOP-এ দুই সংস্করণের দাম এক। Sunburst ধীর আর ভালো না হলে, তা আছে কেন?

পার্থক্য এক-এর ল্যাপেল প্রম্পট একই প্যারামিটারে Sunburst-এ চালালাম। পাশাপাশি, কাপড়ের ঘনত্ব, পিনের ধাতু আর ডেপথ-অফ-ফিল্ডের ঢাল সমান-সমান; প্রতিটি পার্থক্য এলোমেলো—Flare দিল গোল পিতলের বোতাম, Sunburst দিল ওক পাতার পিন আর যোগ করল পকেট স্কোয়ার। অন্য কথায়, শূন্য থেকে বানানোয় Sunburst Flare-এর চেয়ে ভালো নয়

একই প্রম্পট, দুটোই Low: বামে Flare, ডানে Sunburst

ধীর এটি সত্যিই, তবে কতটা ধীর তার সংখ্যা আমি দিতে পারব না। একই জোড়ার সেট আমি দুবার মেপেছি: দুবারেই Sunburst-এর মধ্যমা Flare-এর পিছনে, কিন্তু দুই দফার ব্যবধান অনেকটাই আলাদা, আর কিছু ঘর উল্টেও গেছে। টেকে দিকটা, গুণক নয়। OpenAI-র অবস্থানের সঙ্গে মেলে: Sunburst-এর শক্তি এডিটিং—"শুধু এটা বদলাও, বাকি রাখো" ধরনের—text-to-image নয়।

তাই নিয়ম সহজ। ডিফল্ট Flare। Sunburst-এ যান শুধু যখন বিদ্যমান ছবিতে নির্ভুল এডিট করছেন আর বদলটা ঠিক যেখানে দেখাচ্ছেন সেখানেই পড়তে হবে। text-to-image আর ব্যাচ খসড়ায় Sunburst শুধু অপেক্ষা করায়।

কী 2.5-এ নেবেন, আর কী রেখে দেবেন

চার পার্থক্য এক তালিকায়।

GPT Image 2.5-এ নিন: যা বড় করে দেখা হবে—ছাপা কি-ভিজ্যুয়াল, ল্যান্ডিং পেজের হিরো, বড় পর্দার ব্যাকড্রপ; যাতে ছোট লেখা বা ঘন টাইপোগ্রাফি; যাতে নেটিভ 4K ওয়াইডস্ক্রিন লাগে; যাতে এক ডজন বা তার বেশি রেফারেন্স ছবি জোড়া লাগে। এসব ক্ষেত্রে ফাঁক দেখা যায়।

তাড়া নেই: প্রতিদিনের সোশ্যাল ছবি, শুধু ফোনে দেখা ছবি, নিছক স্টাইল-খোঁজার খসড়া। Low-তে প্রজন্মের পার্থক্য বিদ্যমান সেট আবার চালানোর মতো যথেষ্ট নয়। GPT Image 2 দিয়ে বানানো ব্যাচে আরও কয়েকটা মিলিয়ে লাগলে 2.0-তেই থাকা নিরাপদ।

নতুন কাজ 2.5 থেকে শুরু করুন। ZOOOP-এর এআই ইমেজ জেনারেটর-এ এটি তালিকায় GPT Image 2-এর আগে, Flare ডিফল্ট সংস্করণ, আর পাঁচ কোয়ালিটি স্তর ও 4K একই প্যানেলে। ক্রেডিট দুই মডেলে ভাগ করা, তাই এদিক-ওদিক করতে দ্বিতীয় বাজেট লাগে না।

শেয়ার করুন