GPT Image 2.5 против GPT Image 2: я прогнал одни и те же промпты через обе модели. Вот где они действительно различаются

GPT Image 2.5 против GPT Image 2: я прогнал одни и те же промпты через обе модели. Вот где они действительно различаются

АналитикаОпубликовано на

OpenAI выпустила ChatGPT Images 2.5 8 сентября и описала её как «sharper details, more precise editing, and faster generation». Со стороны API это две новые модели: GPT-Image-2.5 Flare и GPT-Image-2.5 Sunburst. В ZOOOP обе появились на следующий день — как две версии одной модели внутри генератора изображений AI.

Посты о запуске всегда читаются хорошо. Если вы генерируете изображения каждый день, ответа заслуживает лишь один вопрос: меня устраивает GPT Image 2 — что я реально получу, перейдя на 2.5? Поэтому я прогнал один и тот же набор промптов через оба поколения, не меняя ничего, кроме модели. Вот что видно — и что нет.

Что такое GPT Image 2.5 и что такое Flare и Sunburst

Сначала названия, потому что OpenAI выпустила сразу три.

ChatGPT Images 2.5 — это название продукта внутри ChatGPT. Модели API с именем «2.5» нет — есть две: Flare и Sunburst. По словам OpenAI, Flare — вариант по умолчанию для большинства задач: качество выше, чем у GPT-Image-2, при вдвое меньшей задержке. Sunburst создан для премиальных процессов, где нужен более точный контроль над правками, и генерирует дольше. Промпты, параметры и соотношения сторон у них общие.

В ZOOOP мы не стали выставлять их как две отдельные модели — это выглядело бы как выбор между двумя разными вещами. Это две версии внутри GPT Image 2.5, одним переключателем. Поэтому все сравнения в этой статье по умолчанию сделаны на Flare; Sunburst получил отдельный раздел ниже.

По сравнению с GPT Image 2 на уровне параметров изменились три вещи: шкала качества выросла с Low / Medium / High до пяти ступеней — сверху добавились XHigh и Max; появилось разрешение 4K; один запрос теперь принимает до 16 референсов вместо 10. Остальное без изменений — те же одиннадцать соотношений сторон, промпты пишутся так же.

Метод: те же промпты, меняется только модель

Четыре промпта, покрывающие четыре вещи, которые меня волнуют больше всего. Детали ткани и металла: крупный план лацкана тёмно-синего пиджака в ёлочку с латунной булавкой. Мелкий текст в кадре: деревянная вывеска пекарни с надписью от руки. Отражения и материалы: матовый чёрный чайник на полированной каменной стойке. Типографика: винтажная концертная афиша, приколотая к кирпичной стене.

Каждый промпт прогонялся по одному разу на каждой модели — 16:9, то же разрешение, качество Low. Low — ступень, которой я пользуюсь чаще всего, и она показывает нижний предел модели: на верхней ступени любая модель навалит деталей. Для промпта с тканью я добавил пару на High и один рендер на Max, который есть только у 2.5, — чтобы увидеть, куда шкала доходит на самом деле.

Здесь не тестировалось: редактирование и композитинг из нескольких референсов. Именно о них OpenAI говорит больше всего применительно к 2.5, и они заслуживают отдельной статьи.

Различие первое: проработка деталей

Коротко: оба рендера на Low пригодны; разрыв виден при увеличении. У GPT Image 2 ёлочка есть, но мягкая, будто через марлю. GPT Image 2.5 ставит каждое ребро, и строчка по краю лацкана твёрже. Второй разрыв — не в текстуре, а в послушании. Я просил латунную булавку; 2.0 нарисовал подвеску в форме фонаря, 2.5 — круглую латунную пуговицу с гербом. Ни то ни другое не хрестоматийно, но 2.5 ближе к промпту.

Один промпт, GPT Image 2 слева, GPT Image 2.5 справа, обе на Low

Пара с чайником лучше всего показывает, что значит «проработка деталей». Материал чайника верен у обеих; разница — в стойке. Отражение у 2.0 — размытое тёмное пятно. 2.5 отражает ручку, корпус и крышку по отдельности, а сквозь них просвечивают прожилки мрамора. Это слабое место, на которое я чаще всего натыкаюсь у любого генератора изображений AI: сам объект в порядке, а кольцо, где объект встречается со средой, расплывается. У 2.5 это кольцо заметно плотнее.

Чёрный чайник и его отражение, GPT Image 2 слева, GPT Image 2.5 справа

Что касается текста в кадре: «MORNING LOAF · est. 1987» на вывеске и три строки на афише вышли буква в букву у обеих моделей. Читаемая типографика всегда была фирменной чертой линейки GPT Image; 2.5 не откатывает её назад, но и не отрывается. Различия — вокруг букв. Вывеска у 2.5 — по-настоящему выветренное дерево на железных крюках, а афиша со складками и шляпками кнопок. Вывеска у 2.0 выглядит свежевыкрашенной, а на афише появился винтажный автомобиль, которого в промпте не было.

Вывеска пекарни, GPT Image 2 слева, GPT Image 2.5 справа

Винтажная концертная афиша, GPT Image 2 слева, GPT Image 2.5 справа

Различие второе: три ступени качества становятся пятью

С тремя ступенями GPT Image 2 моё правило было: Low достаточно, Medium — для насыщенных композиций, High — почти никогда. 2.5 добавляет XHigh и Max над High, и первая реакция — «то есть High подороже».

Оказалось иначе: переход на ступень выше не делает ту же картинку резче — он генерирует новую. На рендерах Low, High и Max булавка сменилась с круглого герба на форму листа, а слой под пиджаком — с белой рубашки на кремовый свитер и обратно. Композиция уплыла; стабильно росла только ткань. Ёлочка у Max настолько плотная, что можно считать нити, High следом, а Low в веб-размере почти неотличим от High. Так что если план был «зафиксировать композицию на Low, а потом перерендерить тот же кадр на Max для печати», такого пути нет. Поднимайтесь по шкале, пока ещё готовы принять смену композиции.

GPT Image 2.5, один промпт на Low, High и Max

Совет тот же, что и для 2.0, только шкала длиннее: исследуйте на Low, зафиксируйте композицию, поднимайте только тот кадр, который реально сдаёте. Какая ступень — зависит от того, насколько крупно его будут смотреть. Печатный постер, hero на лендинге, 4K-подложка — вот где место XHigh и Max. Поднимать пост для соцсетей — просто дороже.

Различие третье: широкоформатный 4K и 16 референсов

4K — ощутимое добавление. GPT Image 2.5 выдаёт 3840×2160 и 2160×3840 напрямую, без 2K с последующим апскейлом — а нативный и апскейленный кадр в высокочастотных деталях вроде листвы и волос — разные вещи.

Одно нужно знать заранее: 4K доступен только для четырёх широких и вертикальных форматов — 21:9, 16:9, 9:16 и 9:21. Остальные семь соотношений упираются в 3K. Это пиксельный потолок модели, а не ограничение ZOOOP; мы делаем недоступные комбинации серыми, чтобы вы не заплатили, не прождали полминуты и не получили ошибку.

Лимит референсов вырос с 10 до 16 — реальное удобство для e-commerce-композитов и вёрстки: пэкшоты, реквизит, цветовая карта и черновой макет — всё в одном запросе, а промпт описывает расстановку. Сравнения для этого я не снимал, но «лучше сохранять объекты с ваших референсных фото» — одна из главных линий анонса OpenAI, и это совпадает с тем, что мы видели в разрозненных тестах в редакторе изображений AI.

Различие четвёртое: рендерят ли Flare и Sunburst по-разному?

Это я хотел выяснить больше всего, потому что в ZOOOP обе версии стоят одинаково. Если Sunburst медленнее и не лучше — зачем он?

Я прогнал промпт с лацканом из первого различия через Sunburst с теми же параметрами. Рядом плотность ткани, металл булавки и спад глубины резкости — вничью; все различия случайны: Flare дал круглую латунную пуговицу, Sunburst — булавку в виде дубового листа и добавил нагрудный платок. Иначе говоря, для генерации с нуля Sunburst не лучше Flare.

Один промпт, обе на Low: Flare слева, Sunburst справа

Он медленнее, но назвать число я не берусь. Один и тот же набор парных прогонов я посчитал дважды: в обоих случаях медиана Sunburst отстаёт от Flare, однако разрыв между заходами сильно отличался, а отдельные ячейки менялись местами. Держится направление, а не множитель. Это совпадает с позиционированием OpenAI: сила Sunburst — в редактировании, того рода «поменяй только это, остальное оставь», а не в text-to-image.

Правило простое. По умолчанию — Flare. Переключайтесь на Sunburst только когда точечно правите существующее изображение и правка должна лечь ровно туда, куда вы указали. Для text-to-image и пакетных черновиков Sunburst просто заставит вас ждать.

Что переводить на 2.5, а что оставить

Четыре различия — в один список.

Переводить на GPT Image 2.5: всё, что будут смотреть крупно — печатные ключевые визуалы, hero на лендингах, фоны для больших экранов; всё с мелким текстом или плотной типографикой; всё, где нужен нативный широкоформатный 4K; всё, где композитится дюжина и больше референсов. Здесь разрыв виден.

Не спешить: повседневные картинки для соцсетей, изображения только для телефона, черновики чистого поиска стиля. На Low разница между поколениями не оправдывает перегон уже готового набора. Если у вас есть серия, сделанная на GPT Image 2, и нужно добавить к ней несколько в том же духе — остаться на 2.0 надёжнее.

Новую работу начинайте на 2.5. В генераторе изображений AI ZOOOP он стоит в списке выше GPT Image 2, Flare — версия по умолчанию, а пять ступеней качества и 4K — на той же панели. Кредиты общие для обеих моделей, так что переключаться туда-сюда без отдельного бюджета.

Поделиться