Images 2.5 — эволюция, а не революция архитектуры
Images 2.0 вышла в апреле 2026-го. Она принесла 2K-разрешение, несколько соотношений сторон и веб-поиск, чтобы генератор опирался на свежие данные. Через пять месяцев, 8 сентября 2026 года, появилась версия 2.5 — и она не переписывает архитектуру заново. Задача другая: закрыть конкретные слабые места, на которые пользователи жаловались постоянно.
Понять логику апдейта помогает цифра, которую OpenAI приводит на старте: каждую неделю через ChatGPT Images и модели GPT-Image в API проходит свыше 3 миллиардов сгенерированных изображений. При таком потоке любое улучшение касается огромного числа людей сразу, и ставка делается не на эффектный прорыв, а на надёжность в ежедневной работе.
Три заявленные оси изменений — это продолжение того, что уже было, а не смена курса:
- Точность образа. Раньше лица и предметы на референсах могли «плыть» при переносе в новую сцену. Теперь субъект остаётся узнаваемым при смене стиля, фона и композиции.
- Точечное редактирование. Раньше правка одного элемента задевала всю картинку. Теперь меняется только названное — товар, фон, надпись, — а окружение остаётся на месте.
- Многоэтапное редактирование. Раньше после нескольких правок подряд изображение деградировало. Теперь предыдущие изменения сохраняются, и качество не сползает с каждым шагом.
Подтверждение инкрементального характера — в бенчмарках. На LM Arena новые модели заняли первые два места: Sunburst с ELO 1421 и Flare с 1399, тогда как GPT-Image-2 (medium) осталась на 1381. Разрыв между поколениями — около сорока пунктов. Это ровный шаг вперёд, а не скачок. И это честно отражает суть релиза: ощутимо выросла не «вау»-составляющая, а предсказуемость редактирования и повторных итераций.
Источник: Habr
Скорость генерации и задержка: почти 50% ускорения
Разработчик, прогнавший через gpt-image-2 около 50 тысяч изображений через API, зафиксировал среднюю задержку на уровне 104 секунд. После обновления тот же показатель упал до 35–40 секунд. Это уже не заявленные «до 50%», а более чем двукратное ускорение на реальном потоке задач.
Дальше расхождение только растёт. Flare — модель по умолчанию — отдаёт качественные изображения в два-четыре раза быстрее GPT-Image-2. Для массовой генерации это разница между очередью, которая копится часами, и конвейером, который успевает за спросом. Плюс у Flare заметно лучше работает генерация прозрачного фона — а это как раз тот случай, когда картинку сразу кладут на макет, не вырезая вручную.
При этом скорость не куплена ценой качества: по этому параметру Flare сопоставим с GPT Image 2. Если в вашем пайплайне узкое место — именно время ответа, Flare стоит прогнать на своих данных первым.
Хирургическая точность правок вместо мутаций
Один и тот же товарный кадр перекрашивают под сезон, меняют фон под кампанию, исправляют цену на этикетке — и всё это без пересборки сцены с нуля. Так выглядит точечное редактирование в GPT Images 2.5: вы называете один элемент, меняется именно он, а субъект, композиция и фирменный стиль вокруг остаются на месте. Раньше правка одного фрагмента задевала картинку целиком — приходилось мириться с тем, что заодно «уплывало» и то, что трогать не просили.
Проверить это просто. Берём фото, где мужчина держит цветок, и одной фразой просим: убери цветок из руки мужчины, ничего больше не меняй. Меняется только цветок. Обе модели справляются — и быстрая Flare, и более точная Sunburst, — но принцип у них общий: меняется лишь названное. Ключ здесь в формулировке промпта, и промптинг для этой модели давно стал отдельной дисциплиной со своим гайдом.
Отсюда вырастает вторая проблема, знакомая каждому, кто правил картинку по шагам. Делаешь пять правок подряд — и на пятой получаешь «свою», но какую-то мутировавшую версию задуманного. В 2.5 ранние изменения с большей вероятностью удерживаются, и каждая новая правка строится на уже сделанной работе, не ухудшая результат со временем. Пример — один и тот же слон в восьми последовательных кадрах: внешность животного, освещение и окружение сохраняются от кадра к кадру, никакой «мутации» между ними. Сравните это с серией из девяноста шести покадровых генераций пеликана на велосипеде: там задача заметно сложнее, и отдельные кадры скачут. Разница в том, что восемь кадров — это цепочка правок одного объекта, а не независимые генерации.
Что это даёт на практике? Итерируйте по одному изменению за раз: подавайте предыдущий результат как вход для следующей правки и явно повторяйте детали, которые важно сохранить. На примере билборда это выглядит так — сначала сцена на закате с точным текстом «Fresh and clean», затем запрос «сделай зимний вечер со снегопадом». Билборд, текст и композиция остаются нетронутыми.
Масштаб использования и рост с 1381 до 1421 пунктов ELO
Пока в проде через ChatGPT Images и GPT-Image в API проходит свыше 3 миллиардов изображений за неделю, рейтинг на LM Arena сдвинулся куда скромнее. Sunburst набрал 1421 балл, Flare — 1399, тогда как GPT-Image-2 (medium) держался на 1381. Разница между прежним поколением и новым лидером — 40 пунктов.
Для сравнения: Mai-Image-2.6 расположился на 1331. То есть весь квартет укладывается в диапазон около 90 баллов, где плотность высокая, а отрыв лидера от второго места — 22 пункта.
Цифры в 3 миллиарда и прирост в 40 баллов говорят об одном и том же с разных сторон. Массовость запросов означает, что улучшения нужны не в лабораторном «вау», а в предсказуемости на каждом отдельном запросе — иначе миллионы пользователей увидят регрессию. А сдержанный рост ELO намекает: качественная планка генерации уже упёрлась в потолок, и завоевать очки сверху получается только за счёт надёжности редактирования и итераций, а не за счёт очередного скачка «реализма».
Проще говоря, первое и второе места на арене здесь — не про революцию картинки, а про то, что модель перестала портиться на пятой правке подряд. Именно поэтому скачок от 1381 к 1421 стоит читать не как «стало вдвое красивее», а как «стало вдвое меньше поводов переделывать».
Заглянуть в детали обновления можно в обзоре на Хабре.
Flare и Sunburst: две модели под разные задачи
Выбор между двумя новыми моделями сводится к одному вопросу: что для вас дороже — секунды на запрос или точность каждой правки. Flare оптимизирован под скорость: он отдаёт результат в два–четыре раза быстрее GPT-Image-2, а задержка относительно предшественника ниже примерно вдвое. Sunburst, наоборот, ставит во главу угла контроль: качество выше, чем у GPT Image 2, но и время отклика больше.
Разберём на конкретных сценариях. Лента соцсетей, товарные карточки для маркетплейса, визуальный поиск, массовая генерация — здесь картинок много, а требования к каждой невысокие. Для такого потока Flare подходит лучше: он быстрее и одинаково хорошо справляется с прозрачным фоном. Если у вас интернет-магазин с сотней позиций и нужно перекрасить сезонную линейку, скорость решает больше, чем микронная точность.
Другой полюс — рекламная графика, продуктовые съёмки и точечные правки. Здесь важнее, чтобы при замене фона или надписи не поехали композиция и фирменный стиль. Sunburst для этого и создан: он аккуратнее удерживает неизменные части кадра и лучше подходит для итераций, где каждая правка строится на предыдущей.
Есть и компромисс. Sunburst принимает тот же набор значений quality (auto, low, medium, high, xhigh, max), что и Flare, — то есть на быстрых прогонах можно снизить настройку и получить приемлемое время. Практический совет: не выбирайте модель раз и навсегда — прогоните один и тот же набор из десяти своих типовых задач через обе и сравните не только результат, но и суммарное время пайплайна.
Интерфейс: @Sketch, шаблон Product photo и тулбар редактирования
Набрать «@Sketch» в чате — и открывается холст, внешне напоминающий MS Paint образца 1995 года. Никаких слоёв, кистей и кривых Безье. Задача другая: зафиксировать мысль, которую неудобно описывать словами. План комнаты, силуэт одежды, кривая загогулина «примерно вот так» — грубого наброска достаточно. Дальше вы добавляете описание стиля, и модель превращает каракули в готовое изображение. Художественные навыки не требуются: холст здесь — способ донести замысел, а не финальный артефакт.
Обратная ситуация — «хочу картинку, но не знаю, с какого промпта начать». Для неё есть шаблоны. Вы выбираете формат (плакат, мерч, товарное фото) и вместо пустого поля получаете структурированный набор вопросов, как в мастере настройки. Возьмём шаблон «Product photo»: загружаете снимок товара, указываете стиль — Clean Studio, Editorial или Lifestyle, — затем сцену, например Dark Studio, и только после этого запускается генерация. Порядок шагов задан заранее, так что первый промпт вы не изобретаете с нуля.
Правки тоже стали адресными. Кликните по нужной области картинки и напишите «уберите это» или «сделайте синим» — изменение затронет именно это место, а не всю сцену. Логика та же, что у комментариев арт-директора в Figma: замечание привязано к конкретному участку макета, а не к файлу целиком.
Под это подвели и полноценный тулбар в мобильной и веб-версии: Markup, Comment, Remove BG, Erase, Resize. Отдельно отметим историю версий — каждая правка сохраняется отдельным файлом, поэтому можно откатиться к любой из предыдущих картинок, а не пересобирать сцену заново.
Длинные диалоги и многокадровая согласованность
Проблема, знакомая каждому, кто собирал анимацию по кадрам: на десятом изображении персонаж уже не тот. Уши поменяли форму, куртка другого оттенка, свет падает с другой стороны. Каждая правка по отдельности выглядит нормально, а вместе они дают медленную мутацию.
В GPT Images 2.5 этот дрейф заметно слабее. Модель держит контекст предыдущих шагов: то, что вы сохранили раньше, остаётся на месте и на следующей итерации, а не пересобирается заново. Каждый кадр строится поверх уже сделанной работы.
Насколько это выдерживает нагрузку, показывает тест с пеликаном на велосипеде. 96 отдельных кадров — по одному за раз, без опоры на готовую раскадровку — а потом склейка в восьмисекундный ролик. Задача жёсткая: птица, велосипед и сцена должны оставаться собой на всём протяжении. Отдельные кадры всё ещё «скачут», но общая идентичность персонажа не распадается.
Более короткий пример — стоп-моушен из восьми последовательных кадров. Здесь сохранены и внешность животного, и освещение, и окружение: между кадрами нет «мутации», из-за которой персонаж на середине превращается в собственную подделку.
Механика тут та же, что и в точечном редактировании: меняется только названное, всё остальное удерживается. Разница в масштабе — не один предмет на фото, а серия шагов, где каждый следующий зависит от предыдущего. Именно на длинных цепочках раньше и рассыпалась картинка, а теперь — нет.
Кому и что делать: выводы и практический совет
GPT Images 2.5 — обновление не про «вау», а про предсказуемость: скорость выросла, правки стали точечными, а предыдущие изменения перестали разваливаться при следующем шаге. На LM Arena Sunburst набрал 1421 балл ELO, Flare — 1399, тогда как GPT-Image-2 (medium) остался на 1381. Разрыв небольшой, и это честно отражает суть релиза: не революция, а доведённая до надёжности итеративная работа.
Отсюда второй вывод: выбирать модель нужно под задачу, а не «по новизне». Flare жертвует частью качества ради скорости и подходит для массовой генерации — соцсети, товарные карточки, визуальный поиск. Sunburst медленнее, зато даёт больше контроля в точечных правках — рекламная графика, продуктовые снимки.
Практический совет для разработчиков с работающим продакшн-пайплайном на GPT Image 2: возьмите Flare и прогоните его на своих реальных данных. Один разработчик, который пропустил около 50 тысяч изображений через API, зафиксировал падение средней задержки со 104 секунд до 35–40 — это уже не «до 50%», а более чем двукратный выигрыш. Если ваша нагрузка чувствительна к времени ответа, проверьте эту разницу на своих запросах, прежде чем что-то менять в архитектуре.
А если вы просто пользуетесь ChatGPT — делать ничего не нужно: обновление пришло само.