Назад к блогу

GPT-6.1 Sol: обновление через неделю после предшественника и впятеро дешевле флагмана

GPT-6.1 Sol: обновление через неделю после предшественника и впятеро дешевле флагмана

OpenAI выпустила GPT-6.1 Sol — промежуточное обновление всего через неделю после GPT-6 Sol, которое почти догнало флагманскую GPT-6 Astra по сложным задачам, но стоит в пять раз дешевле. Разбираем, что реально изменилось в бенчмарках, где предшественник проваливался и почему это меняет расклад на рынке доступных агентных моделей.

OpenAI анонсировала GPT-6.1 Sol — обновление GPT-6 Sol, вышедшее всего через 7 дней после него. По данным Artificial Analysis, модель набирает на 4 пункта больше в Intelligence Index, чем GPT-6 Sol, и на 5 пунктов больше, чем GPT-5.6 Sol, оказываясь на 1 пункт ниже флагманской GPT-6 Astra. Цены остались на уровне GPT-6 Sol — $2 за миллион входных и $10 за миллион выходных токенов, — но скидка на чтение кэша выросла с 90% до 95%.

Что именно изменилось

Заявленное превосходство над GPT-6 Sol сосредоточено в сложной профессиональной работе: написание и отладка кода, понимание документов, многоэтапные бизнес-процессы. По замерам:

  • DeepSWE v1.1 (решение задач разработки в реальных кодовых базах) — плюс 6,4 п. п. к лучшему результату GPT-6 Sol при меньших затратах;
  • AutomationBench (выполнение многоэтапных бизнес-процессов агентами) — плюс 4,8 п. п. при среднем уровне усилий;
  • OSWorld 2.0 (взаимодействие с компьютерными приложениями) — плюс 7 п. п. при максимальных усилиях и затратах более чем вдвое ниже;
  • Terminal-Bench Science 0.1 (научные рабочие процессы) — более чем вдвое выше результата GPT-6 Sol при максимальных усилиях и стоимости более чем вдвое ниже;
  • фактическая точность при очень высоком уровне усилий — 4,1% фактических ошибок против 4,5% у GPT-6 Sol.

Отдельно заявлены улучшения в тестах на соответствие человеческим намерениям и ценностям: модель реже скрывает неисправность инструментов поиска, нарушает явные ограничения или совершает несанкционированные действия в агентных задачах. Попыток обойти автоматическую систему проверки безопасности не зафиксировано.

Цены и token efficiency

Стандартные цены GPT-6.1 Sol — $2 за миллион входных токенов, $10 за миллион выходных, $0,10 за миллион кэшированных входных. У GPT-6 Astra — $10, $50 и $1 соответственно. То есть Sol в пять раз дешевле по входу и выходу и в десять раз по кэшу. Кэшированный вход на 95% ниже стандартной цены входных данных — это важно для агентных задач, где контекст переиспользуется в нескольких запросах.

token efficiency у GPT-6.1 Sol формально хуже: он тратит на 10–30% больше выходных токенов, чем GPT-6 Sol, при тех же настройках усилий. За счёт роста интеллекта часть настроек становится Pareto-оптимальными по этому показателю. В нижней ценовой части Pareto frontier для Artificial Analysis Coding Agent Index GPT-6.1 Sol доминирует: он набирает на 1 балл больше GPT-6 Astra при менее чем 15% стоимости за задачу — это прирост 6 баллов относительно GPT-6 Sol.

Предыстория: что было не так с GPT-6 Sol

Независимое тестирование The New Stack на трёх тестах — CI triage, Incident logs и Resolver spec — выявило конкретные сбои GPT-6 Sol. В Resolver spec, где модель пишет dependency resolver для вымышленного пакетного менеджера по двухстраничной спецификации без запуска кода, а результат проверяется скрытым набором из 120 тестов, GPT-6 Sol оставил лишнюю скобку в одном прогоне, из-за чего резолвер упал. В Incident logs он пропустил клиента в двух прогонах и неверно посчитал неудачные проверки в третьем.

GPT-6.1 Sol и Astra в тех же условиях ответили на все семь вопросов Incident logs правильно в каждом прогоне и прошли все 120 скрытых тестов Resolver spec в каждом прогоне. Вызовы шли через OpenAI Responses API с одинаковыми промптами, с максимальным уровнем усилия на рассуждения — reasoning effort — и лимитом вывода 64 000 токенов.

Почему это сделали

Позиционирование строится на цене при близком качестве: обновление приближает линейку Sol к GPT-6 Astra в сложных задачах при тарифах в пять раз ниже. В тестах The New Stack обе модели дали все ответы верно, но GPT-6.1 Sol обошёлся менее чем в пятую часть цены Astra. По совокупности 15 прогонов GPT-6.1 Sol стоил $2,66 против $14,77 у Astra — 18% от стоимости Astra, что близко к заявленной пятой части. В Resolver spec разрыв по стоимости отдельного запуска — $0,20 против $1,28, по времени — 7 минут 7 секунд против 10 минут 6 секунд, по объёму вывода — 19 637 токенов против 25 207.

Что это меняет на практике

В Resolver spec обе модели прошли все 120 скрытых тестов на каждом запуске, при этом GPT-6.1 Sol быстрее и дешевле — это сценарий, где замена Astra на Sol не требует компромисса по точности. В CI triage точность совпала, Astra выиграла по скорости, GPT-6.1 Sol — по стоимости. В Incident logs точность совпала, GPT-6.1 Sol выиграл и по скорости, и по стоимости. В OSWorld 2.0 Sol отстаёт от Astra на 2,1 п. п. при стоимости примерно в семь раз ниже. Автор тестов заключает, что использовал бы GPT-6.1 Sol для такой работы, поскольку не увидел причины платить за Astra.

Ограничения и открытые вопросы

GPT-6.1 Sol всё ещё уступает Astra в задачах взаимодействия с компьютерными приложениями (2,1 п. п. в OSWorld 2.0) и немного проигрывает по фактической точности при очень высоком уровне усилий: 4,1% ошибок против 4,0% у Astra. Автор независимого тестирования оговаривает, что его тесты не доказывают равенства моделей во всём, и индекс Artificial Analysis всё ещё ставит Astra немного впереди при максимальном усилии. В обычном чате ChatGPT новая модель пока недоступна.

Источники

Похожее