OpenAI анонсировала GPT-6.1 Sol — обновление GPT-6 Sol, вышедшее всего через 7 дней после него. По данным Artificial Analysis, модель набирает на 4 пункта больше в Intelligence Indexсводный показатель уровня интеллекта модели в независимых тестах, чем GPT-6 Sol, и на 5 пунктов больше, чем GPT-5.6 Sol, оказываясь на 1 пункт ниже флагманской GPT-6 Astra. Цены остались на уровне GPT-6 Sol — $2 за миллион входных и $10 за миллион выходных токенов, — но скидка на чтение кэша выросла с 90% до 95%.
Что именно изменилось
Заявленное превосходство над GPT-6 Sol сосредоточено в сложной профессиональной работе: написание и отладка кода, понимание документов, многоэтапные бизнес-процессы. По замерам:
- DeepSWE v1.1 (решение задач разработки в реальных кодовых базах) — плюс 6,4 п. п. к лучшему результату GPT-6 Sol при меньших затратах;
- AutomationBench (выполнение многоэтапных бизнес-процессов агентами) — плюс 4,8 п. п. при среднем уровне усилий;
- OSWorld 2.0 (взаимодействие с компьютерными приложениями) — плюс 7 п. п. при максимальных усилиях и затратах более чем вдвое ниже;
- Terminal-Bench Science 0.1 (научные рабочие процессы) — более чем вдвое выше результата GPT-6 Sol при максимальных усилиях и стоимости более чем вдвое ниже;
- фактическая точность при очень высоком уровне усилий — 4,1% фактических ошибок против 4,5% у GPT-6 Sol.
Отдельно заявлены улучшения в тестах на соответствие человеческим намерениям и ценностям: модель реже скрывает неисправность инструментов поиска, нарушает явные ограничения или совершает несанкционированные действия в агентных задачах. Попыток обойти автоматическую систему проверки безопасности не зафиксировано.
Цены и token efficiency
Стандартные цены GPT-6.1 Sol — $2 за миллион входных токенов, $10 за миллион выходных, $0,10 за миллион кэшированных входных. У GPT-6 Astra — $10, $50 и $1 соответственно. То есть Sol в пять раз дешевле по входу и выходу и в десять раз по кэшу. Кэшированный вход на 95% ниже стандартной цены входных данных — это важно для агентных задач, где контекст переиспользуется в нескольких запросах.
token efficiencyпоказатель того, насколько экономно модель расходует выходные токены относительно достигаемого уровня интеллекта у GPT-6.1 Sol формально хуже: он тратит на 10–30% больше выходных токенов, чем GPT-6 Sol, при тех же настройках усилий. За счёт роста интеллекта часть настроек становится Pareto-оптимальнымитакими, что улучшение одного показателя уже невозможно без ухудшения другого по этому показателю. В нижней ценовой части Pareto frontierграницы множества достижимых комбинаций индекса и стоимости для Artificial Analysis Coding Agent Indexиндекса, оценивающего модели как агентов в задачах программирования GPT-6.1 Sol доминирует: он набирает на 1 балл больше GPT-6 Astra при менее чем 15% стоимости за задачу — это прирост 6 баллов относительно GPT-6 Sol.
Предыстория: что было не так с GPT-6 Sol
Независимое тестирование The New Stack на трёх тестах — CI triageпроверка, насколько правильно модель разбирает сбои непрерывной интеграции, Incident logsразбор журналов инцидентов с ответами на вопросы о произошедшем и Resolver specнаписание резолвера зависимостей по спецификации без запуска кода — выявило конкретные сбои GPT-6 Sol. В Resolver spec, где модель пишет dependency resolverкомпонент, который по спецификации зависимостей пакетов вычисляет порядок их установки для вымышленного пакетного менеджера по двухстраничной спецификации без запуска кода, а результат проверяется скрытым набором из 120 тестов, GPT-6 Sol оставил лишнюю скобку в одном прогоне, из-за чего резолвер упал. В Incident logs он пропустил клиента в двух прогонах и неверно посчитал неудачные проверки в третьем.
GPT-6.1 Sol и Astra в тех же условиях ответили на все семь вопросов Incident logs правильно в каждом прогоне и прошли все 120 скрытых тестов Resolver spec в каждом прогоне. Вызовы шли через OpenAI Responses API с одинаковыми промптами, с максимальным уровнем усилия на рассужденияНастройка, задающая, сколько вычислений модель тратит на обдумывание ответа. — reasoning effortнастройкой, задающей, сколько вычислений модель тратит на обдумывание ответа — и лимитом вывода 64 000 токенов.
Почему это сделали
Позиционирование строится на цене при близком качестве: обновление приближает линейку Sol к GPT-6 Astra в сложных задачах при тарифах в пять раз ниже. В тестах The New Stack обе модели дали все ответы верно, но GPT-6.1 Sol обошёлся менее чем в пятую часть цены Astra. По совокупности 15 прогонов GPT-6.1 Sol стоил $2,66 против $14,77 у Astra — 18% от стоимости Astra, что близко к заявленной пятой части. В Resolver spec разрыв по стоимости отдельного запуска — $0,20 против $1,28, по времени — 7 минут 7 секунд против 10 минут 6 секунд, по объёму вывода — 19 637 токенов против 25 207.
Что это меняет на практике
В Resolver spec обе модели прошли все 120 скрытых тестов на каждом запуске, при этом GPT-6.1 Sol быстрее и дешевле — это сценарий, где замена Astra на Sol не требует компромисса по точности. В CI triage точность совпала, Astra выиграла по скорости, GPT-6.1 Sol — по стоимости. В Incident logs точность совпала, GPT-6.1 Sol выиграл и по скорости, и по стоимости. В OSWorld 2.0 Sol отстаёт от Astra на 2,1 п. п. при стоимости примерно в семь раз ниже. Автор тестов заключает, что использовал бы GPT-6.1 Sol для такой работы, поскольку не увидел причины платить за Astra.
Ограничения и открытые вопросы
GPT-6.1 Sol всё ещё уступает Astra в задачах взаимодействия с компьютерными приложениями (2,1 п. п. в OSWorld 2.0) и немного проигрывает по фактической точности при очень высоком уровне усилий: 4,1% ошибок против 4,0% у Astra. Автор независимого тестирования оговаривает, что его тесты не доказывают равенства моделей во всём, и индекс Artificial Analysis всё ещё ставит Astra немного впереди при максимальном усилии. В обычном чате ChatGPT новая модель пока недоступна.