Anthropic выпустила Claude Opus 5.5 — модель, которая позиционируется относительно Opus 5 как более дешёвая и быстрая, но не более качественная на задачах рассуждения. Сравнение обеих моделей на трёх задачах показало одинаковый результат: обе решили логическую сетку и игру в камни, обе провалили задачу упорядочивания.
Экономия оказалась не там, где можно было ожидать. Основная часть снижения стоимости пришлась на меньшее число выходных токенов, а собственно снижение цены даёт лишь 20%. При этом Opus 5.5 не позволяет отключать мышлениережим, в котором модель тратит токены на промежуточные рассуждения перед ответом.
Что именно изменилось
По тарифам Opus 5.5 стоит $4 за миллион входных и $20 за миллион выходных токенов против $5 и $25 у Opus 5. Общая стоимость теста составила $3.95 против $6.55.
По скорости Opus 5.5 писала 103.4 токена в секунду против 93.1 у Opus 5 — примерно на 11% быстрее. Максимальное преимущество на отдельной задаче составило 19%, что меньше заявленных Anthropic 30%.
На трёх задачах рассуждения модели выступили одинаково. Экономия в основном объясняется меньшим числом выходных токенов, а снижение цены даёт лишь 20%.
Отдельное изменение — мышление.
Как измеряли
Скорость считалась как среднее число выходных токенов в секунду по всем вызовам. Для каждого вызова фиксировались входные токены, выходные токены, стоимость по прайс-листу и время. Токены размышлениятокены, которые модель тратит на внутренние рассуждения перед ответом; они оплачиваются по тарифу выходных токенов, то есть как обычный текст ответа тарифицируются как выходные, поэтому включались в подсчёт. При нескольких прогонах метрики усреднялись, итоговая стоимость суммировалась.
Для сравнения взяли три задачи:
- Логическая сетка средней сложности. Семь инженеров, у каждого день дежурства, язык, сервис и город; 22 подсказки, из которых шесть условные или «ровно одна из этих истинна»; удаление любой одной подсказки ломает головоломку.
- Упорядочивание высокой сложности. Переставить 10 задач деплоя так, чтобы ни одна не осталась в исходном слоте и никакие две последовательно пронумерованные задачи не стояли рядом; посчитать для 6, 8 и 10 задач.
- Игра в камни повышенной сложности. Игроки убирают 2, 5, 7 или 11 камней, не повторяя последний ход соперника и свой собственный; определить победителя при 200 камнях, посчитать проигрышные стартовые размеры до 500 и назвать наименьший проигрышный размер выше 340.
Предыстория
До этого модели Opus тестировали на повседневных задачах разработчика: обе исправляли три подсаженных бага в Python-сервисе биллинга, разбирали 40 упавших CI-задач и отвечали на 20 вопросов о вымышленном SDK, не выдумывая ни одного метода. Затем применялись более сложные версии — разбор 3 664 строк посмертного отчёта об инциденте и реализация спецификации, оцениваемая 120 скрытыми тестами, — и обе модели прошли их идеально.
От обычного моделирования рабочего процесса разработчика отказались, потому что модели хорошо справлялись с повседневными задачами, а трудности возникали именно на задачах рассуждения. Обе модели вызывались через Anthropic API с идентичными промптами, с адаптивным мышлениемрежимом, в котором модель сама решает, сколько рассуждать перед ответом на уровне усилий по умолчаниюстандартной настройке того, насколько много модель размышляет, по одному прогону на задачу.
Почему это сделали
Модель предлагается выбирать по ситуации: там, где ошибка дорога и никто не проверяет результат, важнее точность, а не цена и скорость. Для массовой работы с проверкой результата человеком или тестами дешевизна и скорость оправдывают выбор более слабой по точности модели.
В тесте Opus 5.5 против Opus 5 обе модели показали одинаковый результат на сложных задачах, но Opus 5.5 был дешевле и быстрее. В тесте GPT-6 Solдругая тестируемая модель, с которой сравнивали Opus 5.5 против Opus 5.5 Sol был быстрее и дешевле, но ошибался на двух самых сложных тестах, и эти ошибки могли пройти незамеченными при проверке.
Что это меняет на практике
Переход на Opus 5.5 оправдан, если вы уже используете Opus 5: те же результаты на сложных рассуждениях за меньшие деньги и время. Opus 5.5 также оправдан там, где ошибка дорога и результат никто не проверяет, — например, финансовая сверка или отчёты об инцидентах, отправляемые напрямую клиентам.
Сопоставление с GPT-6 Sol показало, что на одиночной попытке модели сравнялись, но при повторных прогонах Opus 5.5 оказался точнее: он идеально прошёл все 15 запусков, а Sol — 12 из 15, промахнувшись на двух самых сложных тестах. Sol при этом был быстрее и дешевле на каждом тесте: его 15 запусков стоили $2.68 — около 16% от $16.72 у Opus 5.5. Для команд рекомендуется использовать Sol для высокообъёмной работы, где вывод проверяет человек или тестовый набор, например триаж, черновики и код, проходящий через CI, — при таких ценах можно позволить запустить его дважды и сравнить.
Для задач подсчёта вроде теста с упорядочиванием нужно дать модели инструмент исполнения кода, а не надеяться на рассуждения. Также следует ставить жёсткий лимит на выход, потому что обе модели могут думать около 20 минут и вернуть пустой результат, что важно при оплате за каждый токен.
Цифры по стоимости и объёму
В тестах с повторными прогонами фиксировались средние значения на прогон:
- CI triageЗадача разбора упавших CI-задач, на которой обе модели прошли 5 из 5, но Sol стоил 8% от стоимости Opus 5.5.: Opus 5.5 — 11 127 выходных токенов и $0.24, Sol — 1 143 токена и $0.02.
- Incident logs: Opus 5.5 — 53 308 выходных токенов и $1.68, Sol — 7 073 токена и $0.30.
- Resolver spec: Opus 5.5 — 70 687 выходных токенов и $1.42, Sol — 21 435 токенов и $0.22.
На incident logs Opus 5.5 был идеален все пять раз, а Sol — только дважды: два прогона пропустили одного и того же клиента, чей исходный платёж был подтверждён через 52 секунды после успешного повтора, а ещё один прогон насчитал 27 неудачных оформлений вместо 28. На resolver spec Opus 5.5 прошёл все тесты каждый раз, а Sol — четыре из пяти, оставив лишнюю закрывающую скобку на строке 78, из-за чего модуль упал при импорте и провалил все 120 тестов.
Ограничения и открытые вопросы
Заявленные Anthropic бенчмарки по кодингу, работе со знаниями и рассуждению не перепроверялись. Вместо этого обеим моделям дали три задачи на рассуждение, и они выступили одинаково.
По задаче с упорядочиванием ни одна модель не дала ответа: её трудно решить одним рассуждением, а запускать код в этом тесте модели не могли. При лимите вывода 48 000 токенов обе модели истратили весь бюджет на размышление и не ответили. При лимите 128 000 токенов Opus 5 завершил работу без ответа за более чем 25 минут и $3.20, а Opus 5.5 работал 19 минут, использовал 112 733 токена и завершился причиной остановкиполе ответа API, которое сообщает, почему генерация прекратилась: например, модель закончила ответ, достигла лимита токенов или прервалась по иной причине со значением refusalостановка, при которой API прекращает ответ, не выдав текста без текста — что, вероятнее всего, ошибка фильтра безопасности, сработавшего на безобидный запрос.
Остаётся невыясненным заявленное преимущество в скорости: 11% против обещанных Anthropic 30%.