Назад к блогу

Claude Opus 5.5: дешевле и быстрее Opus 5 при том же качестве рассуждений

Claude Opus 5.5: дешевле и быстрее Opus 5 при том же качестве рассуждений

Anthropic выпустила Claude Opus 5.5 — более дешёвую и быструю альтернативу Opus 5, которая, однако, не претендует на улучшение качества рассуждений. Сравнение на трёх специально подобранных задачах показало одинаковый результат у обеих моделей, что делает вопрос выбора между ними вопросом цены и скорости, а не точности. Отдельного внимания заслуживает то, как именно достигается экономия: основная выгода приходит не от снижения тарифов, а от изменившегося поведения модели при генерации ответов.

Anthropic выпустила Claude Opus 5.5 — модель, которая позиционируется относительно Opus 5 как более дешёвая и быстрая, но не более качественная на задачах рассуждения. Сравнение обеих моделей на трёх задачах показало одинаковый результат: обе решили логическую сетку и игру в камни, обе провалили задачу упорядочивания.

Экономия оказалась не там, где можно было ожидать. Основная часть снижения стоимости пришлась на меньшее число выходных токенов, а собственно снижение цены даёт лишь 20%. При этом Opus 5.5 не позволяет отключать мышление.

Что именно изменилось

По тарифам Opus 5.5 стоит $4 за миллион входных и $20 за миллион выходных токенов против $5 и $25 у Opus 5. Общая стоимость теста составила $3.95 против $6.55.

По скорости Opus 5.5 писала 103.4 токена в секунду против 93.1 у Opus 5 — примерно на 11% быстрее. Максимальное преимущество на отдельной задаче составило 19%, что меньше заявленных Anthropic 30%.

На трёх задачах рассуждения модели выступили одинаково. Экономия в основном объясняется меньшим числом выходных токенов, а снижение цены даёт лишь 20%.

Отдельное изменение — мышление.

Как измеряли

Скорость считалась как среднее число выходных токенов в секунду по всем вызовам. Для каждого вызова фиксировались входные токены, выходные токены, стоимость по прайс-листу и время. Токены размышления тарифицируются как выходные, поэтому включались в подсчёт. При нескольких прогонах метрики усреднялись, итоговая стоимость суммировалась.

Для сравнения взяли три задачи:

  • Логическая сетка средней сложности. Семь инженеров, у каждого день дежурства, язык, сервис и город; 22 подсказки, из которых шесть условные или «ровно одна из этих истинна»; удаление любой одной подсказки ломает головоломку.
  • Упорядочивание высокой сложности. Переставить 10 задач деплоя так, чтобы ни одна не осталась в исходном слоте и никакие две последовательно пронумерованные задачи не стояли рядом; посчитать для 6, 8 и 10 задач.
  • Игра в камни повышенной сложности. Игроки убирают 2, 5, 7 или 11 камней, не повторяя последний ход соперника и свой собственный; определить победителя при 200 камнях, посчитать проигрышные стартовые размеры до 500 и назвать наименьший проигрышный размер выше 340.

Предыстория

До этого модели Opus тестировали на повседневных задачах разработчика: обе исправляли три подсаженных бага в Python-сервисе биллинга, разбирали 40 упавших CI-задач и отвечали на 20 вопросов о вымышленном SDK, не выдумывая ни одного метода. Затем применялись более сложные версии — разбор 3 664 строк посмертного отчёта об инциденте и реализация спецификации, оцениваемая 120 скрытыми тестами, — и обе модели прошли их идеально.

От обычного моделирования рабочего процесса разработчика отказались, потому что модели хорошо справлялись с повседневными задачами, а трудности возникали именно на задачах рассуждения. Обе модели вызывались через Anthropic API с идентичными промптами, с адаптивным мышлением на уровне усилий по умолчанию, по одному прогону на задачу.

Почему это сделали

Модель предлагается выбирать по ситуации: там, где ошибка дорога и никто не проверяет результат, важнее точность, а не цена и скорость. Для массовой работы с проверкой результата человеком или тестами дешевизна и скорость оправдывают выбор более слабой по точности модели.

В тесте Opus 5.5 против Opus 5 обе модели показали одинаковый результат на сложных задачах, но Opus 5.5 был дешевле и быстрее. В тесте GPT-6 Sol против Opus 5.5 Sol был быстрее и дешевле, но ошибался на двух самых сложных тестах, и эти ошибки могли пройти незамеченными при проверке.

Что это меняет на практике

Переход на Opus 5.5 оправдан, если вы уже используете Opus 5: те же результаты на сложных рассуждениях за меньшие деньги и время. Opus 5.5 также оправдан там, где ошибка дорога и результат никто не проверяет, — например, финансовая сверка или отчёты об инцидентах, отправляемые напрямую клиентам.

Сопоставление с GPT-6 Sol показало, что на одиночной попытке модели сравнялись, но при повторных прогонах Opus 5.5 оказался точнее: он идеально прошёл все 15 запусков, а Sol — 12 из 15, промахнувшись на двух самых сложных тестах. Sol при этом был быстрее и дешевле на каждом тесте: его 15 запусков стоили $2.68 — около 16% от $16.72 у Opus 5.5. Для команд рекомендуется использовать Sol для высокообъёмной работы, где вывод проверяет человек или тестовый набор, например триаж, черновики и код, проходящий через CI, — при таких ценах можно позволить запустить его дважды и сравнить.

Для задач подсчёта вроде теста с упорядочиванием нужно дать модели инструмент исполнения кода, а не надеяться на рассуждения. Также следует ставить жёсткий лимит на выход, потому что обе модели могут думать около 20 минут и вернуть пустой результат, что важно при оплате за каждый токен.

Цифры по стоимости и объёму

В тестах с повторными прогонами фиксировались средние значения на прогон:

  • CI triage: Opus 5.5 — 11 127 выходных токенов и $0.24, Sol — 1 143 токена и $0.02.
  • Incident logs: Opus 5.5 — 53 308 выходных токенов и $1.68, Sol — 7 073 токена и $0.30.
  • Resolver spec: Opus 5.5 — 70 687 выходных токенов и $1.42, Sol — 21 435 токенов и $0.22.

На incident logs Opus 5.5 был идеален все пять раз, а Sol — только дважды: два прогона пропустили одного и того же клиента, чей исходный платёж был подтверждён через 52 секунды после успешного повтора, а ещё один прогон насчитал 27 неудачных оформлений вместо 28. На resolver spec Opus 5.5 прошёл все тесты каждый раз, а Sol — четыре из пяти, оставив лишнюю закрывающую скобку на строке 78, из-за чего модуль упал при импорте и провалил все 120 тестов.

Ограничения и открытые вопросы

Заявленные Anthropic бенчмарки по кодингу, работе со знаниями и рассуждению не перепроверялись. Вместо этого обеим моделям дали три задачи на рассуждение, и они выступили одинаково.

По задаче с упорядочиванием ни одна модель не дала ответа: её трудно решить одним рассуждением, а запускать код в этом тесте модели не могли. При лимите вывода 48 000 токенов обе модели истратили весь бюджет на размышление и не ответили. При лимите 128 000 токенов Opus 5 завершил работу без ответа за более чем 25 минут и $3.20, а Opus 5.5 работал 19 минут, использовал 112 733 токена и завершился причиной остановки со значением refusal без текста — что, вероятнее всего, ошибка фильтра безопасности, сработавшего на безобидный запрос.

Остаётся невыясненным заявленное преимущество в скорости: 11% против обещанных Anthropic 30%.

Источники

Похожее