Назад к блогу

Haiku 5.5: ступенчатая цена, скрытый расход токенов и API-кредиты подписчикам

Haiku 5.5: ступенчатая цена, скрытый расход токенов и API-кредиты подписчикам

Anthropic выпустила Haiku 5.5 — самую быструю модель линейки с новой ступенчатой ценой, которая формально выглядит рекордно дешёвой, но на деле скрывает подвох: расход токенов растёт, а длинные запросы дорожают в пять раз. Разбираем, как устроена новая тарификация, почему заявленная экономия может быть завышена и что означают API-кредиты для подписчиков на фоне снижения цены кеша у Sonnet 5.5.

7 октября 2026 года Anthropic выпустила Claude Haiku 5.5 — младшую модель линейки и самую быструю у компании. Она заменяет Haiku 4.5 и позиционируется для массовых недорогих задач: кратких пересказов, сжатия контекста, запросов к базам данных, классификации, а также как субагент для Opus 5.5 и Sonnet 5.5 в задачах программирования.

В тот же день компания снизила цену чтения из кеша у Sonnet 5.5 вдвое и добавила подписчикам Max и Team ежемесячные кредиты на API. Вместе эти шаги описываются как согласованное наступление на экономику агентов.

Что именно изменилось

Цена Haiku 5.5 ступенчатая по длине запроса, порог — 100 000 токенов. До порога вход стоит $0,10 за миллион токенов, выход — $0,50, чтение из кеша — $0,01. Свыше порога ставки вырастают в пять раз: $0,50 за вход, $2,50 за выход, $0,05 за чтение из кеша.

Prompt length   Input / output per 1M tokens   Cache reads per 1M
Under 100K      $0.10 / $0.50                  $0.01
Over 100K       $0.50 / $2.50                  $0.05

По данным Anthropic, в среднем модель обходится примерно на 75 % дешевле Haiku 4.5. Для запросов до 100 000 токенов цена ниже на 90 %: $0,10 за миллион входных и $0,50 за миллион выходных против $1 и $5 у Haiku 4.5. На длинных запросах скидка составляет 50 %.

Меняется и поведение модели. Haiku 5.5 — первая Haiku с настройками усилия (effort) и адаптивным мышлением. Отключить рассуждения нельзя, по умолчанию используется уровень medium; доступны уровни low, medium, high, xhigh и max. Haiku 4.5 уровни рассуждений не поддерживала.

Подписчикам добавили ежемесячные API-кредиты Claude Platform: $100 на тарифе Max 5x, $200 на Max 20x и до $500 на команду в Team с общим пулом. Кредиты работают с любой моделью, включая Haiku 5.5, и в сторонних обвязках. Одновременно цена чтения из кеша у Sonnet 5.5 снизилась с $0,20 до $0,10 за миллион токенов — по оценке Anthropic, это делает Sonnet 5.5 примерно на 20 % дешевле на большинстве длительных или агентных задач.

Предыстория

Haiku 4.5 вышла почти год назад и стоила $1 за миллион входных и $5 за миллион выходных токенов — в 10 раз дороже GPT-6 Luna от OpenAI, выпущенной месяцем ранее. Контекстное окно составляло 200k токенов. Защитные ограничения в области кибербезопасности у Haiku 4.5 были мягче, чем у Haiku 5.5.

По бенчмаркам предыдущая модель заметно отставала: 15,7 % в OSWorld 2.1 и ноль в Terminal-Bench 4.0. Новая модель набирает в них 72,4 % и 39,2 % соответственно.

Почему это сделали

Заявленная экономия от ступенчатой цены может быть завышена из-за расхода токенов. Интенсивное использование токенов — примерно в 3 раза больше, чем у Luna при максимальных усилиях, — частично компенсирует скидку за токен. На максимальном усилии модель тратит около 162k выходных токенов на задачу. Запросы длиннее 100K токенов стоят в 5 раз дороже, что важно для длинных агентных циклов.

Эти два эффекта, по мнению авторов разбора, объясняют расхождение между оценкой Cursor «в 10 раз дешевле на коротких запросах» и оценкой Anthropic «на 75 % дешевле в среднем». Заголовочная цена может преувеличивать реальную экономию.

Снижение цены кеша у Sonnet и API-кредиты подаются как согласованный шаг: кредиты работают с любой моделью и в сторонних обвязках. Внешние комментаторы трактуют снижение цены кеша как давление на OpenAI, а кредиты — как приглашение к ответу.

Что это меняет на практике

При миграции с Haiku 4.5 на Haiku 5.5 цена для запросов до 100 000 токенов падает на 90 %, на длинных запросах — на 50 %. Но токенизатор расходует примерно в 1,25 раза больше токенов на тот же длинный промпт, что создаёт скрытое удорожание: за одну и ту же задачу списывается больше токенов, поэтому реальная экономия оказывается меньше заявленной. По данным Anthropic, этот рост учтён в расчёте средней экономии.

Поведение тоже меняется: отключить рассуждения нельзя, по умолчанию medium. У модели строже защитные ограничения в кибербезопасности, чем у Haiku 4.5: она помогает с защитными задачами, но блокирует, например, тестирование на проникновение.

Для доступа через плагин llm-anthropic нужно обновить плагин и список моделей, после чего вызывать модель по имени с опцией усилия:

llm install -U llm-anthropic
llm anthropic refresh
llm -m claude-haiku-5.5 "..." -o thinking_effort low

Последний релиз плагина устранил необходимость выпускать новую версию под каждую новую модель.

Цифры и независимые оценки

Artificial Analysis приводит Intelligence Index 43 при максимальном усилии — на 26 пунктов выше предыдущей Haiku. Это немного впереди GLM-5.3 Flash (42), Gemini 3.8 Flash (41) и GPT-6 Luna (38), сопоставимо с Kimi K3 (44) и на 13 пунктов ниже Claude Sonnet 5.5 при максимальном усилии (56).

На Terminal-Bench 4.0 модель набирает 33 % (рост с 0 % у Haiku 4.5), на уровне GLM-5.3 Flash и впереди Gemini 3.8 Flash (20 %) и GPT-6 Luna (13 %). В AA-Briefcase — 1578 Elo , впереди Kimi K3 и GLM-5.3, сопоставимо с Muse Spark 1.3 на максимуме. В AA-Omniscience точность 36 % при уровне галлюцинаций 40 %, тогда как у Gemini 3.8 Flash 55 %/55 %, у GPT-6 Luna 44 %/77 %. В AutomationBench-AA — 35 % против 53–60 % у Luna, Gemini 3.8 Flash и GLM-5.3 Flash.

Ограничения и открытые вопросы

Стоимостные показатели предварительны: Artificial Analysis пока не моделирует пятикратный шаг цены выше 100K токенов, а цифры стоимости за задачу появятся позже. Независимые оценки стоимости за задачу ждут поддержки ступенчатого ценообразования. Часть заявлений о бенчмарках помечена как исходящая от вендора или из вторых рук.

Оценка AutomationBench-AA занижена из-за предрелизного бага безопасности, вызвавшего чрезмерные отказы; Anthropic работает над исправлением, и Artificial Analysis перезапустит оценку, ожидая роста результата. Основная оговорка — расход токенов. Оценки Arena ещё не готовы: модель добавлена в Agent Arena, Code Arena WebDev, Text, Document и Vision, но баллы ожидаются.

Источники

Похожее