Claude Haiku 5.5: самая дешёвая модель для массовых простых задач
7 октября 2026 года Anthropic выпустила Claude Haiku 5.5: 0,10 доллара за миллион входных и 0,50 за выходные токены для запросов до 100 тысяч. Разбираю, какие задачи бота модель закрывает, где слабее, как выглядит схема «дешёвая модель на входе, сильная на сложных» на условном расчёте и как проверить качество на своих данных.
Сделаю под ключ: разберу задачу, назову срок и цену. Чтобы начать, напишите в Telegram одной фразой.
ИИ-агенты под ключЧто вышло и что я проверил
Haiku 5.5 вышла 7 октября 2026 года. Цифры я сверил с анонсом Anthropic, страницей цен и страницей модели.
Подтверждено. Для запросов до 100 тысяч входных токенов: вход 0,10 доллара, выход 0,50, запись в кэш на 5 минут 0,125, на час 0,20, чтение кэша 0,01. Для запросов длиннее 100 тысяч: 0,50, 2,50 и чтение кэша 0,05. Порог считается по всем входным токенам, включая кэш. Пакетный режим даёт скидку 50 процентов. Контекст 1 миллион токенов вместо 200 тысяч, вывод до 128 тысяч. ID claude-haiku-5-5, доступна в Claude API, Amazon Bedrock, Google Cloud и Microsoft Foundry.
Пересказ про 75 и 90 процентов подтвердился. Anthropic пишет: в среднем модель дешевле Haiku 4.5 на 75 процентов, на запросах до 100 тысяч токенов на 90, на более длинных на 50. Разницу она объясняет тем, что около 90 процентов запросов к Haiku 4.5 были короче 100 тысяч. Токенизатор новый: по документации тот же текст даёт примерно на 30 процентов больше токенов, чем на Haiku 4.5. Anthropic говорит, что её цифры экономии это учитывают. Это первый Haiku с настройкой effort: по умолчанию medium, уровни low, medium, high, xhigh и max. Бенчмарки в анонсе заявлены самой Anthropic, независимых замеров не нашёл.
Где модели такого класса достаточно
Anthropic пишет, что Haiku 5.5 создана для массовых задач: классификация, извлечение данных, маршрутизация, подзадачи агентов. Я бы отдавал ей такое:
- разметка входящих заявок: тема, срочность, язык, тональность;
- извлечение полей из писем и чеков: сумма, дата, номер заказа, реквизиты, ответ в JSON;
- короткие ответы по FAQ, когда нужный кусок базы знаний уже найден и подан в запрос;
- маршрутизация обращений по темам;
- предварительная проверка текста перед отправкой: пустые поля, грубость, лишние обещания.
Список мой, в документации его нет.
Где она слабее и что с доступом
Сама Anthropic оставляет сложную агентную работу за Sonnet 5.5 и Opus 5.5, а в руководстве по промптам перечисляет слабые места Haiku. На уровне low в длинных промптах модель чаще пропускает поиск и останавливается раньше времени. В чат-боте она может перестать держаться системной инструкции, если пользователь спорит или настаивает. При low или выключенном thinking в ответ клиенту иногда попадает текст рассуждений. Ещё одна новость: классификаторы безопасности могут отклонить запрос, тогда приходит stop_reason: "refusal". Серверного запасного варианта нет, повтор обычно даёт тот же отказ, обрабатывайте это в коде.
От себя: юридически чувствительные ответы, длинные рассуждения над договором и сложные продажи с возражениями я бы не отдавал самой дешёвой модели. Это мнение, проверяйте на своих диалогах.
Доступ и оплата из России: уточняйте, подтверждения не искал. Данные клиентов в запросе это передача за рубеж, как в разборе про токен GPT-6.1 Sol, и вопрос к юристу. Запасной вариант на российских моделях описан в сравнении GigaChat, YandexGPT и ChatGPT.
Бюджет на 1000 обращений: условный пример
Допущения: 1000 обращений в месяц, по одному запросу на обращение. Вход 2500 токенов (инструкция 1500, остальное 1000). Haiku отвечает 300 токенами, Sonnet 5.5 развёрнутым ответом в 600. Цены Sonnet 5.5 по той же странице: 2 и 10 долларов. Сложных обращений 20 процентов. Курс условный, 90 рублей.
- Всё на Sonnet: вход 2,5 млн × 2 = 5 долларов, выход 0,6 млн × 10 = 6. Итого 11 долларов, около 990 рублей.
- Всё на Haiku: вход 2,5 млн × 0,10 = 0,25, выход 0,3 млн × 0,50 = 0,15. Итого 0,40 доллара, около 36 рублей.
- Схема «Haiku на входе, Sonnet на сложных»: Haiku видит все 1000 обращений (0,40 доллара), Sonnet получает 200 (вход 0,5 млн × 2 = 1, выход 0,12 млн × 10 = 1,2, итого 2,20). Всего 2,60 доллара, около 234 рублей, в 4,2 раза дешевле схемы «всё на Sonnet».
Кэш добавляет немного. Если 1500 токенов инструкции читаются из кэша, они стоят 0,015 доллара вместо 0,15, и Haiku обходится примерно в 0,27 доллара. Это если запросы идут чаще раза в пять минут: иначе кэш протухает, и запись в него (0,125 за миллион) съедает выигрыш. Размышления модели входят в max_tokens, реальную длину выхода смотрите в поле usage ответа API.
На 1000 обращений токены стоят копейки. Счёт растёт от длинных диалогов и большой базы знаний, как в статье про маршрутизацию моделей.
Как проверить качество и не сломать бота при смене модели
Берёте 30-50 реальных обращений с эталонной разметкой и прогоняете через Haiku 5.5 на двух-трёх уровнях effort. Методика описана в статье про тест на 30 вопросов. Считайте долю верных меток и валидного JSON, число отказов refusal, длину ответов. Порог роутинга ставьте по набору: низкая уверенность Haiku и чувствительные темы всегда уходят наверх.
Документация перечисляет, что ломается в коде при смене модели. Любое значение temperature, top_p или top_k, кроме значений по умолчанию, даёт ошибку 400. Предзаполнение ответа (prefill) тоже даёт ошибку. Ручной бюджет размышлений через budget_tokens заменён на effort. Ответ может начинаться с блока thinking, блок выбирайте по полю type. Прежнюю модель держите в запасе и включайте новую сначала на малой доле обращений, как в статье про откат при смене версии.
Что можно сделать уже сейчас
Соберите золотой набор. Возьмите последние 200 заявок, 50 разметьте вручную.
Посчитайте свой счёт. Подставьте токены из логов в расчёт выше.
Прогоните набор на трёх уровнях effort. Medium, low, high: сравните качество и длину выхода.
Соберите роутинг. Простое решает дешёвая модель, спорное уходит сильной или человеку. Помогу в рамках разработки ИИ-агентов под ключ.
Частые вопросы
Haiku 5.5 дешевле Haiku 4.5 в десять раз?
По прайсу за токен да, 0,10 против 1 доллара на входе. Средняя экономия по оценке Anthropic около 75 процентов: запросы длиннее 100 тысяч токенов дешевле лишь вдвое.
Можно ли отдать модели всех клиентов?
Начните с разметки и извлечения полей, сложные вопросы оставьте сильной модели. Границу покажет ваш набор данных.
Что если провайдер недоступен из России?
Доступ и оплату уточняйте, я их не проверял. Закладывайте запасную модель, в том числе российскую, и проверяйте её на том же наборе.
Коротко о главном
Haiku 5.5 стоит 0,10 и 0,50 доллара за миллион токенов для запросов до 100 тысяч, средняя экономия против Haiku 4.5 по оценке Anthropic около 75 процентов. Для разметки, извлечения полей и простых ответов её стоит проверить первой.
Если хотите, чтобы я пересчитал бюджет вашего бота и собрал золотой набор с роутингом по уверенности, напишите мне в Telegram кодовое слово «МАЛЫШ», пришлю шаблон расчёта.
Что я делаю для бизнеса
Напишите одной фразой, что нужно. Отвечу, что подойдёт, сколько займёт и сколько стоит. Сообщение уже подготовлено.
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


