Сколько стоят токены ИИ-агента: как посчитать бюджет до внедрения
Счёт за ИИ-агента считается отдельно за вход и выход, и вход обычно съедает большую часть бюджета. Показываю арифметику на реальных тарифах и приёмы, которые режут сумму почти вдвое.
Коротко (TL;DR)
- Счёт считается отдельно за вход и выход. Формула: диалоги, умноженные на сообщения, на токены в запросе и на цену за миллион.
- Главный источник перерасхода — не длинные ответы, а длинный вход: инструкция и фрагменты базы знаний уходят в каждый запрос.
- На тарифах Qwen3.8-Max-0902 (вход 2 доллара за 1 млн токенов, выход 6) типовой консультант поддержки при моих допущениях выходит примерно в 83 доллара в месяц, а с кэшированием — почти вдвое дешевле.
- Цена — только один конец сделки. Второй — скорость, лимиты и юрисдикция данных. Тарифы меняются, сверяйтесь с официальными страницами.
Токены ИИ-агента — это единицы текста, в которых провайдер считает оплату: отдельно за то, что вы отправили в модель (входные токены), и отдельно за то, что она сгенерировала (выходные). Бюджет на месяц считается до внедрения, а не по факту первого счёта, и делается это обычной арифметикой. Разбираю, из чего складывается сумма, показываю расчёт на реальных тарифах и делюсь методикой, по которой я закладываю бюджет на проектах.
Что такое токен и почему вход и выход считают отдельно
Модель работает не с буквами, а с кусочками текста. Один токен — примерно 2-3 символа русского текста; точное соотношение зависит от токенизатора, и на русском оно хуже, чем на английском. Прикидка: страница текста — порядка 500-700 токенов.
Разделение на вход и выход неслучайно. Входные токены модель обрабатывает параллельно, это дёшево. Выходные генерирует по одному, каждый следующий зависит от предыдущего, и это дорого. У Qwen3.8-Max-0902 разрыв трёхкратный: 2 доллара за миллион входных против 6 за миллион выходных.
Во входные токены попадает всё, что вы отправили: инструкция, описание инструментов, фрагменты базы знаний, история переписки и сам вопрос. Это и есть место, где бюджеты неожиданно вырастают.
Из чего складывается счёт за месяц
Базовая формула простая: диалоги, умноженные на число сообщений, дают количество запросов, у каждого свой вход и выход. Но есть множители, о которых на старте почти никто не думает, и первым делом я проверяю именно их.
- Системная инструкция уходит в каждый запрос. Регламент на две страницы — это 1200-1500 токенов при каждом сообщении, а не один раз за диалог.
- Контекст из базы знаний. Пять фрагментов по 400 токенов дают плюс 2000 к каждому запросу.
- История переписки. К шестому сообщению вы отправляете пять предыдущих пар вопрос-ответ.
- Описание инструментов. Каждая подключённая функция — это её схема в каждом запросе.
- Повторные попытки. Ошибки, таймауты, перезапросы после неудачного вызова инструмента — надбавка сверх идеального расчёта.
Расчёт на примере: консультант поддержки
Считаю на тарифах Qwen3.8-Max-0902: вход 2 доллара за 1 млн токенов, выход 6, явное попадание в кэш 0,17, неявное 0,25. Параметры ниже — мои допущения для иллюстрации метода, а не чей-то реальный проект: 1000 диалогов в месяц, по 6 сообщений пользователя (итого 6000 запросов). На вход в среднем 6000 токенов — инструкция и инструменты около 1500, база знаний около 2000, история и вопрос около 2500. Ответы короткие, по 300 токенов.
| Статья | Объём | Цена за 1 млн | Итого |
|---|---|---|---|
| Входные токены | 6000 x 6000 = 36 млн | 2 доллара | 72 доллара |
| Выходные токены | 6000 x 300 = 1,8 млн | 6 долларов | 10,8 доллара |
| Всего за месяц | — | — | около 83 долларов |
При условном курсе 90 рублей за доллар это порядка 7,5 тысячи рублей в месяц; курс берите актуальный на день расчёта.
Обратите внимание на пропорцию: вход съедает 87 процентов бюджета. Здесь и работает кэширование. Из 6000 входных токенов около 3500 — стабильный префикс: инструкция, описание инструментов, неизменные блоки регламента. В кэше он считается по 0,17 доллара за миллион вместо 2.
- Кэшируемая часть: 6000 x 3500 = 21 млн токенов. По обычной цене 42 доллара, по цене попадания в кэш — около 3,6.
- Некэшируемая часть входа: 6000 x 2500 = 15 млн токенов, это 30 долларов.
- Выход не меняется: 10,8 доллара.
- Итого около 44 долларов вместо 83. При неявном попадании в кэш по 0,25 — около 46.
Одна архитектурная деталь — стабильный префикс запроса — экономит почти половину бюджета и масштабируется линейно. Хотите такую таблицу под свой сценарий, а не под мои допущения, — считаю по вашим цифрам: обращения, объём базы знаний, инструменты. Общие вилки по проектам собраны в статье сколько стоит ИИ-агент для продаж.
Чем дело не ограничивается: скорость, лимиты, юрисдикция
Цена за токен — только один конец сделки. Второй — скорость. По анонсу от 31 августа 2026 года Cerebras начинает хостить Qwen 3.8 27B с 3 сентября со скоростью более 2000 токенов в секунду. Для сравнения: ChatGPT обычно выдаёт около 50-100 токенов в секунду, быстрый режим Codex — примерно 150-200. Разница не академическая: ответ за три секунды вместо тридцати — это другой процент доведённых до конца диалогов, а в агентных сценариях из десяти шагов скорость решает, дождётся ли клиент вообще.
- Лимиты. Ограничения по запросам в минуту упираются в пиковую нагрузку раньше, чем в бюджет.
- Стабильность. Модель с регулярными сбоями в поддержке ведёт себя иначе, чем доступная 99 процентов времени.
- Юрисдикция данных. Если в запросах есть персональные данные, вопрос 152-ФЗ возникает раньше вопроса цены.
- Когда выгоднее локальная модель. Счёта за токены нет вовсе, зато есть железо и человек. Порог разбирал в сравнении локальный LLM против облака.
Методика: как я закладываю бюджет на проекте
Расчёт на салфетке нужен, чтобы понять порядок величины. Дальше работает другое.
- Считать по логам пилота, а не по прикидкам. Две недели на реальных обращениях дают распределение длин и частоту перезапросов. Прикидки ошибаются в разы, логи — на проценты.
- Резать системную инструкцию. Две страницы обычно сжимаются вдвое без потери качества.
- Кэшировать стабильный префикс. Всё неизменное — в начало запроса, меняющееся — в конец.
- Ограничивать историю. Окно последних сообщений плюс краткая сводка. Экономит и деньги, и качество ответов.
- Ставить дневной лимит и алерт. Ошибка в цикле не должна обнаруживаться в конце месяца по счёту.
- Пересчитывать при смене модели. Тарифы меняются; смена без пересчёта — лотерея.
Честная оговорка: цифры выше взяты из публикаций начала сентября 2026 года. Тарифы и лимиты провайдеры меняют, поэтому перед подписанием сметы сверяйтесь с официальными страницами цен. Не меняется методика: логи вместо догадок, кэш вместо повторов, лимит вместо сюрприза.
Если считать это самим не хочется — я беру сценарий, собираю пилот, снимаю логи и выдаю смету с разбивкой по статьям, а затем внедряю агента с ограничением расходов и мониторингом. Порядок работы по этапам — на странице внедрения ИИ за 90 дней.
Частые вопросы
Сколько символов в одном токене?
Примерно 2-3 символа русского текста, точное соотношение зависит от токенизатора. Страница текста — порядка 500-700 токенов. На английском токенизация экономнее, поэтому тот же текст на русском обходится дороже.
Почему выходные токены стоят дороже входных?
Входные модель обрабатывает параллельно, а выходные генерирует последовательно, по одному. У Qwen3.8-Max-0902 разница трёхкратная: 2 доллара за миллион на входе против 6 на выходе.
Что такое кэширование входных токенов и сколько оно экономит?
Провайдер запоминает неизменное начало запроса и берёт за него сниженную цену. В расчёте выше кэш по 0,17 доллара за миллион вместо 2 уменьшил счёт с 83 до 44 долларов.
Сколько стоит ИИ-агент поддержки в месяц по токенам?
При допущениях 1000 диалогов, 6 сообщений, 6000 входных и 300 выходных токенов на запрос — около 83 долларов в месяц, или порядка 44 с кэшированием. Ваши цифры будут другими.
Когда выгоднее локальная модель вместо оплаты за токены?
Когда объём запросов стабильно большой, данные чувствительные или счёт за API сопоставим со стоимостью железа за год. Ниже этого порога облако дешевле. Полная картина затрат — в статье сколько стоит внедрить ИИ.
Коротко о главном
Бюджет ИИ-агента — это арифметика, а не гадание. Умножаете диалоги на сообщения, сообщения на токены, токены на цену — и получаете порядок величины за десять минут. Дальше решают детали: длина инструкции, объём контекста, глубина истории и кэширование префикса.
С чего начнём: присылаете сценарий — сколько обращений в месяц, о чём спрашивают, какие документы должен знать агент. Я считаю смету по токенам с разбивкой на вход, выход и кэш и говорю, если в вашем случае дешевле локальная модель. Дальше собираю агента с дневным лимитом трат, алертами и отчётностью — порядок работы на странице внедрения ИИ-агентов. Про окупаемость такого проекта — в разборе окупаемости ИИ-агентов.
Что я делаю для бизнеса
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


