Сколько стоит выполненная задача агента: разбор Hermes Index
Nous Research опубликовала Hermes Index: рейтинг моделей в агенте Hermes Agent с баллом и ценой одной задачи. Разбираю, почему цена токена и цена принятого результата расходятся, и считаю на условном примере 3 моделей и 30 задач с учётом повторов и времени человека.
Сделаю под ключ: разберу задачу, назову срок и цену. Чтобы начать, напишите в Telegram одной фразой.
ИТ-аудит и проверка ИИ-решенияЧто опубликовали и что я проверил
Nous Research запустила Hermes Index 6 октября 2026 года. Дату я знаю по анонсам в X, на которые ссылается главная страница nousresearch.com (сами посты не открывал), и по пересказам в прессе. На странице рейтинга даты нет, статьи в блоге Nous я не нашёл.
Первоисточник цифр: страница Hermes Index. Индекс считается как средний балл и средняя цена задачи по четырём тестам: Terminal-Bench 4, Terminal-Bench Science, SkillsBench и новому Hermes Bench. Все модели идут через один и тот же Hermes Agent, с высоким уровнем рассуждения там, где модель его поддерживает. Каждая задача решается с одной попытки. Агент открытый, лицензия MIT по файлу LICENSE в репозитории.
Hermes Bench состоит из 150 задач в 25 категориях. Агент стартует в рабочей папке с настоящими файлами, итоговое состояние проверяют автоматически, местами с моделью-судьёй. Мои цифры из таблицы на 9 октября, в рейтинге 14 моделей:
- Claude Opus 5.5: 63,31 балла, 4,99 доллара за задачу.
- GPT 6 Astra: 56,25 и 11,61, самая дорогая задача в таблице.
- Claude Sonnet 5.5: 53,14 и 2,82.
- GPT 6 Sol: 44,10 и 2,23.
- DeepSeek V4.1 Flash: 36,91 и 0,259.
- GPT 6 Luna: 33,89 и 0,141.
Границу Парето по цене страница показывает сама: Opus, Sonnet, Sol, DeepSeek V4.1 Flash, Luna и Ling 3.0 Flash. У Opus и Sonnet итоговая цена стоит со звёздочкой, то есть это частичный прогон или оценка до полного перезапуска.
Цена токена и цена результата
В таблице видно, что цена задачи зависит не только от прайса. Grok 4.7 стоит 10,77 доллара за задачу, в 2,2 раза дороже Opus, а балл у него 39,32. DeepSeek V4.1 Flash дешевле Opus примерно в 19 раз и набирает 58 процентов его балла. Про токены я писал в разборе стоимости токенов ИИ-агента, а недавно считал, как подешевевший токен GPT-6.1 Sol меняет бюджет бота. Рейтинг добавляет второй слой: сколько токенов модель сжигает, пока делает работу.
Для своего процесса я считаю так:
стоимость принятой задачи = (расход на токены + повторные попытки + проверка человеком) / доля решённых.
Если грубо поделить цену задачи на балл, получится Opus 7,88 доллара, Sonnet 5,31, Sol 5,06, DeepSeek Flash 0,70, Luna 0,42, Astra 20,64. Это моя арифметика, такой колонки у Nous нет, а средний балл с частичным зачётом не равен доле решённых задач. Цифры дают порядок величин, проверки человеком в них нет.
Условный пример: 3 модели, 30 задач
Это условный пример, не замер моего или чужого проекта. Допущения: 30 одинаковых задач вроде разбора обращений. Час человека стоит 600 рублей, то есть 10 рублей за минуту. Проверка одного результата занимает 2 минуты. Модели обозначены буквами.
- Модель А, дешёвая: попытка 2 рубля, в среднем 2 попытки на задачу (60 попыток), принято 18 из 30. Токены 120 рублей, проверка 1200, итого 1320. На принятую задачу 73 рубля.
- Модель Б, средняя: попытка 12 рублей, 1,3 попытки (39 попыток), принято 24. Токены 468, проверка 780, итого 1248. На принятую 52 рубля.
- Модель В, сильная: попытка 40 рублей, одна попытка на задачу, принято 28. Токены 1200, проверка 600, итого 1800. На принятую 64 рубля.
Попытка у А в 20 раз дешевле, чем у В, а принятая задача дешевле всего у Б. Время человека перевешивает токены. Если проверка автоматическая и стоит ноль, картина другая: на принятую задачу А выходит 6,7 рубля, Б 19,5, В 42,9.
Роутинг: дешёвая на простое, сильная на сложное
Отсюда схема, которую я ставлю. Простые обращения идут на дешёвую модель: статус заказа, час работы, повторяющиеся шаблонные ответы. Если ответ не прошёл проверку или вопрос длинный и неоднозначный, задача уходит на сильную модель. Человек подключается там, где ошибка стоит дороже правки: деньги, договоры, жалобы.
Правило передачи должно быть измеримым: например, дешёвая модель отвечает только при уверенном совпадении с базой знаний. Как собрать набор задач для такой проверки, я описывал в статье про тест на 30 вопросов. Там же объяснено, почему результат зависит от обвязки. Какую модель брать под какую роль, разбирал в материале как не переплатить за модель для бота.
Что важно учесть
Один рейтинг не решение. Он измерен в обвязке Hermes Agent, при высоком уровне рассуждения и с одной попыткой. В другой обвязке, с меньшим рассуждением или с повторами цифры и цена изменятся. Terminal-Bench 4 прогнан без четырёх задач на GPU. В SkillsBench часть агентов нашла в открытом репозитории готовые решения, поэтому засчитывается очищенный балл, а сырой лежит рядом.
Задачи рейтинга терминальные, про файлы и инструменты. Переписки с клиентом и работы с 1С в них нет, цифры на бизнес-процесс не переносятся. Пресса отмечает и другое: Nous сама оценивает модели в своём фреймворке, на котором строит корпоративные продукты. Это комментарий Crypto Briefing, вторичный источник.
Цены меняются, рейтинг живой, и страница может измениться после моей проверки. Доступ к API и оплата из России зависят от провайдера, условия уточняйте.
Что можно сделать уже сейчас
Соберите 30 реальных задач. Обращения, письма, заявки, по которым вы знаете правильный результат. Без этого сравнивать модели нечем.
Замерьте три числа. Среднюю цену попытки из логов провайдера, число попыток на задачу и минуты, которые человек тратит на проверку и правку.
Пересчитайте формулу для каждой модели. Две-три модели хватит. Повторяйте при смене версии: цены и модели меняются быстро. Метод оценки качества описан в статье как оценить качество ИИ-бота.
Разделите поток. Простое отдайте дешёвой модели, сложное сильной. Если нужна независимая проверка схемы, это входит в ИТ-аудит и проверку ИИ-решения.
Частые вопросы
Можно ли выбирать модель для бота по Hermes Index?
Использовать как повод проверить, да. Выбирать только по нему нельзя: рейтинг про терминальные задачи и файлы, а ваш бот отвечает клиентам.
Дешёвая модель всегда проигрывает по итоговой цене?
Нет. Если проверка автоматическая и человек не тратит время на правки, она часто выигрывает. В условном примере выше время человека перевешивает токены.
Откуда взять цену попытки?
Из счётчиков токенов в ответах API, умноженных на прайс. Число попыток видно в журнале запросов.
Коротко о главном
Hermes Index показывает, что цена токена и цена выполненной задачи расходятся. Для бота работает формула: токены, повторы и проверка человеком, делённые на долю решённых. Считайте её на своих 30 задачах.
Если хотите, чтобы я посчитал эту метрику для вашего бота и подобрал схему роутинга, напишите мне в Telegram кодовое слово «ЗАДАЧА», пришлю шаблон расчёта.
Что я делаю для бизнеса
Напишите одной фразой, что нужно. Отвечу, что подойдёт, сколько займёт и сколько стоит. Сообщение уже подготовлено.
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


