62% и 33% у одной модели: чужой бенчмарк не про ваш процесс
Hugging Face показала, что одни и те же веса решают 62% задач в одной агентной обвязке и 33% в другой. Значит, чужой рейтинг не скажет, как модель справится с вашим процессом. Разбираем, как за вечер собрать свой тест из 30 задач, и где он перестаёт быть надёжным.
Одна модель, два результата
Команда FineEnvs из Hugging Face выпустила большой разбор под названием «The ultimate guide to multi-harness RL». Страница обновлена в начале октября 2026 года. Авторы обучали маленькую открытую модель LFM2.5-2.6B от Liquid AI внутри готовых агентных программ: Claude Code, Codex, OpenCode и Mini-SWE-Agent. Источник: гайд на Hugging Face.
Самая понятная цифра там не про обучение. До всякого дообучения эта модель решала 62% тестовых задач в Mini-SWE-Agent и 33% в Claude Code. Веса те же, задачи те же. Отличается только программа вокруг модели: она решает, какие инструменты модель видит, как собирается контекст и как разбирается ответ.
Авторы приводят и чужой замер. По их ссылке, исследователь Joel Niklaus на тесте SWE-bench Pro получил от модели GLM-5.2 23% в одной обвязке и 52% в другой. Рейтинг обвязок для разных моделей при этом не совпал: Codex у GLM-5.2 оказался вторым из десяти, а у Gemma 4 26B-A4B девятым.
Что получилось после обучения
Обучение шло сразу в четырёх обвязках. Между обвязкой и моделью стоит прокси, который записывает точные номера токенов и logprobs, то есть вероятности, с которыми модель выбирала каждое слово. Код самих обвязок авторы не меняли. Результат на 250 отложенных задачах по анализу данных: точность выросла с 42,2% до 54,2%, а вызовов инструментов на уже решаемых задачах стало на 31% меньше.
Для сравнения авторы взяли дообучение на готовых примерах. Старшая модель Qwen3.8-27B прошла задачи, из удачных попыток собрали 3189 траекторий. На них обучили две версии. Версия на одной обвязке OpenCode дошла до 47,5%. Версия на всех 3189 примерах из четырёх обвязок осталась на 43,1%, в пределах шума от исходных 42,2%. В телеграм-пересказах 47,5% иногда приписывают именно 3189 траекториям, в оригинале это разные запуски.
При чём тут ваш бизнес
Вы не обучаете модели в обвязках. Но каждый, кто ставит ИИ в процесс, собирает свою обвязку: системную инструкцию, доступ к базе знаний и CRM, правила формата ответа, обрезку истории переписки. Все эти части влияют на результат так же, как в замере Hugging Face, только на других задачах и в других масштабах. Прямого замера для чат-бота поддержки в гайде нет, это перенос принципа, и я называю его переносом.
Из этого следует практичная вещь. Таблица «модель A набрала 80, модель B набрала 75» получена на чужих задачах, с чужими инструкциями и чужими инструментами. Она может не совпасть с тем, что вы увидите на своих вопросах. Когда выбираете модель для бота, свою проверку полезно сделать до того, как читать рейтинги. Про выбор я писал в статьях как не переплатить за модель и GigaChat, YandexGPT и ChatGPT для бизнеса в РФ.
Чего пока нельзя
Авторы сами называют ограничения. Это небольшие эксперименты на одном семействе задач, по одному прогону на каждую настройку, с неравным объёмом данных и вычислений. Каждая ячейка прогонялась один раз, поэтому разницу в один-два пункта между соседними чекпойнтами они считают шумом. Общий рейтинг сочетаний обвязок эти данные не доказывают.
Ещё одна оговорка от меня. Все замеры в гайде сделаны на задачах про данные и код, в программах для программистов. Что на вашем потоке вопросов про доставку, договоры или цены обвязка сдвинет сильнее, чем модель, или слабее, гайд не говорит. Поэтому и нужен собственный тест.
Что можно сделать уже сейчас
Соберите 30 задач. Возьмите реальные вопросы клиентов и сотрудников за последний месяц из переписок, заявок, почты. Уберите имена, телефоны, номера договоров. Двадцать обычных, пять трудных и пять ловушек, на которые правильный ответ звучит как «этого я не знаю, передаю менеджеру». Магазин берёт вопросы про наличие, возврат и сроки, юрист берёт вопросы по типовым условиям договора, склад берёт расхождения в остатках.
Напишите эталоны. Каждый эталон составляет человек, который знает правильный ответ. Полный текст не нужен, достаточно списка фактов, которые должны быть в ответе: цена, срок, условие, запрет. Это занимает самую большую часть вечера, и она самая полезная, потому что вы фиксируете, что для вас считается правильным.
Оценивайте по простой шкале: 0 значит неверно или опасно, 1 значит частично, 2 значит можно отправить клиенту. Отдельно считайте опасные ответы: выдуманная цена, невозможное обещание, раскрытые лишние данные. Такой ответ хуже любого «частично», даже если средний балл красивый. Смотрите ответы вслепую: перемешайте их и спрячьте названия моделей.
Прогоните две-три модели на двух вариантах инструкции. Один вариант короткий, второй с правилами и примерами. Получается шесть прогонов по 30 ответов, 180 штук. На разбор уйдёт около трёх часов, это моя прикидка. Чтобы отсеять случайность, поставьте температуру пониже и прогоните каждую задачу дважды. Этот же набор потом пригодится для проверки перед запуском, а общий порядок проверки описан в статье про тест бота и сайта перед запуском. Автоматическую оценку ответов моделью-судьёй разбирает эта статья.
У такого теста есть предел. Тридцать вопросов дают оценку, а не доказательство. Один вопрос весит 3,3 пункта. При результате около 60% грубая погрешность порядка 15 пунктов в обе стороны, это простой расчёт по формуле для долей. Разрыв в два-три вопроса между моделями ничего не говорит. Заметная разница видна, когда она держится на обоих вариантах инструкции и на ловушках.
Решение по одной цифре принимать нельзя. Смотрите на опасные ответы, на то, что меняется при смене инструкции, и на то, какие вопросы ломаются у всех. Полезнее всего список вопросов, где не справилась ни одна модель: нередко там не хватает данных в базе знаний, и никакая модель их не придумает.
Частые вопросы
Нужны ли программисты, чтобы собрать такой тест?
Для сбора вопросов и эталонов нет. Для прогона через несколько моделей достаточно скрипта на десяток строк или готового сервиса со сравнением ответов. Оценивать должен человек из вашего процесса, не разработчик.
Сколько стоит такой замер?
Цену называть не буду, она зависит от моделей и объёма. Для 180 коротких ответов затраты на запросы к моделям обычно невелики, основные расходы это время сотрудников на эталоны и оценку. Цены на мои услуги есть в прайсе.
Мы уже выбрали модель по рейтингу. Что делать?
Прогоните на ней хотя бы 30 своих задач и посмотрите на опасные ответы. Если результат совпал с рейтингом, вы подтвердили выбор. Если нет, вы узнали об этом до жалоб клиентов.
Коротко о главном
Hugging Face показала, что модель с теми же весами решает 62% задач в одной обвязке и 33% в другой, а обучение внутри четырёх обвязок подняло точность с 42,2% до 54,2%. У вашего бота обвязка тоже есть: инструкция, инструменты, формат ответа. Поэтому чужой бенчмарк говорит о вашем процессе меньше, чем 30 ваших вопросов с эталонами.
Хотите свой тест, но некогда собирать вопросы и оценивать? Напишите мне в Telegram слово «ТЕСТ». Разберём, какие 30 задач взять, соберём замер на нескольких моделях и покажем, где ответы опасны. Для проверки готового решения у меня есть ИТ-аудит и проверка ИИ-решения.
Что я делаю для бизнеса
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


