GigaChat 3.5 Reasoning: три цифры из пресс-релиза и столбец, которого в нём нет
В новости три бенчмарка и рост показателей. В карточке модели — восемнадцать строк и третий столбец с конкурентом, где GigaChat уступает по среднему. Зато на русском языке выигрывает в полтора-два раза. Разбираю, что из этого следует для выбора модели.
Коротко (TL;DR)
- Сбер выложил GigaChat 3.5 Reasoning под лицензией MIT: 432 млрд параметров, из них 28 млрд активных, контекст 262 тысячи токенов. Веса свободно скачиваются, коммерческое использование разрешено.
- Цифры из пресс-релиза настоящие — я сверил все три с карточкой модели. Но в карточке восемнадцать строк и три столбца, а в пресс-релизе — три строки и один. В третьем столбце DeepSeek V4 Flash Preview выигрывает девять строк из восемнадцати и общее среднее: 72,71 против 68,88.
- Зато на русском языке GigaChat выигрывает с разгромным счётом: Arena Hard Ru 60,7 против 36,8, Ru LLM Arena 64 против 48,5. Вот это и есть повод её брать — а не среднее по бенчмаркам.
Новость про GigaChat 3.5 Reasoning за неделю разошлась одним и тем же текстом: режим рассуждений, минус 37% токенов на математике, три бенчмарка выросли, лицензия MIT. Всё правда. Я открыл карточку модели на HuggingFace и сверил — цифры на месте.
Только карточка рассказывает другую историю, и она полезнее.
Что именно выложили
Архитектура со смешанными экспертами: всего 432 млрд параметров, на каждый запрос работают 28 млрд. Контекст — 262 тысячи токенов. Веса в двух форматах, BF16 и FP8. Лицензия MIT, то есть самая свободная из ходовых: берите, встраивайте в продукт, продавайте, отдельного разрешения не нужно. Про то, чем лицензии открытых моделей отличаются друг от друга, у меня есть отдельный разбор.
Дальше начинается место, где «бесплатно» расходится с «дёшево». В примере запуска из карточки стоит конфигурация на восемь видеокарт H100. Это не придирка к документации, это класс железа: под такую модель нужна серверная стойка, а не рабочая станция под столом. Скачиваний за месяц на момент проверки — 187, и это ровно то число, которого и ждёшь от модели, которую физически может запустить пара сотен организаций в стране.
Для всех остальных путь один — облачный доступ по API. Лицензия MIT в этом случае вам лично не даёт ничего, кроме уверенности, что модель не отключат вместе со сменой чьей-то политики.
Столбец, которого нет в пересказе
В пресс-релизе три строки, и все три — сравнение модели с самой собой, в режиме рассуждений и без него. IFBench вырос с 44 до 77, Natural Plan — с 64 до 80, Live Code Bench v6 — с 56 до 85. Всё сходится с карточкой.
А в карточке рядом есть третий столбец: та же таблица, но с DeepSeek V4 Flash Preview. И картина меняется.
| Тест | GigaChat без рассуждений | GigaChat Reasoning | DeepSeek V4 Flash |
|---|---|---|---|
| IFBench | 43,66 | 77 | 73,33 |
| AIME 2026 | 67 | 92 | 90,4 |
| Natural Plan | 64 | 80,19 | 88 |
| Live Code Bench v6 | 56,2 | 85,4 | 87,87 |
| SWE-bench Verified | 42,6 | 64,7 | 78,6 |
| Terminal-Bench 2 | 13,48 | 30,3 | 56,6 |
| Среднее по 18 тестам | 51,47 | 68,88 | 72,71 |
Из восемнадцати строк DeepSeek выигрывает девять и общее среднее. Особенно заметен разрыв там, где модель должна не отвечать, а работать: чинить настоящие ошибки в коде (64,7 против 78,6) и вести долгую сессию в терминале (30,3 против 56,6).
Отдельно отмечу, что скрывать это никто не пытался. Таблицу с проигрышными строками выложила сама команда — в карточке модели, открыто, с методическими примечаниями к каждому спорному тесту. Потерялся третий столбец не в карточке, а по дороге в пересказы.
Где модель действительно первая
Теперь самое интересное, и в пресс-релизе этого тоже нет. Русскоязычные тесты:
| Тест | GigaChat Reasoning | DeepSeek V4 Flash |
|---|---|---|
| Arena Hard Ru | 60,7 | 36,8 |
| Ru LLM Arena | 64 | 48,5 |
| Pollux | 67,9 | 49 |
| MERA-2.0 | 42,3 | не измеряли |
Разрыв в полтора-два раза. Модель, которая проигрывает по среднему, на русском языке выигрывает уверенно — и это ровно то, что имеет значение, если ваши пользователи пишут по-русски.
Отсюда практический вывод, который стоит больше всей остальной новости. Смотрите не на среднее по бенчмаркам, а на строки, совпадающие с вашей задачей. Для службы поддержки, разбора заявок и работы с документами на русском эта модель — сильный кандидат. Для агента, который сам правит код и живёт в терминале, есть варианты заметно лучше.
Рассуждение — не бесплатный апгрейд
В той же таблице три строки, где режим рассуждений сделал хуже. Pollux упал с 71,6 до 67,9. Arena Hard Logs V3 — с 62,6 до 56,5. TAU3-bench, где модель ведёт диалог с инструментами, — с 50,03 до 47,8.
Это не дефект, это природа таких моделей: там, где задача решается сразу, лишний круг размышлений добавляет шанс уйти не туда. Я писал об этой развилке подробнее в разборе рассуждающих моделей для бизнеса — вывод там тот же. Рассуждающую модель включают под задачу, а не ставят по умолчанию.
Про экономию в 37% та же история, только мягче. Цифра настоящая, но относится к четырём математическим наборам, и по ним разброс от 23 до 41 процента. На вашей переписке с клиентами эта экономия не обещана никем.
Как читать такие новости за пять минут
Порядок, которым пользуюсь сам.
Открыть карточку модели. Ссылка есть в любом пересказе. Если цифры нет в карточке — цифры нет.
Найти таблицу целиком. Считайте столбцы и строки. Три строки в новости против восемнадцати в карточке — это уже ответ на вопрос, что именно вам показывают.
Посмотреть на строки со сторонней моделью. Сравнение версии с самой собой говорит только о том, что разработчики поработали. О том, брать её или нет, говорит соседний столбец.
Прочитать примечания под таблицей. Здесь их четыре, и они содержательные: один тест судит другая нейросеть, у другого исправленный алгоритм подсчёта, третий гоняли через агента с трёхчасовым лимитом. Числа, полученные так, сопоставимы не со всем подряд.
Найти требования к железу. Пример запуска в карточке — самая честная строчка про стоимость.
Частые вопросы
Можно использовать бесплатно в коммерческом продукте?
Лицензия MIT это разрешает без оговорок. Бесплатны веса; железо, электричество и инженер, который всё это обслуживает, — нет.
Запустится на нашем сервере?
Если в нём меньше восьми серверных видеокарт — практически нет. Реальный путь для большинства компаний — облачный доступ по API.
Значит, DeepSeek лучше и надо брать её?
По среднему — да, по русскому языку — нет, и с заметным отрывом. Выбирайте по строкам, похожим на вашу задачу, а не по итоговой цифре.
Насколько свежие бенчмарки вообще что-то значат?
Они показывают порядок величин и не показывают, как модель справится с вашим прайсом, вашими сокращениями и вашими клиентами. Это выясняется только замером на своих данных.
Стоит ли переходить с текущей модели прямо сейчас?
Не по новости. Возьмите полсотни реальных запросов, прогоните через обе и сравните не красоту ответа, а долю задач, закрытых без вмешательства человека.
Коротко о главном
Релиз настоящий и хороший: сильная модель, максимально свободная лицензия, честная карточка с проигрышными строками внутри. Претензий к Сберу тут нет — вопросы к пересказам, где из восемнадцати строк осталось три, а столбец сравнения исчез.
Что забрать с собой. Три цифры из новости правдивы, но описывают модель относительно себя прежней. По сумме тестов она уступает открытому конкуренту, зато на русском языке превосходит его в полтора-два раза. И «бесплатная по MIT» означает свободу лицензии, а не отсутствие счёта — счёт приходит за восемь видеокарт.
Что предлагаю конкретно. Если выбираете модель под задачу — опишите саму задачу и объём: сколько запросов в день, на каком языке, что считается успехом. Прогоню двух-трёх кандидатов на ваших данных и покажу не средний балл, а стоимость и долю закрытых задач. Напишите в Telegram, MAX или VK.
Что я делаю для бизнеса
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


