AI для разработчиков 4 мин чтения

GigaChat 3.5 Reasoning: три цифры из пресс-релиза и столбец, которого в нём нет

В новости три бенчмарка и рост показателей. В карточке модели — восемнадцать строк и третий столбец с конкурентом, где GigaChat уступает по среднему. Зато на русском языке выигрывает в полтора-два раза. Разбираю, что из этого следует для выбора модели.

GigaChatоткрытые моделибенчмаркивыбор модели

Коротко (TL;DR)

  • Сбер выложил GigaChat 3.5 Reasoning под лицензией MIT: 432 млрд параметров, из них 28 млрд активных, контекст 262 тысячи токенов. Веса свободно скачиваются, коммерческое использование разрешено.
  • Цифры из пресс-релиза настоящие — я сверил все три с карточкой модели. Но в карточке восемнадцать строк и три столбца, а в пресс-релизе — три строки и один. В третьем столбце DeepSeek V4 Flash Preview выигрывает девять строк из восемнадцати и общее среднее: 72,71 против 68,88.
  • Зато на русском языке GigaChat выигрывает с разгромным счётом: Arena Hard Ru 60,7 против 36,8, Ru LLM Arena 64 против 48,5. Вот это и есть повод её брать — а не среднее по бенчмаркам.

Новость про GigaChat 3.5 Reasoning за неделю разошлась одним и тем же текстом: режим рассуждений, минус 37% токенов на математике, три бенчмарка выросли, лицензия MIT. Всё правда. Я открыл карточку модели на HuggingFace и сверил — цифры на месте.

Только карточка рассказывает другую историю, и она полезнее.

Что именно выложили

Архитектура со смешанными экспертами: всего 432 млрд параметров, на каждый запрос работают 28 млрд. Контекст — 262 тысячи токенов. Веса в двух форматах, BF16 и FP8. Лицензия MIT, то есть самая свободная из ходовых: берите, встраивайте в продукт, продавайте, отдельного разрешения не нужно. Про то, чем лицензии открытых моделей отличаются друг от друга, у меня есть отдельный разбор.

Дальше начинается место, где «бесплатно» расходится с «дёшево». В примере запуска из карточки стоит конфигурация на восемь видеокарт H100. Это не придирка к документации, это класс железа: под такую модель нужна серверная стойка, а не рабочая станция под столом. Скачиваний за месяц на момент проверки — 187, и это ровно то число, которого и ждёшь от модели, которую физически может запустить пара сотен организаций в стране.

Для всех остальных путь один — облачный доступ по API. Лицензия MIT в этом случае вам лично не даёт ничего, кроме уверенности, что модель не отключат вместе со сменой чьей-то политики.

Столбец, которого нет в пересказе

В пресс-релизе три строки, и все три — сравнение модели с самой собой, в режиме рассуждений и без него. IFBench вырос с 44 до 77, Natural Plan — с 64 до 80, Live Code Bench v6 — с 56 до 85. Всё сходится с карточкой.

А в карточке рядом есть третий столбец: та же таблица, но с DeepSeek V4 Flash Preview. И картина меняется.

ТестGigaChat без рассужденийGigaChat ReasoningDeepSeek V4 Flash
IFBench43,667773,33
AIME 2026679290,4
Natural Plan6480,1988
Live Code Bench v656,285,487,87
SWE-bench Verified42,664,778,6
Terminal-Bench 213,4830,356,6
Среднее по 18 тестам51,4768,8872,71

Из восемнадцати строк DeepSeek выигрывает девять и общее среднее. Особенно заметен разрыв там, где модель должна не отвечать, а работать: чинить настоящие ошибки в коде (64,7 против 78,6) и вести долгую сессию в терминале (30,3 против 56,6).

Отдельно отмечу, что скрывать это никто не пытался. Таблицу с проигрышными строками выложила сама команда — в карточке модели, открыто, с методическими примечаниями к каждому спорному тесту. Потерялся третий столбец не в карточке, а по дороге в пересказы.

Где модель действительно первая

Теперь самое интересное, и в пресс-релизе этого тоже нет. Русскоязычные тесты:

ТестGigaChat ReasoningDeepSeek V4 Flash
Arena Hard Ru60,736,8
Ru LLM Arena6448,5
Pollux67,949
MERA-2.042,3не измеряли

Разрыв в полтора-два раза. Модель, которая проигрывает по среднему, на русском языке выигрывает уверенно — и это ровно то, что имеет значение, если ваши пользователи пишут по-русски.

Отсюда практический вывод, который стоит больше всей остальной новости. Смотрите не на среднее по бенчмаркам, а на строки, совпадающие с вашей задачей. Для службы поддержки, разбора заявок и работы с документами на русском эта модель — сильный кандидат. Для агента, который сам правит код и живёт в терминале, есть варианты заметно лучше.

Рассуждение — не бесплатный апгрейд

В той же таблице три строки, где режим рассуждений сделал хуже. Pollux упал с 71,6 до 67,9. Arena Hard Logs V3 — с 62,6 до 56,5. TAU3-bench, где модель ведёт диалог с инструментами, — с 50,03 до 47,8.

Это не дефект, это природа таких моделей: там, где задача решается сразу, лишний круг размышлений добавляет шанс уйти не туда. Я писал об этой развилке подробнее в разборе рассуждающих моделей для бизнеса — вывод там тот же. Рассуждающую модель включают под задачу, а не ставят по умолчанию.

Про экономию в 37% та же история, только мягче. Цифра настоящая, но относится к четырём математическим наборам, и по ним разброс от 23 до 41 процента. На вашей переписке с клиентами эта экономия не обещана никем.

Как читать такие новости за пять минут

Порядок, которым пользуюсь сам.

Открыть карточку модели. Ссылка есть в любом пересказе. Если цифры нет в карточке — цифры нет.

Найти таблицу целиком. Считайте столбцы и строки. Три строки в новости против восемнадцати в карточке — это уже ответ на вопрос, что именно вам показывают.

Посмотреть на строки со сторонней моделью. Сравнение версии с самой собой говорит только о том, что разработчики поработали. О том, брать её или нет, говорит соседний столбец.

Прочитать примечания под таблицей. Здесь их четыре, и они содержательные: один тест судит другая нейросеть, у другого исправленный алгоритм подсчёта, третий гоняли через агента с трёхчасовым лимитом. Числа, полученные так, сопоставимы не со всем подряд.

Найти требования к железу. Пример запуска в карточке — самая честная строчка про стоимость.

Частые вопросы

Можно использовать бесплатно в коммерческом продукте?

Лицензия MIT это разрешает без оговорок. Бесплатны веса; железо, электричество и инженер, который всё это обслуживает, — нет.

Запустится на нашем сервере?

Если в нём меньше восьми серверных видеокарт — практически нет. Реальный путь для большинства компаний — облачный доступ по API.

Значит, DeepSeek лучше и надо брать её?

По среднему — да, по русскому языку — нет, и с заметным отрывом. Выбирайте по строкам, похожим на вашу задачу, а не по итоговой цифре.

Насколько свежие бенчмарки вообще что-то значат?

Они показывают порядок величин и не показывают, как модель справится с вашим прайсом, вашими сокращениями и вашими клиентами. Это выясняется только замером на своих данных.

Стоит ли переходить с текущей модели прямо сейчас?

Не по новости. Возьмите полсотни реальных запросов, прогоните через обе и сравните не красоту ответа, а долю задач, закрытых без вмешательства человека.

Коротко о главном

Релиз настоящий и хороший: сильная модель, максимально свободная лицензия, честная карточка с проигрышными строками внутри. Претензий к Сберу тут нет — вопросы к пересказам, где из восемнадцати строк осталось три, а столбец сравнения исчез.

Что забрать с собой. Три цифры из новости правдивы, но описывают модель относительно себя прежней. По сумме тестов она уступает открытому конкуренту, зато на русском языке превосходит его в полтора-два раза. И «бесплатная по MIT» означает свободу лицензии, а не отсутствие счёта — счёт приходит за восемь видеокарт.

Что предлагаю конкретно. Если выбираете модель под задачу — опишите саму задачу и объём: сколько запросов в день, на каком языке, что считается успехом. Прогоню двух-трёх кандидатов на ваших данных и покажу не средний балл, а стоимость и долю закрытых задач. Напишите в Telegram, MAX или VK.

Услуги по теме

Что я делаю для бизнеса

  • Боты в Telegram, MAX, VK
  • Автоматизация процессов и CRM
  • Аналитика и дашборды
  • Сайты и лендинги под ключ

Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»

12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.

Готовы обсудить вашу задачу?

Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.

Пишу о разработке, ИИ и законах для бизнеса

Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.

Готовые решения под ключTurnkey solutionsSoluciones llave en mano交钥匙解决方案Түлхүүр гардуулах шийдэл 449 готовых IT-решений для бизнеса449 ready-made IT solutions for business449 soluciones IT listas para empresas449 个面向企业的现成 IT 解决方案Бизнест зориулсан 449 бэлэн IT шийдэл Автоматизация, боты, AI, 152-ФЗ и платформы · бесплатная консультацияAutomation, bots, AI, data privacy and platforms · free consultationAutomatización, bots, IA, privacidad de datos y plataformas · consulta gratis自动化、机器人、AI、数据合规与平台 · 免费咨询Автоматжуулалт, бот, AI, өгөгдлийн хамгаалалт ба платформ · үнэгүй зөвлөгөө Смотреть каталогView catalogVer catálogo查看目录Каталог үзэх