Модель на 7 млрд обходит девятимиллиардные: почему это не значит «дешевле»
Вышло семейство из шести полностью открытых моделей, и версия на 7 млрд параметров обходит более крупные конкурентов. Цифра настоящая, но рядом с ней в карточке написано условие, которое переворачивает вывод о стоимости.
Коротко (TL;DR)
- Вышло семейство из шести моделей от 0,9 до 375 млрд параметров под лицензией Apache 2.0. Открыты не только веса, но и данные обучения, рецепт, код и промежуточные контрольные точки — это редкость.
- Версия на 7 млрд набирает 70,6 на инженерном тесте против 50,8 у девятимиллиардной модели другого семейства. Цифра настоящая, из карточки модели.
- Но там же написано, при каких условиях: с высокой глубиной рассуждения и с запасом минимум в 32 тысячи токенов на ответ. Значит «маленькая модель» здесь не равно «дешёвая» — платите вы за рассуждение, а не за параметры.
Привычка считать стоимость модели по числу параметров сложилась в те времена, когда модель просто отвечала. Чем меньше параметров — тем дешевле железо, тем быстрее ответ. Модели, которые перед ответом рассуждают, эту арифметику ломают, и свежий пример показывает это особенно наглядно.
Что вышло
Институт фундаментальных моделей выпустил семейство K2 Horizon: шесть базовых размеров — 0,9, 3,7, 7, 32 млрд, вариант со смешанной архитектурой на 36 млрд и старшая на 375 млрд. Лицензия Apache 2.0, то есть коммерческое использование разрешено без оговорок. Контекст 512 тысяч токенов.
Отдельно стоит отметить степень открытости, потому что она выше обычной. Большинство «открытых» моделей публикуют только веса — готовый результат, который нельзя воспроизвести. Здесь выложены данные обучения, рецепт, код и промежуточные контрольные точки, по которым видно, как менялись способности по ходу обучения.
Для бизнеса это не абстракция. Модель, чей путь обучения виден, проверяема: можно понять, на чём она училась, и оценить, не попали ли туда данные, с которыми у вас будут проблемы.
Про цифру 70,6
Заявлено, что версия на 7 млрд параметров набирает 70,6 на тесте, где модели чинят настоящие ошибки в открытом коде. Для сравнения в карточке приведены: 50,8 у девятимиллиардной модели одного известного семейства, 47,7 у восьмимиллиардной другого, 30,6 у двенадцатимиллиардной третьего.
Цифру я сверил с карточкой модели — она там есть, и указан конкретный вариант теста. Это уже отличает её от чисел, которые кочуют по пересказам без источника.
Но в той же карточке написано и то, чего в пересказах нет.
Оговорка, которая меняет экономику
Авторы прямо указывают: все приведённые результаты получены при высокой глубине рассуждения, и рекомендуют давать модели не меньше 32 тысяч токенов на ответ, чтобы рассуждение не оборвалось. Формулировка у них жёсткая: оборванное рассуждение — это не более короткий ответ, а неудачный.
Отсюда вывод, который стоит держать в голове при любом сравнении моделей. Стоимость запроса определяется не числом параметров, а количеством выпущенных токенов. Семимиллиардная модель, которая перед ответом пишет тридцать тысяч токенов рассуждения, обходится дороже и отвечает дольше, чем модель втрое больше, отвечающая сразу.
| Что сравниваем | Интуиция | Как на самом деле |
|---|---|---|
| Стоимость запроса | Меньше параметров — дешевле | Определяется числом выпущенных токенов |
| Скорость ответа | Маленькая модель отвечает быстро | Рассуждение занимает основное время |
| Требования к железу | 7 млрд влезет куда угодно | Влезет, но длинный вывод требует памяти под контекст |
| Где выигрыш реален | Везде | Там, где задача правда требует рассуждения |
Про то, из чего вообще складывается счёт за агента, я разбирал отдельно: сколько стоят токены ИИ-агента.
Кому это нужно, а кому нет
Нужно там, где задача содержательно сложная. Разбор кода, длинные цепочки действий, анализ, где надо удержать много условий сразу. Здесь глубина рассуждения окупается: ответ либо правильный, либо бесполезный, и промежуточного не бывает.
Не нужно на потоке простых задач. Ответ по прайсу, классификация обращений, извлечение полей из документа. Рассуждающая модель здесь потратит в разы больше токенов ради того же результата. Для таких задач берут обычную модель — и это ровно та развилка, о которой я писал в разборе рассуждающих моделей для бизнеса.
Отдельно про открытость. Полная публикация данных и рецепта важна тем, кто планирует дообучать модель под себя или обязан объяснять, откуда она взялась. Для тех, кто просто пользуется, это приятная, но не решающая деталь.
Подобрать модель под конкретную задачу и посчитать расход я могу под ключ: ИИ-агенты под ключ.
Как проверять такие новости
Порядок, которым я пользуюсь и который сэкономит вам время.
Найти цифру в карточке модели. Если её там нет, а есть только в пересказе — считать, что цифры нет.
Прочитать условия рядом с ней. Именно там обычно написано про глубину рассуждения, длину вывода и настройки, при которых результат получен. Это самая пропускаемая часть.
Посмотреть, какой вариант теста указан. У популярных тестов есть облегчённые и полные версии, и числа по ним несопоставимы.
Проверить возраст. Эта модель опубликована в первых числах сентября 2026 года, скачиваний пока несколько тысяч. Свежая модель ещё не прошла проверку практикой, и строить на ней рабочий процесс рано.
Померить на своих задачах. Тест меряет то, что интересно его авторам. Ваш прайс, ваши вопросы клиентов и ваш русский язык — единственная проверка, которая что-то значит.
Частые вопросы
Значит, маленькие модели больше не выгодны?
Выгодны, но по другой причине: они дешевле по железу и не требуют мощной видеокарты. Экономия на самих запросах появляется только если модель отвечает коротко.
Можно ли использовать её коммерчески?
Лицензия Apache 2.0 это разрешает. Но проверьте отдельно лицензию тех данных, на которых будете дообучать, — она своя.
Что даёт контекст в 512 тысяч токенов?
Возможность подать большой массив за раз. Практически длинный контекст стоит денег и замедляет ответ, поэтому в рабочих системах его почти всегда сокращают до нужного, а не заполняют до предела.
Почему вообще открывают данные обучения — им не жалко?
Мотивы разные: научная репутация, привлечение исследователей, независимость от чужой инфраструктуры. Для вас важен не мотив, а следствие: модель с открытым рецептом можно воспроизвести и проверить, а закрытую приходится принимать на веру. В отраслях, где надо объяснять происхождение инструмента, это решающий довод.
Стоит ли переходить с текущей модели?
Не по новости. Померьте обе на своих задачах и сравните не качество ответа, а стоимость и время одной успешно закрытой задачи — это разные величины.
Коротко о главном
Событие настоящее и хорошее: шесть моделей, Apache 2.0, полная публикация данных, рецепта и кода — по нынешним меркам это редкая честность. Заявленный результат семимиллиардной версии тоже подтверждается карточкой.
Но вместе с ним в карточке написано условие, которое переворачивает вывод: результат получен при высокой глубине рассуждения и с запасом в 32 тысячи токенов на ответ. Число параметров перестало быть мерой стоимости — считать надо по выпущенным токенам и по времени на одну закрытую задачу.
Что предлагаю конкретно. Опишите задачу, под которую подбираете модель, и объём — сколько запросов в день. Посчитаем расход на двух-трёх кандидатах и выберем не самую громкую, а ту, что дешевле закрывает вашу задачу. Напишите в Telegram, MAX или VK.
Что я делаю для бизнеса
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


