Spark-X2.5-4B: агентная модель на 4B с контекстом 1 млн токенов — что это меняет для бизнеса
Вышла Spark-X2.5-4B — агентная модель на 4 млрд параметров с нативным контекстом в миллион токенов и лицензией Apache 2.0. Разбираю, что именно заявлено, почему это важно малому бизнесу и как я проверяю такие модели перед тем, как ставить клиенту.
Коротко (TL;DR)
- Spark-X2.5-4B — агентная модель на 4 млрд параметров с контекстом 1 млн токенов и лицензией Apache 2.0. По заявленным бенчмаркам обходит Qwen3.5-9B в кодинге и лидирует в тестах на вызов инструментов.
- Для малого бизнеса это ИИ-агент для документов и инструментов на обычном сервере или ноутбуке: данные не уходят, счетов за API нет.
- Цифры пока — заявления разработчиков. Перед внедрением я проверяю русский язык, инструменты, длинный контекст, скорость и галлюцинации.
- Первые задачи: разбор входящих, черновики документов, ассистент по базе знаний, рутина в Claude Code и похожих агентах.
Spark-X2.5-4B — это агентная модель на 4 миллиарда параметров с нативным контекстом в 1 миллион токенов, которая работает с репозиториями, пишет код и вызывает инструменты, распространяется под лицензией Apache 2.0 и запускается локально через Ollama, LM Studio, llama.cpp, vLLM, SGLang и MLX. Новость вышла 2 сентября 2026 года, и я вижу в ней сдвиг, которого ждал: агентная модель локально перестаёт требовать дорогого железа. Разбираю, что заявлено, почему это важно бизнесу и как я оцениваю такие модели, прежде чем ставить их клиенту.
Что заявлено о Spark-X2.5-4B
Оговорюсь: всё в этом разделе — заявленные результаты со страницы коллекции на ModelScope. Независимых проверок на момент написания я не видел и сам модель ещё не гонял.
- Размер и контекст. 4B параметров, нативный контекст 1 млн токенов — порядка двух-трёх тысяч страниц текста за один проход.
- Кодинг. SWE-bench Pro — 44,4 против 33,8 у Qwen3.5-9B; SWE-bench Multilingual — 53,3 против 43,3. Модель вдвое меньше, а результат выше.
- Агентные тесты. Лидерство на τ³-bench, MCP-Atlas, MCP-Mark, Workspace Bench, VitaBench 2.0 и BrowseComp — тесты на вызов инструментов, протокол MCP, работу в рабочем пространстве и поиск в вебе.
- Математика. AIME 2026 — 90,7; HMMT Feb 2026 — 81,2.
- Интеграции и лицензия. Работает внутри Codex, Claude Code, OpenClaw и Hermes; 200+ языков; Apache 2.0 — можно использовать в коммерческих продуктах без отчислений.
Почему 4B-агент с миллионным контекстом — перелом
До сих пор компромисс был жёстким: чтобы агент уверенно вызывал инструменты и не терял нить на длинных документах, нужна была модель на 30-70 млрд параметров и видеокарта на 24-48 ГБ. Когда вышла Muse Glimmer, я разбирал, что значит агентная модель на обычном ПК. Модель на 4B опускает планку ещё ниже: в 8-битном виде это примерно 4-5 ГБ весов — влезает в ноутбук с 16 ГБ и в сервер за несколько тысяч рублей в месяц.
- Данные не уходят. Договоры, переписка, база знаний обрабатываются на своём сервере — прямой ответ на 152-ФЗ и на осторожность в отношении зарубежных облаков.
- Нет счетов за API. Агент, который ночью разбирает входящие, потребляет только электричество. Экономику я считал в статье локальный ИИ — не паранойя, а расчёт.
- Миллион контекста без RAG. Можно не строить векторный поиск: положить в контекст всю документацию и спрашивать.
Оговорка: нативный контекст в миллион и реальная способность им пользоваться — разные вещи. У многих моделей качество проседает уже на 100-200 тысячах токенов.
Бенчмарки простыми словами
- SWE-bench Pro и Multilingual — модели дают реальную задачу из репозитория с ошибкой и проверяют, прошли ли тесты после исправления. Ближе всего к работе живого разработчика.
- τ³-bench — модель играет агента поддержки, который по правилам компании обрабатывает запрос, вызывая функции: посмотреть заказ, оформить возврат. Оценивается точность действий.
- MCP-Atlas и MCP-Mark — работа по протоколу MCP, через который агенту подключают CRM, базу данных, файлы. Именно так я подключаю агентов к системам клиентов.
- Workspace Bench, BrowseComp — документы, таблицы, письма, задачи; многошаговый поиск в вебе.
- AIME и HMMT — олимпиадная математика.
Моя позиция как практика: для бизнеса важнее «инструменты и документы», чем олимпиадные задачи. Клиенты просили, чтобы агент нашёл заказ в CRM, не перепутал сумму в договоре и не придумал позицию на складе. Поэтому смотрю в первую очередь на τ³-bench, MCP-тесты и Workspace Bench; математика — сигнал о качестве рассуждений, но не критерий выбора.
Как я проверяю такие модели
Эту методику я прогоняю на каждой новой модели; со Spark-X2.5-4B сделаю то же — вот что проверю первым делом.
- Русский язык. «200+ языков» ничего не гарантирует. Даю реальные письма клиентов, договоры, обращения с опечатками. Смотрю на грамотность и понимание: падежи, числительные, названия организаций.
- Вызов инструментов. Подключаю через MCP три-пять функций, даю 50 запросов, треть — с ловушками, где инструмент не нужен. Считаю точность аргументов и отсутствие лишних вызовов.
- Длинный контекст. Кладу 200, 500 и 900 тысяч токенов документации, прячу в середине факты и спрашиваю про них. Если модель «теряет середину», миллион остаётся цифрой на слайде.
- Скорость на 16-32 ГБ. Меряю токены в секунду на типичном железе клиента. Требования к железу разбирал в статье сколько железа нужно локальному ИИ.
- Галлюцинации. Задаю вопросы, ответов на которые в контексте нет. Хорошая модель говорит «в документах этого нет», плохая уверенно выдумывает. Для бизнеса это критерий номер один.
Только после этого модель попадает в список, который я веду в материале какой локальный LLM выбрать.
Какие задачи отдать первыми и где осторожно
Если проверка подтвердит заявленное, начинать я бы стал с этого — от простого к сложному.
- Разбор входящих. Письма, заявки, сообщения в мессенджерах: классифицировать, вытащить суть, положить в CRM карточку с полями.
- Черновики документов. Коммерческие предложения, ответы на типовые запросы, акты по шаблону. Человек проверяет и подписывает.
- Ассистент по базе знаний. Регламенты, инструкции, прайсы загружаются целиком — без RAG-конвейера.
- Автоматизация в агентах для кода. Раз модель совместима с Claude Code и Codex, её можно поставить «вторым пилотом» для рутины в репозитории — без отправки кода наружу.
Где осторожно. Apache 2.0 — плюс, но лицензия не отвечает, кто стоит за моделью, на чём она обучена и будет ли поддержка через полгода. Перед продакшеном я проверяю происхождение весов, наличие технического отчёта, активность репозитория и загрузку штатными версиями llama.cpp и vLLM без патчей. И не ставлю новую модель сразу на критичные процессы.
Частые вопросы
Что такое Spark-X2.5-4B?
Агентная языковая модель на 4 млрд параметров с контекстом 1 млн токенов, выпущенная 2 сентября 2026 года под лицензией Apache 2.0. По заявлению разработчиков, работает с репозиториями, вызывает инструменты и запускается локально через Ollama, LM Studio, llama.cpp и vLLM.
Можно ли запустить агентную модель локально на обычном ноутбуке?
Модель на 4B в 8-битном виде занимает около 4-5 ГБ, так что ноутбук с 16 ГБ подходит. Но длинный контекст требует памяти под кэш, поэтому реальный объём документов нужно проверять на практике.
Чем локальный ИИ-агент для бизнеса лучше облачного?
Данные не покидают ваш контур, что закрывает вопросы 152-ФЗ и коммерческой тайны, а платы за запросы нет. Минусы: своё железо и человек, который следит за обновлениями.
Что означает контекст 1 млн токенов на практике?
Примерно две-три тысячи страниц текста за один запрос: вся документация компании или крупный репозиторий. Способность реально помнить середину такого документа проверяют отдельно.
Стоит ли уже сейчас ставить Spark-X2.5-4B в рабочие процессы?
Я бы не торопился: независимых проверок мало. Разумный путь — развернуть в тестовом контуре, прогнать на своих задачах по методике из статьи и только потом переводить на реальные процессы, начиная с некритичных.
Коротко о главном
Spark-X2.5-4B — заявка на то, что агентная модель локально больше не требует дорогой видеокарты: 4B параметров, миллион токенов контекста, лидерство в тестах на вызов инструментов и Apache 2.0. Для бизнеса это ИИ-агент, который работает с документами и системами внутри контура, без счетов за API. Цифры пока на совести разработчиков, поэтому перед внедрением я прогоняю свою проверку. Хотите ИИ-агента на своём сервере — с этой моделью или проверенной альтернативой — начните с приватного ИИ-облака: разворачиваю, тестирую на ваших данных, подключаю к CRM и мессенджерам. Порядок работы — на странице внедрение ИИ-агентов.
Что я делаю для бизнеса
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


