Как удешевить ИИ-агента: маршрутизация задач между моделями
Держать всё на одной топовой модели дорого: она думает над каждой мелочью по цене сложного рассуждения. NVIDIA показала другой подход — распределять этапы работы агента между моделями. Разбираю на примере Nemotron 3.5 Lightning и библиотеки NeMo Switchyard, как это режет счёт за ИИ в разы.
Коротко (TL;DR)
- Если гнать все задачи агента через одну топовую модель, вы платите цену сложного рассуждения даже за пустяки — а таких пустяков у постоянно работающего агента тысячи в день.
- Дешевле разделить: сложное планирование → дорогой умной модели, вал рутины → быстрой и дешёвой. Это подход, а не конкретный продукт.
- NVIDIA показала пример: открытая модель Nemotron 3.5 Lightning как «рабочая лошадка» и библиотека NeMo Switchyard как диспетчер, который раздаёт задачи.
- Все цифры ниже — заявления NVIDIA из анонса. Бенчмарки жду в независимой проверке, а сам принцип экономии работает независимо от бренда модели.
Ко мне часто приходят с вопросом: «Подключили ИИ-агента, всё работает, но счёт кусается — что не так?» Обычно причина одна: агент держат на одной дорогой модели и пропускают через неё всё. Ниже разберу подход, который режет этот счёт, — маршрутизацию задач между моделями. NVIDIA как раз выпустила инструменты, на которых удобно показать идею.
Почему ИИ-агент дорого обходится
Представьте сотрудника, который постоянно что-то делает: разбирает заявки, дёргает сервисы, форматирует данные. Если весь поток идёт через мощную и дорогую модель, происходит абсурд: каждая мелочь оплачивается по цене сложного рассуждения.
Переставить строку в таблице, вызвать инструмент, разобрать ответ «да/нет», привести дату к формату — всё это модель обдумывает так же дорого, как стратегический анализ. По отдельности копейки, но у круглосуточного агента таких микроопераций тысячи в день. Счёт за токены растёт, а заодно копятся задержки.
Идея: разные задачи — разным моделям
Ключевая мысль простая: задачи агента неоднородны. Часть требует «подумать» — спланировать, сделать сложный вывод. Но по моим наблюдениям 80–90% операций — это рутина: вызвать инструмент, преобразовать данные, обработать однотипный кусок.
Логично планирование отдать сильной дорогой модели, а вал рутины — быстрой и дешёвой. Это как в компании: стратегию решает руководитель, а типовые операции выполняют исполнители. Никто не зовёт директора переставить строку в таблице.
| Тип задачи | Какая модель | Почему |
|---|---|---|
| Планирование, сложный вывод, разбор запутанного случая | Дорогая передовая | Здесь качество мышления окупает цену — таких задач мало |
| Вызов инструмента, простое преобразование, массовая обработка | Быстрая дешёвая | Их тысячи; платить за них как за рассуждение — расточительство |
Близкая тема — маленькие доменные модели (SLM): иногда узкую операцию тянет совсем компактная модель.
Nemotron Lightning: быстрая рабочая лошадка
Теперь конкретный пример «дешёвого исполнителя». NVIDIA выпустила открытую модель Nemotron 3.5 Lightning под постоянно работающих агентов. Интересна она архитектурой MoE — «смесь экспертов».
Объясню просто. В модели 30 миллиардов параметров, но на каждый запрос включается не вся махина, а лишь малая часть — около 3 миллиардов активных. Модель как большой отдел: на вопрос отвечают только те, кто в теме, остальные молчат. За счёт этого, по данным NVIDIA, скорость генерации до 4 раз выше, чем у «плотных» моделей сопоставимого размера.
Заявленные в анонсе бенчмарки: точность 86% в тесте PinchBench; 10 000 задач выполнены на 35% быстрее, чем у модели Qwen3.6 35B, при сопоставимой точности. Подчеркну — это заявления компании, ждём независимых замеров.
Ещё два практичных момента. Первый — компактность: NVIDIA заявляет, что модель запускается на DGX Spark. Это, по сути, настольный ИИ-компьютер — компактная станция для локального ИИ, которую можно держать у себя, а не в облаке. Второй — модель можно дообучить на своих данных и процессах: компания открыла веса, данные и рецепты обучения. Логику локального запуска я разбирал в материале про открытую агентную модель локально.
NeMo Switchyard: кто раздаёт задачи
Быстрая модель сама по себе счёт не уменьшит — нужен тот, кто решит: «эту задачу сюда, ту туда». Вместе с Nemotron NVIDIA открыла библиотеку NeMo Switchyard. Это маршрутизатор: он смотрит на тип шага и направляет его либо на дорогую модель (думать), либо на быструю (исполнять).
Название говорящее: switchyard — это сортировочная станция, где вагоны раскидывают по нужным путям. Здесь то же самое, только с задачами. Именно маршрутизатор превращает разрозненный «зоопарк моделей» в единую экономную систему, где каждая задача едет по самому дешёвому пути.
Что это даёт бизнесу
Что это значит для владельца.
- Меньше счёт за ИИ при том же результате. Рутина уходит на дешёвую модель, дорогая включается только там, где нужна голова.
- Быстрее ответы. Рутина не стоит в очереди за тяжёлой моделью — простые шаги выполняются мгновенно.
- Можно смешивать облако и локаль. Думает облачный флагман, исполняет локальная дешёвая модель на вашем железе — часть данных не уходит наружу. Об этом выборе — разбор локальный LLM против облака.
И сразу честная оговорка. Маршрутизация добавляет сложности в настройку: нужно разметить типы задач, свести модели, отладить диспетчер. Окупается это на объёме — у агента с тысячами операций в день. Если у вас пара запросов в день, городить такую систему смысла мало: проще одна модель. И не обязательно брать именно Nemotron — важен принцип, собрать его можно из разных моделей. Подробнее о том, где агенты приносят пользу, — в разборе ИИ-агентов в бизнесе.
Частые вопросы
Насколько реально дешевле? Зависит от доли рутины. Чем больше в потоке простых операций (а их обычно 80–90%), тем сильнее экономия: именно они уходят с дорогой модели на дешёвую. Точную цифру даёт только замер на вашем сценарии.
Нужен ли свой сервер? Не обязательно. Маршрутизировать можно и между облачными моделями — дорогой и дешёвой. Свой сервер нужен, если хотите держать исполнителя локально ради приватности или чтобы не платить за токены помесячно.
Подойдёт ли малому бизнесу? Смотря по нагрузке, а не по размеру компании. Если агент работает постоянно и гоняет много операций — да. Если это разовые запросы — берите одну модель.
Можно ли смешивать облако и локальную модель? Да, в этом часть смысла. Сложное отдаёте облачному флагману, массовое — локальной дешёвой модели у себя. Так вы экономите и оставляете часть данных внутри периметра.
Коротко о главном
Дорогой ИИ-агент чаще всего дорог не потому, что «ИИ вообще дорогой», а потому что одну топовую модель заставляют делать всё подряд, включая рутину. Маршрутизация это лечит: дорогая модель думает, быстрая исполняет вал операций, а диспетчер вроде NeMo Switchyard раздаёт задачи по адресу.
NVIDIA с Nemotron Lightning и Switchyard — удобный пример, но принцип шире любого бренда, а его цифры пока стоит держать как заявления анонса. Если у вас нагруженный агент и счёт за него растёт, разложить поток по моделям — один из самых прямых способов его срезать. Хотите прикинуть, что применимо у вас, — напишите мне.
Что я делаю с ИИ-стеком
- Маршрутизация: дорогое думает, дешёвое исполняет
- Снижение стоимости токенов и задержек
- Локальные модели на вашем сервере
- Агенты под ваши процессы и данные
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


