AI для разработчиков 5 мин чтения

Как удешевить ИИ-агента: маршрутизация задач между моделями

Держать всё на одной топовой модели дорого: она думает над каждой мелочью по цене сложного рассуждения. NVIDIA показала другой подход — распределять этапы работы агента между моделями. Разбираю на примере Nemotron 3.5 Lightning и библиотеки NeMo Switchyard, как это режет счёт за ИИ в разы.

ИИагентыоптимизациястоимость2026

Коротко (TL;DR)

  • Если гнать все задачи агента через одну топовую модель, вы платите цену сложного рассуждения даже за пустяки — а таких пустяков у постоянно работающего агента тысячи в день.
  • Дешевле разделить: сложное планирование → дорогой умной модели, вал рутины → быстрой и дешёвой. Это подход, а не конкретный продукт.
  • NVIDIA показала пример: открытая модель Nemotron 3.5 Lightning как «рабочая лошадка» и библиотека NeMo Switchyard как диспетчер, который раздаёт задачи.
  • Все цифры ниже — заявления NVIDIA из анонса. Бенчмарки жду в независимой проверке, а сам принцип экономии работает независимо от бренда модели.

Ко мне часто приходят с вопросом: «Подключили ИИ-агента, всё работает, но счёт кусается — что не так?» Обычно причина одна: агент держат на одной дорогой модели и пропускают через неё всё. Ниже разберу подход, который режет этот счёт, — маршрутизацию задач между моделями. NVIDIA как раз выпустила инструменты, на которых удобно показать идею.

Почему ИИ-агент дорого обходится

Представьте сотрудника, который постоянно что-то делает: разбирает заявки, дёргает сервисы, форматирует данные. Если весь поток идёт через мощную и дорогую модель, происходит абсурд: каждая мелочь оплачивается по цене сложного рассуждения.

Переставить строку в таблице, вызвать инструмент, разобрать ответ «да/нет», привести дату к формату — всё это модель обдумывает так же дорого, как стратегический анализ. По отдельности копейки, но у круглосуточного агента таких микроопераций тысячи в день. Счёт за токены растёт, а заодно копятся задержки.

Идея: разные задачи — разным моделям

Ключевая мысль простая: задачи агента неоднородны. Часть требует «подумать» — спланировать, сделать сложный вывод. Но по моим наблюдениям 80–90% операций — это рутина: вызвать инструмент, преобразовать данные, обработать однотипный кусок.

Логично планирование отдать сильной дорогой модели, а вал рутины — быстрой и дешёвой. Это как в компании: стратегию решает руководитель, а типовые операции выполняют исполнители. Никто не зовёт директора переставить строку в таблице.

Тип задачиКакая модельПочему
Планирование, сложный вывод, разбор запутанного случаяДорогая передоваяЗдесь качество мышления окупает цену — таких задач мало
Вызов инструмента, простое преобразование, массовая обработкаБыстрая дешёваяИх тысячи; платить за них как за рассуждение — расточительство

Близкая тема — маленькие доменные модели (SLM): иногда узкую операцию тянет совсем компактная модель.

Nemotron Lightning: быстрая рабочая лошадка

Теперь конкретный пример «дешёвого исполнителя». NVIDIA выпустила открытую модель Nemotron 3.5 Lightning под постоянно работающих агентов. Интересна она архитектурой MoE — «смесь экспертов».

Объясню просто. В модели 30 миллиардов параметров, но на каждый запрос включается не вся махина, а лишь малая часть — около 3 миллиардов активных. Модель как большой отдел: на вопрос отвечают только те, кто в теме, остальные молчат. За счёт этого, по данным NVIDIA, скорость генерации до 4 раз выше, чем у «плотных» моделей сопоставимого размера.

Заявленные в анонсе бенчмарки: точность 86% в тесте PinchBench; 10 000 задач выполнены на 35% быстрее, чем у модели Qwen3.6 35B, при сопоставимой точности. Подчеркну — это заявления компании, ждём независимых замеров.

Ещё два практичных момента. Первый — компактность: NVIDIA заявляет, что модель запускается на DGX Spark. Это, по сути, настольный ИИ-компьютер — компактная станция для локального ИИ, которую можно держать у себя, а не в облаке. Второй — модель можно дообучить на своих данных и процессах: компания открыла веса, данные и рецепты обучения. Логику локального запуска я разбирал в материале про открытую агентную модель локально.

NeMo Switchyard: кто раздаёт задачи

Быстрая модель сама по себе счёт не уменьшит — нужен тот, кто решит: «эту задачу сюда, ту туда». Вместе с Nemotron NVIDIA открыла библиотеку NeMo Switchyard. Это маршрутизатор: он смотрит на тип шага и направляет его либо на дорогую модель (думать), либо на быструю (исполнять).

Название говорящее: switchyard — это сортировочная станция, где вагоны раскидывают по нужным путям. Здесь то же самое, только с задачами. Именно маршрутизатор превращает разрозненный «зоопарк моделей» в единую экономную систему, где каждая задача едет по самому дешёвому пути.

Что это даёт бизнесу

Что это значит для владельца.

  • Меньше счёт за ИИ при том же результате. Рутина уходит на дешёвую модель, дорогая включается только там, где нужна голова.
  • Быстрее ответы. Рутина не стоит в очереди за тяжёлой моделью — простые шаги выполняются мгновенно.
  • Можно смешивать облако и локаль. Думает облачный флагман, исполняет локальная дешёвая модель на вашем железе — часть данных не уходит наружу. Об этом выборе — разбор локальный LLM против облака.

И сразу честная оговорка. Маршрутизация добавляет сложности в настройку: нужно разметить типы задач, свести модели, отладить диспетчер. Окупается это на объёме — у агента с тысячами операций в день. Если у вас пара запросов в день, городить такую систему смысла мало: проще одна модель. И не обязательно брать именно Nemotron — важен принцип, собрать его можно из разных моделей. Подробнее о том, где агенты приносят пользу, — в разборе ИИ-агентов в бизнесе.

Частые вопросы

Насколько реально дешевле? Зависит от доли рутины. Чем больше в потоке простых операций (а их обычно 80–90%), тем сильнее экономия: именно они уходят с дорогой модели на дешёвую. Точную цифру даёт только замер на вашем сценарии.

Нужен ли свой сервер? Не обязательно. Маршрутизировать можно и между облачными моделями — дорогой и дешёвой. Свой сервер нужен, если хотите держать исполнителя локально ради приватности или чтобы не платить за токены помесячно.

Подойдёт ли малому бизнесу? Смотря по нагрузке, а не по размеру компании. Если агент работает постоянно и гоняет много операций — да. Если это разовые запросы — берите одну модель.

Можно ли смешивать облако и локальную модель? Да, в этом часть смысла. Сложное отдаёте облачному флагману, массовое — локальной дешёвой модели у себя. Так вы экономите и оставляете часть данных внутри периметра.

Коротко о главном

Дорогой ИИ-агент чаще всего дорог не потому, что «ИИ вообще дорогой», а потому что одну топовую модель заставляют делать всё подряд, включая рутину. Маршрутизация это лечит: дорогая модель думает, быстрая исполняет вал операций, а диспетчер вроде NeMo Switchyard раздаёт задачи по адресу.

NVIDIA с Nemotron Lightning и Switchyard — удобный пример, но принцип шире любого бренда, а его цифры пока стоит держать как заявления анонса. Если у вас нагруженный агент и счёт за него растёт, разложить поток по моделям — один из самых прямых способов его срезать. Хотите прикинуть, что применимо у вас, — напишите мне.

Услуги по теме

Что я делаю с ИИ-стеком

  • Маршрутизация: дорогое думает, дешёвое исполняет
  • Снижение стоимости токенов и задержек
  • Локальные модели на вашем сервере
  • Агенты под ваши процессы и данные

Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»

12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.

Готовы обсудить вашу задачу?

Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.

Пишу о разработке, ИИ и законах для бизнеса

Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.

Готовые решения под ключ 449 готовых IT-решений для бизнеса Автоматизация, боты, AI, 152-ФЗ и платформы · бесплатная консультация Смотреть каталог