AI для разработчиков 5 мин чтения

Сколько нужно RAM и видеокарты для локального ИИ

Разбираю на реальных цифрах, сколько оперативной памяти и какая видеокарта нужны для локального ИИ разного размера — от ноутбука с 16 ГБ до сервера с двумя GPU. Без маркетинга, только рабочие ориентиры.

железо для ИИвидеокартаRAMлокальный ИИ
TL;DR: Для модели 7B хватит 16 ГБ RAM и видеокарты с 8 ГБ VRAM (или вообще без неё, но медленно). Для 13B нужно 32 ГБ RAM и 12-16 ГБ VRAM. Для 70B — 64+ ГБ RAM и либо профессиональная видеокарта с 48 ГБ VRAM, либо смириться со скоростью пары слов в секунду на CPU. Квантизация (сжатие модели) снижает требования в 2-4 раза почти без потери качества ответов.

Ко мне регулярно приходят с одним и тем же вопросом: «Хочу развернуть локальный ИИ, чтобы данные не улетали к сторонним провайдерам — какое железо покупать?» Вопрос правильный: локальный ИИ и правда снимает часть рисков по 152-ФЗ и избавляет от зависимости от внешних API. Но ответ «зависит» никого не устраивает, поэтому ниже — конкретные цифры, на которые я сам ориентируюсь, когда считаю сервер под заказчика.

Коротко: требования к железу зависят от размера модели в параметрах (7B, 13B, 70B) и от квантизации — сжатия весов модели. Оперативная память нужна как минимум под размер модели плюс запас на систему: для 7B хватит 16 ГБ, для 13B — 32 ГБ, для 70B — от 64 ГБ. Видеокарта не обязательна, но без неё модель будет отвечать в разы медленнее — CPU справляется, но в час по чайной ложке. Для быстрой и комфортной работы нужна видеокарта с достаточным объёмом VRAM под конкретную модель, и это обычно самая дорогая часть сборки.

От чего зависит

Прежде чем считать гигабайты, важно понять логику. Требования к железу для локального ИИ определяют два параметра: размер модели в миллиардах параметров (те самые «7B», «13B», «70B» в названии) и уровень квантизации — насколько сильно веса модели сжаты при хранении.

Чем больше параметров, тем «умнее» и универсальнее модель, но тем больше памяти она занимает и тем медленнее считает ответ. Модель на 7 миллиардов параметров без сжатия занимает около 14 ГБ памяти, на 13 миллиардов — около 26 ГБ, на 70 миллиардов — порядка 140 ГБ. Это цифры для полной точности (fp16), с которой модели обычно и обучают.

Дальше в игру вступает квантизация — про неё отдельно ниже, — которая позволяет ужать модель в 2-4 раза почти без потери качества ответов. Именно квантизация делает локальный ИИ реалистичным на обычном железе, а не только на серверах дата-центра.

Третий фактор — что для вас важнее: скорость ответа или сам факт, что модель вообще запустится. Оперативная память и процессор способны «вытянуть» практически любую модель, если её хватает по объёму, но скорость на CPU в разы, а иногда в десятки раз ниже, чем на видеокарте. Видеокарта нужна не для того, чтобы модель заработала, а для того, чтобы с ней можно было комфортно работать в реальном времени — как с диалогом, а не с медленной перепиской.

Сколько оперативной памяти

Оперативная память — это минимальное условие: без неё модель просто не загрузится. Общее правило простое: RAM должна быть не меньше объёма модели в памяти плюс запас 4-8 ГБ на операционную систему, браузер и фоновые процессы.

МодельRAM (мин.)VRAM для комфортаСкорость на CPU
7B (квантизация 4-бит)16 ГБ6-8 ГБ5-10 токенов/сек
13B (квантизация 4-бит)32 ГБ10-12 ГБ2-5 токенов/сек
34B (квантизация 4-бит)48 ГБ20-24 ГБ1-2 токена/сек
70B (квантизация 4-бит)64-96 ГБ40-48 ГБменее 1 токена/сек

Цифры ориентировочные — конкретная модель, формат файла и настройки контекста (насколько длинную переписку она «помнит») сдвигают их в ту или иную сторону. Но как отправная точка для планирования бюджета они рабочие: именно так я прикидываю конфигурацию, когда клиент присылает список моделей, которые хочет запустить.

Отдельный момент — скорость самой памяти и число каналов. Для запуска моделей на CPU важна не только ёмкость, но и пропускная способность: две-четыре планки в многоканальном режиме дают заметно более высокую скорость генерации, чем одна планка того же суммарного объёма. Если бюджет позволяет, лучше взять 2×16 ГБ, чем одну планку на 32 ГБ.

Нужна ли видеокарта

Видеокарта не обязательна — модель можно запустить целиком на процессоре и оперативной памяти, и для тестов, разовых задач или несрочной обработки текста в фоне этого достаточно. Но разница в скорости колоссальная: на CPU ответ модели 13B может печататься со скоростью «пара слов в секунду», что для живого диалога с клиентом уже некомфортно, а для фонового пакетного анализа документов — вполне приемлемо.

Если нужен живой диалог — чат-бот с ИИ, ассистент для сотрудников, RAG-система с быстрым откликом, — видеокарта становится практически обязательной. Ключевой параметр здесь не мощность ядра (как в играх), а объём видеопамяти VRAM: именно в неё должна поместиться модель целиком, чтобы вычисления шли на GPU, а не «протекали» обратно в оперативную память, что резко всё замедляет.

Практический ориентир: видеокарта с 8 ГБ VRAM закрывает модели 7B в квантизации, с 12-16 ГБ — комфортно тянет 13B, с 24 ГБ — модели среднего размера (20-34B). Для полноценных 70B-моделей на приемлемой скорости нужны уже 48 ГБ VRAM — это либо одна профессиональная карта такого объёма, либо две потребительские карты по 24 ГБ, объединённые программно.

Отдельно скажу про доступность: свежие потребительские видеокарты с большим объёмом VRAM в России купить не всегда просто и не всегда дёшево, поэтому часть внедрений я закладываю на карты предыдущих поколений с достаточным объёмом памяти — для инференса (то есть для использования уже готовой модели, а не для её обучения) это чаще всего вполне рабочий компромисс.

Квантизация и размер модели

Квантизация — это сжатие числовых весов модели: вместо хранения каждого параметра с высокой точностью (16 или 32 бита) его округляют до более грубого формата — 8, 4 или даже меньше бит. Аналогия простая: это как сохранить фотографию не в оригинальном RAW, а в сжатом JPEG — файл в разы меньше, а на глаз разница почти незаметна.

Для локального ИИ квантизация — это то, что вообще делает разговор про «домашнее железо» реалистичным. Модель 13B без квантизации требует около 26 ГБ памяти, а в 4-битном сжатии — уже около 7-8 ГБ. Это разница между «нужен сервер с профессиональной видеокартой» и «хватит игрового ноутбука».

Есть нюанс: чем агрессивнее сжатие, тем выше риск потери качества ответов — модель может чуть чаще путаться в деталях или терять нюансы формулировок. На практике 4-битная квантизация в большинстве задач (ответы на вопросы, работа с базой знаний, суммаризация текста) практически неотличима от полноточной модели, а вот более грубое сжатие (2-3 бита) уже заметно на глаз. Поэтому я обычно рекомендую 4-битную квантизацию как разумный баланс между размером и качеством, если только задача не требует предельной точности — например, работы с числами или юридическими формулировками.

Готовые ориентиры по бюджету

Чтобы не оставлять всё в абстракциях, вот три уровня сборок, которые я реально предлагаю заказчикам под разные задачи.

УровеньЖелезоЧто потянет
Начальный16-32 ГБ RAM, видеокарта 8-12 ГБ VRAMМодели 7B для чат-бота, черновиков текста, простых ответов по базе знаний
Рабочий32-64 ГБ RAM, видеокарта 16-24 ГБ VRAMМодели 13-34B: RAG-система, AI-агент для сотрудников, обработка заявок
Серверный96+ ГБ RAM, одна-две видеокарты по 24-48 ГБ VRAMМодели 70B, несколько параллельных пользователей, production-нагрузка

Для малого и среднего бизнеса в 8 случаях из 10 достаточно рабочего уровня: 13-34B модели в квантизации закрывают задачи чат-бота, поиска по документам и обработки обращений на понятном уровне качества, а серверный уровень я закладываю уже под нагрузку в несколько десятков одновременных пользователей или когда заказчику принципиально важна максимальная точность ответов.

Второй вариант, который я тоже предлагаю, — не покупать железо, а арендовать сервер с нужной конфигурацией. Это снимает вопрос капитальных вложений и апгрейда, но данные при этом всё равно физически размещаются не у заказчика, а на арендованном сервере — если это критично по 152-ФЗ, важно выбирать площадку с размещением в РФ и прописывать это в договоре.

Частые вопросы

Сколько оперативной памяти нужно для локальной нейросети? Минимум — объём модели в памяти плюс 4-8 ГБ запаса на систему. Для моделей 7B в квантизации хватает 16 ГБ, для 13B — 32 ГБ, для 70B — от 64 ГБ.

Обязательна ли видеокарта для локального ИИ? Нет, модель можно запустить только на процессоре и оперативной памяти. Но скорость ответа при этом падает в разы — для живого диалога с клиентами видеокарта нужна, для фоновой пакетной обработки текста можно обойтись без неё.

Какую модель потянет ноутбук с 16 ГБ оперативной памяти? Комфортно — модель 7B в 4-битной квантизации. 13B на 16 ГБ тоже иногда запускается, но с урезанным контекстом и медленнее — я обычно не рекомендую этот вариант для рабочих задач.

Что такое квантизация простыми словами? Это сжатие модели за счёт снижения точности хранения чисел внутри неё — похоже на сжатие фотографии в JPEG. 4-битная квантизация уменьшает размер модели в 3-4 раза почти без потери качества ответов.

Дешевле купить свой сервер или арендовать? Для разовых тестов и небольшой нагрузки аренда почти всегда выгоднее — не нужно вкладываться в дорогую видеокарту сразу. Для постоянной нагрузки и данных, которые нельзя выносить за периметр компании, свой сервер окупается быстрее и снимает вопросы по 152-ФЗ.

Коротко о главном

Железо под локальный ИИ считается не «на глаз», а от конкретной модели и уровня квантизации: 7B требует 16 ГБ RAM и видеокарту с 8 ГБ VRAM, 13B — 32 ГБ и 12-16 ГБ VRAM, 70B — от 64 ГБ RAM и 48 ГБ VRAM. Видеокарта не обязательна, но именно она определяет, будет ли работа с ИИ комфортной или растянется в медленную переписку.

Если сомневаетесь, какой уровень сборки нужен именно под вашу задачу — чат-бот, RAG-систему по базе знаний или обработку заявок, — не стоит гадать и переплачивать за железо с запасом «на всякий случай». Опишите задачу и ожидаемую нагрузку, я подберу конфигурацию под реальные цифры и разверну локальный ИИ под ключ.

Услуги по теме

Что я делаю под ключ

  • Внедрение локального ИИ
  • Свой AI-сервер и DevOps
  • RAG по базе знаний
  • Чат-боты с ИИ
  • Данные по 152-ФЗ

Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»

12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.

Готовы обсудить вашу задачу?

Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.

Готовые решения под ключ 449 готовых IT-решений для бизнеса Автоматизация, боты, AI, 152-ФЗ и платформы · бесплатная консультация Смотреть каталог