Сколько нужно RAM и видеокарты для локального ИИ
Разбираю на реальных цифрах, сколько оперативной памяти и какая видеокарта нужны для локального ИИ разного размера — от ноутбука с 16 ГБ до сервера с двумя GPU. Без маркетинга, только рабочие ориентиры.
Ко мне регулярно приходят с одним и тем же вопросом: «Хочу развернуть локальный ИИ, чтобы данные не улетали к сторонним провайдерам — какое железо покупать?» Вопрос правильный: локальный ИИ и правда снимает часть рисков по 152-ФЗ и избавляет от зависимости от внешних API. Но ответ «зависит» никого не устраивает, поэтому ниже — конкретные цифры, на которые я сам ориентируюсь, когда считаю сервер под заказчика.
Коротко: требования к железу зависят от размера модели в параметрах (7B, 13B, 70B) и от квантизации — сжатия весов модели. Оперативная память нужна как минимум под размер модели плюс запас на систему: для 7B хватит 16 ГБ, для 13B — 32 ГБ, для 70B — от 64 ГБ. Видеокарта не обязательна, но без неё модель будет отвечать в разы медленнее — CPU справляется, но в час по чайной ложке. Для быстрой и комфортной работы нужна видеокарта с достаточным объёмом VRAM под конкретную модель, и это обычно самая дорогая часть сборки.
От чего зависит
Прежде чем считать гигабайты, важно понять логику. Требования к железу для локального ИИ определяют два параметра: размер модели в миллиардах параметров (те самые «7B», «13B», «70B» в названии) и уровень квантизации — насколько сильно веса модели сжаты при хранении.
Чем больше параметров, тем «умнее» и универсальнее модель, но тем больше памяти она занимает и тем медленнее считает ответ. Модель на 7 миллиардов параметров без сжатия занимает около 14 ГБ памяти, на 13 миллиардов — около 26 ГБ, на 70 миллиардов — порядка 140 ГБ. Это цифры для полной точности (fp16), с которой модели обычно и обучают.
Дальше в игру вступает квантизация — про неё отдельно ниже, — которая позволяет ужать модель в 2-4 раза почти без потери качества ответов. Именно квантизация делает локальный ИИ реалистичным на обычном железе, а не только на серверах дата-центра.
Третий фактор — что для вас важнее: скорость ответа или сам факт, что модель вообще запустится. Оперативная память и процессор способны «вытянуть» практически любую модель, если её хватает по объёму, но скорость на CPU в разы, а иногда в десятки раз ниже, чем на видеокарте. Видеокарта нужна не для того, чтобы модель заработала, а для того, чтобы с ней можно было комфортно работать в реальном времени — как с диалогом, а не с медленной перепиской.
Сколько оперативной памяти
Оперативная память — это минимальное условие: без неё модель просто не загрузится. Общее правило простое: RAM должна быть не меньше объёма модели в памяти плюс запас 4-8 ГБ на операционную систему, браузер и фоновые процессы.
| Модель | RAM (мин.) | VRAM для комфорта | Скорость на CPU |
|---|---|---|---|
| 7B (квантизация 4-бит) | 16 ГБ | 6-8 ГБ | 5-10 токенов/сек |
| 13B (квантизация 4-бит) | 32 ГБ | 10-12 ГБ | 2-5 токенов/сек |
| 34B (квантизация 4-бит) | 48 ГБ | 20-24 ГБ | 1-2 токена/сек |
| 70B (квантизация 4-бит) | 64-96 ГБ | 40-48 ГБ | менее 1 токена/сек |
Цифры ориентировочные — конкретная модель, формат файла и настройки контекста (насколько длинную переписку она «помнит») сдвигают их в ту или иную сторону. Но как отправная точка для планирования бюджета они рабочие: именно так я прикидываю конфигурацию, когда клиент присылает список моделей, которые хочет запустить.
Отдельный момент — скорость самой памяти и число каналов. Для запуска моделей на CPU важна не только ёмкость, но и пропускная способность: две-четыре планки в многоканальном режиме дают заметно более высокую скорость генерации, чем одна планка того же суммарного объёма. Если бюджет позволяет, лучше взять 2×16 ГБ, чем одну планку на 32 ГБ.
Нужна ли видеокарта
Видеокарта не обязательна — модель можно запустить целиком на процессоре и оперативной памяти, и для тестов, разовых задач или несрочной обработки текста в фоне этого достаточно. Но разница в скорости колоссальная: на CPU ответ модели 13B может печататься со скоростью «пара слов в секунду», что для живого диалога с клиентом уже некомфортно, а для фонового пакетного анализа документов — вполне приемлемо.
Если нужен живой диалог — чат-бот с ИИ, ассистент для сотрудников, RAG-система с быстрым откликом, — видеокарта становится практически обязательной. Ключевой параметр здесь не мощность ядра (как в играх), а объём видеопамяти VRAM: именно в неё должна поместиться модель целиком, чтобы вычисления шли на GPU, а не «протекали» обратно в оперативную память, что резко всё замедляет.
Практический ориентир: видеокарта с 8 ГБ VRAM закрывает модели 7B в квантизации, с 12-16 ГБ — комфортно тянет 13B, с 24 ГБ — модели среднего размера (20-34B). Для полноценных 70B-моделей на приемлемой скорости нужны уже 48 ГБ VRAM — это либо одна профессиональная карта такого объёма, либо две потребительские карты по 24 ГБ, объединённые программно.
Отдельно скажу про доступность: свежие потребительские видеокарты с большим объёмом VRAM в России купить не всегда просто и не всегда дёшево, поэтому часть внедрений я закладываю на карты предыдущих поколений с достаточным объёмом памяти — для инференса (то есть для использования уже готовой модели, а не для её обучения) это чаще всего вполне рабочий компромисс.
Квантизация и размер модели
Квантизация — это сжатие числовых весов модели: вместо хранения каждого параметра с высокой точностью (16 или 32 бита) его округляют до более грубого формата — 8, 4 или даже меньше бит. Аналогия простая: это как сохранить фотографию не в оригинальном RAW, а в сжатом JPEG — файл в разы меньше, а на глаз разница почти незаметна.
Для локального ИИ квантизация — это то, что вообще делает разговор про «домашнее железо» реалистичным. Модель 13B без квантизации требует около 26 ГБ памяти, а в 4-битном сжатии — уже около 7-8 ГБ. Это разница между «нужен сервер с профессиональной видеокартой» и «хватит игрового ноутбука».
Есть нюанс: чем агрессивнее сжатие, тем выше риск потери качества ответов — модель может чуть чаще путаться в деталях или терять нюансы формулировок. На практике 4-битная квантизация в большинстве задач (ответы на вопросы, работа с базой знаний, суммаризация текста) практически неотличима от полноточной модели, а вот более грубое сжатие (2-3 бита) уже заметно на глаз. Поэтому я обычно рекомендую 4-битную квантизацию как разумный баланс между размером и качеством, если только задача не требует предельной точности — например, работы с числами или юридическими формулировками.
Готовые ориентиры по бюджету
Чтобы не оставлять всё в абстракциях, вот три уровня сборок, которые я реально предлагаю заказчикам под разные задачи.
| Уровень | Железо | Что потянет |
|---|---|---|
| Начальный | 16-32 ГБ RAM, видеокарта 8-12 ГБ VRAM | Модели 7B для чат-бота, черновиков текста, простых ответов по базе знаний |
| Рабочий | 32-64 ГБ RAM, видеокарта 16-24 ГБ VRAM | Модели 13-34B: RAG-система, AI-агент для сотрудников, обработка заявок |
| Серверный | 96+ ГБ RAM, одна-две видеокарты по 24-48 ГБ VRAM | Модели 70B, несколько параллельных пользователей, production-нагрузка |
Для малого и среднего бизнеса в 8 случаях из 10 достаточно рабочего уровня: 13-34B модели в квантизации закрывают задачи чат-бота, поиска по документам и обработки обращений на понятном уровне качества, а серверный уровень я закладываю уже под нагрузку в несколько десятков одновременных пользователей или когда заказчику принципиально важна максимальная точность ответов.
Второй вариант, который я тоже предлагаю, — не покупать железо, а арендовать сервер с нужной конфигурацией. Это снимает вопрос капитальных вложений и апгрейда, но данные при этом всё равно физически размещаются не у заказчика, а на арендованном сервере — если это критично по 152-ФЗ, важно выбирать площадку с размещением в РФ и прописывать это в договоре.
Частые вопросы
Сколько оперативной памяти нужно для локальной нейросети? Минимум — объём модели в памяти плюс 4-8 ГБ запаса на систему. Для моделей 7B в квантизации хватает 16 ГБ, для 13B — 32 ГБ, для 70B — от 64 ГБ.
Обязательна ли видеокарта для локального ИИ? Нет, модель можно запустить только на процессоре и оперативной памяти. Но скорость ответа при этом падает в разы — для живого диалога с клиентами видеокарта нужна, для фоновой пакетной обработки текста можно обойтись без неё.
Какую модель потянет ноутбук с 16 ГБ оперативной памяти? Комфортно — модель 7B в 4-битной квантизации. 13B на 16 ГБ тоже иногда запускается, но с урезанным контекстом и медленнее — я обычно не рекомендую этот вариант для рабочих задач.
Что такое квантизация простыми словами? Это сжатие модели за счёт снижения точности хранения чисел внутри неё — похоже на сжатие фотографии в JPEG. 4-битная квантизация уменьшает размер модели в 3-4 раза почти без потери качества ответов.
Дешевле купить свой сервер или арендовать? Для разовых тестов и небольшой нагрузки аренда почти всегда выгоднее — не нужно вкладываться в дорогую видеокарту сразу. Для постоянной нагрузки и данных, которые нельзя выносить за периметр компании, свой сервер окупается быстрее и снимает вопросы по 152-ФЗ.
Коротко о главном
Железо под локальный ИИ считается не «на глаз», а от конкретной модели и уровня квантизации: 7B требует 16 ГБ RAM и видеокарту с 8 ГБ VRAM, 13B — 32 ГБ и 12-16 ГБ VRAM, 70B — от 64 ГБ RAM и 48 ГБ VRAM. Видеокарта не обязательна, но именно она определяет, будет ли работа с ИИ комфортной или растянется в медленную переписку.
Если сомневаетесь, какой уровень сборки нужен именно под вашу задачу — чат-бот, RAG-систему по базе знаний или обработку заявок, — не стоит гадать и переплачивать за железо с запасом «на всякий случай». Опишите задачу и ожидаемую нагрузку, я подберу конфигурацию под реальные цифры и разверну локальный ИИ под ключ.
Что я делаю под ключ
- Внедрение локального ИИ
- Свой AI-сервер и DevOps
- RAG по базе знаний
- Чат-боты с ИИ
- Данные по 152-ФЗ
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.


