GPU и видеокарта для локального ИИ: что купить в 2026
Видеокарта решает, какую модель вы потянете локально. Разбираю, сколько VRAM нужно под разные размеры моделей и когда без GPU можно обойтись.
Коротко (TL;DR)
- Для локального ИИ главный ресурс — это видеопамять (VRAM), а не сама скорость карты: именно объём VRAM решает, какую модель вы вообще сможете запустить.
- Ориентиры по 4-битной квантизации: модель на 7B помещается примерно в 6 ГБ VRAM, 13B — порядка 8–10 ГБ, а 70B требует уже около 40–48 ГБ.
- Для большинства бизнес-задач хватает карты с 12–16 ГБ VRAM: это разумный старт без переплаты за топовое железо.
- GPU нужен не всегда: небольшие модели работают на процессоре, а под редкие запросы дешевле арендовать облачную видеокарту, чем покупать свою.
- Я помогаю подобрать железо под конкретную задачу и развернуть локальный ИИ под ключ — без переплаты и без покупки того, что не понадобится.
Когда бизнес хочет запустить нейросеть на своём железе, первый вопрос обычно про видеокарту: «Какую брать?» И тут легко ошибиться в обе стороны — купить слишком слабую и упереться в потолок или взять топовую за сотни тысяч и не использовать её мощь. Разберу честно, что на самом деле решает при выборе GPU для локального ИИ, сколько видеопамяти нужно под разные модели и когда без видеокарты можно обойтись вовсе. Все цифры даю как ориентиры, а не как точный прайс — реальные требования зависят от модели, квантизации и того, что вы с ней делаете.
Зачем ИИ видеокарта
Нейросеть — это миллиарды чисел (весов), которые нужно держать в быстрой памяти и перемножать при каждом ответе. Видеокарта делает это в разы быстрее процессора, потому что заточена под параллельные вычисления. Но ключевой момент не в скорости, а в памяти: чтобы модель работала, её веса должны целиком поместиться в видеопамять (VRAM). Не поместились — модель либо не запустится, либо начнёт использовать обычную оперативку и медленный диск, и скорость упадёт в разы.
Поэтому при выборе GPU для ИИ смотрят в первую очередь на объём VRAM, а не на игровую производительность. Карта, которая отлично тянет игры, может оказаться бесполезной для крупной модели просто потому, что памяти на ней мало. Это главное, что стоит понять перед покупкой. Тему объёма памяти я подробнее разбирал в статье про то, сколько памяти нужно для локального ИИ.
Сколько VRAM под какую модель
Размер модели измеряют в миллиардах параметров: 7B, 13B, 70B. Чем больше параметров, тем умнее модель и тем больше памяти она требует. Спасает квантизация — сжатие весов, которое уменьшает аппетит модели в несколько раз почти без потери качества. Практически всегда локально запускают именно квантованные версии.
Вот рабочие ориентиры для популярной 4-битной квантизации:
- Модели 7–8B (базовый уровень, хорошо тянут чат, поддержку, простые задачи) — порядка 6 ГБ VRAM.
- Модели 13–14B (заметно умнее, годятся для работы с документами) — порядка 8–10 ГБ.
- Модели 30–34B (сложные задачи, аккуратные ответы) — порядка 20–24 ГБ.
- Модели 70B (уровень, близкий к облачным сервисам) — порядка 40–48 ГБ.
К объёму весов добавляется память под контекст (историю диалога): чем длиннее переписка или документ, тем больше нужно запаса. Поэтому карту берут не впритык, а с небольшим резервом сверху.
Что купить под задачу
Разложу по бюджетам, отталкиваясь от объёма VRAM, а не от названий. Конкретные модели карт называю как ориентир — рынок меняется, но логика остаётся.
Старт, 12 ГБ. Карты вроде RTX 3060 на 12 ГБ — недорогой вход. Тянут модели до 13B комфортно, а с натяжкой и покрупнее. Этого достаточно, чтобы поднять чат-бота, поддержку или базу знаний для небольшого бизнеса.
Разумный баланс, 16 ГБ. Карты с 16 ГБ VRAM — золотая середина. Уверенно держат модели 13–14B с длинным контекстом, чего хватает подавляющему большинству бизнес-сценариев. Если сомневаетесь — берите отсюда.
С запасом, 24 ГБ. Карты вроде RTX 3090 или 4090 на 24 ГБ позволяют запускать модели 30B и работать с большими документами. Это уже для тех, кому нужно качество ближе к облачному и кто готов вложиться.
Тяжёлые модели, 48 ГБ и выше. Под модели 70B нужны либо специализированные карты, либо связка из нескольких. Это редкий случай для малого бизнеса — чаще такое дешевле арендовать в облаке под конкретную задачу. Если планируете свой сервер под ИИ, логику железа стоит закладывать сразу в инфраструктуру под ключ.
Когда GPU не нужен
Видеокарта нужна не всегда, и это важно сказать честно, чтобы не толкать вас на лишние траты.
Небольшие модели идут на процессоре. Модели до 7B вполне работают на обычном CPU с достаточным объёмом оперативной памяти. Медленнее, чем на GPU, но для нечастых запросов или ночной обработки данных этого хватает. Что реально запускается на скромном железе, я разбирал в тексте про локальный ИИ на слабом ноутбуке.
Редкие запросы дешевле в облаке. Если ИИ нужен пару раз в день, покупать карту за десятки тысяч невыгодно. Разумнее арендовать облачный GPU и платить только за фактическое использование. Своё железо окупается, когда нагрузка постоянная и большая.
Приватность решается и без своей карты. Иногда GPU покупают ради того, чтобы данные не уходили в чужое облако. Но приватность даёт и аренда изолированного сервера в российской инфраструктуре — важно, где физически крутится модель, а не кому принадлежит железо. Какую модель под это брать, я сравнивал в статье про выбор локального LLM.
Частые вопросы
Обязательно ли покупать видеокарту NVIDIA? На практике почти всегда да: под NVIDIA заточено большинство инструментов локального ИИ, и с ней меньше всего боли при настройке. Карты других производителей тоже работают, но требуют больше возни, поэтому для бизнеса я обычно советую NVIDIA как путь наименьшего сопротивления.
Сколько VRAM брать, если не знаю нагрузку заранее? Берите 16 ГБ. Это разумный баланс: тянет модели, которых хватает большинству задач, оставляет запас на контекст и не заставляет переплачивать за топовое железо, которое может не понадобиться.
Хватит ли игровой видеокарты? Да, обычная игровая карта отлично подходит — важен только объём VRAM. Специальные «серверные» карты нужны в основном под тяжёлые модели 70B или под высокую параллельную нагрузку, а для типичного бизнес-сценария хватает потребительской карты с достаточной памятью.
Можно ли докупить память к видеокарте? Нет, VRAM припаяна к карте и не расширяется. Именно поэтому объём памяти нужно выбирать сразу с запасом — увеличить его потом можно только заменой карты целиком.
Коротко о главном
При выборе GPU для локального ИИ главное — не гнаться за скоростью, а смотреть на объём видеопамяти: именно он решает, какую модель вы потянете. Ориентиры простые: 7B — порядка 6 ГБ, 13B — 8–10 ГБ, 70B — 40–48 ГБ, а под большинство бизнес-задач хватает карты на 12–16 ГБ. И помните, что GPU нужен не всегда: небольшие модели работают на процессоре, а под редкие запросы дешевле облако. Не покупайте железо вслепую — сначала посчитайте, какая модель закрывает вашу задачу, и берите карту под неё с небольшим запасом. Если хотите, чтобы кто-то подобрал железо под конкретный сценарий и развернул локальный ИИ под ключ, без переплаты за лишние мощности — я помогу пройти путь от расчёта до работающей системы.
Что я делаю с ИИ под ключ
- ИИ-агенты и чат-боты
- База знаний с ИИ-поиском (RAG)
- Локальные модели на своём сервере
- Приватность и 152-ФЗ
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


