Strata: большой свой ИИ на игровой видеокарте, без облака
Strata запускает большую модель Qwen3.8-Flash-Next на обычном игровом ПК и поднимает локальный API, совместимый с OpenAI и Anthropic. Разбираю, кто стоит за проектом, что в лицензиях, какие требования и когда достаточно Ollama.
Большая модель на игровом ПК
Модели уровня Qwen3.8-Flash-Next обычно живут на серверах с сотнями гигабайт видеопамяти. В ней 125 миллиардов параметров, из них на каждое слово работают около 6 миллиардов, так указано на странице модели на Hugging Face. Небольшой компании оставалось платить облаку и отдавать ему договоры и переписку клиентов или покупать сервер, который окупится нескоро.
Проект Strata предлагает третий вариант. Модель стоит на компьютере с игровой видеокартой, а ваши программы обращаются к ней по адресу http://127.0.0.1:8080/v1, как к обычному OpenAI. По словам автора в README, ничего не уходит за пределы компьютера.
Что я проверил по репозиторию на 8 октября 2026. Он создан 24 сентября, ему 14 дней. Звёзд 17 806, форков 1 573, открытых обсуждений 413. Релиз v0.1.40.4 вышел сегодня утром. Основной автор один, пользователь Niko1221: у него 868 коммитов, а у следующих участников по 10 до 21. За проектом нет компании, это личный профиль с единственным репозиторием и сообщество вокруг него.
Как модель помещается в 12 ГБ
Модель устроена как команда из 24 576 мелких специалистов, в README их называют экспертами. На каждое слово нужны только десять. Видеокарта хранит самых востребованных, оперативная память держит всех, процессор считает остальных параллельно с картой, а SSD хранит большую таблицу подсказок. Если в компьютере две или три карты NVIDIA, модель делится между ними.
Требования по README: видеокарта NVIDIA RTX 20, 30, 40 или 50 серии либо одна из перечисленных карт AMD, не меньше 12 ГБ видеопамяти. Оперативной памяти 32 ГБ и больше, на 64 ГБ работают все размеры модели. На диске около 80 ГБ, лучше на SSD. Скачивается примерно 70 ГБ.
Автор приводит свои замеры. На RTX 5070 с 12 ГБ, Ryzen 5 7600 и 64 ГБ оперативки размер IQ2_XS пишет ответ со скоростью 79 токенов в секунду и читает запрос со скоростью 2 090 токенов в секунду. Размер IQ3_S даёт 53 и 1 620. Я эти цифры на своём железе не повторял, считайте их данными автора на одной конфигурации.
Strata, Ollama или llama.cpp
Strata использует части llama.cpp, это написано в README, и заточена под одну модель в нескольких размерах. llama.cpp и Ollama работают с десятками разных моделей. Поддерживают ли они Qwen3.8-Flash-Next и с какой скоростью, я не проверял.
Если задача решается моделью на 7 или 14 миллиардов параметров, которая целиком влезает в видеопамять, берите Ollama. Она проще, давно живёт, у неё большое сообщество, и 64 ГБ оперативки под неё покупать не надо. Для типовых ответов клиентам и сортировки писем этого часто хватает.
Strata имеет смысл, когда маленькая модель не справляется: длинные договоры, сложные рассуждения, разбор кода, документы с картинками. И при этом нет бюджета на серверную видеокарту. Сколько памяти нужно под модели разного размера, я считал в статье о железе для локального ИИ.
Что важно учесть
Лицензия самой Strata MIT, текст лежит в файле LICENSE репозитория. Использовать, менять и применять в коммерческих целях можно. Модель идёт отдельно, у неё Qwen Community License 1.0. Она разрешает использовать, размещать у себя, дообучать и продавать. Условий два. Если у вашего продукта больше 100 миллионов пользователей в месяц или выручка выше 20 млн долларов в месяц, название модели нужно показывать в интерфейсе. Если вы продаёте доступ к модели через API или делаете продукт для ИИ-помощи в кодинге и офисной работе, нужна отдельная лицензия Qwen. Компании, которая использует модель в своих процессах, это обычно не мешает. Граница между внутренним использованием и доступом для третьих лиц описана в лицензии коротко, так что при сомнениях прочитайте текст целиком или спросите юриста.
Технические ограничения из README. Первый запуск может подвесить компьютер на одну-три минуты, пока модель грузится в оперативку. Запросы по умолчанию обрабатываются по одному, остальные ждут в очереди. Первое сообщение диалога читается примерно минуту на каждые 30 тысяч токенов, следующие стартуют за секунды. Модель сжата до 2 и 3 бит, и автор пишет, что большие размеры чуть умнее маленьких. Как она справляется с русским, в README не сказано, это проверяется на ваших текстах. Версия 0.1, проект меняется каждый день.
Для бота, с которым одновременно говорят десятки клиентов, такой вариант слабый. Для работы сотрудников и ночной обработки документов он подходит.
Что можно сделать уже сейчас
- Проверьте, что у вас уже есть: видеокарта на 12 ГБ и больше, 32 ГБ оперативки. Если нет, сначала прикиньте доплату за железо и только потом считайте экономию на облаке.
- Поставьте Strata на один компьютер и прогоните 20 настоящих документов или вопросов клиентов. Качество на русском оценивайте на своих данных.
- Подключите её к процессам: сайт, бот в Telegram или MAX, обработка входящих файлов. Все они обращаются по стандартному адресу OpenAI. Для доступа с другого компьютера задайте ключ, документация требует этого всегда.
- Для работы с корпоративными документами добавьте поиск по вашей базе знаний, как в RAG-системах. Тогда модель отвечает по вашим файлам, а не из головы.
Прикидка для ночной обработки: договор на 30 тысяч токенов читается около минуты, значит 100 договоров займут примерно полтора-два часа. Это арифметика по цифре из README.
Частые вопросы
Можно ли использовать Strata в коммерческих целях?
Сама программа лицензирована как MIT, это разрешает. Для модели действует Qwen Community License 1.0 с двумя условиями, описанными выше. Для внутренних процессов компании они обычно не мешают. Перед запуском перечитайте актуальный файл LICENSE на странице модели, условия могут измениться.
Хватит ли карты на 8 ГБ?
Нет, минимум по README 12 ГБ видеопамяти. Для старых карт и Intel Arc есть экспериментальные инструкции от сообщества, для работы я бы их не брал.
Что лучше для бота компании, Strata или облако?
Зависит от нагрузки и данных. Облако проще масштабируется. Strata оставляет данные у вас, но отвечает по одному запросу за раз. Если клиентов много, закладывайте облако или сервер с видеокартой.
Коротко о главном
Strata делает большую открытую модель доступной на игровом ПК. Проекту две недели, автор один, обновления выходят каждый день. Скорости в README получены автором на его железе, а лицензию модели стоит прочитать до запуска.
Хотите свой ИИ без облака, но не хотите сами разбираться с установкой, лицензиями и подключением к сайту, мессенджерам и документам? Напишите мне в Telegram слово «ВИДЕОКАРТА». Проверим ваше железо, прогоним пробу на ваших данных и скажем честно, хватит ли Ollama. Условия работ есть на странице цен, а как я делаю ИИ-агентов, описано на странице услуги.
Что я делаю для бизнеса
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


