Разработка 4 мин чтения

Strata: большой свой ИИ на игровой видеокарте, без облака

Strata запускает большую модель Qwen3.8-Flash-Next на обычном игровом ПК и поднимает локальный API, совместимый с OpenAI и Anthropic. Разбираю, кто стоит за проектом, что в лицензиях, какие требования и когда достаточно Ollama.

локальный ИИStrataQwenopen-source
Коротко. Strata это бесплатная программа с открытым кодом (MIT). Она запускает большую модель Qwen3.8-Flash-Next на обычном игровом ПК: видеокарта от 12 ГБ, оперативной памяти от 32 ГБ. Поднимает локальный API, совместимый с OpenAI и Anthropic, читает картинки и ставится двойным кликом на Windows и Linux. Проекту две недели, у него один основной автор и почти 18 тысяч звёзд на GitHub. Для компании это свой ИИ без облака на обычном железе, но скорость и качество надо проверять на своих задачах.

Большая модель на игровом ПК

Модели уровня Qwen3.8-Flash-Next обычно живут на серверах с сотнями гигабайт видеопамяти. В ней 125 миллиардов параметров, из них на каждое слово работают около 6 миллиардов, так указано на странице модели на Hugging Face. Небольшой компании оставалось платить облаку и отдавать ему договоры и переписку клиентов или покупать сервер, который окупится нескоро.

Проект Strata предлагает третий вариант. Модель стоит на компьютере с игровой видеокартой, а ваши программы обращаются к ней по адресу http://127.0.0.1:8080/v1, как к обычному OpenAI. По словам автора в README, ничего не уходит за пределы компьютера.

Что я проверил по репозиторию на 8 октября 2026. Он создан 24 сентября, ему 14 дней. Звёзд 17 806, форков 1 573, открытых обсуждений 413. Релиз v0.1.40.4 вышел сегодня утром. Основной автор один, пользователь Niko1221: у него 868 коммитов, а у следующих участников по 10 до 21. За проектом нет компании, это личный профиль с единственным репозиторием и сообщество вокруг него.

Как модель помещается в 12 ГБ

Модель устроена как команда из 24 576 мелких специалистов, в README их называют экспертами. На каждое слово нужны только десять. Видеокарта хранит самых востребованных, оперативная память держит всех, процессор считает остальных параллельно с картой, а SSD хранит большую таблицу подсказок. Если в компьютере две или три карты NVIDIA, модель делится между ними.

Требования по README: видеокарта NVIDIA RTX 20, 30, 40 или 50 серии либо одна из перечисленных карт AMD, не меньше 12 ГБ видеопамяти. Оперативной памяти 32 ГБ и больше, на 64 ГБ работают все размеры модели. На диске около 80 ГБ, лучше на SSD. Скачивается примерно 70 ГБ.

Автор приводит свои замеры. На RTX 5070 с 12 ГБ, Ryzen 5 7600 и 64 ГБ оперативки размер IQ2_XS пишет ответ со скоростью 79 токенов в секунду и читает запрос со скоростью 2 090 токенов в секунду. Размер IQ3_S даёт 53 и 1 620. Я эти цифры на своём железе не повторял, считайте их данными автора на одной конфигурации.

Strata, Ollama или llama.cpp

Strata использует части llama.cpp, это написано в README, и заточена под одну модель в нескольких размерах. llama.cpp и Ollama работают с десятками разных моделей. Поддерживают ли они Qwen3.8-Flash-Next и с какой скоростью, я не проверял.

Если задача решается моделью на 7 или 14 миллиардов параметров, которая целиком влезает в видеопамять, берите Ollama. Она проще, давно живёт, у неё большое сообщество, и 64 ГБ оперативки под неё покупать не надо. Для типовых ответов клиентам и сортировки писем этого часто хватает.

Strata имеет смысл, когда маленькая модель не справляется: длинные договоры, сложные рассуждения, разбор кода, документы с картинками. И при этом нет бюджета на серверную видеокарту. Сколько памяти нужно под модели разного размера, я считал в статье о железе для локального ИИ.

Что важно учесть

Лицензия самой Strata MIT, текст лежит в файле LICENSE репозитория. Использовать, менять и применять в коммерческих целях можно. Модель идёт отдельно, у неё Qwen Community License 1.0. Она разрешает использовать, размещать у себя, дообучать и продавать. Условий два. Если у вашего продукта больше 100 миллионов пользователей в месяц или выручка выше 20 млн долларов в месяц, название модели нужно показывать в интерфейсе. Если вы продаёте доступ к модели через API или делаете продукт для ИИ-помощи в кодинге и офисной работе, нужна отдельная лицензия Qwen. Компании, которая использует модель в своих процессах, это обычно не мешает. Граница между внутренним использованием и доступом для третьих лиц описана в лицензии коротко, так что при сомнениях прочитайте текст целиком или спросите юриста.

Технические ограничения из README. Первый запуск может подвесить компьютер на одну-три минуты, пока модель грузится в оперативку. Запросы по умолчанию обрабатываются по одному, остальные ждут в очереди. Первое сообщение диалога читается примерно минуту на каждые 30 тысяч токенов, следующие стартуют за секунды. Модель сжата до 2 и 3 бит, и автор пишет, что большие размеры чуть умнее маленьких. Как она справляется с русским, в README не сказано, это проверяется на ваших текстах. Версия 0.1, проект меняется каждый день.

Для бота, с которым одновременно говорят десятки клиентов, такой вариант слабый. Для работы сотрудников и ночной обработки документов он подходит.

Что можно сделать уже сейчас

  • Проверьте, что у вас уже есть: видеокарта на 12 ГБ и больше, 32 ГБ оперативки. Если нет, сначала прикиньте доплату за железо и только потом считайте экономию на облаке.
  • Поставьте Strata на один компьютер и прогоните 20 настоящих документов или вопросов клиентов. Качество на русском оценивайте на своих данных.
  • Подключите её к процессам: сайт, бот в Telegram или MAX, обработка входящих файлов. Все они обращаются по стандартному адресу OpenAI. Для доступа с другого компьютера задайте ключ, документация требует этого всегда.
  • Для работы с корпоративными документами добавьте поиск по вашей базе знаний, как в RAG-системах. Тогда модель отвечает по вашим файлам, а не из головы.

Прикидка для ночной обработки: договор на 30 тысяч токенов читается около минуты, значит 100 договоров займут примерно полтора-два часа. Это арифметика по цифре из README.

Частые вопросы

Можно ли использовать Strata в коммерческих целях?

Сама программа лицензирована как MIT, это разрешает. Для модели действует Qwen Community License 1.0 с двумя условиями, описанными выше. Для внутренних процессов компании они обычно не мешают. Перед запуском перечитайте актуальный файл LICENSE на странице модели, условия могут измениться.

Хватит ли карты на 8 ГБ?

Нет, минимум по README 12 ГБ видеопамяти. Для старых карт и Intel Arc есть экспериментальные инструкции от сообщества, для работы я бы их не брал.

Что лучше для бота компании, Strata или облако?

Зависит от нагрузки и данных. Облако проще масштабируется. Strata оставляет данные у вас, но отвечает по одному запросу за раз. Если клиентов много, закладывайте облако или сервер с видеокартой.

Коротко о главном

Strata делает большую открытую модель доступной на игровом ПК. Проекту две недели, автор один, обновления выходят каждый день. Скорости в README получены автором на его железе, а лицензию модели стоит прочитать до запуска.

Хотите свой ИИ без облака, но не хотите сами разбираться с установкой, лицензиями и подключением к сайту, мессенджерам и документам? Напишите мне в Telegram слово «ВИДЕОКАРТА». Проверим ваше железо, прогоним пробу на ваших данных и скажем честно, хватит ли Ollama. Условия работ есть на странице цен, а как я делаю ИИ-агентов, описано на странице услуги.

Услуги по теме

Что я делаю для бизнеса

  • Боты в Telegram, MAX, VK
  • Автоматизация процессов и CRM
  • Аналитика и дашборды
  • Сайты и лендинги под ключ

Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»

12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.

Готовы обсудить вашу задачу?

Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.

Пишу о разработке, ИИ и законах для бизнеса

Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.

Готовые решения под ключTurnkey solutionsSoluciones llave en mano交钥匙解决方案Түлхүүр гардуулах шийдэл 451 готовых IT-решений для бизнеса451 ready-made IT solutions for business451 soluciones IT listas para empresas451 个面向企业的现成 IT 解决方案Бизнест зориулсан 451 бэлэн IT шийдэл Автоматизация, боты, AI, 152-ФЗ и платформы · бесплатная консультацияAutomation, bots, AI, data privacy and platforms · free consultationAutomatización, bots, IA, privacidad de datos y plataformas · consulta gratis自动化、机器人、AI、数据合规与平台 · 免费咨询Автоматжуулалт, бот, AI, өгөгдлийн хамгаалалт ба платформ · үнэгүй зөвлөгөө Смотреть каталогView catalogVer catálogo查看目录Каталог үзэх