Открытые ИИ-модели для языков народов России

Большие модели знают русский и английский, а дальше начинается пустота: для языков народов России готовых решений почти нет, и то, что есть, собрано небольшими командами и энтузиастами. Здесь собраны такие модели: распознавание речи, синтез, перевод, разбор текста. Качество у них разное, проверять надо на своих записях, но это единственный способ сделать сервис на родном языке, не дожидаясь, пока до него дойдут большие разработчики.

В подборке 15 семейств открытых моделей.Обновлено 22.09.2026Открыть весь каталог с фильтрами
ПереводRUGGUF2026

TuvanGemma

Mergen Kungaa · не раскрыта

Перевод русский — тувинский, работает на своём компьютере: готовые сборки GGUF, адаптер LoRA и отдельное приложение под Windows. Автор сам предупреждает, что имена, числа и важный текст надо перепроверять у носителя языка.

  • Перевод документов и объявлений на тувинский
  • Перевод тувинских текстов на русский
  • Черновой перевод без отправки данных наружу
Размеры
4B и 12B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстRU2025–2026

Лаборатория ИИ СВФУ: якутский язык

Лаборатория искусственного интеллекта Северо-Восточного федерального университета · Россия

Самый полный набор моделей для якутского языка в одном месте: языковые модели разных размеров, перевод с русского и на русский, эмбеддинги и распознавание текста с изображений. Качество у моделей разное, проверять надо на своих данных.

  • Ответы и переписка на якутском языке
  • Перевод документов и материалов
  • Поиск по смыслу в якутских текстах
Размеры
1.1B – 27B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Разбор текстаRU2026

BashkirRoBERTa и набор моделей для башкирского

Tvoy_Tezka (failed09) · не раскрыта

Небольшой набор инструментов для башкирского текста: языковая модель с заполнением пропусков, определитель башкирского языка, эмбеддинги fastText, оценщик пар с русским и восстановление башкирских букв. Всё это выложено осенью 2026 года, качество надо проверять на своих данных.

  • Проверка орфографии и подсказка слов на башкирском
  • Отделение башкирских текстов от чужих
  • Восстановление специфических букв в тексте
Размеры
50M у BashkirRoBERTa
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Речь в текстRU2022–2026

Распознавание речи для башкирского, татарского и марийского (AigizK)

Айгиз Кунафин (AigizK), участник сообщества SLONE · Россия

Многолетняя работа одного энтузиаста вокруг башкирского Common Voice: дообучения Whisper, wav2vec2, w2v-BERT и GigaAM под башкирский, татарский и марийский языки. Качество у моделей разное, проверять надо на своих записях.

  • Расшифровка звонков и совещаний на башкирском и татарском
  • Субтитры к видео и радиоэфирам
  • Перевод архивных записей в текст
Размеры
от 220M до 1B в разных моделях
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ПереводRU2022–2026

SLONE: перевод для языков народов России

SLONE (David Dale, Айгиз Кунафин и другие) · не раскрыта

Сообщество, которое достраивает NLLB и mBART под малоресурсные языки. В моделях есть эрзянский, тувинский, башкирский, татарский, чувашский, бурятский, марийский, хакасский и карачаево-балкарский. Качество по языкам разное, проверять надо на своих текстах.

  • Перевод с русского на национальный язык и обратно
  • Подготовка двуязычных материалов и вывесок
  • Поиск соответствий в параллельных текстах
Размеры
42M у компактных энкодеров, 620M – 758M у переводчиков
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Разбор текстаRU2026

Tatar NLP Community

Tatar NLP Community · не раскрыта

Свежий набор моделей для татарского языка: разбор слов по морфологии на нескольких базах, вопросы и ответы по татарским и русским топонимам, дообучения Mistral и GPT-2 под татарский.

  • Морфологический разбор татарских текстов
  • Поиск ответов по названиям мест
  • Генерация текста на татарском
Размеры
178M у моделей морфологии, 7B у дообучения Mistral
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Речь в текстRU2024–2025

Распознавание карельской речи (Mihaj)

Mihaj Dolgushin · не раскрыта

Два десятка дообучений Whisper, wav2vec2 и WavLM под карельский язык, в том числе под записи, где человек переходит с карельского на русский. Карточки моделей пустые, качество надо проверять на своих записях.

  • Расшифровка полевых и архивных записей на карельском
  • Субтитры к материалам на карельском языке
  • Работа с записями, где смешаны карельский и русский
Размеры
от 300M до 1B в разных моделях
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Разбор текстаRUGGUF2025

mmBERT

Университет Джонса Хопкинса (JHU CLSP) · США

Многоязычный энкодер, обученный более чем на 1800 языках. В список входят татарский, башкирский, чувашский, удмуртский, бурятский, коми, ингушский и другие языки народов России. Основа для классификаторов и поиска по таким текстам.

  • Классификация обращений и документов на национальных языках
  • Поиск по смыслу в текстах на редких языках
  • Извлечение имён, дат и названий из текста
Размеры
140M и 307M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Поиск и RAGRU2023–2025

LaBSE для языков народов России (lingtrain)

lingtrain · не раскрыта

Набор дообучений LaBSE, которые переводят предложения в векторы: бурятский, марийский, удмуртский, ингушский, чувашский, якутский и калмыцкий. Обучены на парах с русским, качество по языкам разное.

  • Сопоставление параллельных текстов на русском и национальном языке
  • Поиск по смыслу в двуязычных архивах
  • Сборка обучающих наборов для перевода
Размеры
дообучение LaBSE, размер в параметрах на карточках не указан
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речиRU2025

F5-TTS для чувашского языка

Misha Yakovlev (Misha24-10) · не раскрыта

Синтез чувашской речи: дообучение F5-TTS поверх русской версии на 24 часах записей Common Voice. Умеет повторять голос из примера — использовать только с согласия владельца голоса. Автор называет это экспериментом, качество надо проверять на своих текстах.

  • Озвучивание текстов на чувашском языке
  • Голосовые подсказки и объявления
  • Аудиоверсии материалов для обучения
Размеры
размер в параметрах на карточке не указан
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Разбор текстаRUНе развивается2024

Zerpal: модели для удмуртского языка

udmurtNLP · не раскрыта

Проект вокруг удмуртского языка: энкодеры на базе mBERT, rubert-tiny2 и Glot500, разметчики частей речи, модель исправления опечаток и эмбеддинги удмуртского с английским.

  • Разбор удмуртских текстов по частям речи
  • Исправление опечаток и ошибок распознавания
  • Поиск по смыслу в удмуртских материалах
Размеры
33M – 187M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Разбор текстаRUНе развивается2023–2024

GlotLID

CIS, Университет Людвига-Максимилиана в Мюнхене · Германия

Определяет, на каком языке написан текст: в третьей версии более двух тысяч меток, включая татарский, башкирский, чувашский, удмуртский, марийский, эрзянский, коми и другие языки народов России.

  • Разбор смешанных архивов текстов по языкам
  • Отсев мусора и чужих языков перед обучением моделей
  • Маршрутизация обращений на нужного оператора или модель
Размеры
модель FastText, число параметров на карточке не указано
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстRUGGUFНе развивается2024

Tweety Tatar

Tweeties (Francois Remy, Гентский университет, и соавторы) · Бельгия

Языковая модель для татарского языка: Mistral 7B, переведённая на татарский токенизатор, плюс версия для перевода между татарским и десятком других языков, включая русский. Качество надо проверять на своих текстах.

  • Генерация и продолжение текстов на татарском
  • Перевод между татарским и русским
  • Основа для дообучения под свою задачу
Размеры
7B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Речь в текстRUНе развивается2023

MMS (Massively Multilingual Speech)

Meta AI · США

Речевые модели Meta более чем на тысячу языков. В списке поддержки есть башкирский, татарский, чувашский, якутский, осетинский, чеченский, аварский, удмуртский, марийский, эрзянский, мокшанский, калмыцкий и карельский. Качество по языкам очень разное, проверять надо на своих записях.

  • Расшифровка аудио и видео на редких языках
  • Озвучивание текста на национальном языке
  • Определение, на каком языке звучит запись
Размеры
300M – 1B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
ТекстRUGGUFНе развивается2023

mGPT 1.3B для языков народов России

SberDevices (ai-forever) · Россия

Отдельные версии mGPT под один язык каждая: башкирский, бурятский, калмыцкий, марийский, осетинский, татарский, тувинский, чувашский и якутский. В карточках у каждой заявлены также русский и английский.

  • Генерация и продолжение текста на национальном языке
  • Основа для дообучения под свою задачу
  • Опыты с редкими языками без обучения с нуля
Размеры
1.3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее

Подборки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение