Большие модели знают русский и английский, а дальше начинается пустота: для языков народов России готовых решений почти нет, и то, что есть, собрано небольшими командами и энтузиастами. Здесь собраны такие модели: распознавание речи, синтез, перевод, разбор текста. Качество у них разное, проверять надо на своих записях, но это единственный способ сделать сервис на родном языке, не дожидаясь, пока до него дойдут большие разработчики.
Перевод русский — тувинский, работает на своём компьютере: готовые сборки GGUF, адаптер LoRA и отдельное приложение под Windows. Автор сам предупреждает, что имена, числа и важный текст надо перепроверять у носителя языка.
Лаборатория искусственного интеллекта Северо-Восточного федерального университета · Россия
Самый полный набор моделей для якутского языка в одном месте: языковые модели разных размеров, перевод с русского и на русский, эмбеддинги и распознавание текста с изображений. Качество у моделей разное, проверять надо на своих данных.
Небольшой набор инструментов для башкирского текста: языковая модель с заполнением пропусков, определитель башкирского языка, эмбеддинги fastText, оценщик пар с русским и восстановление башкирских букв. Всё это выложено осенью 2026 года, качество надо проверять на своих данных.
Проверка орфографии и подсказка слов на башкирском
Айгиз Кунафин (AigizK), участник сообщества SLONE · Россия
Многолетняя работа одного энтузиаста вокруг башкирского Common Voice: дообучения Whisper, wav2vec2, w2v-BERT и GigaAM под башкирский, татарский и марийский языки. Качество у моделей разное, проверять надо на своих записях.
Расшифровка звонков и совещаний на башкирском и татарском
SLONE (David Dale, Айгиз Кунафин и другие) · не раскрыта
Сообщество, которое достраивает NLLB и mBART под малоресурсные языки. В моделях есть эрзянский, тувинский, башкирский, татарский, чувашский, бурятский, марийский, хакасский и карачаево-балкарский. Качество по языкам разное, проверять надо на своих текстах.
Перевод с русского на национальный язык и обратно
Подготовка двуязычных материалов и вывесок
Поиск соответствий в параллельных текстах
Размеры
42M у компактных энкодеров, 620M – 758M у переводчиков
Свежий набор моделей для татарского языка: разбор слов по морфологии на нескольких базах, вопросы и ответы по татарским и русским топонимам, дообучения Mistral и GPT-2 под татарский.
Морфологический разбор татарских текстов
Поиск ответов по названиям мест
Генерация текста на татарском
Размеры
178M у моделей морфологии, 7B у дообучения Mistral
Два десятка дообучений Whisper, wav2vec2 и WavLM под карельский язык, в том числе под записи, где человек переходит с карельского на русский. Карточки моделей пустые, качество надо проверять на своих записях.
Расшифровка полевых и архивных записей на карельском
Субтитры к материалам на карельском языке
Работа с записями, где смешаны карельский и русский
Многоязычный энкодер, обученный более чем на 1800 языках. В список входят татарский, башкирский, чувашский, удмуртский, бурятский, коми, ингушский и другие языки народов России. Основа для классификаторов и поиска по таким текстам.
Классификация обращений и документов на национальных языках
Набор дообучений LaBSE, которые переводят предложения в векторы: бурятский, марийский, удмуртский, ингушский, чувашский, якутский и калмыцкий. Обучены на парах с русским, качество по языкам разное.
Сопоставление параллельных текстов на русском и национальном языке
Поиск по смыслу в двуязычных архивах
Сборка обучающих наборов для перевода
Размеры
дообучение LaBSE, размер в параметрах на карточках не указан
Синтез чувашской речи: дообучение F5-TTS поверх русской версии на 24 часах записей Common Voice. Умеет повторять голос из примера — использовать только с согласия владельца голоса. Автор называет это экспериментом, качество надо проверять на своих текстах.
Проект вокруг удмуртского языка: энкодеры на базе mBERT, rubert-tiny2 и Glot500, разметчики частей речи, модель исправления опечаток и эмбеддинги удмуртского с английским.
CIS, Университет Людвига-Максимилиана в Мюнхене · Германия
Определяет, на каком языке написан текст: в третьей версии более двух тысяч меток, включая татарский, башкирский, чувашский, удмуртский, марийский, эрзянский, коми и другие языки народов России.
Разбор смешанных архивов текстов по языкам
Отсев мусора и чужих языков перед обучением моделей
Маршрутизация обращений на нужного оператора или модель
Размеры
модель FastText, число параметров на карточке не указано
Tweeties (Francois Remy, Гентский университет, и соавторы) · Бельгия
Языковая модель для татарского языка: Mistral 7B, переведённая на татарский токенизатор, плюс версия для перевода между татарским и десятком других языков, включая русский. Качество надо проверять на своих текстах.
Речевые модели Meta более чем на тысячу языков. В списке поддержки есть башкирский, татарский, чувашский, якутский, осетинский, чеченский, аварский, удмуртский, марийский, эрзянский, мокшанский, калмыцкий и карельский. Качество по языкам очень разное, проверять надо на своих записях.
Отдельные версии mGPT под один язык каждая: башкирский, бурятский, калмыцкий, марийский, осетинский, татарский, тувинский, чувашский и якутский. В карточках у каждой заявлены также русский и английский.
Генерация и продолжение текста на национальном языке
Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.
ПодберуМодель и размер под задачу и бюджет на железо
ПоставлюНа ваш сервер или в закрытый контур, с API