Разбор текстаПоиск и RAG

BashkirRoBERTa и набор моделей для башкирского

Небольшой набор инструментов для башкирского текста: языковая модель с заполнением пропусков, определитель башкирского языка, эмбеддинги fastText, оценщик пар с русским и восстановление башкирских букв. Всё это выложено осенью 2026 года, качество надо проверять на своих данных.

Разработчик
Tvoy_Tezka (failed09), не раскрыта
Первый выпуск
сен 2026
Последний выпуск
сен 2026
Размеры
50M у BashkirRoBERTa
Лицензия
Коммерция с условиямиApache 2.0 у большинства моделей; у BashkirRoBERTa — собственные условия разработчика
Русский язык
Есть
Готовые сборки
8 бит
Запуск
Через свой серверРаботает и без видеокарты
Сферы
Документы и бухгалтерия, Образование, Медиа и продакшн, Наука

Какие задачи решает

  • Проверка орфографии и подсказка слов на башкирском
  • Отделение башкирских текстов от чужих
  • Восстановление специфических букв в тексте
  • Подбор соответствий башкирский — русский

Где применяется

Документооборот и архивыОбразование и культураМедиа и издательства

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. Восстановление башкирских букв
  2. Эмбеддинги fastText
  3. Оценщик пар предложений башкирский — русский
  4. Определитель башкирского языка
  5. BashkirRoBERTa

Как запустить

На своём сервереВеса скачиваются с Hugging Face, запуск — через vLLM (нагрузка и API) или llama.cpp (скромное железо). Так модель работает в закрытом контуре, без оплаты за запросы.Hugging Face
Сколько нужно железаПосчитайте видеопамять под нужный размер модели, контекст и число одновременных запросов.Открыть калькулятор железа

Ставлю и настраиваю под ключ: подберу размер модели, разверну на вашем сервере, подключу к вашим системам. Квантование — сжатие модели: она занимает меньше видеопамяти и работает на более скромном железе. Отвечает при этом чуть иначе, поэтому качество проверяют на своих примерах.

Частые вопросы

Можно ли использовать BashkirRoBERTa и набор моделей для башкирского в коммерческом проекте?

С условиями. Лицензия: Apache 2.0 у большинства моделей; у BashkirRoBERTa — собственные условия разработчика. Ограничения бывают разными — регион, выручка компании, требование указывать авторство. Перед коммерческим запуском проверьте условия с юристом.

Какое железо нужно для BashkirRoBERTa и набор моделей для башкирского?

Минимум: Ноутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии. Есть версии, которые работают и без видеокарты, на обычном процессоре. Точный объём видеопамяти под ваш размер модели и контекст можно посчитать в калькуляторе железа.

Поддерживает ли BashkirRoBERTa и набор моделей для башкирского русский язык?

Да, русский язык заявлен в карточке модели.

Где скачать BashkirRoBERTa и набор моделей для башкирского и сколько это стоит?

Веса BashkirRoBERTa и набор моделей для башкирского лежат в открытом доступе и скачиваются бесплатно. Платить нужно только за железо, на котором модель работает, и за настройку. Ссылки на первоисточник — в конце страницы.

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели

Речь в текстРаспознавание речи для башкирского, татарского и марийского (AigizK)Айгиз Кунафин (AigizK), участник сообщества SLONE · РоссияКоммерция с условиями

Многолетняя работа одного энтузиаста вокруг башкирского Common Voice: дообучения Whisper, wav2vec2, w2v-BERT и GigaAM под башкирский, татарский и марийский языки. Качество у моделей разное, проверять надо на своих записях.

Подробнее
ПереводSLONE: перевод для языков народов РоссииSLONE (David Dale, Айгиз Кунафин и другие) · не раскрытаКоммерция с условиями

Сообщество, которое достраивает NLLB и mBART под малоресурсные языки. В моделях есть эрзянский, тувинский, башкирский, татарский, чувашский, бурятский, марийский, хакасский и карачаево-балкарский. Качество по языкам разное, проверять надо на своих текстах.

Подробнее
Разбор текстаGlotLIDCIS, Университет Людвига-Максимилиана в Мюнхене · ГерманияМожно в коммерцию

Определяет, на каком языке написан текст: в третьей версии более двух тысяч меток, включая татарский, башкирский, чувашский, удмуртский, марийский, эрзянский, коми и другие языки народов России.

Подробнее

Источник: huggingface.co/failed09/bashkir-roberta. Данные сверены с карточкой модели 22.09.2026. Лицензию перед коммерческим запуском проверьте с юристом.