Речь в текст

Распознавание речи для башкирского, татарского и марийского (AigizK)

Многолетняя работа одного энтузиаста вокруг башкирского Common Voice: дообучения Whisper, wav2vec2, w2v-BERT и GigaAM под башкирский, татарский и марийский языки. Качество у моделей разное, проверять надо на своих записях.

Разработчик
Айгиз Кунафин (AigizK), участник сообщества SLONE, Россия
Первый выпуск
мар 2022
Последний выпуск
июл 2026
Размеры
от 220M до 1B в разных моделях
Лицензия
Коммерция с условиямиразная у моделей: Apache 2.0 и MIT у большинства, у модели для татарского CC-BY-NC 4.0
Русский язык
Есть
Готовые сборки
8 бит
Запуск
Через свой серверРаботает и без видеокарты
Сферы
Медиа и продакшн, Госсектор, Образование, Поддержка клиентов

Какие задачи решает

  • Расшифровка звонков и совещаний на башкирском и татарском
  • Субтитры к видео и радиоэфирам
  • Перевод архивных записей в текст
  • Голосовой ввод в приложениях на национальном языке

Где применяется

Медиа и вещаниеГосударственные и муниципальные учрежденияОбразование и культура

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. GigaAM Bashkir CV25 и сборка ONNX
  2. w2v-BERT 2.0 для марийского (Common Voice 17)
  3. MMS-1B для татарского, версия 2
  4. Whisper small для башкирского
  5. wav2vec2 XLS-R для башкирского (Common Voice 7)

Как запустить

На своём сервереВеса скачиваются с Hugging Face, запуск — через vLLM (нагрузка и API) или llama.cpp (скромное железо). Так модель работает в закрытом контуре, без оплаты за запросы.Hugging Face
Сколько нужно железаПосчитайте видеопамять под нужный размер модели, контекст и число одновременных запросов.Открыть калькулятор железа

Ставлю и настраиваю под ключ: подберу размер модели, разверну на вашем сервере, подключу к вашим системам. Квантование — сжатие модели: она занимает меньше видеопамяти и работает на более скромном железе. Отвечает при этом чуть иначе, поэтому качество проверяют на своих примерах.

Частые вопросы

Можно ли использовать Распознавание речи для башкирского, татарского и марийского (AigizK) в коммерческом проекте?

С условиями. Лицензия: разная у моделей: Apache 2.0 и MIT у большинства, у модели для татарского CC-BY-NC 4.0. Ограничения бывают разными — регион, выручка компании, требование указывать авторство. Перед коммерческим запуском проверьте условия с юристом.

Какое железо нужно для Распознавание речи для башкирского, татарского и марийского (AigizK)?

Минимум: Ноутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии. Есть версии, которые работают и без видеокарты, на обычном процессоре. Точный объём видеопамяти под ваш размер модели и контекст можно посчитать в калькуляторе железа.

Поддерживает ли Распознавание речи для башкирского, татарского и марийского (AigizK) русский язык?

Да, русский язык заявлен в карточке модели.

Где скачать Распознавание речи для башкирского, татарского и марийского (AigizK) и сколько это стоит?

Веса Распознавание речи для башкирского, татарского и марийского (AigizK) лежат в открытом доступе и скачиваются бесплатно. Платить нужно только за железо, на котором модель работает, и за настройку. Ссылки на первоисточник — в конце страницы.

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели

Источник: huggingface.co/AigizK/GigaAM-Bashkir-CV25. Данные сверены с карточкой модели 22.09.2026. Лицензию перед коммерческим запуском проверьте с юристом.