Речь в текстСинтез речи

Vosk (русские модели)

Офлайн-распознавание русской речи, которое работает даже на Raspberry Pi и телефоне, без интернета. Есть потоковые модели для живого звука и простой русский синтез речи Vosk TTS.

Разработчик
Alpha Cephei, Россия
Первый выпуск
фев 2023
Последний выпуск
сен 2025
Размеры
около 45 МБ – 1,8 ГБ
Лицензия
Можно в коммерциюApache 2.0

Какие задачи решает

  • Расшифровка звонков и записей на русском без облака
  • Голосовое управление в приложениях и киосках
  • Распознавание речи в потоке с малой задержкой
  • Простая озвучка текста на русском

Где применяется

Колл-центрыВстраиваемые устройства и киоскиМобильные приложенияПредприятия с закрытым контуром

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. Streaming ru 0.56
  2. vosk-model-ru-0.54 (Zipformer2)
  3. Vosk TTS на StableTTS
  4. Vosk TTS ru multi
  5. Small Streaming (Zipformer)
  6. vosk-model-ru-0.42

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели