Речь в текст

Moonshine

Очень маленькие и быстрые модели распознавания речи для телефонов, планшетов и встраиваемых устройств. Вторая версия работает потоково и выдаёт текст, пока человек ещё говорит.

Разработчик
Moonshine AI (Useful Sensors), США
Первый выпуск
окт 2024
Последний выпуск
авг 2026
Размеры
27M – 245M
Лицензия
Можно в коммерциюMIT; исключение — старые непотоковые модели для языков кроме английского (некоммерческая Moonshine Community License)

Какие задачи решает

  • Голосовое управление устройствами
  • Распознавание на телефоне без интернета
  • Живые субтитры
  • Голосовые интерфейсы в приложениях

Где применяется

Производители устройствМобильные приложенияУмный домКиоски и терминалы

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. Потоковые модели для других языков
  2. Moonshine v2 (потоковая)
  3. Moonshine Tiny / Base

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели