Речь в текстСинтез речи

MMS (Massively Multilingual Speech)

Речевые модели Meta более чем на тысячу языков. В списке поддержки есть башкирский, татарский, чувашский, якутский, осетинский, чеченский, аварский, удмуртский, марийский, эрзянский, мокшанский, калмыцкий и карельский. Качество по языкам очень разное, проверять надо на своих записях.

Последняя открытая версия вышла в сен 2023. Семейство давно не обновлялось: это не значит, что модель не работает, но свежих исправлений и новых размеров ждать не стоит.

Разработчик
Meta AI, США
Первый выпуск
май 2023
Последний выпуск
сен 2023
Размеры
300M – 1B
Лицензия
Только некоммерческоеCC-BY-NC 4.0 — только некоммерческое использование
Русский язык
Есть
Запуск
Через свой серверРаботает и без видеокарты
Сферы
Медиа и продакшн, Госсектор, Образование, Поддержка клиентов

Какие задачи решает

  • Расшифровка аудио и видео на редких языках
  • Озвучивание текста на национальном языке
  • Определение, на каком языке звучит запись
  • Основа для дообучения под один конкретный язык

Где применяется

Медиа, архивы и библиотекиГосударственные и муниципальные учрежденияОбразование и сохранение языков

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. MMS-TTS, отдельные модели синтеза по языкам
  2. MMS-LID, определение языка записи
  3. MMS-1B-all, распознавание речи

Как запустить

На своём сервереВеса скачиваются с Hugging Face, запуск — через vLLM (нагрузка и API) или llama.cpp (скромное железо). Так модель работает в закрытом контуре, без оплаты за запросы.Hugging Face
Сколько нужно железаПосчитайте видеопамять под нужный размер модели, контекст и число одновременных запросов.Открыть калькулятор железа

Ставлю и настраиваю под ключ: подберу размер модели, разверну на вашем сервере, подключу к вашим системам.

Частые вопросы

Можно ли использовать MMS (Massively Multilingual Speech) в коммерческом проекте?

Нет. Лицензия: CC-BY-NC 4.0 — только некоммерческое использование. Для коммерческого продукта нужна другая модель или отдельное соглашение с правообладателем.

Какое железо нужно для MMS (Massively Multilingual Speech)?

Минимум: Ноутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии. Есть версии, которые работают и без видеокарты, на обычном процессоре. Точный объём видеопамяти под ваш размер модели и контекст можно посчитать в калькуляторе железа.

Поддерживает ли MMS (Massively Multilingual Speech) русский язык?

Да, русский язык заявлен в карточке модели.

Где скачать MMS (Massively Multilingual Speech) и сколько это стоит?

Веса MMS (Massively Multilingual Speech) лежат в открытом доступе и скачиваются бесплатно. Платить нужно только за железо, на котором модель работает, и за настройку. Ссылки на первоисточник — в конце страницы.

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели

Источник: huggingface.co/facebook/mms-1b-all. Данные сверены с карточкой модели 22.09.2026. Лицензию перед коммерческим запуском проверьте с юристом.