Синтез речи

MOSS-TTS / MOSS-TTSD

Семейство синтеза речи: озвучка диалогов на несколько голосов (TTSD), быстрый синтез для живого общения и крошечная Nano. Версия 1.5 поддерживает 30+ языков, включая русский.

Разработчик
OpenMOSS (Фуданьский университет), Китай
Первый выпуск
июн 2025
Последний выпуск
май 2026
Размеры
100M – 8.5B
Лицензия
Можно в коммерциюApache 2.0

Какие задачи решает

  • Озвучка подкастов и диалогов
  • Голос для ассистента
  • Клонирование голоса
  • Многоязычная озвучка

Где применяется

Медиа и подкастыОнлайн-обучениеГолосовые боты

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. MOSS-TTS v1.5
  2. MOSS-TTS Nano 100M
  3. MOSS-TTS, TTSD v1.0 и Realtime
  4. MOSS-TTSD v0.7
  5. MOSS-TTSD v0

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели