Синтез речи

IndexTTS

Синтез речи с клонированием голоса и точным контролем длительности, удобен для дубляжа видео. Управляет эмоциями отдельно от тембра.

Разработчик
bilibili, Китай
Первый выпуск
мар 2025
Последний выпуск
авг 2026
Размеры
около 1B – 2B
Лицензия
Коммерция с условиямиIndexTTS и 1.5 — Apache 2.0; IndexTTS2 и 2.5 — bilibili Model License (бесплатно, но с ограничениями для очень крупных компаний)

Какие задачи решает

  • Дубляж видео с попаданием в тайминг
  • Клонирование голоса
  • Эмоциональная озвучка

Где применяется

Медиа и видеопродакшнИгрыМаркетинг

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. IndexTTS 2.5
  2. IndexTTS2
  3. IndexTTS 1.5
  4. IndexTTS

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели