Голос: спикеры и звукСинтез речи

GPT-SoVITS

Синтез речи с клонированием голоса: хватает 5 секунд образца, а после дообучения на минуте записи голос звучит заметно точнее. Использовать только с согласия владельца голоса.

Разработчик
RVC-Boss и сообщество, Китай
Первый выпуск
янв 2024
Последний выпуск
июн 2025
Размеры
менее 1B
Лицензия
Можно в коммерциюMIT

Какие задачи решает

  • Озвучка текстов голосом конкретного диктора
  • Голос для бота или ассистента
  • Дубляж обучающих роликов

Где применяется

Медиа и продакшнОнлайн-обучениеИгры

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. v2Pro
  2. v4
  3. v3
  4. v2
  5. GPT-SoVITS v1

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели