Голос: спикеры и звукСинтез речи
GPT-SoVITS
Синтез речи с клонированием голоса: хватает 5 секунд образца, а после дообучения на минуте записи голос звучит заметно точнее. Использовать только с согласия владельца голоса.
- Разработчик
- RVC-Boss и сообщество, Китай
- Первый выпуск
- янв 2024
- Последний выпуск
- июн 2025
- Размеры
- менее 1B
- Лицензия
- Можно в коммерциюMIT
Какие задачи решает
- Озвучка текстов голосом конкретного диктора
- Голос для бота или ассистента
- Дубляж обучающих роликов
Где применяется
Медиа и продакшнОнлайн-обучениеИгры
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- v2Pro
- v4
- v3
- v2
- GPT-SoVITS v1
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Голос: спикеры и звукRVC (Retrieval-based Voice Conversion)Сообщество RVC-Project · КитайМожно в коммерцию
Самый массовый открытый инструмент конверсии голоса: модель под конкретный голос учится за 10–30 минут записи, работает в реальном времени. Использовать только с согласия владельца голоса.
ПодробнееСинтез речиF5-TTSШанхайский университет Цзяотун и партнёры · КитайТолько некоммерческоеМодель клонирования голоса по нескольким секундам образца, английский и китайский. Сообщество выпустило много дообученных версий под другие языки, в том числе русский.
ПодробнееСинтез речиCosyVoice / Fun-CosyVoiceAlibaba (Tongyi, FunAudioLLM) · КитайМожно в коммерциюСинтез речи с клонированием голоса по короткому образцу и потоковой выдачей для живого диалога. Третья версия поддерживает 9 языков, включая русский.
Подробнее

