Голос: спикеры и звукСинтез речи
OpenVoice
Мгновенное клонирование голоса по короткому образцу с управлением эмоцией и акцентом, V2 говорит на нескольких языках. Использовать только с согласия владельца голоса.
- Разработчик
- MyShell и MIT, США
- Первый выпуск
- янв 2024
- Последний выпуск
- апр 2024
- Размеры
- менее 1B
- Лицензия
- Можно в коммерциюMIT (V1 и V2)
Какие задачи решает
- Озвучка роликов голосом диктора компании
- Голосовой бот с узнаваемым голосом бренда
- Перенос тембра на готовый синтез речи
Где применяется
Маркетинг и медиаОнлайн-обучениеКолл-центры
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версийКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- OpenVoice V2
- OpenVoice V1
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Голос: спикеры и звукSeed-VCSongting Liu (Plachtaa) · КитайКоммерция с условиями
Конверсия голоса без обучения: переносит тембр по образцу в 1–30 секунд, умеет петь и работать в реальном времени, V2 меняет и акцент. Использовать только с согласия владельца голоса.
ПодробнееСинтез речиCoqui XTTSCoqui · ГерманияТолько некоммерческоеПопулярная модель клонирования голоса по короткому образцу на 17 языках, включая русский. Компания Coqui закрылась, развитие остановлено.
ПодробнееСинтез речиF5-TTSШанхайский университет Цзяотун и партнёры · КитайТолько некоммерческоеМодель клонирования голоса по нескольким секундам образца, английский и китайский. Сообщество выпустило много дообученных версий под другие языки, в том числе русский.
Подробнее

