Речь в текстСинтез речи
VibeVoice
Речевые модели Microsoft: синтез длинных диалогов на несколько голосов, быстрый синтез для живого общения и распознавание длинных записей с разделением по говорящим, в том числе на русском.
- Разработчик
- Microsoft, США
- Первый выпуск
- авг 2025
- Последний выпуск
- сен 2026
- Размеры
- 0.5B – 9B
- Лицензия
- Можно в коммерциюMIT
Какие задачи решает
- Расшифровка длинных встреч с разметкой говорящих
- Озвучка подкастов и диалогов
- Голос для ассистентов в реальном времени
- Разбор записей звонков
Где применяется
Медиа и подкастыКолл-центрыКорпоративные встречиГолосовые ассистенты
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- VibeVoice ASR Streaming 1.5B и 7B
- VibeVoice ASR 9B
- VibeVoice Realtime 0.5B (синтез)
- VibeVoice 1.5B (синтез)
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Речь в текстWhisperOpenAI · СШАМожно в коммерцию
Распознавание речи на 99 языках, включая русский. Стандарт де-факто для расшифровки звонков и встреч.
ПодробнееСинтез речиDiaNari Labs · Южная КореяМожно в коммерциюМодель, которая озвучивает целые диалоги на два голоса со смехом, вздохами и паузами. Только английский.
ПодробнееСинтез речиHiggs AudioBoson AI · СШАКоммерция с условиямиВыразительный синтез речи и диалогов с клонированием голоса, плюс модели распознавания. Третья версия синтеза поддерживает около 100 языков, включая русский, но некоммерческая.
Подробнее

