Речь в текстСинтез речи

VibeVoice

Речевые модели Microsoft: синтез длинных диалогов на несколько голосов, быстрый синтез для живого общения и распознавание длинных записей с разделением по говорящим, в том числе на русском.

Разработчик
Microsoft, США
Первый выпуск
авг 2025
Последний выпуск
сен 2026
Размеры
0.5B – 9B
Лицензия
Можно в коммерциюMIT

Какие задачи решает

  • Расшифровка длинных встреч с разметкой говорящих
  • Озвучка подкастов и диалогов
  • Голос для ассистентов в реальном времени
  • Разбор записей звонков

Где применяется

Медиа и подкастыКолл-центрыКорпоративные встречиГолосовые ассистенты

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. VibeVoice ASR Streaming 1.5B и 7B
  2. VibeVoice ASR 9B
  3. VibeVoice Realtime 0.5B (синтез)
  4. VibeVoice 1.5B (синтез)

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели