Голос: спикеры и звук

Silero VAD

Самый популярный открытый детектор речи: отличает голос от тишины и шума. Обрабатывает фрагмент звука меньше чем за миллисекунду на одном ядре процессора, обучен на записях более чем 6000 языков.

Разработчик
Silero, Россия
Первый выпуск
дек 2020
Последний выпуск
ноя 2025
Размеры
около 2 МБ
Лицензия
Можно в коммерциюMIT
Русский язык
Есть
Запуск
Через свой серверРаботает и без видеокарты
Сферы
Поддержка клиентов, Разработка ПО, Медиа и продакшн

Какие задачи решает

  • Нарезка звонков и записей перед распознаванием речи
  • Определение, когда клиент говорит, в голосовом боте
  • Отсев тишины и шума, экономия на расшифровке

Где применяется

Колл-центрыГолосовые боты и ассистентыМедиа и подкасты

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. v6.2
  2. v6
  3. v5
  4. v4
  5. v3
  6. Первая версия

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели