Голос: спикеры и звук

FireRedVAD

Детектор речи и звуковых событий: отличает речь, пение и музыку. В тесте на 102 языках (набор FLEURS, русский входит) обошёл Silero VAD и TEN VAD. Есть потоковый режим.

Разработчик
FireRedTeam (Xiaohongshu), Китай
Первый выпуск
фев 2026
Последний выпуск
мар 2026
Размеры
компактная, точный размер не указан
Лицензия
Можно в коммерциюApache 2.0
Русский язык
Есть
Запуск
Через свой серверРаботает и без видеокарты
Сферы
Поддержка клиентов, Медиа и продакшн, Разработка ПО

Какие задачи решает

  • Нарезка записей перед распознаванием речи
  • Отделение речи от музыки и пения в эфирах и роликах
  • Определение речи в голосовых ботах

Где применяется

Колл-центрыМедиа и видеопродакшнГолосовые боты

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. FireRedVAD отдельным проектом
  2. FireRedVAD в составе FireRedASR2S

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели