Музыка и звукПоиск и RAG

AST (Audio Spectrogram Transformer)

Классическая модель 2021 года для распознавания звуков: определяет 527 классов событий AudioSet (сирена, лай, стекло, музыка). Лёгкая, работает без видеокарты, с 2022 года в Transformers.

Разработчик
MIT, США
Первый выпуск
ноя 2022
Последний выпуск
ноя 2022
Размеры
около 87M
Лицензия
Можно в коммерциюBSD 3-Clause
Запуск
Через свой серверРаботает и без видеокарты
Сферы
Безопасность, Производство и склад, Медиа и продакшн

Какие задачи решает

  • Распознавание звуковых событий
  • Разметка аудиоархива
  • Детекция тревожных звуков
  • Распознавание голосовых команд

Где применяется

Безопасность и мониторингПроизводство (контроль по звуку)Медиа

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. AST, дообученные на AudioSet и Speech Commands (в Transformers)

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели