Музыка и звукПоиск и RAG
AST (Audio Spectrogram Transformer)
Классическая модель 2021 года для распознавания звуков: определяет 527 классов событий AudioSet (сирена, лай, стекло, музыка). Лёгкая, работает без видеокарты, с 2022 года в Transformers.
- Разработчик
- MIT, США
- Первый выпуск
- ноя 2022
- Последний выпуск
- ноя 2022
- Размеры
- около 87M
- Лицензия
- Можно в коммерциюBSD 3-Clause
- Запуск
- Через свой серверРаботает и без видеокарты
- Сферы
- Безопасность, Производство и склад, Медиа и продакшн
Какие задачи решает
- Распознавание звуковых событий
- Разметка аудиоархива
- Детекция тревожных звуков
- Распознавание голосовых команд
Где применяется
Безопасность и мониторингПроизводство (контроль по звуку)Медиа
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версийКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- AST, дообученные на AudioSet и Speech Commands (в Transformers)
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Музыка и звукMERTm-a-p (Multimodal Art Projection) · Великобритания / КитайТолько некоммерческое
Энкодер музыки: превращает трек в числовое описание, по которому определяют жанр, настроение, тональность и ритм. MERT-v2 работает с целыми песнями до 6 минут.
ПодробнееМузыка и звукMuQ / MuQ-MuLanTencent AI Lab · КитайТолько некоммерческоеМузыкальный энкодер MuQ и модель MuQ-MuLan, которая сопоставляет музыку и текст: можно искать треки по описанию на английском или китайском.
ПодробнееГолос: спикеры и звукSAM AudioMeta · СШАКоммерция с условиямиМодель вырезает из записи нужный звук по текстовому описанию, по отметке на видео или по отрезку: голос, инструмент, шум. Доступ к весам выдают по заявке.
Подробнее

