AASIST
Базовая открытая модель против подмены голоса: слушает сырую запись и отличает живого человека от синтеза и записи. Ошибается в обе стороны — её вывод повод для проверки человеком, а не доказательство.
Последняя открытая версия вышла в окт 2021. Семейство давно не обновлялось: это не значит, что модель не работает, но свежих исправлений и новых размеров ждать не стоит.
- Разработчик
- NAVER Clova AI Research и EURECOM, Южная Корея
- Первый выпуск
- окт 2021
- Последний выпуск
- окт 2021
- Размеры
- файлы весов 0,4 и 1,3 МБ
- Лицензия
- Можно в коммерциюMIT
- Запуск
- Через свой серверРаботает и без видеокарты
- Сферы
- Безопасность, Финансы, Поддержка клиентов, Госсектор
Какие задачи решает
- Проверка голоса при телефонной аутентификации
- Отсев записей и синтеза в голосовом меню
- Базовая линия при сравнении детекторов голоса
- Дообучение под свой канал связи
Где применяется
Требования к железу
Версии
- AASIST-L (облегчённая)
- AASIST
Как запустить
Ставлю и настраиваю под ключ: подберу размер модели, разверну на вашем сервере, подключу к вашим системам.
Частые вопросы
Можно ли использовать AASIST в коммерческом проекте?
Да. Лицензия: MIT. Это разрешает коммерческое использование, но перед запуском лицензию всё равно стоит показать юристу.
Какое железо нужно для AASIST?
Минимум: Ноутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии. Есть версии, которые работают и без видеокарты, на обычном процессоре. Точный объём видеопамяти под ваш размер модели и контекст можно посчитать в калькуляторе железа.
Поддерживает ли AASIST русский язык?
Для этой модели язык не важен: она работает не с текстом.
Где скачать AASIST и сколько это стоит?
Веса AASIST лежат в открытом доступе и скачиваются бесплатно. Платить нужно только за железо, на котором модель работает, и за настройку. Ссылки на первоисточник — в конце страницы.
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Развитие AASIST: вместо сырого звука берётся речевой энкодер wav2vec 2.0, из-за чего модель лучше держится на незнакомых способах синтеза. Ошибается в обе стороны — итог проверяет человек.
ПодробнееДетекция подделокAntiDeepfake (NII)National Institute of Informatics, Yamagishi Lab · ЯпонияТолько некоммерческоеСемь речевых энкодеров (wav2vec 2.0, XLS-R, MMS, HuBERT), дообученных различать живую и синтезированную речь. Разработчики сами отмечают: качество сильно зависит от набора данных, вывод проверяет человек.
ПодробнееГолос: спикеры и звукWeSpeakerСообщество WeNet · КитайМожно в коммерциюНабор готовых моделей «голосового отпечатка»: сравнивает, один ли человек говорит в двух записях, и помогает делить запись по спикерам. Одна из моделей встроена в pyannote 3.x.
ПодробнееИсточник: github.com/clovaai/aasist. Данные сверены с карточкой модели 22.09.2026. Лицензию перед коммерческим запуском проверьте с юристом.


