Голос: спикеры и звукРечь в текст

pyannote (диаризация)

Самый распространённый открытый инструмент, который размечает запись по спикерам: кто и когда говорил. Обычно ставится в связку с распознаванием речи. Веса выдаются после короткой анкеты на HF.

Разработчик
pyannoteAI (Эрве Бредин), Франция
Первый выпуск
мар 2022
Последний выпуск
сен 2025
Размеры
несколько миллионов параметров
Лицензия
Можно в коммерциюMIT (2.x, 3.0, 3.1), CC-BY 4.0 (community-1); скачивание после согласия с условиями на HF

Какие задачи решает

  • Разметка звонков: где оператор, где клиент
  • Протоколы совещаний с подписью спикеров
  • Подготовка записей к расшифровке и анализу

Где применяется

Колл-центры и отделы продажЮристы и HR (интервью, переговоры)Медиа и подкасты

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. speaker-diarization-community-1
  2. speaker-diarization-3.1
  3. speaker-diarization-3.0
  4. speaker-diarization 2.x

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели