Голос: спикеры и звук

NVIDIA Sortformer / TitaNet

Модели NVIDIA для задачи «кто говорит»: TitaNet узнаёт голос конкретного человека, Sortformer размечает запись до 4 спикеров, в том числе потоково во время звонка.

Разработчик
NVIDIA, США
Первый выпуск
июл 2022
Последний выпуск
окт 2025
Размеры
23M (TitaNet) – 117M (Sortformer)
Лицензия
Коммерция с условиямиСмешанная: TitaNet и Streaming Sortformer v2 — CC-BY 4.0, v2.1 — NVIDIA Open Model License, Sortformer v1 — CC-BY-NC

Какие задачи решает

  • Разметка разговоров по спикерам в реальном времени
  • Проверка, что звонит тот же человек (голосовой отпечаток)
  • Подготовка расшифровок совещаний

Где применяется

Колл-центрыБанки и службы безопасностиВидеоконференции

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. Streaming Sortformer v2.1
  2. Streaming Sortformer v2
  3. Sortformer 4spk v1
  4. TitaNet-Large

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели