Голос: спикеры и звук
NVIDIA Sortformer / TitaNet
Модели NVIDIA для задачи «кто говорит»: TitaNet узнаёт голос конкретного человека, Sortformer размечает запись до 4 спикеров, в том числе потоково во время звонка.
- Разработчик
- NVIDIA, США
- Первый выпуск
- июл 2022
- Последний выпуск
- окт 2025
- Размеры
- 23M (TitaNet) – 117M (Sortformer)
- Лицензия
- Коммерция с условиямиСмешанная: TitaNet и Streaming Sortformer v2 — CC-BY 4.0, v2.1 — NVIDIA Open Model License, Sortformer v1 — CC-BY-NC
Какие задачи решает
- Разметка разговоров по спикерам в реальном времени
- Проверка, что звонит тот же человек (голосовой отпечаток)
- Подготовка расшифровок совещаний
Где применяется
Колл-центрыБанки и службы безопасностиВидеоконференции
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версийКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- Streaming Sortformer v2.1
- Streaming Sortformer v2
- Sortformer 4spk v1
- TitaNet-Large
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Голос: спикеры и звукpyannote (диаризация)pyannoteAI (Эрве Бредин) · ФранцияМожно в коммерцию
Самый распространённый открытый инструмент, который размечает запись по спикерам: кто и когда говорил. Обычно ставится в связку с распознаванием речи. Веса выдаются после короткой анкеты на HF.
ПодробнееГолос: спикеры и звукWeSpeakerСообщество WeNet · КитайМожно в коммерциюНабор готовых моделей «голосового отпечатка»: сравнивает, один ли человек говорит в двух записях, и помогает делить запись по спикерам. Одна из моделей встроена в pyannote 3.x.
ПодробнееРечь в текстNVIDIA Parakeet / Canary / Nemotron SpeechNVIDIA · СШАКоммерция с условиямиБыстрые модели распознавания речи от NVIDIA, в том числе потоковые для работы в реальном времени. Parakeet TDT v3 и Nemotron 3.5 ASR понимают русский.
Подробнее

