Речь в текст

NVIDIA Parakeet / Canary / Nemotron Speech

Быстрые модели распознавания речи от NVIDIA, в том числе потоковые для работы в реальном времени. Parakeet TDT v3 и Nemotron 3.5 ASR понимают русский.

Разработчик
NVIDIA, США
Первый выпуск
дек 2023
Последний выпуск
май 2026
Размеры
110M – 2.5B
Лицензия
Коммерция с условиямиСмешанная: Parakeet и Canary в основном CC-BY-4.0 (Canary-1B первой версии некоммерческая), Parakeet Unified и Nemotron Speech Streaming под NVIDIA Open Model License, Nemotron 3.5 ASR под OpenMDW

Какие задачи решает

  • Расшифровка звонков и совещаний
  • Субтитры к видео
  • Голосовой ввод в реальном времени
  • Разметка аудиоархивов

Где применяется

Колл-центрыМедиаГолосовые ботыВнутренние сервисы компаний

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. Nemotron 3.5 ASR Streaming 0.6B
  2. Parakeet Unified 0.6B
  3. Nemotron Speech Streaming 0.6B
  4. Parakeet TDT 0.6B v3 и Canary-1B v2
  5. Canary-Qwen-2.5B
  6. Parakeet TDT 0.6B v2
  7. Canary-1B
  8. Parakeet CTC 0.6B

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели