В телефонии всё упирается в то, что звук это не текст. Пока разговор не расшифрован, ни одна языковая модель его не разберёт, а пока в расшифровке не отмечено, кто говорит, невозможно оценить работу оператора. Поэтому рабочий контур собирают из звеньев: распознавание речи, разделение говорящих, смысловой разбор и голосовой ответ. Так каждое звено можно менять и мерить отдельно, а сбой на одном участке не превращает весь контур в чёрный ящик.
Распознавание речи переводит запись или живой поток в текст. От качества этого шага зависит буквально всё дальнейшее: если модель путает названия товаров и имена, разбор будет строиться на выдумке. Отдельно смотрите на телефонное качество звука, фоновый шум и то, как модель держит русский язык вперемешку с названиями на латинице. Без этого звена остаётся только ручное прослушивание выборки звонков.
Распознавание речи на 99 языках, включая русский. Стандарт де-факто для расшифровки звонков и встреч. Ускоренные Distil-Whisper от Hugging Face — только для английского.
Модели Сбера для распознавания русской речи, одни из самых точных для русского языка. Есть распознавание эмоций, версия v3 с пунктуацией и многоязычная версия (русский, казахский, киргизский, узбекский).
Быстрые модели распознавания речи от NVIDIA, в том числе потоковые для работы в реальном времени. Parakeet TDT v3 и Nemotron 3.5 ASR понимают русский.
Расшифровка звонков и совещаний
Субтитры к видео
Голосовой ввод в реальном времени
Размеры
110M – 2.5B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Шаг 2. Понять, кто говорит и где границы реплик
Диаризация размечает, какая фраза принадлежит оператору, а какая клиенту, и отделяет речь от пауз и шума. Без неё расшифровка превращается в сплошное полотно, по которому нельзя ни посчитать, кто больше говорил, ни проверить, прозвучал ли обязательный скрипт. Для живого разговора это же звено отвечает за момент, когда человек договорил и можно отвечать.
Самый распространённый открытый инструмент, который размечает запись по спикерам: кто и когда говорил. Обычно ставится в связку с распознаванием речи. Веса выдаются после короткой анкеты на HF.
Модели NVIDIA для задачи «кто говорит»: TitaNet узнаёт голос конкретного человека, Sortformer размечает запись до 4 спикеров, в том числе потоково во время звонка.
Разметка разговоров по спикерам в реальном времени
Проверка, что звонит тот же человек (голосовой отпечаток)
Самый популярный открытый детектор речи: отличает голос от тишины и шума. Обрабатывает фрагмент звука меньше чем за миллисекунду на одном ядре процессора, обучен на записях более чем 6000 языков.
Нарезка звонков и записей перед распознаванием речи
Определение, когда клиент говорит, в голосовом боте
Отсев тишины и шума, экономия на расшифровке
Размеры
около 2 МБ
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Шаг 3. Разобрать смысл и подготовить ответ
Языковая модель работает уже с текстом: вытаскивает причину обращения, тему, договорённости и следующий шаг, а в живом сценарии формулирует реплику. Тут же ставится проверка на соблюдение скрипта и пометка тяжёлых звонков для руководителя. Если выкинуть это звено, останутся расшифровки, которые никто не читает, потому что читать сотни страниц в день некому.
Самая известная русскоязычная доучка сообщества: чужие открытые модели (Llama, Mistral, Gemma, YandexGPT) дообучены отвечать на русском как ассистент. Удобная отправная точка для русского чат-бота на своём сервере.
Модели, с которых начался массовый open source в ИИ. Огромная экосистема дообученных версий и инструментов.
Ассистент для сотрудников
Суммаризация встреч и документов
Основа для дообучения под отрасль
Размеры
1B – 405B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Шаг 4. Ответить голосом
Синтез речи озвучивает готовый текст. Здесь важны не только чистота голоса, но и скорость: в телефонном разговоре пауза дольше пары секунд читается как обрыв связи. Отдельно решите вопрос с интонацией и с тем, предупреждаете ли вы собеседника, что говорит робот. Без этого звена сценарий ограничен перепиской и уведомлениями, голосовой канал не закрывается.
Лёгкий синтез русской речи, работает на обычном процессоре. Версия v5 добавила языки СНГ и народов России: татарский, башкирский, якутский, казахский и другие.
Озвучка ответов голосового бота
Чтение текстов на русском
Голоса на языках народов России
Размеры
десятки мегабайт
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
На что смотреть до внедрения
Главная ловушка это ожидание, что модель будет разбирать звонки так же хорошо, как человек с опытом. Начинайте с разбора уже состоявшихся записей, а не с живого ответа клиенту: ошибка в аналитике стоит дёшево, ошибка в разговоре стоит клиента. Проверьте связку на своей реальной телефонии, а не на студийных записях. Запись разговоров, уведомление собеседника и хранение голоса регулируются, здесь это в общих чертах, конкретный случай смотрит юрист.
Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.
ПодберуМодель и размер под задачу и бюджет на железо
ПоставлюНа ваш сервер или в закрытый контур, с API