Pipecat: свой голосовой ИИ-агент вместо платы за минуты
Готовые голосовые боты берут плату за каждую минуту и держат записи в чужом облаке. Pipecat это открытый фреймворк (BSD-2-Clause), на котором такого агента можно собрать самим. Разбираем, что он умеет, как запускается, что с русским языком и телефонией и где без разработчика не обойтись.
Почему готовый голосовой бот дорожает
Вы подключили голосового бота на приём звонков. Сначала цена устраивала. Потом звонков стало вдвое больше, и счёт вырос вместе с ними: платформа берёт деньги за каждую минуту, а внутри этой минуты сидят те же распознавание, модель и синтез, которые можно купить напрямую. К тому же записи звонков и расшифровки лежат в чужом облаке, и вы не решаете, где именно.
У такой схемы есть оборотная сторона: поменять голос, подключить свою CRM или перевести разговор на живого менеджера в нужный момент можно только в пределах того, что платформа разрешила.
Про готовые решения для приёма заявок и обзвона я уже писал: голосовой ИИ-робот для приёма заявок, а про российский набор сервисов речи отдельно в статье голосовой ассистент на российском стеке. Здесь речь о том, на чём собрать своего агента, чтобы держать стоимость и данные под контролем.
Что такое Pipecat
Репозиторий pipecat-ai/pipecat создан в декабре 2023 года, поддерживает его компания Daily вместе с сообществом. На 1 октября 2026 года у проекта около 16 тысяч звёзд и 2,8 тысячи форков. Последний релиз v1.12.0 вышел 26 сентября, последний коммит в основную ветку сделан в день проверки, в списке участников около 350 человек.
Работает так. Звук от клиента проходит по конвейеру: распознавание речи, языковая модель, синтез голоса, ответ уходит обратно. Каждый этап сменный. В документации заявлено больше 150 интеграций, а в README перечислены десятки сервисов распознавания и синтеза, десятки языковых моделей, в том числе локальная Ollama, и речевые модели, которые слушают и отвечают голосом напрямую (OpenAI Realtime, Gemini Multimodal Live и другие).
Есть и многоагентные схемы: несколько специалистов передают друг другу разговор или работают параллельно. Для сценариев с жёсткой логикой разговора в состав входит Pipecat Flows, он описывает ветки диалога и состояние.
Как запустить у себя
Нужен Python 3.11 или новее, рекомендуют 3.12 и выше. По квикстарту документации ставите утилиту командой uv tool install "pipecat-ai[cli]", создаёте проект через pipecat init quickstart и запускаете uv run bot.py. Бот открывается в браузере на localhost, звук идёт по WebRTC. В примере из документации используются ключи от Deepgram, OpenAI и Cartesia.
Pipecat Cloud, управляемый хостинг от авторов, для этого не нужен. В документации прямо указано, что можно развернуть всё на своей инфраструктуре. Есть и полностью локальные варианты отдельных звеньев: распознавание Whisper, синтез Piper и Kokoro, модели через Ollama. Потянут ли они разговор без заметной паузы, зависит от железа, это мерят на вашем сервере.
Русский язык и телефония
За русский язык отвечают модели, сам Pipecat его не обеспечивает. В коде фреймворка русский прописан для Whisper, Azure, Cartesia, Google TTS и ElevenLabs STT. Но один и тот же провайдер даёт разное качество на русском, на именах, цифрах и телефонном шуме, поэтому выбор моделей мы делаем по тестовым записям, а не по описанию. Яндекс SpeechKit и Сбер SaluteSpeech в списке сервисов не значатся, к ним пишется собственная интеграция. Архитектура это допускает, у проекта есть руководство по сторонним интеграциям.
С телефонией так. Из коробки есть сериализаторы для Twilio, Telnyx, Plivo, Exotel, Genesys и Vonage. Twilio, например, подключается по протоколу Media Streams через WebSocket, а в качестве сервера используется FastAPI. Про SIP в проверенной мной документации ничего нет. Российские номера и операторы идут своим путём: выбираем оператора связи, мост до Pipecat и условия обзвона, и проверяем всё на тестовых звонках до запуска.
Что важно учесть
Это фреймворк для разработчиков. Его надо установить, написать сценарий, подобрать модели, поставить на сервер, мониторить и обновлять. Без программиста в команде или подрядчика результата не будет.
Качество разговора складывается из распознавания, модели, синтеза и задержки между репликами. Если ответ приходит через две секунды, человек перебивает бота, и разговор разваливается. Задержку мерят на реальных звонках.
Запись разговоров и расшифровки это персональные данные. По 152-ФЗ при сборе данных граждан России их запись и хранение в базах за пределами РФ не допускаются, с исключениями, которые перечислены в законе (часть 5 статьи 18). Если звук уходит на распознавание в зарубежное облако, вопрос, где он хранится, решается до запуска, с юристом.
Модель ошибается: путает фамилии, неверно понимает цифры, выдумывает ответ там, где данных нет. Нужны перевод на живого сотрудника по запросу клиента и по признакам сбоя, а также честное предупреждение, что это робот. Такой агент берёт на себя рутину и не заменяет менеджера в сложном разговоре.
Что можно сделать уже сейчас
С этих четырёх сценариев обычно начинают.
Приём звонков вне рабочего времени: бот узнаёт имя и вопрос, записывает заявку в CRM и утром отдаёт её менеджеру с текстом разговора.
Голосовой консультант: отвечает по вашему прайсу и регламентам, а на непонятный вопрос зовёт человека.
Обзвон по списку: напоминание об оплате, подтверждение записи, опрос после покупки. Как это устроено у должников, описано в статье про голосового робота обзвона.
Запись и разбор звонков менеджеров: расшифровка, краткое содержание и отметка, где клиента потеряли.
Прикидка по стоимости такая: готовая платформа берёт плату за минуту, у своего агента вы платите провайдерам моделей по факту и за сервер. При росте нагрузки разницу стоит считать на ваших цифрах. Что входит в разработку, смотрите на странице голосового ИИ, про общую схему агентов на странице агентов, а ориентиры по ценам в прайсе.
Частые вопросы
Можно ли использовать Pipecat в коммерческом проекте?
Лицензия BSD-2-Clause разрешает коммерческое использование и изменение кода, при условии сохранить уведомление об авторских правах. Отдельные сервисы, которые вы подключаете (распознавание, синтез, модели), имеют свои условия, и их надо читать отдельно.
Нужна ли своя видеокарта?
Если распознавание, модель и синтез берутся у внешних поставщиков, видеокарта не нужна: сервер только гоняет звук. Свои локальные модели снимают зависимость от чужого облака, но требуют железа, и мы заранее проверяем, потянет ли оно разговор в реальном времени.
Сколько уходит на запуск?
Прототип по квикстарту поднимается за вечер. Агент с вашим сценарием, русскими моделями, телефонией, CRM и тестами требует нескольких недель, срок зависит от сложности. Конкретную оценку даём после разбора задачи.
Коротко о главном
Pipecat даёт основу для голосового агента, которым вы владеете сами: открытый код, сменные модели, запуск на своём сервере. Цена за это очевидная: нужна разработка, подбор моделей под русский язык, отдельная работа с телефонией и аккуратность с записью разговоров.
Мы собираем голосового агента на открытой основе под вашу задачу: сценарий разговора, подбор моделей под русский язык, телефония, интеграция с CRM, тесты, запуск и поддержка. Напишите мне в Telegram слово «РОБОТ», и я задам несколько вопросов о ваших звонках, чтобы прикинуть, что собирать.
Ещё open-source для бизнеса
Эта статья — часть каталога бесплатных решений, которые я разворачиваю на вашем сервере под ключ: CRM, аналитика, документы, почта, безопасность, магазины, AI.
Что я делаю для бизнеса
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


