CosyVoice: своя озвучка и клонирование голоса без платы за символ
CosyVoice от Alibaba позволяет озвучивать ролики, IVR и напоминания на своём сервере, без платы за символ и отправки текстов в облако. Разбираем, что система умеет, как с русским и лицензиями и где юридические границы клонирования голоса.
Сколько стоит голос, когда им говорит весь бизнес
Ролики для рекламы, голосовое меню на входящей линии, напоминания о записи, голосовой бот. Пока текстов мало, облачная озвучка выглядит дёшево. Когда фраз тысячи в месяц, счёт за символы растёт вместе с оборотом, а сами тексты (имена клиентов, суммы, адреса) уезжают на чужой сервер.
Альтернатива есть: поставить синтез речи у себя. Одна из самых заметных открытых систем для этого называется CosyVoice. Ниже, что она реально умеет и где её границы.
Что такое CosyVoice
Проект делает команда Alibaba, код лежит в репозитории FunAudioLLM/CosyVoice на GitHub. На момент проверки у него около 23,8 тысячи звёзд и 2,7 тысячи форков, последнее изменение в коде датировано 25 мая 2026 года. Релизов в разделе Releases нет, версии идут как семейство моделей: 1.0, 2.0 и актуальная Fun-CosyVoice 3.0, чья основная модель весом 0,5 млрд параметров вышла в декабре 2025 года.
Лицензия кода Apache-2.0, она разрешает коммерческое использование. Для весов Fun-CosyVoice3-0.5B-2512 карточка на Hugging Face тоже указывает Apache-2.0. Для старых моделей семейства лицензию мы отдельно не сверяли, поэтому перед запуском проверьте карточку той модели, которую берёте.
Что она умеет по описанию авторов
Всё ниже взято из README проекта. Мы эти заявления пока не перепроверяли своими замерами.
- Девять языков: китайский, английский, японский, корейский, немецкий, испанский, французский, итальянский и русский, плюс больше 18 китайских диалектов.
- Клонирование голоса по короткому образцу, в том числе между языками: образец на одном языке, текст на другом.
- Потоковый режим: текст можно подавать кусками, а звук отдаётся сразу, задержка заявлена от 150 мс. Для голосового агента это важно, потому что пауза в секунду убивает живой разговор.
- Управление текстовыми инструкциями: эмоция, скорость, громкость, диалект.
- Чтение чисел, дат и символов без отдельного модуля подготовки текста.
По собственной таблице авторов, вариант Fun-CosyVoice3-0.5B-2512 с дообучением RL показывает лучшие результаты среди открытых моделей в сравнении: ошибка распознавания 0,81 процента на китайском и 1,68 процента на английском. Это замеры самих разработчиков на их наборах, и русского в этой таблице нет.
Железо и запуск
Как поднять: клонировать репозиторий, поставить окружение на Python 3.10, скачать веса с Hugging Face или ModelScope. Для ускорения README описывает запуск через vLLM (версии 0.9.0 или 0.11 и новее) и через NVIDIA TensorRT-LLM, где заявлено ускорение языковой части в четыре раза относительно обычной реализации. Для боевого сервиса в репозитории лежат Dockerfile и готовые серверы: FastAPI и gRPC, оба запускаются командой docker run с флагом runtime=nvidia, то есть с видеокартой NVIDIA.
Сколько видеопамяти нужно, в README не написано. Мы цифру не называем: объём зависит от модели, режима и числа одновременных запросов, и его меряют тестовым запуском на вашей карте.
Голос человека и закон
Клонирование голоса технически занимает минуты. С юридической стороны это самое острое место.
Мы сверили тексты на КонсультантПлюс. В статье 150 ГК РФ нематериальные блага перечислены, слова «голос» там нет, но список открытый, в нём есть формулировка «иные нематериальные блага». Статья 152.1 ГК РФ требует согласия гражданина на обнародование и использование его изображения: фотографий, видеозаписей, произведений изобразительного искусства. Голос и звукозаписи в этой статье не названы. Отдельной нормы про голос мы в этих текстах не нашли, и судебной практики по нему мы не проверяли.
Зато есть закон 152-ФЗ: персональные данные это любая информация, относящаяся к прямо или косвенно определённому человеку. Запись голоса сотрудника или клиента, по которой его узнают, под это определение подходит. Относится ли голос к биометрическим данным по статье 11, из текста закона напрямую не следует, и мы этого не утверждаем. Практический вывод простой: берите письменное согласие на запись и на создание синтетической копии, указывайте, где и как она будет использоваться. Чужие голоса, голоса артистов и блогеров без договора не клонируем. Дипфейки и телефонное мошенничество не делаем и не поддерживаем.
Про обязательную маркировку озвучки, созданной нейросетью, в рекламе и в других материалах мы нормы не проверяли. Если у вас реклама, уточните это у юриста до публикации.
Где это не сработает
- Качество русского не подтверждено независимыми тестами. Язык заявлен в README, метрик по нему там нет. Ударения, редкие фамилии и названия брендов нужно прогнать на ваших текстах.
- Это инструмент для инженера, готового сервиса из коробки нет. Нужны сервер с видеокартой NVIDIA, настройка окружения, очередь запросов и мониторинг.
- Для небольшого объёма облачный сервис может выйти дешевле, чем свой сервер. Свой синтез выигрывает, когда фраз много или тексты нельзя отдавать наружу.
- В репозитории больше 680 открытых обращений, платной поддержки нет. Вопросы решаются через сообщество.
- Для голосового бота одного синтеза мало: нужны ещё распознавание речи и логика диалога.
Что можно сделать уже сейчас
- Соберите 20–30 типичных фраз: приветствие IVR, напоминание о записи, цена с цифрами, название вашего бренда. Они пригодятся для любого теста.
- Сравните CosyVoice с другими вариантами на этих фразах. Про лёгкую альтернативу мы писали в разборе MOSS-TTS-Nano, про сборку голосового агента целиком в материале про Pipecat.
- Решите, чей голос будет у бренда: диктор по договору, голос сотрудника с письменным согласием или готовый нейтральный голос без клонирования.
- Посчитайте объём: сколько символов в месяц вы сейчас озвучиваете и сколько платите. От этого зависит, нужен ли свой сервер.
Частые вопросы
Можно ли использовать CosyVoice в коммерческих проектах?
Лицензия кода Apache-2.0 это разрешает, а карточка основной модели Fun-CosyVoice3-0.5B-2512 тоже указывает Apache-2.0. Условия на других весах проверяйте отдельно. Права на сам голос, который вы клонируете, остаются за человеком, и согласие нужно получать у него.
Работает ли русский язык хорошо?
Русский заявлен авторами, но независимых замеров по нему мы не видели. Честный ответ звучит так: нужен тест на ваших текстах, с вашими названиями и числами.
Данные уходят в облако?
Если вы запускаете модель на своём сервере, тексты и образцы голоса остаются у вас. Веса при установке скачиваются один раз из открытого хранилища.
Коротко о главном
CosyVoice даёт бизнесу свою озвучку без платы за символ: девять языков, клонирование голоса, потоковую выдачу и сервер на FastAPI. Цена свободы в том, что серверную часть и юридическую сторону согласия придётся вести самим, а русский проверять на своих текстах.
Мы разворачиваем такие системы, подбираем голоса и подключаем озвучку к вашим процессам: к голосовому меню, напоминаниям и ботам. Подробности на странице голосового ИИ. Напишите мне в Telegram кодовое слово «ГОЛОС», и мы обсудим вашу задачу.
Ещё open-source для бизнеса
Эта статья — часть каталога бесплатных решений, которые я разворачиваю на вашем сервере под ключ: CRM, аналитика, документы, почта, безопасность, магазины, AI.
Что я делаю для бизнеса
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


