Экспертный блог 5 мин чтения

Gemini 3.8 Flash TTS: голос менеджера за 30 секунд и без студии

Google выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS: больше 2000 голосов, голос по текстовому описанию и копия живого голоса по записи до 30 секунд. Разбираю, как устроено согласие, что будет с ценами 1 января и где это работает в бизнесе: голосовой робот, автоответчик, озвучка обучения, многоязычная поддержка.

синтез речиклонирование голосаголосовой роботGemini
Коротко. 23 сентября Google выпустила две модели синтеза речи, Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. В библиотеке больше 2000 готовых голосов, новый голос можно описать словами, а голос живого человека копируется по записи длиной до 30 секунд. Русский язык есть. Копирование работает только вместе с записью, где владелец голоса вслух даёт согласие. Цены до конца 2026 года акционные, с 1 января 2027 они вырастут ровно вдвое. Из России Gemini API официально недоступен, поэтому для российского бизнеса это скорее ориентир по качеству и цене, чем готовое решение.

Менеджеру больше не нужна студия

Раньше, чтобы робот на линии говорил голосом вашего менеджера, человека сажали в студию на полдня и записывали сотни фраз. Теперь хватит записи от 10 до 30 секунд обычной речи. Дальше модель читает любой текст этим голосом, с нужной интонацией и на любом из поддерживаемых языков.

Google выпустила сразу две модели. Flash TTS рассчитана на озвучку с режиссурой: аудиокниги, игры, подкасты, ролики. Flash-Lite TTS быстрее и дешевле, её делали под голосовых ассистентов, дубляж и перевод потоком. Прежний набор из 30 голосов заменили библиотекой на 2000 с лишним голосов. Языков и диалектов больше сотни, русский в таблице поддержки есть у обеих моделей.

Второе новшество называется дизайном голоса. Вы пишете текстом, кто говорит: «спокойная женщина 40 лет, врач, говорит медленно и тепло». Модель создаёт такой голос, и его можно сохранить и использовать дальше. Источник: анонс в блоге Google.

В те же дни Alibaba выпустила Qwen-Audio 3.1 и снизила цены на синтез и распознавание речи, а Fish Audio открыла предварительную версию Drama 3.

Как копируется голос и при чём тут согласие

Для копирования нужны две записи одного и того же взрослого человека. Первая, от 10 до 30 секунд чистой речи, служит образцом. Во второй тот же человек зачитывает обязательную фразу о согласии: «Я являюсь владельцем этого голоса и даю согласие Google…». Фраза есть на 30 языках, русский среди них. Без второй записи голос не создаётся. Порядок описан в документации Gemini API.

Готовый голос хранится в проекте год, лимит 200 голосов на проект. Есть режим, в котором Google не хранит профиль у себя: вы получаете зашифрованный ключ, он живёт 7 дней. Всё сгенерированное аудио помечается невидимым водяным знаком SynthID, по нему потом можно определить, что речь синтезирована.

В Google AI Studio копирование голоса закрыто для Евросоюза, Великобритании, Швейцарии, Индии, штатов Иллинойс и Техас. Там строгие законы о биометрии, и Google решила не рисковать.

Сколько стоит и что будет 1 января

По официальному прайсу час речи на Flash TTS сейчас стоит около 0,81 доллара, на Flash-Lite около 0,54 доллара. Это акционные цены до 31 декабря 2026 года. С 1 января 2027 года все тарифы удваиваются: 1,62 и 1,08 доллара за час. Удвоение прямо указано в прайсе Google.

Даже удвоенная цена копеечная. Полчаса обучающего курса обойдутся дешевле чашки кофе. Считать бюджет всё равно лучше по ценам 2027 года, чтобы в январе не было сюрприза.

Чего пока нельзя

Россия не входит в список стран, где официально работают Gemini API и Google AI Studio. Для компании в России это означает сложную схему доступа, риск блокировки аккаунта и передачу голоса сотрудника на серверы за рубежом. Поэтому в рабочие системы российских клиентов я её сейчас не ставлю.

Есть два рабочих пути. Первый, модели синтеза и копирования голоса на своём сервере, я разбирал в статье про клонирование голоса на своём сервере, там же про лицензии, которые легко нарушить. Второй, российские сервисы распознавания и синтеза, описан в разборе голосового ассистента на российском стеке.

Ещё одно ограничение: модель синтезирует речь, но сама разговор не ведёт. Чтобы робот слушал клиента и отвечал по делу, нужны распознавание речи, языковая модель с вашими данными и телефония.

Закон и этика

Голос сотрудника относится к его персональным данным. Если запись служит для установления личности, это уже биометрия, и по 152-ФЗ на неё нужно письменное согласие. Спорить, биометрия ли голосовой клон, дороже, чем сразу взять согласие в письменном виде. Отправка записи на серверы в другую страну считается трансграничной передачей, о ней нужно заранее уведомить Роскомнадзор. Фраза, которую Google просит зачитать, закрывает требования Google. Ваши обязательства перед сотрудником по российскому закону она не закрывает.

Поэтому согласие оформляем отдельной бумагой: для чего используется голос, где, на какой срок и что происходит при увольнении. Человек ушёл из компании, его голос удаляется из системы в тот же день.

Вторая сторона той же технологии: мошенникам тоже нужно 30 секунд. Запись с вебинара или из голосового в мессенджере хватит, чтобы позвонить бухгалтеру голосом директора и попросить срочный перевод. Водяной знак SynthID тут не поможет, по телефону его никто не проверяет. Работает простое правило: любые деньги по звонку или голосовому только после подтверждения по второму каналу. Договоритесь о кодовом слове внутри компании, пока этого не случилось.

Что можно сделать уже сейчас

Голос звучит живо, студия не нужна, минута речи стоит пару центов. Вот где это окупается.

Голосовой робот. Принимает входящие, записывает на услугу, уточняет заявку и перезванивает тем, кто оставил её на сайте. Как это собирается, я описал в статье про голосового ИИ-робота для приёма заявок и обзвона. Голос выбираете сами: придуманный по описанию или голос вашего администратора, с его согласием. Готовый вариант для телефонии есть в предложении голосовой AI-бот.

Автоответчик на пропущенные. Ночью или в пиковый час клиент попадает на робота, говорит, что ему нужно, и получает ответ или запись. Утром менеджер видит готовые заявки. Подробно в разборе автоответчика на пропущенные звонки.

Обучение и видео. Курс для новых сотрудников, инструкции, ролики для соцсетей голосом эксперта компании. Поменялся регламент, вы правите текст, и через минуту готова новая озвучка.

Многоязычная поддержка. Туристам, покупателям из Китая, клиентам из Казахстана бот отвечает на их языке одним и тем же фирменным голосом. Отдельный диктор под каждый язык не нужен.

Всё это входит в мою услугу голосовых ИИ-ассистентов. Модель синтеза подбираю под задачу и под то, где должны храниться данные.

Частые вопросы

Можно ли скопировать голос человека без его ведома?

В Gemini нет. Без записи, где тот же человек вслух даёт согласие, голос не создаётся. Открытые модели на своём сервере такой проверки не делают, поэтому согласие собираем сами, письменно.

Как звучит русский язык?

Русский официально поддерживается обеими моделями. Сравнивать лучше на своих текстах: названия улиц, фамилии и термины вашей отрасли. Такой тест занимает час и снимает большинство сомнений.

Что будет с ценой после Нового года?

С 1 января 2027 года все тарифы удвоятся, это указано в прайсе Google. Час речи на Flash TTS будет стоить около 1,62 доллара.

Коротко о главном

Gemini 3.8 Flash TTS и Flash-Lite TTS копируют голос по записи до 30 секунд, создают новый голос по описанию и говорят по-русски. Копирование защищено обязательной записью согласия, всё аудио помечено водяным знаком, а цены с 1 января удвоятся. Из России сервис официально недоступен, поэтому для работы здесь я собираю то же самое на своём сервере или на российском стеке.

Хотите, чтобы звонки принимал робот с голосом вашего администратора, или нужна озвучка обучения без студии? Напишите мне в Telegram слово «ДИКТОР». Подберу модель, посчитаю стоимость минуты и оформлю согласие так, чтобы к нему не было вопросов.

Услуги по теме

Что я делаю для бизнеса

  • Боты в Telegram, MAX, VK
  • Автоматизация процессов и CRM
  • Аналитика и дашборды
  • Сайты и лендинги под ключ

Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»

12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.

Готовы обсудить вашу задачу?

Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.

Пишу о разработке, ИИ и законах для бизнеса

Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.

Готовые решения под ключTurnkey solutionsSoluciones llave en mano交钥匙解决方案Түлхүүр гардуулах шийдэл 451 готовых IT-решений для бизнеса451 ready-made IT solutions for business451 soluciones IT listas para empresas451 个面向企业的现成 IT 解决方案Бизнест зориулсан 451 бэлэн IT шийдэл Автоматизация, боты, AI, 152-ФЗ и платформы · бесплатная консультацияAutomation, bots, AI, data privacy and platforms · free consultationAutomatización, bots, IA, privacidad de datos y plataformas · consulta gratis自动化、机器人、AI、数据合规与平台 · 免费咨询Автоматжуулалт, бот, AI, өгөгдлийн хамгаалалт ба платформ · үнэгүй зөвлөгөө Смотреть каталогView catalogVer catálogo查看目录Каталог үзэх