Синтез речиРечь в текст

Kyutai STT, TTS и Pocket TTS

Потоковые модели распознавания и синтеза речи от авторов Moshi: начинают говорить и расшифровывать, не дожидаясь конца фразы. Pocket TTS (100M) работает на процессоре. Английский, французский и ещё несколько европейских языков, русского нет.

Разработчик
Kyutai, Франция
Первый выпуск
июн 2025
Последний выпуск
апр 2026
Размеры
100M (Pocket TTS) – 2.6B
Лицензия
Можно в коммерциюCC BY 4.0 (веса), код MIT и Apache 2.0
Русский язык
Нет
Запуск
Через свой серверРаботает и без видеокарты
Сферы
Поддержка клиентов, Медиа и продакшн, Разработка ПО

Какие задачи решает

  • Потоковая расшифровка речи для голосовых ботов
  • Озвучка ответов с минимальной задержкой
  • Синтез речи на сервере без видеокарты (Pocket TTS)

Где применяется

Голосовые ботыКолл-центрыРазработка продуктов

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. Pocket TTS 2.0 (6 европейских языков)
  2. Pocket TTS (100M)
  3. Kyutai TTS 0.75B
  4. Kyutai TTS 1.6B
  5. Kyutai STT 1B (английский и французский)
  6. Kyutai STT 2.6B (английский)

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели