Синтез речиРечь в текст
Kyutai STT, TTS и Pocket TTS
Потоковые модели распознавания и синтеза речи от авторов Moshi: начинают говорить и расшифровывать, не дожидаясь конца фразы. Pocket TTS (100M) работает на процессоре. Английский, французский и ещё несколько европейских языков, русского нет.
- Разработчик
- Kyutai, Франция
- Первый выпуск
- июн 2025
- Последний выпуск
- апр 2026
- Размеры
- 100M (Pocket TTS) – 2.6B
- Лицензия
- Можно в коммерциюCC BY 4.0 (веса), код MIT и Apache 2.0
- Русский язык
- Нет
- Запуск
- Через свой серверРаботает и без видеокарты
- Сферы
- Поддержка клиентов, Медиа и продакшн, Разработка ПО
Какие задачи решает
- Потоковая расшифровка речи для голосовых ботов
- Озвучка ответов с минимальной задержкой
- Синтез речи на сервере без видеокарты (Pocket TTS)
Где применяется
Голосовые ботыКолл-центрыРазработка продуктов
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- Pocket TTS 2.0 (6 европейских языков)
- Pocket TTS (100M)
- Kyutai TTS 0.75B
- Kyutai TTS 1.6B
- Kyutai STT 1B (английский и французский)
- Kyutai STT 2.6B (английский)
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Голосовые ассистентыMoshi / HibikiKyutai · ФранцияКоммерция с условиями
Голосовой ассистент, который слушает и говорит одновременно, без задержки на распознавание и синтез. Hibiki — синхронный перевод речи в речь между несколькими европейскими языками.
ПодробнееСинтез речиKokorohexgrad (независимый разработчик) · не указанаМожно в коммерциюКрошечная модель синтеза речи (82M), которая звучит на уровне крупных. Работает на обычном процессоре; английский и ещё несколько языков, русского нет.
ПодробнееРечь в текстNVIDIA Parakeet / Canary / Nemotron SpeechNVIDIA · СШАКоммерция с условиямиБыстрые модели распознавания речи от NVIDIA, в том числе потоковые для работы в реальном времени. Parakeet TDT v3 и Nemotron 3.5 ASR понимают русский.
Подробнее

