Open-source и свой сервер 4 мин чтения

AI-Youtube-Shorts-Generator: пять роликов из часа видео без Opus Clip

Проект AI-Youtube-Shorts-Generator с лицензией MIT расшифровывает длинное видео Whisper, выбирает моменты языковой моделью и режет их в формат 9:16. Разбираю по README, как он работает, что с русским языком и железом, что остаётся человеку и как проверить его на своей записи за вечер.

нарезка видеоopen sourceWhisperвертикальные ролики
Коротко. AI-Youtube-Shorts-Generator это проект с открытым кодом под лицензией MIT, который берёт длинное видео, расшифровывает его Whisper, просит языковую модель выбрать сильные моменты и режет их в вертикальный формат 9:16 без водяных знаков. С одного часа можно попросить пять роликов. Выбор моментов, субтитры, обложку и проверку цитат он за вас не закрывает. Ниже что в нём есть по README, где он ошибается и как проверить его на своём видео за вечер.

Что это за проект

У эксперта, студии или магазина обычно лежит архив длинных записей: вебинары, интервью, обзоры товаров, разборы. Из часа разговора можно сделать несколько коротких роликов, но вручную это долго: надо найти момент, вырезать, перевести в вертикаль, подписать. Сервисы вроде Opus Clip, Vidyo.ai, Klap и SubMagic делают это за подписку. Проект Anil-matcha/AI-Youtube-Shorts-Generator позиционируется как их бесплатная замена.

Что я проверил на странице репозитория на 4 октября 2026 года: лицензия MIT, около 5,2 тысячи звёзд, 956 форков, девять открытых вопросов. Последний коммит от 29 сентября, но это правка ссылок в README. Последняя правка кода в списке коммитов датирована июнем: исправление локальной расшифровки на видеокарте. Проект живой, но бурно не развивается.

Как он работает

По README конвейер такой: скачивание видео, расшифровка Whisper, определение типа ролика (подкаст, интервью, обучение, влог), ранжирование моментов языковой моделью с оценкой от 0 до 100, удаление пересекающихся кандидатов, выбор лучших и вертикальное кадрирование. Видео длиннее 30 минут режется на куски по 20 минут с нахлёстом, чтобы не потерять момент на стыке. Для каждого ролика проект отдаёт заголовок, оценку, фразу-зацепку и короткое объяснение выбора. Количество задаёт флаг --num-clips, по умолчанию их три, для пяти ставите пять.

Режимов два. В режиме API скачивание, расшифровка и кадрирование идут через сторонний сервис MuAPI, нужен его ключ, а выбор моментов делает модель gpt-5-mini оттуда же. В локальном режиме работают yt-dlp, faster-whisper, ffmpeg и OpenCV на вашей машине, а удалённым остаётся только шаг с языковой моделью: нужен ключ OpenAI (по умолчанию gpt-4o-mini) или Gemini (gemini-2.5-flash). Туда уходит текст расшифровки, само видео остаётся у вас. Цены MuAPI я не проверял.

Источник видео: ссылка на YouTube или, в локальном режиме, файл на диске. Для записи вебинара, которая лежит у вас в папке, второй вариант удобнее.

Русский язык и железо

Ограничения на английский в README я не нашёл. Whisper сам определяет язык, а флаг --language принимает код ISO-639-1 и фиксирует язык принудительно, для русского это ru. В документации сказано, что на плохо поддерживаемом языке расшифровка может не выдать ни одного сегмента. Подсказки для модели в коде написаны по-английски. Будут ли заголовки и зацепки на русском и насколько хорошо модель выбирает моменты в русской речи, README не говорит, это проверяется только на вашем материале.

Про требования к железу README даёт мало. Нужны Python 3.10 или новее и ffmpeg в пути, видеокарта с CUDA необязательна, на процессоре расшифровка тоже работает. Размер модели Whisper задаётся от tiny до large-v3, по умолчанию base. Чем крупнее модель, тем точнее текст и дольше расчёт. Конкретных цифр по памяти и времени в README нет, поэтому замерьте на своём компьютере. Для русской речи я бы сразу брал модель покрупнее, чем base.

Что остаётся человеку и где он ошибается

Выбор моментов. Модель оценивает по шкале виральности: зацепки, конфликт, цитируемые фразы. Эксперту с тихой, плотной речью такая шкала подходит хуже, чем болтливому подкасту. Окончательный выбор делает человек, список кандидатов проект выдаёт в JSON, там удобно смотреть и отбракованные.

Кадрирование. В локальном режиме код следит за самым крупным лицом в кадре с помощью OpenCV, а если лица нет, окно остаётся в центре. Для интервью с говорящей головой это нормально. Для обзора товара на столе, слайдов или записи экрана центральная полоса может отрезать важное.

Субтитры. Вшитых в картинку субтитров в списке возможностей README я не нашёл. Расшифровка сохраняется файлом srt, а как наложить её красиво, решать вам. Про это у меня есть отдельный материал: субтитры и нарезка видео для соцсетей.

Обложка и цитаты. Обложки проект не делает. Цитаты надо сверять с оригиналом: Whisper путает имена, термины и цифры, а выдернутая из контекста фраза может звучать иначе, чем в записи. Особенно это важно для медицины, юридических тем и обещаний по цене.

Чьё видео можно резать

Резать стоит только своё видео или то, на которое у вас есть письменное разрешение автора. Чужой разговор или чужой ролик с YouTube нарезать нельзя, даже если технически это возможно. Если в записи участвует гость или клиент, получите его согласие на публикацию кусков. Про охваты ничего не обещаю: проект делает ролики, а смотреть их будут или нет, зависит от темы, подачи и площадки.

Что можно сделать уже сейчас

Шаг 1. Возьмите одну свою запись на 30-60 минут, лучше с чистым звуком. Поставьте проект в локальном режиме, как описано в README, и положите в окружение ключ OpenAI или Gemini.

Шаг 2. Запустите с флагами --mode local --language ru --num-clips 5 --output-json result.json. Засеките время расшифровки и всего прогона.

Шаг 3. Отдельно, не заглядывая в результат, отметьте вручную пять моментов, которые вы бы вырезали сами. Затем сравните: сколько совпало, где проект начал ролик на середине фразы, где обрезал кадр неудачно, как расшифровал имена.

Шаг 4. Выбранные ролики доведите руками: субтитры, обложка, сверка цитат с текстом. По итогу вы увидите, сколько времени проект реально экономит именно на вашем материале. Если нужна пакетная расшифровка без нарезки, смотрите разбор про расшифровку звонков и совещаний пачкой.

Если вам нужен другой подход, когда ролик собирается не из записи, а из текста и картинок, у меня разобраны MoneyPrinterTurbo на своём сервере и конвейер роликов из фото и инфографики.

Частые вопросы

Нужна ли видеокарта?

README её не требует: расшифровка работает на процессоре, CUDA её только ускоряет. Сколько это займёт на вашем компьютере, я не проверял, замерьте на коротком отрывке.

Видео уходит в чужое облако?

В режиме API скачивание, расшифровка и кадрирование идут через MuAPI, то есть материал попадает на сторонние серверы. В локальном режиме в облако уходит только текст расшифровки для выбора моментов. Если в записи персональные данные или закрытые обсуждения, берите локальный режим и сначала прочитайте условия провайдера модели.

Можно ли настроить под себя критерии выбора?

Да, по README критерии и системный промпт лежат в файле highlights.py, их можно править. Для эксперта разумно заменить виральность на полезность и законченность мысли, и проверить результат тем же сравнением с ручной нарезкой.

Коротко о главном

Проект с открытым кодом режет длинное видео на кандидатов в короткие ролики, а решение, что публиковать, остаётся за вами. Пять роликов из часа это вечер проверки: моменты, субтитры, обложку и цитаты проверяет человек.

Если у вас есть архив записей, и вы хотите превратить его в поток роликов с вашим стилем, контент и ролики из одного материала описаны на отдельной странице. Напишите мне в Telegram кодовое слово «НАРЕЗКА», я посмотрю на вашу запись и скажу, что из неё реально получится.

Ещё open-source для бизнеса

Эта статья — часть каталога бесплатных решений, которые я разворачиваю на вашем сервере под ключ: CRM, аналитика, документы, почта, безопасность, магазины, AI.

Услуги по теме

Что я делаю для бизнеса

  • Боты в Telegram, MAX, VK
  • Автоматизация процессов и CRM
  • Аналитика и дашборды
  • Сайты и лендинги под ключ

Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»

12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.

Готовы обсудить вашу задачу?

Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.

Пишу о разработке, ИИ и законах для бизнеса

Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.

Готовые решения под ключTurnkey solutionsSoluciones llave en mano交钥匙解决方案Түлхүүр гардуулах шийдэл 451 готовых IT-решений для бизнеса451 ready-made IT solutions for business451 soluciones IT listas para empresas451 个面向企业的现成 IT 解决方案Бизнест зориулсан 451 бэлэн IT шийдэл Автоматизация, боты, AI, 152-ФЗ и платформы · бесплатная консультацияAutomation, bots, AI, data privacy and platforms · free consultationAutomatización, bots, IA, privacidad de datos y plataformas · consulta gratis自动化、机器人、AI、数据合规与平台 · 免费咨询Автоматжуулалт, бот, AI, өгөгдлийн хамгаалалт ба платформ · үнэгүй зөвлөгөө Смотреть каталогView catalogVer catálogo查看目录Каталог үзэх