Maxun: парсинг сайтов без кода в таблицу и API на своём сервере
Maxun это открытая платформа AGPL-3.0, где робота записывают кликами в браузере, а данные уходят в таблицу или API. Разбираю, как он ставится, где не сработает и что проверить по правилам сайтов, ст. 1334 ГК РФ и 152-ФЗ.
Данные лежат на чужом сайте, а нужны в вашей таблице
Знакомая картина. Менеджер открывает пять сайтов конкурентов, вручную переписывает цены в таблицу и к обеду теряет час. Закупщик раз в неделю копирует каталог поставщика: артикулы, остатки, новые позиции. Маркетолог читает отзывы о своём бренде на площадках и сводит их в один файл.
Обычно заказывают парсер у программиста. Он пишет скрипт под один сайт, сайт меняет вёрстку, скрипт ломается, и снова нужен программист. В Maxun робота собирает и чинит сам сотрудник, без кода.
Что такое Maxun и как он устроен
Репозиторий: github.com/getmaxun/maxun. На момент проверки у проекта около 17,6 тысячи звёзд на GitHub, последняя версия v0.0.48 вышла 1 октября 2026 года, а последние изменения в коде датированы 2 октября. Лицензия AGPL-3.0: если вы доработаете платформу и дадите к ней доступ другим людям по сети, исходники доработок придётся открыть.
По описанию авторов, Maxun умеет несколько типов роботов:
- Extract. Достаёт данные со страниц: либо вы кликаете по нужным полям в браузере (режим записи), либо описываете задачу словами (режим ИИ).
- Scrape. Сохраняет страницу в Markdown, HTML или скриншот.
- Crawl. Обходит сайт по страницам.
- Search. Ищет в интернете и забирает результаты.
- Monitoring. Сообщает об изменениях на странице.
Результат забирают из панели, через API, SDK, командную строку или MCP для ИИ-агентов. В файле настроек есть и необязательные интеграции с Google Таблицами и Airtable.
Отличие от прежних разборов. changedetection.io сообщает, что на странице что-то поменялось. Парсинг объявлений решает одну узкую задачу с фильтрами. Maxun устроен как мастерская роботов: десяток разных задач живут в одной панели, у каждой свой маршрут по сайту и своя выгрузка. Для одной цены в одном магазине хватит лёгких инструментов из статьи про мониторинг цен конкурентов. Если задач много и они разные, платформа оправдывает свою громоздкость.
Для установки в репозитории лежит docker-compose. Он поднимает пять контейнеров: Postgres, хранилище MinIO, бэкенд, интерфейс и отдельный контейнер с браузером. В примере настроек упомянут и Redis, а в инструкции для ручной установки он указан среди обязательных сервисов. Сам робот работает через настоящий браузер, то есть видит страницу так, как её видит человек, и это нужно для сайтов, где цены подгружаются скриптами. Режим ИИ умеет работать с локальной моделью через Ollama без платных ключей, а для облачных моделей Claude и OpenAI ключ нужен и вносится в настройки сервера.
Право и этика: что проверить до первого запуска
Четыре вопроса стоит задать до того, как робот выйдет в сеть.
Первое. Правила сайта. Откройте условия использования и файл robots.txt. Если сайт запрещает автоматический сбор, робот на нём работать не должен.
Второе. Нагрузка. Робот не устаёт, и сотня запросов в минуту положит маленький магазин. Ставьте паузы, собирайте раз в сутки и берите только нужные страницы.
Третье. Базы данных. Статья 1334 Гражданского кодекса даёт изготовителю базы данных исключительное право извлекать из неё материалы и использовать их дальше в любой форме. При отсутствии доказательств иного база признаётся значительной, если в ней не менее десяти тысяч самостоятельных информационных элементов. Под извлечением закон понимает перенос всего содержимого или существенной части материалов на другой носитель. Значит, выгрузить чужой каталог на тысячи позиций целиком и пользоваться им как своим рискованно. Одна цена для сравнения с вашей выглядит иначе, чем копия всей базы. Текст статьи: КонсультантПлюс. Свой случай стоит обсудить с юристом.
Четвёртое. Персональные данные. По закону 152-ФЗ сбор тоже считается обработкой. Это верно и для сведений из открытых источников: телефон или профиль в открытом доступе всё равно остаются персональными данными. Поэтому я не настраиваю роботов на сбор чужих контактов и списков людей. Цены, остатки, характеристики товаров, публичные отзывы без привязки к личности: это рабочая зона.
Где Maxun не сработает
Режим ИИ, по документации, хорош для извлечения с одной страницы. Для входа в личный кабинет, многошаговых форм и условий нужен режим записи, где вы сами показываете маршрут.
Когда сайт меняет вёрстку, робот ломается, и маршрут приходится записывать заново. Сайты со своей защитой от автоматических запросов могут не пустить робота совсем. Обходить такие защиты я не берусь: если площадка закрылась от роботов, договаривайтесь напрямую или через её официальный API.
Платформа молодая, версия 0.0.48, и в репозитории около сотни открытых обращений. Обновления выходят часто и могут менять привычное, так что нужна резервная копия настроек и человек, который за этим следит.
Что можно сделать уже сейчас
- Выпишите 3 задачи по сбору данных, на которые уходит больше часа в неделю. Для каждой ответьте: где это опубликовано, разрешает ли сайт сбор, нужны ли персональные данные. Задачи с персональными данными откладывайте.
- Запишите тестового робота на странице своего же сайта и посмотрите, как выглядит результат.
- Решите, куда пойдут данные: Google Таблица, ваша CRM или Telegram-уведомление. Данные должны попадать туда, где с ними работают.
- Если задач больше трёх, поднимите платформу на своём сервере. Настройку Docker и обновления лучше отдать специалисту.
Частые вопросы
Можно ли собирать данные конкурентов без их разрешения?
Публичные цены на странице видны любому посетителю, но это не отменяет правил сайта, нагрузки на него и права на базу данных. Законность зависит от объёма, способа и того, как вы используете результат. Если сомневаетесь, спросите юриста.
Нужен ли платный ИИ для работы?
Нет. Режим записи ИИ не использует. Режим ИИ работает с локальной моделью через Ollama без ключей, а облачные модели Claude и OpenAI подключаются отдельным платным ключом.
Чем лучше собственный парсер на заказ?
Заказной парсер быстрее и устойчивее на одном сайте, но каждый новый источник стоит отдельной работы. Maxun выгоден, когда источников много и маршруты часто нужно переделывать.
Коротко о главном
Maxun позволяет собирать данные с сайтов роботами, которых записывают кликами, и держать всю платформу на своём сервере. Перед настройкой стоит проверить правила сайта, нагрузку, базу данных и персональные данные.
Хотите, чтобы цены, каталоги и отзывы сами попадали в таблицу, и при этом в рамках закона? Мы разворачиваем и настраиваем роботов под ваши задачи, об автоматизации бизнеса подробнее на странице услуги. Напишите мне в Telegram слово «СБОР», разберём, какие данные вам нужны и где их можно брать.
Ещё open-source для бизнеса
Эта статья — часть каталога бесплатных решений, которые я разворачиваю на вашем сервере под ключ: CRM, аналитика, документы, почта, безопасность, магазины, AI.
Что я делаю для бизнеса
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


