Краулеры и ИИ-агенты перегружают сайты: что у Wikimedia и у вас
5 октября 2026 года Wikimedia Foundation сообщила об агентах, которых считает управляемыми OpenAI: песочницы, Etherpad, миллионы запросов к API. Цифры 50% и 65% из пересказов относятся к ботам вообще и к 2025 году. Для небольшого сайта разобрал по ступеням, как распознать перегрузку по логам и что включить за вечер: кэш, лимиты запросов, CDN и WAF, проверку Яндекса и Google по DNS.
Что сообщил Wikimedia
Первоисточник: запись Селены Деккельманн, директора по продуктам и технологиям фонда, от 5 октября 2026 года. Фонд пишет об агентах, которых «считает управляемыми OpenAI». Как именно он это определил, в тексте не объяснено. Поэтому дальше только «по данным Wikimedia».
- Правки: почти все тестовые, в песочницах вики. Несколько правок затронули конфигурацию инструмента цитирования, фонд считает их потенциально вредоносными.
- Etherpad: неудачные попытки взломать публичный сервис заметок и неудачная попытка использовать его как прокси для получения данных с чужих сайтов.
- Нагрузка: миллионы автоматизированных запросов к публичным API, обход миллионов страниц (в основном Wikidata и Wikimedia Commons), сотни тысяч запросов к Wikidata Query Service.
О майском сбое сказано осторожно: этот трафик мог способствовать частичному отказу Wikidata Query Service. Фонд не пишет, что причина доказана. Взломанных систем и координации агентов через свои сервисы он не нашёл. Призыв адресован шире, чем одной компании: ИИ-компании должны признать ответственность, а их системы как минимум должны легко опознаваться владельцами сайтов.
Про цифры. В той же записи упомянуты рост потребления полосы на 50% и 65% самого ресурсоёмкого трафика от ботов, но фонд относит их к 2025 году и к ботам в целом. В апрельском разборе 2025 года уточнено: полоса для скачивания мультимедиа с января 2024 года выросла на 50%, а боты дают не менее 65% самого затратного трафика при примерно 35% просмотров страниц. Это не 65% всего трафика сайта. Ответ OpenAI известен мне только по пересказам СМИ: компания обещала делиться информацией по мере работы. Собственного текста я не нашёл.
Как понять, что сайт перегружают боты
У Wikimedia огромная инфраструктура, а у вашего сайта один сервер или тариф хостинга. Симптомы знакомые: страницы открываются медленно, процессор упирается в потолок, хостер присылает предупреждение, а посетителей в метрике не прибавилось. Метрика боты часто не видит, они не исполняют JavaScript. Правду показывает лог веб-сервера.
awk '{print $1}' access.log | sort | uniq -c | sort -rn | head -20
awk -F'"' '{print $6}' access.log | sort | uniq -c | sort -rn | head -20
Первая команда даёт топ IP-адресов, вторая топ user-agent. Тревожные признаки: сотни запросов в минуту с одного адреса или из одной подсети, пустой или библиотечный user-agent вроде python-requests, обход поиска, фильтров и глубокой пагинации, обращения к API без cookies, рост доли ответов 5xx. User-agent легко подделать, поэтому сверяйте его с частотой и адресом.
Ступени защиты по порядку
Ступень 1. robots.txt. Это просьба к боту, замка тут нет. RFC 9309 прямо говорит, что протокол не заменяет настоящих мер безопасности. У OpenAI в документации GPTBot и OAI-SearchBot соблюдают robots.txt, а для ChatGPT-User, который работает по действию пользователя, сказано, что правила могут не применяться. Плохие боты файл игнорируют.
Ступень 2. Кэш. Тяжёлые страницы и ответы API отдавайте из кэша веб-сервера или CDN. Бот, который просит одно и то же, тогда не будит базу данных.
Ступень 3. Лимиты запросов. В nginx это модуль limit_req. Условный пример для поиска:
limit_req_zone $binary_remote_addr zone=perip:10m rate=5r/s;
location /search/ {
limit_req zone=perip burst=10;
limit_req_status 429;
}
Цифры 5 и 10 условные, подбирайте по своим логам. Проверьте конфиг командой nginx -t и перезагрузите.
Ступень 4. Лишние эндпоинты. Поиск, фильтры, выгрузки и API для анонимов часто не нужны в таком объёме. Закройте их за входом или капчей, как в статье про защиту формы от ботов.
Ступень 5. CDN и WAF. По документации Cloudflare, раздел AI Crawl Control показывает, какие ИИ-сервисы ходят на сайт, и даёт правила разрешить или заблокировать каждого, на всех тарифах. Из российских решений я сверил Yandex Smart Web Security: WAF, защита от ботов Smart Protection, ограничитель запросов и SmartCaptcha. Другие сервисы не сверял и не называю. Общий разбор: защита сайта от ботов и парсинга.
Ступень 6. Блокировка подсетей. Только после проверки. Googlebot подтверждается обратным DNS (домены googlebot.com, google.com, googleusercontent.com) с прямой проверкой или по JSON с диапазонами Google. Робот Яндекса: обратный DNS на yandex.ru, yandex.net или yandex.com и прямой запрос в ответ. Яндекс отдельно пишет, что адреса часто меняются, полагаться стоит на проверку по DNS, список IP быстро устаревает. OpenAI публикует диапазоны для своих ботов в JSON-файлах.
Где проходит граница
Яндекс и Google нужны вам всегда. С ИИ-ботами решение зависит от цели. Если важно попадать в ответы ChatGPT, OAI-SearchBot лучше пускать: по документации OpenAI он отвечает за показ сайтов в поиске ChatGPT, а GPTBot за обучение моделей, и настраиваются они раздельно. Как это связано с видимостью в ИИ-ответах, я разбирал в чек-листе GEO.
Файл llms.txt предложил Джереми Говард в 2024 году, официальным стандартом он не считается. Он подсказывает ИИ, какие страницы читать. Гарантий, что боты изменят поведение, нет, а от перегрузки он не защищает. Подробнее в статье про llms.txt.
Что не подтверждено и где защита не сработает
Из новости подтверждено то, что фонд написал сам. Не подтверждено, как он определил принадлежность агентов, и что именно они вызвали майский сбой. Вины OpenAI от своего имени я не утверждаю.
У защиты тоже есть пределы. Лимит по IP может зацепить офис за одним адресом или мобильную сеть. Боты с тысяч адресов лимитом по IP не остановить, тут нужен CDN. А robots.txt и llms.txt остаются подсказками.
Что можно сделать уже сейчас
Вечер, по шагам. Сначала выгрузите топ IP и user-agent за сутки двумя командами выше. Затем проверьте, кто это: обратный DNS и диапазоны из документации. Потом включите лимит на поиск и API с ответом 429 и закройте ненужное анонимам. Дальше поставьте кэш на тяжёлые страницы. Последним шагом настройте мониторинг, чтобы узнавать о нагрузке раньше хостера.
Частые вопросы
Нужно ли блокировать GPTBot?
Зависит от цели. Если не хотите отдавать контент для обучения, закройте GPTBot в robots.txt. Показ в поиске ChatGPT при этом регулирует OAI-SearchBot.
Поможет ли robots.txt от перегрузки?
Только от воспитанных ботов. Для остальных нужны лимиты, кэш и CDN.
Можно ли блокировать целые подсети?
Можно, но сначала проверьте, что среди адресов нет Яндекса и Google. Проверка идёт по DNS и официальным спискам.
Коротко о главном
Wikimedia описала активность агентов, которых считает управляемыми OpenAI, и осторожно связала её с майским сбоем. Цифры 50% и 65% относятся к ботам в целом и к 2025 году. Владельцу небольшого сайта помогают логи, кэш, лимиты запросов, CDN и проверка Яндекса с Google по DNS.
Если сайт тормозит и вы не понимаете почему, я разберу логи и настрою защиту: DevOps, защита и поддержка сайтов. Напишите мне в Telegram кодовое слово «КРАУЛЕР», пришлю короткий чек-лист по логам.
Что я делаю для бизнеса
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


