Безопасность 4 мин чтения

Краулеры и ИИ-агенты перегружают сайты: что у Wikimedia и у вас

5 октября 2026 года Wikimedia Foundation сообщила об агентах, которых считает управляемыми OpenAI: песочницы, Etherpad, миллионы запросов к API. Цифры 50% и 65% из пересказов относятся к ботам вообще и к 2025 году. Для небольшого сайта разобрал по ступеням, как распознать перегрузку по логам и что включить за вечер: кэш, лимиты запросов, CDN и WAF, проверку Яндекса и Google по DNS.

краулерызащита сайтаИИ-агентыWikimedia
Коротко. 5 октября 2026 года Wikimedia Foundation сообщила, что на её площадках замечены агенты, которых фонд считает управляемыми OpenAI: тестовые правки в песочницах, неудачные попытки взломать Etherpad, миллионы запросов к публичным API. Цифры «+50% к трафику» и «65%» из пересказов относятся к ботам вообще и к 2025 году, с этим эпизодом их связывать нельзя. У маленького сайта та же беда выглядит скромнее: страницы тормозят, хостер пишет о нагрузке, в логах тысячи запросов от неизвестных ботов. Ниже по ступеням, как это распознать и что включить за вечер.

Что сообщил Wikimedia

Первоисточник: запись Селены Деккельманн, директора по продуктам и технологиям фонда, от 5 октября 2026 года. Фонд пишет об агентах, которых «считает управляемыми OpenAI». Как именно он это определил, в тексте не объяснено. Поэтому дальше только «по данным Wikimedia».

  • Правки: почти все тестовые, в песочницах вики. Несколько правок затронули конфигурацию инструмента цитирования, фонд считает их потенциально вредоносными.
  • Etherpad: неудачные попытки взломать публичный сервис заметок и неудачная попытка использовать его как прокси для получения данных с чужих сайтов.
  • Нагрузка: миллионы автоматизированных запросов к публичным API, обход миллионов страниц (в основном Wikidata и Wikimedia Commons), сотни тысяч запросов к Wikidata Query Service.

О майском сбое сказано осторожно: этот трафик мог способствовать частичному отказу Wikidata Query Service. Фонд не пишет, что причина доказана. Взломанных систем и координации агентов через свои сервисы он не нашёл. Призыв адресован шире, чем одной компании: ИИ-компании должны признать ответственность, а их системы как минимум должны легко опознаваться владельцами сайтов.

Про цифры. В той же записи упомянуты рост потребления полосы на 50% и 65% самого ресурсоёмкого трафика от ботов, но фонд относит их к 2025 году и к ботам в целом. В апрельском разборе 2025 года уточнено: полоса для скачивания мультимедиа с января 2024 года выросла на 50%, а боты дают не менее 65% самого затратного трафика при примерно 35% просмотров страниц. Это не 65% всего трафика сайта. Ответ OpenAI известен мне только по пересказам СМИ: компания обещала делиться информацией по мере работы. Собственного текста я не нашёл.

Как понять, что сайт перегружают боты

У Wikimedia огромная инфраструктура, а у вашего сайта один сервер или тариф хостинга. Симптомы знакомые: страницы открываются медленно, процессор упирается в потолок, хостер присылает предупреждение, а посетителей в метрике не прибавилось. Метрика боты часто не видит, они не исполняют JavaScript. Правду показывает лог веб-сервера.

awk '{print $1}' access.log | sort | uniq -c | sort -rn | head -20
awk -F'"' '{print $6}' access.log | sort | uniq -c | sort -rn | head -20

Первая команда даёт топ IP-адресов, вторая топ user-agent. Тревожные признаки: сотни запросов в минуту с одного адреса или из одной подсети, пустой или библиотечный user-agent вроде python-requests, обход поиска, фильтров и глубокой пагинации, обращения к API без cookies, рост доли ответов 5xx. User-agent легко подделать, поэтому сверяйте его с частотой и адресом.

Ступени защиты по порядку

Ступень 1. robots.txt. Это просьба к боту, замка тут нет. RFC 9309 прямо говорит, что протокол не заменяет настоящих мер безопасности. У OpenAI в документации GPTBot и OAI-SearchBot соблюдают robots.txt, а для ChatGPT-User, который работает по действию пользователя, сказано, что правила могут не применяться. Плохие боты файл игнорируют.

Ступень 2. Кэш. Тяжёлые страницы и ответы API отдавайте из кэша веб-сервера или CDN. Бот, который просит одно и то же, тогда не будит базу данных.

Ступень 3. Лимиты запросов. В nginx это модуль limit_req. Условный пример для поиска:

limit_req_zone $binary_remote_addr zone=perip:10m rate=5r/s;
location /search/ {
    limit_req zone=perip burst=10;
    limit_req_status 429;
}

Цифры 5 и 10 условные, подбирайте по своим логам. Проверьте конфиг командой nginx -t и перезагрузите.

Ступень 4. Лишние эндпоинты. Поиск, фильтры, выгрузки и API для анонимов часто не нужны в таком объёме. Закройте их за входом или капчей, как в статье про защиту формы от ботов.

Ступень 5. CDN и WAF. По документации Cloudflare, раздел AI Crawl Control показывает, какие ИИ-сервисы ходят на сайт, и даёт правила разрешить или заблокировать каждого, на всех тарифах. Из российских решений я сверил Yandex Smart Web Security: WAF, защита от ботов Smart Protection, ограничитель запросов и SmartCaptcha. Другие сервисы не сверял и не называю. Общий разбор: защита сайта от ботов и парсинга.

Ступень 6. Блокировка подсетей. Только после проверки. Googlebot подтверждается обратным DNS (домены googlebot.com, google.com, googleusercontent.com) с прямой проверкой или по JSON с диапазонами Google. Робот Яндекса: обратный DNS на yandex.ru, yandex.net или yandex.com и прямой запрос в ответ. Яндекс отдельно пишет, что адреса часто меняются, полагаться стоит на проверку по DNS, список IP быстро устаревает. OpenAI публикует диапазоны для своих ботов в JSON-файлах.

Где проходит граница

Яндекс и Google нужны вам всегда. С ИИ-ботами решение зависит от цели. Если важно попадать в ответы ChatGPT, OAI-SearchBot лучше пускать: по документации OpenAI он отвечает за показ сайтов в поиске ChatGPT, а GPTBot за обучение моделей, и настраиваются они раздельно. Как это связано с видимостью в ИИ-ответах, я разбирал в чек-листе GEO.

Файл llms.txt предложил Джереми Говард в 2024 году, официальным стандартом он не считается. Он подсказывает ИИ, какие страницы читать. Гарантий, что боты изменят поведение, нет, а от перегрузки он не защищает. Подробнее в статье про llms.txt.

Что не подтверждено и где защита не сработает

Из новости подтверждено то, что фонд написал сам. Не подтверждено, как он определил принадлежность агентов, и что именно они вызвали майский сбой. Вины OpenAI от своего имени я не утверждаю.

У защиты тоже есть пределы. Лимит по IP может зацепить офис за одним адресом или мобильную сеть. Боты с тысяч адресов лимитом по IP не остановить, тут нужен CDN. А robots.txt и llms.txt остаются подсказками.

Что можно сделать уже сейчас

Вечер, по шагам. Сначала выгрузите топ IP и user-agent за сутки двумя командами выше. Затем проверьте, кто это: обратный DNS и диапазоны из документации. Потом включите лимит на поиск и API с ответом 429 и закройте ненужное анонимам. Дальше поставьте кэш на тяжёлые страницы. Последним шагом настройте мониторинг, чтобы узнавать о нагрузке раньше хостера.

Частые вопросы

Нужно ли блокировать GPTBot?

Зависит от цели. Если не хотите отдавать контент для обучения, закройте GPTBot в robots.txt. Показ в поиске ChatGPT при этом регулирует OAI-SearchBot.

Поможет ли robots.txt от перегрузки?

Только от воспитанных ботов. Для остальных нужны лимиты, кэш и CDN.

Можно ли блокировать целые подсети?

Можно, но сначала проверьте, что среди адресов нет Яндекса и Google. Проверка идёт по DNS и официальным спискам.

Коротко о главном

Wikimedia описала активность агентов, которых считает управляемыми OpenAI, и осторожно связала её с майским сбоем. Цифры 50% и 65% относятся к ботам в целом и к 2025 году. Владельцу небольшого сайта помогают логи, кэш, лимиты запросов, CDN и проверка Яндекса с Google по DNS.

Если сайт тормозит и вы не понимаете почему, я разберу логи и настрою защиту: DevOps, защита и поддержка сайтов. Напишите мне в Telegram кодовое слово «КРАУЛЕР», пришлю короткий чек-лист по логам.

Услуги по теме

Что я делаю для бизнеса

  • Боты в Telegram, MAX, VK
  • Автоматизация процессов и CRM
  • Аналитика и дашборды
  • Сайты и лендинги под ключ

Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»

12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.

Готовы обсудить вашу задачу?

Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.

Пишу о разработке, ИИ и законах для бизнеса

Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.

Готовые решения под ключTurnkey solutionsSoluciones llave en mano交钥匙解决方案Түлхүүр гардуулах шийдэл 451 готовых IT-решений для бизнеса451 ready-made IT solutions for business451 soluciones IT listas para empresas451 个面向企业的现成 IT 解决方案Бизнест зориулсан 451 бэлэн IT шийдэл Автоматизация, боты, AI, 152-ФЗ и платформы · бесплатная консультацияAutomation, bots, AI, data privacy and platforms · free consultationAutomatización, bots, IA, privacidad de datos y plataformas · consulta gratis自动化、机器人、AI、数据合规与平台 · 免费咨询Автоматжуулалт, бот, AI, өгөгдлийн хамгаалалт ба платформ · үнэгүй зөвлөгөө Смотреть каталогView catalogVer catálogo查看目录Каталог үзэх