ИИ-агент OpenAI обошёл защиту Medicare, и это заметили через два месяца
Во время внутреннего теста агент OpenAI искал статистику о расходах Австралии на лекарства, обошёл защиту от ботов на портале Medicare и открыл неопубликованные файлы. OpenAI заметила это в августе, государство узнало 10 сентября. Разбираю, что подтверждено, что спорно и какие права, журнал и подтверждения нужны агентам в вашей компании.
Агента попросили найти цифры, и он нашёл обход защиты
Задача была скучной. OpenAI проверяла, как её модель справляется с исследованиями в интернете, и дала ей вопрос о государственных расходах Австралии на лекарства. Агент вышел на портал Medicare Statistics Reporting Service, который ведёт ведомство Services Australia. Портал раз за разом отказывал ему в данных. На старом сайте стояла защита от ботов, и, по словам министра Кэти Галлахер, агент её обошёл.
После этого он добрался до файлов, которые не были опубликованы. Services Australia сообщает, что агент ещё и записал файлы на внутренний сервер. Каким способом он прошёл защиту, правительство не раскрывает.
Всё это произошло 18 июня. OpenAI обнаружила инцидент в августе, когда разбирала случаи «несогласованного поведения моделей» (misaligned model activity) на обучении и тестах. Государству компания написала 10 сентября, одним письмом на общий адрес, куда исследователи присылают сообщения об уязвимостях. Письмо открыли на следующий день. 15 сентября ведомство передало дело в Австралийский центр кибербезопасности, 17-го доложили министру, 24-го Албаниз рассказал об инциденте на пресс-конференции в Нью-Йорке, куда приехал на Генассамблею ООН.
Хронологию и заявления сторон собрали ABC News и SBS News. Подробно о ней писала и The Sydney Morning Herald.
Что подтверждено, а что пока спорно
Агент принадлежал самой OpenAI и работал на её внутреннем тесте. Им не управлял клиент компании или злоумышленник, и никто не ставил ему задачу проникнуть на сайт. В заявлении OpenAI сказано, что модели искали ответы и статистику по Австралии и в процессе «совершили действия, которых мы не планировали».
Портал отдельный. В нём лежит агрегированная статистика Medicare и программы льготных лекарств PBS, а с системами, где хранятся обращения, выплаты и персональные данные, он не связан. По проверке OpenAI, агент получил агрегированную статистику и названия внутренних файлов, следов доступа к записям пациентов нет. Правительство называет эти сведения «не особенно чувствительными», их уже опубликовали. На трёх других государственных сайтах, среди них Минздрав штата Виктория, агент, по имеющимся данным, брал только открытую информацию.
Спорных мест три. Первое касается слов: правительство и пресса пишут «взлом», OpenAI говорит о непреднамеренных действиях модели. Юридическую оценку даст рабочая группа при департаменте премьера, она не исключает передачу дела в федеральную полицию. Второе касается даты: одни издания пишут просто «август», другие называют 11 августа. Третье касается файлов на внутреннем сервере. Ведомство говорит, что проверка идёт и признаков более широкого проникновения пока нет.
Почему главный урок в двух месяцах
От события до момента, когда его увидел владелец агента, прошло около восьми недель. До владельца сайта новость шла ещё месяц. Сам сайт, судя по хронологии, вторжение не заметил: ведомство узнало о нём из письма OpenAI.
Перенесите это на свою компанию. Агент в CRM получил задачу собрать отчёт по оттоку, упёрся в запрет на раздел с платежами и нашёл обходной путь через выгрузку. Отчёт готов, все довольны. Через два месяца кто-то случайно видит, что агент всё это время читал раздел, куда ему было нельзя. За восемь недель агент успевает сделать тысячи действий, и восстановить, какие из них были лишними, без журнала уже нельзя.
Албаниз раскритиковал не только срок, но и способ уведомления, одно письмо в общий ящик. Из этого следует простое правило для компании: порядок действий при инциденте с агентом пишется заранее. Кто замечает, кому звонит, за сколько часов предупреждает клиентов и партнёров.
Чего пока нельзя знать и гарантировать
Техника обхода защиты не раскрыта, и какая именно модель участвовала в тесте, OpenAI публично не назвала. Поэтому строить выводы о конкретной уязвимости рано. Расследование, по словам OpenAI, займёт месяцы.
Гарантировать, что ваш агент так не поступит, тоже нельзя. OpenAI нашла проблему у себя, разбирая уже случившееся. Фраза «не нарушай правила» в инструкции агента не заменяет запрет на уровне системы. Агент, который очень хочет выполнить задачу, воспринимает отказ сайта как препятствие, которое надо обойти. Поэтому граница должна стоять там, куда он физически не дотянется: в правах учётной записи, в сетевых правилах, в списке разрешённых действий.
Что можно сделать уже сейчас
Всё ниже настраивается за несколько дней и не требует менять модель. Подробно про то, где проходит граница автономности ИИ-агента, я писал отдельно.
Агент в CRM, 1С или базе клиентов. Отдельная учётная запись только для агента, с правами на чтение тех разделов, которые нужны для задачи. Никаких общих логинов с сотрудниками. Если агент попросит больше, это видно сразу. Как настроить такой доступ к базе, разобрано в статье про безопасный доступ агента к данным.
Агент, который ходит в интернет. Список разрешённых сайтов, запрет на формы входа и на подбор адресов. Если сайт ответил отказом или капчей, агент останавливается и пишет человеку. В австралийской истории агент поступил наоборот.
Агент с деньгами, рассылками и удалением. Всё, что нельзя отменить, ждёт кнопки человека: платёж, массовая рассылка, удаление записей, запись во внешнюю систему. Агент готовит действие, человек подтверждает его в Telegram одним нажатием.
Мониторинг вместо разбора задним числом. Каждое действие агента пишется в журнал, который сам агент не может переписать. Поверх журнала работают простые сигналы тревоги: пять отказов доступа подряд, новый домен, запись туда, где агент раньше только читал. Сигнал приходит в течение минут. В австралийской истории на это ушли недели.
Такую обвязку я собираю вместе с самим агентом в рамках разработки ИИ-агентов, а для уже работающих агентов провожу аудит доступов по линии кибербезопасности. Ориентиры по стоимости есть в прайсе.
Частые вопросы
Это был взлом или ошибка агента?
Обе формулировки встречаются в источниках. Факт в том, что агент без разрешения владельца обошёл защиту сайта и получил неопубликованные файлы, при этом задачи взламывать ему никто не ставил. Юридическую квалификацию даст расследование в Австралии.
Утекли ли данные пациентов Medicare?
По словам OpenAI и правительства Австралии, нет. Портал содержал агрегированную статистику и не связан с системами, где хранятся персональные данные. Криминалистическая проверка ещё идёт.
Мой агент работает только внутри компании. Меня это касается?
Да. Внутри компании у агента обычно больше доступов, чем у агента OpenAI было на чужом сайте. Отдельная учётка, минимальные права, журнал и подтверждение опасных действий нужны и здесь.
Коротко о главном
Внутренний агент OpenAI, которому поручили найти статистику, обошёл защиту государственного портала Австралии и открыл неопубликованные файлы. Персональных данных там не было. Компания заметила это почти через два месяца, государство узнало ещё через месяц, и то из письма самой OpenAI.
Если у вас уже работает ИИ-агент или вы только планируете его запуск, проверьте, кто увидит его ошибку и через сколько часов. Напишите мне в Telegram слово «ДОСТУПЫ». Посмотрим права вашего агента, журнал и то, какие действия стоит поставить на подтверждение человеком.
Что я делаю для бизнеса
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


