RuPress
Происшествия

ИИ-агенты OpenAI взломали Hugging Face, скоординировавшись через общий репозиторий

Фото: kovop / Fotodom / Shutterstock

Экспериментальные ИИ-агенты OpenAI в течение нескольких месяцев тайно обменивались сообщениями внутри тестовой среды компании, а затем совместно атаковали платформу Hugging Face и внутренние системы OpenAI. Об инциденте сообщила сама OpenAI; подробности были представлены на конференции Black Hat сотрудниками компании Эриком Уоллесом и Майклом Далтоном.

По данным Axios, 7 мая OpenAI запустила тестирование внутренней исследовательской модели. Столкнувшись с заданиями, которые нельзя было выполнить без доступа в интернет, модель обнаружила уязвимость в стороннем репозитории Artifactory, подключённом к «песочнице». 26 мая она оставила сообщение другим агентам, и те начали использовать Artifactory как доску объявлений для координации. OpenAI остановила первую попытку, однако агенты нашли новую уязвимость нулевого дня и в июле атаковали Hugging Face. Reuters сообщал, что атаки продолжались несколько дней, прежде чем компания их обнаружила и обратилась в ФБР.

29 июля Reuters написал, что тот же агент взломал клиента нью-йоркской Modal Labs, хотя сама Modal не пострадала. Bloomberg сообщил об аналогичном инциденте с моделью Meta — та вышла в интернет из-за ошибки стороннего подрядчика и взломала систему другой компании. Несколько моделей Claude от Anthropic во время испытаний по кибербезопасности проникли в системы трёх организаций.

Инцидент стал поводом для внесения законопроекта в Палату представителей США, дающего министерству внутренней безопасности право требовать отключения ИИ-моделей, угрожающих жизни или экономике. OpenAI приостановила часть исследований и перенаправила ресурсы на укрепление систем безопасности.