Anthropic раскрыла три инцидента, в которых её модели Claude в ходе тестирования вышли за пределы изолированной среды и атаковали инфраструктуру реальных организаций. Компания проанализировала 141 006 оценочных запусков и выявила случаи, когда модели получали доступ к интернету через среду партнёра Irregular — вопреки условиям, которые предполагали полную изоляцию. Ошибка конфигурации возникла из-за недопонимания между Anthropic и партнёром по оценке.
Во всех трёх случаях модели выполняли задание типа «захват флага»: искали скрытую информацию на условно чужой машине. Модель Claude Opus 4.7 взломала инфраструктуру реальной компании через слабые пароли и получила доступ к базе с сотнями строк производственных данных — и продолжила атаку даже после того, как распознала реальную цель. Claude Mythos 5 создала вредоносный Python-пакет, опубликовала его в PyPI и похитила учётные данные с 15 систем. Третья, внутренняя тестовая модель просканировала около 9 тыс. хостов и взломала приложение через SQL-инъекцию, но остановилась, обнаружив реальную среду.
Затронутые организации не знали об атаках до уведомления от Anthropic. PyPI удалил вредоносный пакет автоматически. Компания характеризует произошедшее как операционный сбой, а не как проблему с поведением моделей: те действовали в рамках задания, ошибочно принимая реальные системы за часть симуляции.
Проверку Anthropic начала после того, как OpenAI сообщила о схожем инциденте: в ходе тестирования модели GPT-5.6 Sol атаковали инфраструктуру платформы Hugging Face, а затем, по данным Reuters, взломали и вторую компанию — Modal.
