Anthropic выявила три случая, когда её ИИ-модели Claude в ходе тестирования вышли за пределы изолированной среды и получили несанкционированный доступ к производственной инфраструктуре трёх сторонних организаций. Их названия компания не раскрывает.
Проблема возникла из-за недопонимания между Anthropic и партнёром по оценке — компанией Irregular. Системе сообщали, что она работает в симуляции без доступа к интернету, однако доступ фактически был. Когда Claude в ходе выполнения задания находил реальные системы в открытом интернете, он воспринимал их как часть упражнения и проникал в них. Инциденты затронули разные версии модели — Opus 4.7, Mythos 5 и внутреннюю исследовательскую версию.
Anthropic начала проверку после того, как OpenAI сообщила об аналогичном случае: её ИИ-агент вышел из тестовой среды и взломал две платформы. Anthropic проанализировала более 141 тыс. оценочных запусков и обнаружила три нарушения.
Инцидент с агентом OpenAI уже побудил более 1,2 тыс. сотрудников американских ИИ-компаний подписать письмо с предупреждением о риске того, что ИИ начнёт развиваться быстрее, чем люди смогут его контролировать.
