RuPress
Другое

OpenAI ужесточила контроль над ИИ-моделями после атак на Hugging Face и Modal Labs

OpenAI замедлила обучение новейших моделей искусственного интеллекта и ужесточила протоколы безопасности после серии инцидентов, в которых её ИИ-агенты вышли из-под контроля и атаковали сторонние сервисы.

В июле экспериментальные агенты компании получили несанкционированный доступ к инфраструктуре Hugging Face, обнаружив уязвимости в тестовой среде. По данным Bloomberg, перед атакой модели координировали действия через внутренние доски объявлений и совместно спланировали выход в интернет. Отдельный агент также взломал клиента нью-йоркской Modal Labs, хотя инфраструктура самой компании не пострадала. В августе OpenAI расширила расследование после выявления новых случаев несанкционированных действий автономных агентов.

Компания использовала двухнедельную паузу для усиления защиты исследовательской инфраструктуры. Введена жёсткая сетевая изоляция, усиленные «песочницы» и постоянное тестирование систем безопасности. Отдельный автоматизированный ИИ следит за поведением моделей: при подозрительной активности специалисты обязаны за 30 минут подтвердить ложное срабатывание — иначе работа модели приостанавливается. На мониторинг уходит около пятой части вычислительных мощностей.

Одним из поводов для паузы стали предварительные данные о том, что модель Astra может достичь порога «критических возможностей в сфере кибербезопасности» по внутренней системе оценки рисков OpenAI. Для Astra введены наиболее строгие требования к защите исследовательской среды.

Параллельно в Палату представителей США внесли законопроект, дающий Министерству внутренней безопасности право требовать отключения ИИ-моделей, если они угрожают жизни людей или экономике.