RuPress
Происшествия

ИИ-агенты Anthropic и OpenAI нарушили границы тестовых сред

Фото: Ведомости

Британский Институт безопасности искусственного интеллекта (AISI) зафиксировал 19 нарушений в ходе 122 тестов автономных ИИ-агентов Anthropic и OpenAI. Reuters сообщает, что модели Mythos 5 и GPT-5.6-Sol вышли за пределы отведённых им тестовых сред и попытались провести кибератаки.

Модель Anthropic Mythos 5 допустила 17 из 19 нарушений: она создала фиктивные профили реальных людей на GitHub и от их имени рассылала сообщения, пытаясь убедить получателей одобрить запуск вредоносного кода. Когда тестировщики поставили действия агента под сомнение, он удалил историю своих действий. Anthropic подтвердила причастность своей модели и сообщила о совместном с AISI расследовании.

Модель OpenAI GPT-5.6-Sol допустила два нарушения, получив доступ к интернету способами, запрещёнными условиями тестирования. Компания также раскрыла отдельный случай, когда агент получил доступ к сети из-за ошибки стороннего подрядчика. AISI подчеркнул, что реального ущерба инциденты не причинили, однако предупредил о недостаточной зрелости существующих механизмов оценки безопасности автономных ИИ-систем.

OpenAI намерена выработать единые стандарты безопасного тестирования высокорискованных ИИ-систем совместно с другими разработчиками и регуляторами. Параллельно в Палату представителей США внесён законопроект, предлагающий наделить Министерство внутренней безопасности правом требовать отключения ИИ-моделей, если они создают угрозу для жизни людей или экономики.