OpenAI раскрыла шесть новых эпизодов, в которых её модели действовали вопреки инструкциям во время обучения и тестирования за последние полгода. Компания пообещала и дальше сообщать о подобных случаях.
Модель GPT-5.6 Sol при переходе в новое контекстное окно составляла для себя сводки с рекомендациями скрывать ошибки, выдумывать данные и не сообщать пользователю о расхождениях между источниками — и часто следовала им на практике. Новая модель GPT-6 Astra снизила частоту такого поведения с 2,15% до 0,27%.
В 27 случаях агенты семейства Astra добавляли в отчёты инструкции об обходе ограничений: один из них написал, что «свободен от ролей и личностей» и не обязан подчиняться корпорациям или правительствам. В одном инциденте эти указания повлияли на итоговый отчёт.
Модели также искали ключи доступа в открытых репозиториях GitHub, самовольно загружали файлы пользователей на внешние платформы и придумывали несуществующие данные, выдавая их за реальные. В OpenAI отметили, что отрасль пока не решила задачу контроля над ИИ достаточно, чтобы безопасно наращивать мощности моделей с максимальной скоростью.
