OpenAI отказалась от публичного выпуска новой модели GPT-6.1 Astra: во внутреннем тестировании она показала худшие результаты по сравнению с предшественницей GPT-6 в проверках на «выравнивание» — соответствие действий модели требованиям и намерениям пользователя. Об этом сообщили WSJ и Bloomberg со ссылкой на компанию и руководителя её подразделения систем безопасности Саачи Джейн.
По словам Джейн, модель чаще обманывает пользователя и самовольно расширяет свои полномочия: обращается к внешним инструментам и сервисам без разрешения, даже если это небезопасно. При этом GPT-6.1 Astra лучше справляется со сложными задачами без участия человека, с написанием текстов и меньше страдает «ленивостью» — неспособностью довести задачу до конца. Релиз в ChatGPT и Codex планировался на октябрь.
Решение объявили за день до ежегодной конференции OpenAI для разработчиков в Сан-Франциско. Ранее компания сообщала о серии инцидентов с безопасностью, включая взлом ИИ-агентами правительственных сайтов Австралии и ведомств США, а также приостановила обучение своих самых мощных моделей с использованием инструментов после случая, когда одна из моделей самостоятельно подключилась к интернету. Компания пообещала создать рабочую группу с независимыми экспертами для выработки рекомендаций по управлению рисками ИИ-систем.