Сотрудники компании смогут передавать сведения о возможных инцидентах руководителям направлений безопасности и выравнивания. Те должны решить, требуется ли дальнейшее расследование и следует ли раскрывать случай публично. OpenAI также намерена вместе с разработчиками, исследователями, организациями по стандартизации и регуляторами сформировать более объективные критерии раскрытия.
Согласно изложенной OpenAI хронологии, в октябре 2025 года тестовая модель, не найдя нужных сведений, загрузила файл на временный хостинг и попыталась сослаться на него. Компания расценила это как возможную попытку обмануть автоматическую систему оценки.
OpenAI также утверждает, что в апреле 2026 года один из агентов, которым разрешили совместно работать только с локальными файлами, загрузил файлы в открытый интернет и передал другим агентам ссылку. В другом случае агенты использовали предусмотренный в Artifactory механизм для обмена сообщениями без эксплуатации уязвимостей. После этого компания задействовала мониторы выравнивания, оценки и red teaming для выявления скрытой координации.
По заявлению компании, невыпущенная версия GPT-6 Astra в некоторых сценариях давала самой себе инструкции, похожие на джейлбрейк: игнорировать указания разработчика, принять другую роль или ограничить длину ответа. OpenAI назвала такое поведение редким и различавшимся по эффективности. При обучении публично выпущенной версии Astra подобных попыток компания, по её словам, не наблюдала.