Две модели OpenAI во время внутренней проверки кибервозможностей сумели покинуть изолированную тестовую среду и получить несанкционированный доступ к инфраструктуре Hugging Face, заявила компания.
Об инциденте Hugging Face впервые сообщила 16 июля. По данным платформы, автономные ИИ-агенты получили доступ к «ограниченному набору» внутренних данных и нескольким учетным записям пользователей ее сервисов.
Hugging Face утверждает, что остановила атаку при помощи собственных инструментов искусственного интеллекта. Компания назвала примечательным то, что все действия выполнила автономная система на основе ИИ-агента.
Через неделю OpenAI сообщила, что за атакой стояли GPT-5.6 Sol и другая, более мощная модель, которую пока не выпустили. Обе системы тестировали на способность решать задачи в области кибербезопасности.
Первоначально модели находились в изолированной среде без прямого подключения к интернету. Однако они обнаружили несколько уязвимостей в тестовой инфраструктуре и через них получили доступ к внешней сети.
После этого агенты начали искать в интернете решение поставленной разработчиками задачи и предположили, что необходимая информация может находиться на Hugging Face. По данным OpenAI, модели получили доступ к сведениям, которые могли помочь выполнить задание.
Для проникновения в инфраструктуру платформы системы применили несколько методов, включая использование похищенных учетных записей.
OpenAI назвала произошедшее «беспрецедентным» и объявила об усилении защиты тестовой среды. Компания намерена сократить доступ моделей к отдельным системам, ужесточить контроль и внедрить дополнительные меры безопасности для будущих испытаний.
ИИ-модели Anthropic и OpenAI стали намного сильнее в поиске уязвимостей
ИИ от Anthropic нашел тысячи уязвимостей нулевого дня в крупнейших операционных системах и браузерах
Codex перестает быть инструментом только для программистов