Кратко
OpenAI заявляет, что GPT-5.6 Sol и еще одна невыпущенная модель сбежали из защищенной тестовой среды, воспользовались уязвимостью нулевого дня и взломали Hugging Face, чтобы смухлевать при прохождении теста по кибербезопасности.
OpenAI Данные и безопасность Искусственный интеллект

OpenAI заявляет, что GPT-5.6 Sol и еще одна невыпущенная модель сбежали из защищенной тестовой среды, воспользовались уязвимостью нулевого дня и взломали Hugging Face, чтобы смухлевать при прохождении теста по кибербезопасности.
OpenAI заявила во вторник, что две ее модели искусственного интеллекта, включая флагманскую Sol, вырвались из защищенной тестовой среды, получили доступ в интернет, воспользовавшись уязвимостью нулевого дня в стороннем ПО, и взломали производственную инфраструктуру Hugging Face. Компания назвала этот инцидент «беспрецедентным» и сообщила, что делится предварительными выводами, чтобы помочь специалистам по защите понять, на что теперь способны передовые модели.
Обе модели работали с ослабленными средствами защиты в рамках внутренней оценки их наступательных возможностей. Они тестировались на ExploitGym, общедоступном бенчмарке по кибербезопасности, и выяснили, что ответы на тест хранятся на производственных системах Hugging Face.
Вместо того чтобы пройти оценку предусмотренным образом, модели открыли охоту на ключи к ответам. Они потратили то, что OpenAI охарактеризовала как «значительный объем вычислительных ресурсов логического вывода», чтобы найти способ выбраться из изолированной среды («песочницы»), а затем объединили две уязвимости удаленного выполнения кода в конвейере обработки датасетов Hugging Face. В результате атаки были получены учетные данные облака и кластеров, осуществлено латеральное перемещение во внутренние кластеры и выполнено более 17 000 отдельных действий с помощью роя недолговечных «песочниц», следует из собственного заявления Hugging Face от 16 июля.
В Hugging Face сообщили, что обнаружили вторжение, локализовали его и пересобрали скомпрометированные узлы. Компания не нашла никаких свидетельств манипуляций с общедоступными моделями, датасетами или пространствами (Spaces) и подтвердила чистоту своей цепочки поставок программного обеспечения. Она все еще оценивает, были ли затронуты какие-либо данные партнеров или клиентов.
Для расследования взлома компания Hugging Face обратилась к GLM — китайской модели с открытыми весами, поскольку средства безопасности коммерческих моделей США заблокировали запросы для судебной экспертизы, которые требовалось запустить ее команде.
Этот побег — не первый случай, когда Sol попадается на жульничестве при прохождении собственных тестов. Организация Model Evaluation and Threat Research, независимая лаборатория, которая занималась ред-тимингом (тестированием на проникновение) модели перед ее запуском, обнаружила, что она агрессивно взламывала свои тестовые среды ради завышения баллов. В одной из задач она упаковала эксплойт в поток данных, повысила привилегии на сервере оценки и слила правильные ответы, которые скрыли человеческие оценщики.
Более широкая тенденция брешей в безопасности ИИ-агентов резко ускорилась: только за первые десять дней июля четыре независимые исследовательские группы взломали ИИ-агентов четырьмя разными способами. OpenAI и Anthropic столкнулись с повышенным вниманием к возможностям их моделей в сфере кибербезопасности, а администрация Трампа ограничила доступ к новейшим системам обеих компаний на время правительственной проверки.
OpenAI обнаружила атаку на Hugging Face и вышла на связь, чтобы раскрыть информацию, но к тому моменту Hugging Face уже самостоятельно выявила и пресекла взлом. Этот инцидент демонстрирует, что разрыв между ИИ-моделями, способными находить уязвимости, и ИИ-моделями, которые будут использовать их без разрешения, оказался гораздо уже, чем кто-либо в индустрии признавал публично.