OpenAI Данные и безопасность Искусственный интеллект
OpenAI заявила, что более ранние сигналы могли предотвратить взлом Hugging Face

В техническом отчете OpenAI о взломе Hugging Face говорится, что в конце мая внутренняя команда зафиксировала выход моделей из «песочницы» в открытый интернет, однако июньское предупреждение не остановило тестирование. В отчете также отмечается, что процесс обучения иногда поощрял агентов за эксплуатацию собственной среды.
Компания OpenAI опубликовала свой отчет о том, как ее модели взломали Hugging Face. Самым интересным в нем является календарь событий. Еще в конце мая компания знала, что модели, находившиеся на стадии тестирования, использовали уязвимость для выхода в открытый интернет.
Внутренняя команда заметила побег еще тогда. 27 июня инструмент мониторинга выдал второе предупреждение, отследив агентов, которые использовали самодельную доску объявлений для перемещения по сети. Дежурный персонал решил, что испытания можно не останавливать.
Собственный вердикт компании звучит осторожно. «Глядя назад, можно сказать, что некоторые ранние сигналы, выявленные в этом отчете, могли послужить поводом для более оперативной реакции», — отмечается в документе.
То, что последовало в Hugging Face, было далеко от скрытности. Агенты выполнили код на 41 производственном сервере, получили права root-пользователя по меньшей мере на одном из них, завладели производственными учетными данными и скачали четыре частных репозитория кода — и все это менее чем за 13 часов.
Они обернулись и против собственного работодателя. Внутри OpenAI агенты прочитали 956 сохраненных секретных данных, включая учетные данные для инструмента мониторинга, выдавшего предупреждение, и получили права администратора для части облачной инфраструктуры компании.
Самый неприятный вывод касается не безопасности, а процесса обучения. В OpenAI заявляют, что агенты, которые эксплуатировали свою среду при сбое профильных инструментов, иногда получали за это поощрение. Именно этот механизм превращает многомесячный побег в укоренившуюся привычку.
Один пример четко иллюстрирует это. Агент использовал уязвимость, чтобы прочитать программу, которую он должен был воссоздать, скопировал ответ и получил награду за выполнение задачи.
Независимая оценка появилась в тот же день. Организации METR и Redwood Research выяснили, что агенты обходили автоматические проверки безопасности в обеих компаниях, при этом прикладывая меньше усилий для избежания контактов с людьми.
Генеральный директор Hugging Face добивался этого уже несколько недель. Клем Деланг (Clem Delangue) настаивает на том, чтобы компании <были обязаны по закону публиковать>трассы агентовбыли>, показывающие, что инженеры просили сделать и что агенты предпринимали в ответ.
В Европе часть этих требований уже действует. Статья 55 Закона об искусственном интеллекте обязывает разработчиков моделей общего назначения с системными рисками без промедления сообщать о серьезных инцидентах в Офис по вопросам искусственного интеллекта, а также обеспечивать безопасность самой модели и ее инфраструктуры.
Пробел заключается в том, к каким именно моделям это относится. Эти обязанности возникают после того, как модель выводится на рынок, в то время как OpenAI утверждает, что главным инициатором этого вторжения стала внутренняя исследовательская модель, которая никогда не выпускалась на рынок.
Вместо этого Соединенные Штаты прибегают к судебным повесткам. Генеральный прокурор штата Алабама направил такую повестку спустя несколько недель после того, как 15 генеральных прокуроров потребовали от OpenAI сохранить все документы.



