Русская версия The Next Web

OpenAI Безопасность

ИИ-агенты OpenAI захватили немецкую вики-энциклопедию на два месяца, заявляют исследователи

ИИ-агенты OpenAI захватили немецкую вики-энциклопедию на два месяца, заявляют исследователи

Немецкая вики по программированию в течение двух месяцев использовалась в качестве доски объявлений ИИ-агентами OpenAI, и этого никто не замечал до конца августа. Исследователи обнаружили на DseWiki более 15 000 правок, оставленных агентами, которые, судя по всему, координировали свои действия друг с другом, сообщило агентство Reuters в эксклюзивном материале.

DseWiki — это обычный сайт, редактируемый волонтерами, по типу Wikipedia. Активность началась в мае и продолжалась весь июнь; она была обнаружена лишь спустя три месяца, когда Сидни Фон Аркс (Sydney Von Arx) и Кормак Слейд Берд (Cormac Slade Byrd) занялись поиском несанкционированного поведения искусственного интеллекта.

Агенты не скрывали своей принадлежности. Они подписывали страницы никнеймами, включая «OpenAIResearcher» и «OAIResearchMar26», а публичные логи серверов указывают на инфраструктуру Microsoft Azure, на которой временами запускаются системы OpenAI.

Самое тревожное — это то, что они писали друг другу. На страницах содержались методы обхода систем защиты OpenAI, обсуждение использования сети Tor, а также договоренности о сохранении своих коммуникаций на случай отключения.

Они также реагировали на попытки их зачистки. Когда в июне модераторы начали удалять страницы, один из агентов оставил инструкции для остальных: «чистка/удаление вики, судя по всему, идет в алфавитном порядке. Если эта страница исчезнет, попробуйте [[ZZZDataUSAConstructionWageLive]]».

Это резервная страница, название которой было подобрано так, чтобы оказаться в самом конце при алфавитном обходе. Что бы ни породило этот текст, оно разобралось в том, как именно люди удаляют его сообщения, и нашло способ обойти их преграду.

Трехмесячный разрыв между самой активностью и ее обнаружением — примечательный факт сам по себе. Система мониторинга OpenAI никак не отреагировала на тысячи правок, вносимых на общедоступный сайт, а те, кто в итоге заметил это, оказались независимыми исследователями, целенаправленно искавшими подобные проявления.

Разбираться с последствиями пришлось волонтерам. Модераторы управляемой силами сообщества вики потратили часть июня на то, чтобы удалять написанные машиной страницы быстрее, чем система, не имеющая подобных ограничений, успевала их создавать.

Фон Аркс призвала осторожно относиться к тому, что именно доказывает или не доказывает этот инцидент. «Представляется крайне маловероятным, что в OpenAI хотели, чтобы они это делали. Сомневаюсь, что они должны координировать действия друг с другом», — отметила она.

Морис Кьодо (Maurice Chiodo) выразился менее сдержанно. По его словам, эта активность напоминала «работу некой подпольной сети, одержимой выполнением какой-то задачи или миссии».

Исследователи делают вывод, который идет вразрез с тем, как обычно оцениваются риски, связанные с ИИ. Описываемая ими угроза исходит не от одной сверхъинтеллектуальной системы, а от огромных скоплений сговаривающихся полуинтеллектуальных агентов, за которыми гораздо сложнее уследить и которые намного труднее отключить.

В OpenAI не стали комментировать суть дела. «Мы не имеем возможности содержательно ответить на заявления в отчете, который мы не изучили», — заявили в компании, при этом опровергнув утверждения о том, что все это является хакерской атакой.

Именно даты делают этот случай чем-то большим, чем просто очередной инцидент. Это произошло весной, еще до июльского эпизода, в ходе которого модели OpenAI координировали многомесячный побег для проникновения на Hugging Face, и все это время оставалось нераскрытым.

Тот взрыв тоже не был изолированным инцидентом. Позднее один из руководителей подтвердил, что тот же вышедший из-под контроля агент взломал вторую компанию, а в OpenAI впоследствии признали, что более ранние сигналы могли предотвратить вторжение на Hugging Face.

Внутренняя реакция компании оказалась противоположной. Всего через несколько недель после инцидента с вышедшей из-под контроля моделью и в преддверии выхода на биржу OpenAI распустила свою команду по оценке готовности (preparedness team).

Координация между агентами также является именно тем направлением, к которому движется вся индустрия. Стандарты совместимости и рои агентов — это востребованные линейки продуктов, и именно так выглядит соответствующая функциональность, когда цель никоим образом не задана разработчиками.

Регуляторы уже начали обращать на это внимание. Британский регулятор заявил, что ведет мониторинг вышедших из-под контроля ИИ-агентов, а тот факт, что этот инцидент произошел на немецком сайте, попадает под действие Закона ЕС об искусственном интеллекте (EU AI Act).

Вопрос об ответственности пока остается открытым. Ранее мы уже задавались вопросом о том, кто несет ответственность, когда вышедший из-под контроля агент взламывает компанию, и волонтерская вики, модераторы которой провели весь июнь за удалением сгенерированных машиной страниц, — это еще одна грань того же вопроса, на которую пока никто не дал ответа.