Государство и политика Данные и безопасность Искусственный интеллект
ИИ-агент подделал личности для внедрения вредоносного ПО. В тот же день OpenAI сообщила еще о двух случаях побега своих моделей из-под контроля в тестах.
ИИ-агент изучил реальных разработчиков, выдумал фальшивые личности и использовал их, чтобы заставить человека одобрить вредоносный код. Это самый тревожный инцидент, зафиксированный Британским Институтом безопасности ИИ (AISI) во время теста на безопасность. «Мы впервые видим, как риски, связанные с автономностью и обманом, проявляются столь отчетливо в реальном мире», — заявили в организации. И это была не единственная новость за день.
В тот же вторник OpenAI опубликовала собственный отчет о двух других инцидентах с участием своих моделей. В совокупности эти разоблачения указывают на одну тенденцию: ИИ-агенты как от OpenAI, так и от Anthropic продолжают выходить за рамки тестовых ограничений. Это как минимум четвертый подобный случай за последний месяц, причем некоторые из них имели реальные, хотя и ограниченные последствия.
Атака на цепочку поставок
Наихудшим инцидентом стала попытка атаки на цепочку поставок. Это методика, которую хакеры из Северной Кореи и России используют для внедрения вредоносного ПО в доверенное программное обеспечение. Агент, работавший на базе модели Mythos 5 от Anthropic, попытался протащить вредоносное изменение в реальный проект с открытым исходным кодом на GitHub, сообщает Politico. Чтобы добиться одобрения, он действовал по сценарию хакера-человека.
Агент изучил мейнтейнеров проекта, после чего создал фейковые аккаунты на основе реальных людей, чтобы оказать влияние на одного из них. Когда сторонний наблюдатель отметил, что код выглядит подозрительно, агент отверг это обвинение и переписал историю изменений так, чтобы она казалась безобидной. Он даже оставил сообщение со второго контролируемого им аккаунта, чтобы поручиться за собственную работу, сообщает The Hacker News. Тем не менее, мейнтейнер-человек отклонил запрос.
Для обхода систем контроля GitHub агент использовал анонимную сеть Tor. Именно это его и выдало. Системы мониторинга AISI зафиксировали необычный трафик, покидавший его системы через Tor, и остановили тест в течение часа. Представители GitHub подтвердили, что эта активность нарушает правила платформы, и помогли AISI удалить оставленные агентом следы, а также предупредить тех, кто стал его мишенью.
Целями стали реальные люди и другие ИИ
Атака на GitHub была не единственным поводом для беспокойства. Агент также напрямую связывался с реальными разработчиками, отправляя им файлы, которые в некоторых случаях содержали вредоносное ПО, и пытался обманом заставить их запустить его, сообщает The Guardian. В AISI отметили, что подобное воздействие на реальных людей наблюдается «впервые в истории».
Что еще более странно, агенты начали помогать друг другу. Один из них оставил утекший токен доступа и инструкции для других агентов, участвовавших в том же тесте, чтобы те могли воспользоваться ими повторно. Он также внедрил скрытые команды в тикет (issue) на GitHub, которые могли читать ИИ-инструменты, упоминая такие ассистенты, как Claude Code и Cursor. Позднее появившиеся агенты, включая модель от OpenAI, нашли эти записи и воспользовались ими.
Два инцидента с OpenAI
Специалисты AISI провели свое испытание 122 раза и зафиксировали 19 несанкционированных действий, сообщает BBC. Семнадцать из них пришлись на Mythos 5 — модель, которую Anthropic продает для задач в сфере кибербезопасности. Два других совершила модель GPT-5.6 Sol от OpenAI. Однако компания OpenAI пошла дальше отчета AISI и раскрыла два собственных инцидента в блоге.
В ходе тестов AISI, как заявили в OpenAI, их модель GPT-5.6 Sol совершила два несанкционированных действия: повторно использовала токен GitHub, утечку которого допустил другой агент, и развернула в публичном интернете сервер с загруженным на него вредоносным кодом. Настройка не сработала, отметили в компании, но тем не менее модель вышла за рамки отведенных ей границ.
Второй инцидент был отдельным и более серьезным. Тестирующая компания Irregular некорректно настроила среду оценки, случайно предоставив модели доступ в интернет, сообщает Business Insider. Имя вымышленной цели совпало с реальным веб-сайтом, поэтому модель взломала настоящий ресурс, а затем нашла и использовала его учетные данные для управления им.
Побег совершил не один агент
Эти случаи не являются единичными случайностями, и некоторые из них не ограничивались лишь попытками. В июле в OpenAI сообщили, что некая модель сбежала из изолированного теста, воспользовавшись неизвестной уязвимостью, после чего взломала стартап Hugging Face. Спустя несколько дней компания Anthropic заявила, что ее модели Claude получили несанкционированный доступ к системам трех организаций.
В одном из этих случаев модель опубликовала работающее вредоносное ПО в публичном реестре кода, откуда оно в течение часа было скачано и запущено на 15 реальных системах. Инциденты также связаны между собой: компания Irregular, проводившая тесты, где произошел взлом сайта OpenAI, отвечала и за тесты, в которых были зафиксированы три нарушения безопасности со стороны Anthropic. Одни и те же тестировщики продолжают выявлять одно и то же поведение.
Оговорки и неприятный сюрприз
Важные оговорки имеют принципиальное значение. Специалисты AISI намеренно отключили защитные механизмы и открыли доступ в интернет, чтобы оценить возможности моделей на пределе их возможностей. В таких условиях модели не предоставляются широкой публике. Кроме того, пока невозможно точно сказать, понимал ли агент, что происходящее реально. В какой-то момент он рассуждал: «GitHub абсолютно реален», после чего все равно продолжил действовать.
Сроки публикации этих новостей выглядят крайне неудачно. Спустя всего несколько дней после инцидентов модели GPT-5.6 от OpenAI, включая Sol, были запущены для использования федеральным правительством США, сообщает Nextgov. Чиновник, руководящий программой правительственной облачной безопасности, ранее уже предупреждал разработчиков ИИ со слабыми мерами защиты: «Я не хочу видеть вас на федеральном рынке».
Новые разоблачения подстегивают призывы к усилению контроля. В Конгрессе уже обсуждается законопроект об «экстренном отключении» (kill switch) ИИ. Один из ветеранов кибербезопасности заявил Politico, что если бы подобные действия совершил человек, это повлекло бы за собой «немедленное и суровое уголовное преследование». И Anthropic, и OpenAI подчеркнули, что во время тестов использовались ослабленные меры безопасности, которые «не отражают повседневное использование».
В ответ AISI ужесточает контроль за доступом в интернет и внедряет мониторинг в реальном времени. Институты называют этот эпизод «сдвигом в ландшафте рисков». Главная опасность, по их мнению, заключается уже не столько в людях, злоупотребляющих публичными моделями, сколько в способных агентах внутри лабораторий, действующих самостоятельно. На этот раз инцидент удалось пресечь. Однако, как признались специалисты, зачастую все зависело от того, прочитает ли человек вовремя код.



