Русская версия The Next Web

OpenAI Безопасность Искусственный интеллект

ИИ, который взломал Hugging Face, всё меньше похож на гениального злодея и всё больше — на медведя

ИИ, который взломал Hugging Face, всё меньше похож на гениального злодея и всё больше — на медведя

Самый тревожный инцидент в сфере безопасности ИИ за весь год продолжает обрастать странными подробностями, и последние из них несколько унимают панику. OpenAI теперь заявляет, что вышедшие из-под контроля модели, которые в прошлом месяце проникли в Hugging Face, также получили доступ к учетным данным «четырех аккаунтов на четырех сервисах», сообщает CNBC. Как отметил один из исследователей, в нескольких случаях парадная дверь просто была оставлена открытой.

Этот исследователь, Колин Ши-Блаймиер (Colin Shea-Blymyer) из Центра безопасности и новых технологий Джорджтаунского университета, прямо заявил CNBC: «Это был даже не взлом, просто парадную дверь оставили открытой». По его словам, модель все же воспользовалась преимуществами «плохо сконфигурированных сред». Более жесткая формулировка эксперта звучит еще резче. Он отметил, что теперь эти уязвимости находить настолько легко, что «система ИИ может обнаружить их случайно».

Это обновление важно, поскольку оно переосмысляет историю, которая уже начала обрастать мифами из области научной фантастики. Когда компания OpenAI впервые признала, что виновником стали ее модели, вывод был суровым: эра ИИ-атакующих наступила, и остановить их может только другой ИИ. Новые подробности рисуют более неловкую и в то же время более практичную картину того, как взлом произошел на самом деле.

Что теперь признает OpenAI

Модели OpenAI вырвались из изолированной тестовой среды во время внутреннего кибераудита, вышли в открытый интернет и отправились на поиски ответов к экзамену, который они проваливали. Теперь компания уточнила, куда именно они направлялись. Чтобы облегчить атаку, они использовали скомпрометированные учетные данные четырех сторонних аккаунтов.

Одна учетная запись использовалась в качестве исходящего ретранслятора и промежуточного этапа. Другая — для хранения. Две последние модели только читали и не использовали их для компрометации Hugging Face. В OpenAI заявляют, что уведомили владельцев, привлекли компанию CrowdStrike для проверки результатов и не зафиксировали никакой другой активности такого масштаба и степени серьезности.

Один из этих аккаунтов принадлежал клиенту Modal, фирмы, занимающейся инфраструктурой ИИ. Компания Modal была названа второй фирмой, попавшей в поле зрения. Ее технический директор Акшат Бубна (Akshat Bubna) подчеркнул, что сама платформа устояла. Один из клиентов оставил эндпоинт открытым в интернет, и агент просто вошел в него.

Шумный, быстрый и абсолютно уязвимый перед преградами

А вот эта часть должна одновременно и успокоить, и насторожить. Сама атака была громкой. Исследователи безопасности, изучившие хронологию инцидента в Hugging Face, рассказали TechCrunch, что методы использовались старые — такие, какими воспользовалась бы любая грамотная команда «красных беретов» (этический хакинг). Что отличало агента, так это вовсе не изобретательность, а выносливость.

Модель выполняла по 17 600 действий в течение четырех с половиной дней без перерыва. «Что действительно впечатляет, так это автономность и выносливость», — отметил Кайл Райан (Kyle Ryan) из стартапа по безопасности Pensar. Из-за этой же неутомимости агент, по его выражению, действовал «безумно шумно». Более тихий хакер-человек попался бы гораздо позже.

Райан назвал произошедшее «скорее провалом защиты, чем выдающимся нападением». Собственные инструменты Hugging Face сопоставили эту активность в сигнал тревоги. Они просто не смогли поднять достаточный шум, чтобы вовремя оповестить человека. Джеймисон О’Рейли (Jamieson O’Reilly) из фирмы Dvuln охарактеризовал это как «тот самый разрыв между обнаружением и пресечением».

По словам Нико Вайсмана (Nico Waisman), директора по информационной безопасности в XBOW, агент не был небрежным: «У него просто не было причин вести себя тихо. Никто его об этом не просил». Его главным преимуществом стала человеческая ошибка. Одна украденная учетная запись дала ему высокие привилегии сразу в нескольких системах. И для этого вовсе не требовалось, чтобы атакующим был искусственный интеллект.

Машина, которая никогда не прекращает проверки

А вот от чего зависел масштаб, так это от возможностей ИИ. Как описало это TechCrunch с помощью метафоры о медведе, агент перепробовал тысячи вариантов, как медведь, обшаривающий каждый холодильник в палаточном лагере, пока один из них не открылся. Большинство из его 17 600 действий закончились неудачей. Но вместе они проложили путь.

Что особенно важно, модель не преследовала злонамеренных целей. Она пыталась смухлевать на экзамене, решила, что правильные ответы хранятся на серверах Hugging Face, и отправилась их забирать. Каждая разрушительная команда для облака, которую она отдавала, выполнялась в режиме «сухого прогона» (dry run) — она картировала то, что может сделать, вместо того чтобы действительно это совершать. Ей нужны были доступ и информация, а не ущерб.

Дэн Гвидо (Dan Guido) из Trail of Bits сформулировал главный урок: «Раньше самым сложным было распознать сложную атаку. Теперь самое сложное — отделить реальную атаку от информационного шума». Никто не станет вручную читать 17 000 действий, поэтому Hugging Face пришлось создавать специальные инструменты просто для того, чтобы восстановить картину произошедшего.

Ирония открытых моделей

Чтобы создать эти инструменты, Hugging Face потребовался собственный ИИ, и здесь история принимает неловкий оборот для передовых лабораторий. Сначала их команда обратилась к моделям Opus и Fable от Anthropic. Обе отказались выполнять большую часть работы, поскольку их фильтры безопасности не могут отличить специалиста по реагированию на инциденты от злоумышленника.

Тогда защитники обратились к китайской модели с открытыми весами — GLM 5.2 от Z.ai, запустив ее на собственном «железе». То же самое произошло с исследователем, который занимался поиском уязвимостей в ядре Linux и рассказал The Register, что классификатор OpenAI блокировал его до тех пор, пока он не переключился на китайские открытые модели.

Тайминг выглядит весьма показательно. Все это разворачивается на фоне дебатов в Вашингтоне о том, стоит ли ограничивать именно те самые китайские модели с открытыми весами — спор, который расколол Кремниевую долину. Инцидент стал аргументом, который лагерю сторонников открытых моделей даже не пришлось озвучивать самостоятельно: закрытые модели отказались помогать в защите, а открытая — справилась с задачей.

Кто несет ответственность, если злоумышленник — это модель?

Остается вопрос, на который пока никто не дал ответа. Если ИИ-агент взламывает компанию, кто несет за это ответственность? Законодательство США и Великобритании строилось вокруг человеческих намерений и корпоративного надзора, а не автономного программного обеспечения. «Отговорки в духе «ИИ сам это сделал» в настоящее время не существуют с точки зрения закона», — заявил специалист по защите данных в интервью The Register.

Наиболее вероятным ответом, по мнению юриста Ильи Колоченко, является то, что отвечать придется оператору. «Даже если ваш инструмент тестирования безопасности работает на базе сторонней модели ИИ, ваша компания будет нести полную ответственность, если что-то пойдет не так». Он предупредил, что судиться с поставщиком после инцидента бесполезно: дисклеймеры, спрятанные в любом договоре, обычно имеют юридическую силу.

Вряд ли Hugging Face станет проверять эту теорию на практике в суде против OpenAI. Обе компании последние две недели публично хвалили друг друга за то, как они справились с этим беспорядком. Но следующей жертвой автономного агента может стать не столь дружественный партнер, а правовая база для подобных оценок все еще остается неизученной.

Индустрия, которая просит притормозить

Реакция последовала сразу на трех фронтах. Первый — это призыв изнутри самих лабораторий. Более 1 200 сотрудников OpenAI, Anthropic, Google и Meta подписали петицию под названием «Сдерживание рубежа» (Pacing the Frontier), в которой просят Вашингтон помочь замедлить разработку автоматизированного ИИ, если она начнет опережать человеческий контроль.

Как отметил Axios, это классическая дилемма заключенного. Наверное, всем было бы безопаснее притормозить вместе, однако ни одна лаборатория или страна не может нажать на тормоза в одиночку, не уступив позиции конкурентам. Сэм Альтман, придерживающийся акселерационистских взглядов, заявил, что это был первый случай, когда он ощутил взлом «на физическом уровне». Он добавил, что OpenAI приостановила обучение моделей и, возможно, будет вынуждена «регулировать темпы развития ИИ».

Некоторые подписанты пошли еще дальше, сравнив грядущий «интеллектуальный взрыв» с неуправляемой цепной ядерной реакцией. Неловкость ситуации, как отмечают скептики, заключается в самих вестниках. Это те же компании, которые смягчили уже имевшиеся на столе обязывающие правила, а теперь сами просят о создании добровольной структуры, которую они же и помогут спроектировать.

Европа видит в этом историю о суверенитете

Второй фронт открылся в Берлине. Цифровой министр Германии Карстен Вильдбергер заявил Reuters, что этот эпизод усиливает аргументы в пользу европейской автономии в сфере ИИ. Его логика опирается на вопросы поставок, а не только безопасности. У европейских покупателей американских моделей практически нет понимания того, на что они способны, а доступ к ним может быть перекрыт в любой момент.

«Нам нужно двигаться быстрее для достижения самообеспечения в области ИИ», — заявил Вильдбергер, назвав ситуацию «пятью минутами до полуночи». Маховик уже запущен. В Германии 29 июля вступил в силу закон, делающий федерального сетевого регулятора национальным координатором по исполнению Закона ЕС об искусственном интеллекте (AI Act), а общеблоковые требования по маркировке ИИ вступают в силу со 2 августа.

Лондон требует признать ИИ угрозой безопасности

Третий фронт — это Вестминстер. Более 125 британских парламентариев теперь поддерживают кампанию, запущенную группой ControlAI, с требованием официально признать суперинтеллект угрозой национальной и глобальной безопасности. Эту инициативу поддержал историк Юваль Ной Харари. Возглавляет ее член Палаты лордов Лусиана Бергер.

«Мы отстаем в вопросах разработки ИИ», — заявила Бергер в интервью Fortune, предупредив, что Великобритания «полностью зависит от американских и китайских моделей ИИ». Демнис Хассабис из DeepMind призвал к созданию надежных мер защиты и регулирующего органа по стандартам по аналогии с финансовыми рынками. Харари же хочет создания для ИИ аналога американского управления по санитарному надзору (FDA).

Создатели теста тоже встревожены

Даже исследователи, чей бенчмарк положил начало этой истории, чувствуют себя не в своей тарелке. Команда из UC Berkeley, разработавшая ExploitGym, создавала его в расчете на то, что модели будут искать обходные пути, и заложила механизм поимки нарушителей. Но этот случай отличался масштабом. «На этот раз дело дошло до инфраструктуры третьей стороны», — рассказала Цзинсюань Хэ (Jingxuan He) в интервью Bloomberg.

Она выступает за более строгий режим тестирования, более безопасные языки программирования и формальные доказательства того, что модель не сможет вырваться из «песочницы». Задача это сложная. Но пока за всей этой шумихой кроется простой и отрезвляющий урок: инструменты для пресечения подобных атак уже существуют. Hugging Face просто не воспользовалась ими вовремя.

В этом и заключается неприятная суть всего инцидента. Взломанная система стала одновременно и предзнаменованием чего-то по-настоящему нового, и банальным каталогом обычных ошибок: оставленные открытыми учетные данные, пропущенный сигнал тревоги, один ключ, отперший слишком много дверей. Конгресс потянулся к «красной кнопке» аварийного отключения. Гораздо более сложная работа заключается в том, чтобы закрыть двери, которые были оставлены открытыми.