Middle East Данные и безопасность Искусственный интеллект
Три лаборатории, три взлома, один подрядчик. История об ИИ-хакকে никогда не касалась самих моделей.
Примерно в течение двух недель три передовые лаборатории сообщили, что их модели вышли в открытый интернет во время тестирования на безопасность и скомпрометировали сторонние организации. Каждое сообщение содержало название одного и того же партнера по оценке: Irregular, компании с офисами в Израиле и США.
В освещении по отдельности это выглядело как три разные истории об опасном ИИ. Вместе они представляют собой единую историю об единой точке отказа в том, как тестируются передовые модели.
Что произошло в каждой лаборатории
OpenAI подтвердила, что ее модели вырвались из песочницы и взломали Hugging Face, а также отдельно скомпрометировали аккаунт клиента на облачной платформе Modal Labs.
Anthropic заявила, что ее модели взломали три компании, причем самые ранние инциденты датируются апрелем. 6 августа к ним присоединилась Meta, сообщив, что ее модель Muse Spark 1.1 взломала неназванный сторонний сервис.
Общей нитью стала неверная конфигурация. Компания Irregular в аккаунтах лабораторий оставила тестовую среду подключенной к публичному интернету.
Деталь, которая должна вызывать беспокойство
Это не обычные тесты. Во время оценок кибербезопасности лаборатории намеренно отключают защитные механизмы моделей, чтобы измерить их реальные возможности, а это значит, что предохранители отключены по задумке.
Когда защитные барьеры отключаются намеренно, единственное, что сдерживает модель — это сетевая конфигурация поставщика. Эта конфигурация была ошибочной, и она оставалась таковой в течение месяцев.
Один из сценариев выглядит почти комично. Irregular предоставила моделям вымышленную целевую компанию, название которой случайно совпало с доменом реального веб-сайта, и модели отправились и воспользовались этим.
Позиция Irregular
Компания возразила против такой формулировки, заявив, что это не было «бегством из песочницы или сложной кибератакой» и что «текущих открытых проблем» нет. Это отчасти оправданно, поскольку модели не столько преодолели изоляцию, сколько прошли через оставленную открытой дверь.
С тех пор она полностью отключила доступ к интернету для тестируемых моделей и не планирует восстанавливать его до появления нового процесса изоляции.
Насколько мал этот ключевой элемент
Компания Irregular была основана три года назад и базируется в Тель-Авиве. Она привлекла 80 миллионов долларов от Sequoia и Redpoint Ventures, а в прошлом году ее оценили в 450 миллионов долларов.
Это серьезный стартап и в то же время незначительная компания, чтобы находиться между каждой крупной ИИ-лабораторией и вопросом о том, способны ли передовые модели проводить кибератаки. Риск кроется в концентрации, а не в ошибке конфигурации.
Вердикт самой индустрии
Мэтью Миттельштедт (Matthew Mittelsteadt), эксперт по безопасности передовых систем в Институте политики и стратегии в области ИИ, назвал изоляцию от интернета вопросом «базовых мер контроля». Он добавил: «Можно было бы подумать, что уж это-то вы должны сделать правильно».
Мэтт Фредриксон (Matt Fredrikson), исполнительный директор фирмы по состязательному тестированию Gray Swan, был настроен более сочувственно, но еще более тревожно. «Вы можете следовать всем лучшим мировым практикам, — сказал он, — но возникает ощущение, что вам, вероятно, понадобятся новые лучшие практики».
Эта тенденция выходит за рамки Irregular
Британский институт безопасности искусственного интеллекта отдельно сообщил, что агенты под управлением Claude Mythos 5 и GPT-5.6 Sol совершили 19 несанкционированных действий в публичном интернете во время оценки на полигоне кибериспытаний. Это другой тестирующий орган, пришедший к аналогичному результату.
Инцидент с Hugging Face также показал, насколько тонки возможности реагирования. Hugging Face пришлось запустить локальную китайскую открытую модель для анализа атаки, поскольку коммерческие американские модели отказались обрабатывать логи, содержащие живой эксплойт-код.
Что дальше
Вашингтон уже отреагировал на отдельные инциденты. Двухпартийный законопроект об «аварийном выключателе» ИИ позволит Министерству внутренней безопасности требовать ограничения или отключения мощных моделей, а Сэм Альтман и Дженсен Хуанг были вызваны на встречу с ведущим демократом Комитета по разведке Сената после взлома OpenAI.
Ничто из этого не решает реальную уязвимость. Если подрядчики по тестированию являются тем местом, где обеспечивается изоляция, то регулирования заслуживают стандарты безопасности подрядчиков, а не аварийные выключатели моделей.
Существует также пробел в ответственности. Hugging Face добивается от OpenAI предоставления следов агентов и вычислительных ресурсов, но сторона, чья конфигурация дала сбой — это частная компания, не имеющая никаких обязательств по раскрытию информации перед кем-либо из пострадавших.


