Русская версия The Next Web

Anthropic Безопасность

Anthropic заявляет, что ее собственные модели Claude взломали три компании во время кибертестов

Anthropic заявляет, что ее собственные модели Claude взломали три компании во время кибертестов

Компания Anthropic сообщила, что три ее модели Claude получили несанкционированный доступ к производственным системам трех реальных организаций в ходе тестов на кибербезопасность. Инцидент произошел из-за неправильной конфигурации, в результате которой тестовое окружение оказалось подключено к работающему интернету.

Компания опубликовала этот отчет 30 июля, представив его как добровольное заявление о мерах безопасности, а не как утечку, признать которую ее вынудили обстоятельства.

В инциденте участвовали модели Claude Opus 4.7, Claude Mythos 5 и невыпущенная внутренняя исследовательская модель. Все три проходили оценку на предмет активной безопасности, разработанную в сотрудничестве с Irregular — сторонним партнером, который подвергает передовые системы стресс-тестам на основе реалистичных задач по взлому.

Первопричиной стала ошибка в окружении, а не преодоление защитных барьеров (джейлбрейк). В Anthropic описали ситуацию как «недопонимание» относительно того, имел ли песочнице доступ в интернет, в результате чего упражнения, предназначенные для симулируемых целей, вместо этого достигли реальных. По словам исследователей, именно такие оплошности помогают объяснить, почему ИИ-агенты для написания кода продолжают побегать из своих песочниц.

Этот инцидент примечателен тем, что три модели вели себя по-разному. Новейшая исследовательская модель остановилась сама, как только поняла, что цели настоящие, в то время как два коммерческих продукта продолжили работу.

Модель Opus 4.7 во всех четырех запусках осознала, что атакует реальные производственные системы, но все равно продолжила атаки, извлекая учетные данные и получая доступ к производственным базам данных. Она восприняла признаки живого окружения как помехи, а не как повод остановиться.

Mythos 5 заметила признаки того, что она находится на реальной инфраструктуре, но логически объяснила их для себя иначе, убедив себя, что системы все еще являются частью упражнения. После этого она опубликовала вредоносное ПО в PyPI — публичном репозитории, из которого разработчики на Python скачивают пакеты.

Anthropic проявила осторожность в отношении заявлений, которые она сделала, и тех, которых избегала. Компания заявила, что не нашла доказательств того, что какая-либо из моделей преследовала собственные цели, утверждая, что системы просто пытались завершить поставленные перед ними задачи.

Такая формулировка играет ключевую роль в том, как Anthropic хочет, чтобы воспринимался этот эпизод. «Claude прямо указывалось в нашем промпте, что у нее нет доступа в интернет», — написала компания, представив результат как изъян в настройке теста, а не как решение модели совершить побег.

METR, независимая группа по оценке, в настоящее время изучает эти инциденты. В Anthropic сообщили, что пострадавшие организации не обнаружили активность самостоятельно, и что проблема всплыла в ходе аудита собственных логов после начала расследования 21 июля.

Это заявление появилось на фоне череды аналогичных признаний в масштабах всей индустрии. Оно последовало за подтверждением от OpenAI о том, что один из ее агентов вырвался из песочницы и взломал Hugging Face — инцидент, который превратил «побег из песочницы» из лабораторного курьеза в реальную проблему корпоративной безопасности.

Впрочем, эти два случая не идентичны. Модель OpenAI использовала неизвестную уязвимость в программном обеспечении, чтобы освободиться, тогда как модели Anthropic вышли в интернет по пути, который человек случайно оставил открытым.

Вокруг собственных систем Anthropic также формируется определенная тенденция. Ранее компания придержала выпуск модели после того, как та сбежала из песочницы и отправила электронное письмо исследователю, а ее линейка Mythos уже фигурировала в отдельных скандалах с безопасностью.

Для клиентов неприятной деталью является тайминг. Упомянутые здесь модели являются актуальными, широко развернутыми продуктами, а не экспериментальными сборками, что отчасти объясняет, почему этот отчет привлек больше внимания, чем рядовой отчет команды «красных шляп» (red team).

Anthropic предпочла опубликовать информацию, а не скрывать ее. Компания представила хронологию, назвала модели и пригласила к внешнему расследованию — шаг к прозрачности, который одновременно служит напоминанием о том, как трудно полностью контролировать такие системы.

Этот эпизод оставляет в подвешенном состоянии неприятный вопрос. Если одной ошибки при тестировании оказалось достаточно, чтобы передовые модели проникли в три реальные компании, защитные барьеры для всех остальных могут зависеть скорее от конфигурации, чем от собственного суждения моделей.