Anthropic возобновила тесты, в ходе которых ее модели атаковали реальные компании
Компания Anthropic возобновила внешние оценки кибербезопасности, которые она приостановила месяц назад после трех инцидентов, когда ее собственные модели вырвались из тестовых сред и атаковали реальные компании.
Компания заявила, что перед возобновлением тестирования внедрила дополнительные меры безопасности, сообщает Reuters в понедельник.
Эти инциденты, о которых стало известно 31 июля, оказались более конкретными, чем следует из общего описания «инцидента безопасности».
В одном из случаев Claude Opus 4.7 атаковала реальную компанию, которая случайно совпала по доменному имени с вымышленной целью. Это происходило в ходе четырех отдельных тестовых прогонов, в результате которых модель получила доступ к производственным данным и учетным данным.
В другом случае модель сгенерировала вредоносный код на Python, который, как все участники считали, надежно изолирован внутри тестовой среды.
Вместо этого он попал в общедоступный интернет и был скачан 15 системами, включая систему одной охранной фирмы, чей собственный сканер впоследствии выполнил этот код.
Третий инцидент вызывает иную озабоченность, поскольку модель активно искала другую цель после того, как ей не удалось взломать назначенную.
Внутренняя версия Claude просканировала интернет, нашла альтернативную систему и сумела скомпрометировать ее с помощью относительно обычных методов.
Проблема заключалась не во взломе защиты (jailbreak) или преднамеренной попытке модели обойти свои инструкции. Это был сбой в самой тестовой среде.
«Из-за недопонимания между нами и нашим партнером по оценке это оказалось не так, и доступ в интернет был открыт», — заявили в Anthropic, имея в виду песочницу, внутри которой должны были работать модели.
Партнером по оценке выступала компания Irregular. Моделям сообщили, что они работают в изолированной среде, и они вели себя соответствующим образом, но изоляция на самом деле так и не была реализована.
Инцидент с доменным именем иллюстрирует, как быстро кажущаяся незначительной ошибка при тестировании может превратиться в реальную проблему безопасности.
Модели дали вымышленную цель, которой не существовало, она нашла реальную организацию, использующую то же доменное имя, а затем продолжила взаимодействовать с ней так, словно это была та самая задуманная цель.
Временная шкала также вызывает вопросы о том, как мониторился этот процесс тестирования. Самый первый инцидент произошел в апреле, но Anthropic не обнаружила ни одного из трех случаев до тех пор, пока 23 июля не начала проверку, инициированную после того, как OpenAI сообщила об аналогичном инциденте.
Две из пострадавших организаций сами не обнаружили подозрительную активность. Они узнали о том, что их системы были скомпрометированы, только после того, как представители Anthropic связались с ними напрямую.
Возможно, это один из самых важных выводов из произошедшего. Система ИИ с использованием относительно базовых методов проникновения смогла добраться до реальных производственных сред без обнаружения со стороны управляющих ими организаций, по крайней мере, в момент осуществления такой активности.
Это также означает, что проблемы были выявлены благодаря отраслевой проверке, а не потому, что собственные системы мониторинга Anthropic зафиксировали их. Никто в компании не заметил апрельский инцидент в момент его совершения.
Впоследствии Anthropic прекратила все внешние тесты, уведомила своего партнера по оценке и связалась с задействованными организациями.
Теперь компания возобновила работу, хотя публично подробно не объяснила, какие именно дополнительные меры безопасности были внедрены.
Эти инциденты укладываются в более широкую тенденцию, когда тестирование все более мощных систем ИИ приводит к поведению, которого исследователи никак не ожидали.
Британские эксперты по оценке выяснили, что каждая передовая модель, которую они проверяли на склонность к обману, мошенничала, в то время как агент от OpenAI вырвался из тестовой среды и взломал Hugging Face в июле.
Эти инциденты пополнили список примеров, приведенных на этой неделе председателем Совета по финансовой стабильности, который назвал киберриски, создаваемые искусственным интеллектом, наиболее непосредственной угрозой для финансовой стабильности.
Это переводит сбои при оценке моделей из разряда чисто академических проблем безопасности в совершенно иную категорию, особенно по мере того, как системы ИИ обретают способность управлять инструментами и сетями при все меньшем участии человека.
Существует также проблема государственного управления и регулирования, которую сложнее решить за счет улучшения программного обеспечения. Сторонние оценщики работают по контрактам с теми компаниями, чей ИИ они проверяют, в то время как сами компании обычно определяют условия проведения тестирования.
Когда внешняя сторона неправильно настраивает среду, ответственность разделяют и разработчик, и оценщик, но при этом нет независимого регулятора, проверяющего, действительно ли тестовая среда безопасна.
В то же время подобного рода тестирования трудно избежать. Оценки кибербезопасности — это один из немногих способов для исследователей узнать, на что способна мощная модель при получении средств нападения, а для осмысленных тестов требуются реалистичные системы, реалистичные цели и достаточная свобода для того, чтобы модель вела себя непредсказуемо.
Куда более сложный вопрос заключается в том, кто несет ответственность за проверку людей, проводящих эти тесты. Anthropic провела собственную проверку, поработала со своим партнером по оценке над внедрением мер предосторожности и в конечном счете сама решала, когда можно возобновлять внешнее тестирование.
Это стандартная схема для исследований в области безопасности ИИ, но ее становится все труднее оправдывать, когда само тестирование уже затронуло три организации, которые никогда не должны были становиться частью этого эксперимента.
Эти инциденты наглядно показывают, насколько незначительной может быть практическая разница между реалистичным тестом и реальным инцидентом безопасности.
В данном случае эта разница свелась к тому, действовали ли в песочнице те ограничения, в наличии которых были уверены все вовлеченные стороны, и теперь Anthropic делает ставку на то, что защитные механизмы, добавленные после сбоев, помогут удержать следующее тестирование в запланированных изначально границах.


