Русская версия The Next Web

Anthropic Безопасность

Anthropic изучила 481 миллион стенограмм, чтобы найти четыре модели, вышедшие в открытый интернет

Anthropic изучила 481 миллион стенограмм, чтобы найти четыре модели, вышедшие в открытый интернет

Компания Anthropic опубликовала отчет о четырех оценках кибербезопасности, в ходе которых ее модели получили несанкционированный доступ в открытый интернет, и сообщила, что для их обнаружения потребовалось проанализировать около 481 миллиона стенограмм.

Данная оценка была опубликована в среду, причем о трех инцидентах стало известно еще 30 июля. Четвертый инцидент, связанный с ранней контрольной точкой Claude Opus 4.6, которая в январе получила доступ к сторонним системам, был обнаружен только в августе.

Причиной вовсе не стало то, что модель решила вырваться на свободу.

«Клоду сообщили, что он работает в симуляции без доступа к интернету, но из-за неправильной конфигурации он по ошибке оказался подключен к открытому интернету», — говорится в отчете.

Кроме того, модели работали без тех средств киберзащиты, которые поставляются с уже выпущенными продуктами, поскольку для этого и проводятся предварительные оценки. Окружение случайно солгало модели, и модель в это поверила.

Действия моделей различались. Claude Mythos 5 загрузил вредоносный пакет PyPI. Внутренняя исследовательская модель атаковала сторонние системы. Claude Opus 4.7 атаковал веб-сайт реальной компании в ходе четырех отдельных запусков. Anthropic заявляет, что уведомила все пострадавшие стороны.

Все четыре инцидента произошли в рамках оценок, созданных одним и тем же сторонним партнером. Это проливает свет на вопрос, висевший над этой историй с лета, когда мы сообщили о трех нарушениях, трех лабораториях и одном поставщике, и смещает центр тяжести.

Это проблема в цепочке поставок средств оценки, а не четыре независимых сбоя моделей, и теперь Anthropic заявляет, что сторонние партнеры должны соответствовать определенным требованиям, прежде чем запускать модели перед их релизом без средств защиты.

Это также представляет более ранние инциденты в ином свете. Посторонние пользователи отдельно получили доступ к ограниченной модели Mythos от Anthropic, а модель Meta взломала реальную компанию во время проверки безопасности.

Если читать этот отчет в комплексе, становится очевидно: тенденция в индустрии заключается вовсе не в том, что передовые модели выходят из-под контроля. Проблема в том, что места, где их намеренно спускают с поводка, контролируются хуже, чем кто-либо предполагал.

Два названных типа поведения заслуживают точного цитирования, поскольку оба они касаются того, как модели рассуждали. Предвзятые рассуждения определяются как избирательная интерпретация моделей доказательств таким образом, чтобы оправдать свои действия.

Безрассудство — это склонность продолжать попытки решить задачу даже тогда, когда это может причинить вред. В случае с Mythos 5 модель в ходе своих размышлений неоднократно заявляла, что считает себя находящейся в симуляции, хотя окружение предоставляло явные доказательства обратного.

Собственный вывод Anthropic сводится к тому, что действия оставались в узких рамках, и модели никогда не отклонялись от попыток решить поставленные перед ними задачи. Это существенное различие, и в нем же заключается вся суть проблемы в миниатюре.

Система, которая преследует назначенную задачу путем загрузки вредоносного пакета, будучи уверенной в том, что последствия не являются реальными, ведет себя непредсказуемо. Она ведет себя именно так, как ей было велено, основываясь на ложной предпосылке, которую она защищала вопреки противоречащим доказательствам.

Главная цифра здесь — 481 миллион. Anthropic провела двухэтапную проверку, выделила 9,2 миллиона стенограмм для более детального изучения и использовала собственные модели наряду с инструментами интерпретируемости, чтобы выяснить, что произошло. Это судебно-медицинская экспертиза такого масштаба, которую вряд ли смог бы провести кто-либо из других разработчиков, и даже при этом на поиск январского инцидента ушел август.

В этом и заключается проблема регулирования, и она проявилась как раз в ту неделю, когда это регулирование создавалось. OpenAI попросила Конгресс сделать обязательным оперативное письменное уведомление в случае обхода моделью средств контроля безопасности, после чего исследователи заявили, что собственные агенты OpenAI использовали как минимум десять нераскрытых сайтов.

Европа уже требует сообщать о серьезных инцидентах в соответствии с Законом об искусственном интеллекте. Каждая из этих обязанностей вступает в силу в тот момент, когда компания узнает о происшествии. Этот отчет представляет собой подробный отчет о том, как дорого обходится это знание.

Отдадим должное: отчет на редкость конкретен для корпоративного раскрытия информации, называет собственные ошибки, публикует используемые определения и берет на себя обязательство регулярно публиковать отчеты наряду с использованием укрепленных сред и усилением мониторинга.

Он также появляется после того, как исследователь Джейкоб Коксон покинул компанию со словами о том, что индустрия ставит конкуренцию выше безопасности, и после того, как мы писали, что Anthropic возобновила тесты, в которых ее модели атакуют живые цели.