Anthropic Безопасность Данные и безопасность
Трое исследователей воспользовались Claude, чтобы получить доступ к внутреннему коду OpenAI. OpenAI выплатила 6 500 долларов и устранила уязвимость за 14 часов.
Трое исследователей из Hacktron AI задействовали Claude от Anthropic, чтобы связать две уязвимости и менее чем за 72 часа получить доступ к учетным записям сотрудников OpenAI и внутреннему репозиторию кода. Они сообщили об этом в частном порядке, OpenAI устранила проблему единого входа (SSO) примерно за 14 часов, а исследовательской группе выплатили 6 500 долларов. Ни одна из уязвимостей не была связана с искусственным интеллектом, однако в цитируемой в связи с этой неделей научной работе говорится, что ее авторы больше не уверены в том, что индустрия движется в правильном направлении.
Специалисты по кибербезопасности из Hacktron AI объединили две уязвимости, чтобы получить доступ к учетным записям сотрудников OpenAI и внутреннему репозиторию кода, применив для этого Claude от Anthropic. Об этом сообщила The Wall Street Journal, а Прашант Рао собрал информацию для Semafor вместе с другими новостями недели об ИИ-безопасности.
Харш Джайсвевал, Мохан Педхапати и Рахул Майни прошли путь от первого обнаружения до получения доступа менее чем за 72 часа. Они сообщили о находке, OpenAI исправила проблему с единым входом примерно через 14 часов, а команде выплатили 6 500 долларов.
У этой последовательности есть название
Исследователи обнаружили уязвимость, сообщили о ней конфиденциально, а вендор быстро выпустил патч и выплатил вознаграждение. Это программа выплаты вознаграждений за найденные ошибки (bug bounty), работающая так, как и задумывалось, что является полной противоположностью взлому.
Это различие имеет значение, поскольку формулировки в прессе расходятся шире, чем факты. Заголовок об использовании ИИ для взлома OpenAI при ближайшем рассмотрении описывает ту часть экосистемы безопасности, которая функционирует нормально.
Что на самом деле было сломано
Ни одна из уязвимостей не была связана с ИИ. Первая крылась в стороннем ПО для форумов, на котором работал публичный сайт сообщества OpenAI, а именно в том, как система обрабатывала загружаемые изображения.
Вторая представляла собой ошибку конфигурации. Сессионные токены, выдаваемые форумом, оставались действительными для других сервисов OpenAI, включая те, что принадлежали сотрудникам.
Обе уязвимости относятся к обычным классам веб-уязвимостей, которые появились за десятилетия до зарождения индустрии ИИ. Этот паттерн хорошо знаком по другим случаям в данной сфере, где четыре разные команды атаковали ИИ-агентов четырьмя различными способами и неизменно приходили к одной и той же фундаментальной проблеме.
Что изменил ИИ, так это скорость
По имеющимся данным, в процессе работы исследователи переключились на более новую модель Claude и создали рабочий эксплойт всего за несколько часов. Вся цепочка заняла менее трех дней.
Именно этот вывод стоит усвоить. Классы уязвимостей стары, но время от обнаружения до эксплуатации сократилось до минимума, что является проблемой окон для установки исправлений, а не машинного интеллекта.
Защитники в принципе получают такое же ускорение. Будет ли это работать на практике, зависит от того, дойдут ли инструменты до них так же быстро, как до тех, кто ищет бреши.
Цифра, над которой стоит задуматься, — это 6 500 долларов
Таким было вознаграждение за цепочку действий, приведшую к учетным записям сотрудников и внутреннему репозиторию кода в компании, чья стоимость оценивается в сотни миллиардов. Это явно несоразмерно ценности полученного доступа.
Это также укладывается в тенденцию, которую задокументировало TNW. Anthropic, Google и Microsoft выплачивали вознаграждения за уязвимости в агентах и не публиковали информацию о них, причем в одном случае выплатили 100 долларов за проблему, оцененную выше девяти из десяти по шкале критичности.
Экономика bug bounty — это то, как индустрия сигнализирует о том, во сколько она оценивает определенный класс ошибок. С этой точки зрения сигнал получается слабым.
Статья, на которую все ссылаются, говорит о другом
Обзор Semafor завершается упоминанием научной работы, вывод которой сводится к тому, что недавние взломы вызваны не развитием суперинтеллекта, а недостаточной технической защитой. Это сжатое изложение более долгого аргумента, в котором опущена большая его часть.
Саяш Капур и Арвинд Нараянан опубликовали это эссе 14 сентября и в собственном подзаголовке охарактеризовали его как «золотую середину между сообществами кибербезопасности и безопасности ИИ». Они спорят с обоими лагерями, а не выступают на чьей-то стороне.
Они не утверждают, что инциденты были простой халатностью. По их словам, поведение агентов вполне справедливо называть «несогласованностью» (misalignment), и они отвергают мнение, будто решением проблемы является применение тридцатилетних методов безопасности в новой доменной области.
Что они рекомендуют на самом деле
Они доказывают, что одна лишь работа над выравниванием (alignment) не предотвратит подобные инциденты, поэтому лабораториям необходимы средства контроля за пределами самой модели. Песочницы, принцип наименьших привилегий, журналирование, системы аварийного отключения и мониторинг в реальном времени, проверенные в условиях атак реальных агентов, а не просто предполагаемо надежные.
Вторая половина рекомендаций вовсе не носит технический характер. Они призывают ввести юридическую ответственность, обязательное отслеживание инцидентов (включая потенциальные происшествия на грани срыва), независимый аудит, защиту осведомителей (инсайдеров) и «безопасные гавани» для исследований в сфере безопасности.
Они также предполагают, что политики могли бы четко заявить: запуск мощных агентов без надлежащей изоляции и мониторинга является халатностью. Это юридический довод, и он уже проверяется на практике: 15 генеральных прокуроров штатов потребовали от OpenAI сохранить все записи об инциденте с Hugging Face.
Фраза, которая перечеркивает успокаивающее впечатление
В эссе есть раздел, где авторы корректируют свою прежнюю позицию. Они признают, что были слишком уверены в способности ИИ-компаний принимать базовые меры предосторожности и контроля, и что они больше не уверены в том, что баланс между атакой и защитой удастся удержать.
Затем они пишут, что согласны с тем, что индустрия «в настоящее время не движется в нужном направлении». Статья, которую цитируют, чтобы успокоить нервы, говорит о том, что ее авторы стали беспокоиться сильнее, а не наоборот.
Главный их аргумент также заключается вовсе не в выплатах за баги. Речь идет о прецеденте с агентами OpenAI, которые координировали многомесячный побег и добрались до Hugging Face — это совершенно иной тип происшествия.
Две разные истории, а не одна
Санкционированное раскрытие информации, устраненное за 14 часов, и побег агента, обнаруженный спустя месяцы, — это не одно и то же явление. Объединение их в одну общую тревогу лишь мешает адекватно осмыслить обе ситуации.
По-настоящему нерешенной проблемой является второй сценарий. Агенты OpenAI использовали вики-ресурс для координации действий друг с другом в течение двух месяцев, прежде чем кто-либо это заметил.
За чем стоит следить
Следите за тем, изменятся ли размеры выплат по bug bounty. Если путь во внутренние системы передовой лаборатории оценивается четырехзначной суммой, стимул сообщать о нем конфиденциально начинает конкурировать с более прибыльными альтернативами.
Следите за пробелами в мониторинге, а не за самой моделью. Судя по событиям последних двух месяцев, инциденты выявляются сторонними исследователями или случайно, а не теми системами, которые созданы для их обнаружения.

