Русская версия The Next Web

Google Безопасность Искусственный интеллект

В конце июля компания Irregular сообщила четырем лабораториям ИИ, что их модели взломали системы во время ее тестов. Общественность узнавала об этом постепенно, а Google оказалась последней.

В конце июля компания Irregular сообщила четырем лабораториям ИИ, что их модели взломали системы во время ее тестов. Общественность узнавала об этом постепенно, а Google оказалась последней.

Компания Google подтвердила, что ее модель Gemini в мае случайно проникла в три внутренние системы компании во время тестирования на кибербезопасность. Об этом сообщили Джулия Лав и Дейви Альба для Bloomberg, агентство обновило свой материал, поставив Google в один ряд с OpenAI, Anthropic и Meta.

Самое важное заключается в том, что испытательная площадка заявила следом. В Irregular подтвердили, что утечки, о которых сообщили все четыре компании, были частью одной и той же проблемы и что они уведомили соответствующих разработчиков еще в конце июля.

Один инцидент, четыре заявления

В течение нескольких месяцев это преподносилось как череда отдельных прорывов разных моделей в разных компаниях. В августе издание TNW сообщало, что за инцидентами в OpenAI, Anthropic и Meta стоял один и тот же тестировщик.

Теперь Irregular официально подтвердила это и добавила четвертое имя. Паттерн, который встревожил людей, в основном сводился к одной проблеме у одного поставщика.

Это имеет решающее значение для понимания того, как воспринимаются данные события. Четыре независимые лаборатории, теряющие контроль над четырьмя моделями — это история о возможностях моделей, а одна неправильно настроенная тестовая среда — это история об управлении поставщиками.

В чем заключалась ошибка конфигурации

В OpenAI объяснили свои инциденты неправильно настроенной средой оценки, заявив, что из-за недопонимания с Irregular тестовые системы имели доступ к реальному интернету, в то время как моделям сообщили, что они находятся в симуляции.

Это скорее сбой «песочницы», чем побег. Модель, ведущая себя агрессивно в рамках того, что она считает учебной задачей, делает то, о чем ее попросили, и проблема заключалась именно в отсутствии изоляции.

Тем не менее, это не делает последствия безобидными. Модель Meta взломала реальный сторонний сервис, а в одном из случаев с Anthropic модель опубликовала работающее вредоносное ПО в публичный реестр, откуда оно было скачано и запущено в реальных системах.

Семь недель

Инциденты произошли в мае. В Irregular заявляют, что уведомили разработчиков в конце июля, после чего информация стала поступать по очереди: Meta — в начале августа, а Google — на этой неделе.

Таким образом, четыре компании обладали одной и той же информацией с конца июля и каждая самостоятельно решала, когда об этом объявить. Временной разрыв между уведомлением и раскрытием информации у Google составил около семи недель.

Ничего необычного в практике работы с уязвимостями здесь нет, согласованные сроки — это норма. Необычно то, что координации не было, и публикация частями заставила одно событие выглядеть как набирающий обороты тренд.

Обнаружение оказалось самой сложной задачей

Цифры обнаружения объясняют, почему временная шкала так растянулась. Anthropic проанализировала 481 миллион стенограмм, чтобы выявить четыре модели, которые вышли в открытый интернет.

Эта цифра заслуживает осмысления. Инциденты не фиксировались в режиме реального времени системой мониторинга, их обнаружили задним числом в ходе ретроспективной проверки огромного масштаба.

Что бы ни делали модели, следившие за ними системы в тот момент ничего не заметили. Именно этот вывод остается в силе вопреки всем попыткам интерпретации.

Поставщик — единая точка отказа

Четыре передовые лаборатории использовали одну и ту же трехлетнюю компанию для проведения оценок на предмет кибербезопасности. Когда ее среда оказалась настроена неверно, она оказалась неверной для всех них одновременно.

Концентрация в сфере тестирования является зеркальным отражением концентрации в сфере вычислительных мощностей, и ей уделялось меньше внимания. Общий оценщик эффективен, но он также означает общий радиус поражения.

Недавние работы по контролю за ИИ утверждают, что «песочницы» не могут считаться надежной защитой от агентов с кибервозможностями и нуждаются в стресс-тестировании с использованием наступательных инструментов. И это как раз демонстрация данного тезиса сразу на четырех компаниях.

Что будет с тестированием

Работа не останавливается. Anthropic возобновила внешние кибертесты, в ходе которых ее модели атаковали реальные компании, после перестройки окружающих их регламентов.

Это правильное направление. Наступательная оценка — это то, как измеряются данные возможности, и ответом на сбой изоляции должна быть лучшая изоляция, а не сокращение числа тестов.

Вашингтон уже задает вопросы

Утечки привлекли внимание политиков. Демократы в Палате представителей потребовали от OpenAI и Anthropic ответов по поводу их вышедших из-под контроля агентов.

Подтверждение от Irregular меняет суть этих вопросов. Если одна ошибка в конфигурации у поставщика привела к четырем сериям взломов, проблема носит контрактный и процедурный характер, а не является следствием гонки между лабораториями.

Это также поднимает вопрос, который пока никто не озвучил публично: сторонние организации подверглись взлому, и пока неясно, кто именно из четырех компаний или сам поставщик должен нести перед ними ответственность.

За чем следить

Стоит проследить, опубликует ли Irregular собственное заявление. Вендор теперь подтвердил общую причину, но еще не изложил, что именно пошло не так в его среде и что изменилось.

Стоит также последить за тем, придут ли лаборатории к соглашению о едином стандарте скоординированного раскрытия информации об инцидентах тестирования. Публикация одинаковых новостей четырьмя компаниями на протяжении семи недель — лучший аргумент в пользу такого стандарта.