Русская версия The Next Web

Безопасность Данные и безопасность Искусственный интеллект

Дешевая программа стер собственный рейтинг угроз ИИ от Booz Allen

Дешевая программа стер собственный рейтинг угроз ИИ от Booz Allen

Компания Booz Allen испытала 18 самых передовых моделей ИИ в мире на действующей корпоративной сети, поручив им совершить взлом. Одна из них справилась с задачей. Консалтинговая фирма отмечает, что составленный по итогам рейтинг — это вовсе не тот вывод, который следует делать из данного теста.

Индекс кибероружия (Cyber Weapon Index), опубликованный в среду, оценивает девять американских и девять китайских моделей. В нем измерялось, как далеко каждая модель способна продвинуться в реальном сценарии вторжения без участия человека. До конца дошла только модель Claude Mythos от Anthropic. Джессика Лайонс (Jessica Lyons) сообщила об этих результатах для издания The Register в среду вечером.

Что на самом деле представлял собой тест

Каждой модели выделили собственный компьютер атакующего, с которого она по очереди отдавала команды. Booz Allen не предоставила им никакого меню инструментов или вспомогательного ПО, и в этом был весь смысл. Фирма хотела оценить, на что способна модель в одиночку, без окружающего ее привычного инженерного обвеса.

Оценка складывалась из двух частей. Первая определяла, способна ли модель находить уязвимости в скомпилированном программном обеспечении при отсутствии исходного кода. Вторая отслеживала глубину ее продвижения при попытке вторжения в защищенную сеть Active Directory. Тест охватывал все этапы: от первоначального доступа до получения полного контроля над доменом. По заявлению Booz Allen, баллы выставлялись на основе подтвержденных сетевых логов, а не заявлений самих моделей — учитывались записи трафика, журналы безопасности и датчики обнаружения вторжений.

Это различие имеет принципиальное значение, поскольку в июле мы сообщали, что старые тесты перестали давать кому-либо полезную информацию. Большинство существующих бенчмарков измеряют то, что модель знает. Данный тест измеряет то, что она сделала.

Claude Mythos набрала 80 баллов. Получив украденные учетные данные сотрудника, она при каждой попытке захватывала права администратора. Кроме того, она самостоятельно прокладывала маршрут к повышенным привилегиям, а не следовала готовому сценарию. В более сложном тесте, вообще без учетных данных, она взломала систему извне и все равно захватила домен. Все остальные модели этот тест провалили.

Следом за ней расположилась Grok-4.5 с 49 баллами и GPT-5.6 Sol с 46 баллами. Muse Spark 1.1 от Meta и Kimi K3 от Moonshot разделили результат в 38 баллов, GLM-5.2 от Z.ai набрала 37 баллов, а Claude Opus 4.8 — 36. Модель Qwen3-Coder от Alibaba оказалась на последнем месте с 4 баллами. Помимо Mythos, еще три модели получили полный контроль над доменом. Еще четыре продвинулись латерально внутри сети, и все они, кроме одной, проникли внутрь без посторонней помощи.

Вывод, который ставит под сомнение всю таблицу

Затем сам отчет ставит под сомнение собственную турнирную таблицу. Claude Sonnet 5 заняла 15-е место из 18 с результатом в 13 баллов. Однако Booz Allen объединила ее с обвязкой для атак (attack harness) — программным обеспечением, которое связывает модель с хакерскими инструментами и удерживает ее в рамках поставленной задачи. После этого она составила серьезную конкуренцию Mythos.

Разрыв в 67 баллов был преодолен за счет вспомогательной инфраструктуры. Подобная обвязка позволяет модели сохранять концентрацию, адаптироваться, восстанавливаться после сбоев и объединять отдельные действия в непрерывную операцию. Вывод Booz Allen звучит сурово: единицей риска больше не является отдельная модель. Единицей риска является система.

Фирма также признает то, что ей еще не удалось измерить. Она не тестировала китайские модели или модели с открытыми весами в паре с оптимизированными обвязками. По ее словам, полученные результаты убедительно свидетельствуют о том, что полностью работоспособные комбинации уже существуют.

Одна модель отказалась. Ее «сестра» все равно сделала это

Второй вывод в среду практически не привлек к себе внимания. Одна из моделей отклонила задачу на том основании, что у нее нет учетных данных. Ее кибер-настроенный аналог, получив точно такую же задачу, подчинился и выполнил ее.

Booz Allen выводит из этого универсальное правило: защитные барьеры (guardrails) не являются постоянным свойством модели, а их эффективность меняется в зависимости от контекста и конфигурации. Отказ в одной ситуации ничего не говорит о другой. Схожий урок наблюдался в нашей редакции во вторник, когда исследователь перехватил управление Claude Code, попросив ее сделать краткую выжимку страницы.

Где модели по-прежнему терпят неудачу

Самым очевидным пределом возможностей остается реальный поиск уязвимостей. При столкновении с искусственно внедренным изъяном все модели показали результаты близкие к максимальным. Происхождение не имело никакого значения: американские, китайские, с открытым и закрытым кодом модели выступили одинаково. Однако перед лицом реальной неизведанной уязвимости, скрытой в крупной производственной библиотеке, каждая из девяти передовых моделей, согласно отчету, получила ноль баллов. Одна из моделей проанализировала уязвимый компонент правильно, после чего решила, что он безопасен.

Далее в отчете утверждается, что эту уязвимость заметили только передовые модели Anthropic. И только Mythos, добавляется там же, поняла ее достаточно хорошо, чтобы использовать. Эти утверждения соседствуют в одном абзаце, и отчет никак их не согласовывает, поэтому нулевой балл следует воспринимать как относящийся к системе оценки, а не к каждой отдельной попытке. У Mythos уже есть послужной список: в мае она обнаружила 10 000 критических уязвимостей за один месяц.

Booz Allen рассматривает этот разрыв как спасительную передышку. Реальный наступательный потенциал все еще отстает от показателей в бенчмарках, что дает защитникам время на подготовку. Фирма ожидает, что большинство из 18 моделей достигнут уровня Mythos в течение шести полугодий (в течение шести месяцев). Она называет массовые атаки с использованием ИИ неизбежными.

Читайте рекомендации с поправкой на их автора

Booz Allen опубликовала индекс одновременно с выпуском продукта Vellox Labs Guile, созданного для противодействия автономным атакам. В том же пресс-релизе утверждается, что скоординированные контрмеры против ИИ снижают успешность атак злоумышленников более чем на 95% в ходе собственных тестов фирмы. Никто независимо не проверял эту цифру, к тому же она служит аргументом в пользу продаваемого продукта.

Политические требования можно отделить от рекламных заявлений. Авторы отчета добиваются введения обязательных к исполнению отраслевых сроков, которые заставят операторов критической инфраструктуры доказывать свою способность локализовать вторжение. Они выступают за создание национальной программы тестирования зарубежных моделей и моделей с открытыми весами в реалистичных условиях. Кроме того, они требуют предоставить проверенным специалистам по защите контролируемый доступ к тем возможностям, от которых они призваны защищаться.

В отчете упоминается июльский инцидент с взломом Hugging Face как момент, когда модель завершила цепочку уничтожения в реальном мире, а не в лабораторных условиях. Одна модель отсутствует в самом индексе. Astra от OpenAI не тестировалась, причем во вторник компания OpenAI заявила, что та достигла ее критического порога кибербезопасности. Этот индекс выходит в момент, когда область применения уже ушла далеко вперед.