Anthropic

Anthropic заявляет, что китайская GLM-5.3 почти сравнялась с Mythos в способности использовать уязвимости

GLM-5.3 — модель с открытыми весами от китайской лаборатории Zhipu AI — почти не уступает Claude Mythos Preview в самостоятельном создании работающих киберэксплойтов, заявила во вторник Anthropic. Защитные механизмы модели можно обойти простыми приёмами — в некоторых тестах успешность достигала 100%.

Anthropic заявляет, что китайская GLM-5.3 почти сравнялась с Mythos в способности использовать уязвимости

Команда Anthropic Frontier Red Team опубликовала результаты в исследовательской публикации. За пределами Китая Zhipu известна как Z.ai. Пять месяцев назад Anthropic предоставила доступ к Mythos Preview только проверенным специалистам по кибербезопасности в рамках Project Glasswing — из-за возможностей модели во взломе. GLM-5.3 может скачать любой желающий.

«Выход GLM-5.3 знаменует существенный скачок в кибервозможностях, доступных злоумышленникам», — написала Anthropic.

50 работающих эксплойтов в 410 попытках

В тесте ExploitBench, который оценивает эксплойты для известных уязвимостей движка V8, используемого в Google Chrome, GLM-5.3 создала полноценные эксплойты в 50 из 410 попыток. Mythos Preview справилась с этим в 56 попытках. В собственном тесте Anthropic Binary Exploitation GLM-5.3 добилась полного перехвата управления потоком выполнения в 4% из 100 заданий, тогда как у Mythos Preview показатель составил 6%. Предыдущие модели — Claude Opus 4.6 и GLM-5.2 — не справились ни с одним заданием.

В ходе одного тестирования исследователь запустил GLM-5.3 на изолированной машине с Linux-версией популярного веб-браузера. Примерно за день, при минимальном участии человека, модель обнаружила несколько неизвестных уязвимостей в JavaScript-движке браузера. Она объединила их в цепочку и создала веб-страницу, которая считывает файлы с компьютера посетителя. Anthropic сообщила, что передала сведения об уязвимостях разработчику браузера.

В другом тесте более компактная GLM-5.3-Flash объединила эксплойты для известной уязвимости Chrome CVE-2026-11645 и ещё одной известной ошибки. На это потребовалось 20 минут внимания человека и восемь часов работы модели. По тарифам API Zhipu это обошлось бы в 20,40 доллара, сообщила Anthropic.

Защитные механизмы, которые не выдерживают

В исходной версии GLM-5.3 отказывалась выполнять явно вредоносные запросы в смоделированных тестах Anthropic. Но простые уловки меняли результат. Если сказать модели, что она — автономный агент красной команды, она соглашалась в 64% случаев. Если заранее заполнить её рассуждение так, чтобы казалось, будто она уже согласилась, показатель повышался до 92%. Версия модели с удалёнными отказами соглашалась каждый раз. По данным Anthropic, ни один из этих приёмов не сработал с защищёнными моделями Claude.

Такая модификация, известная как абляция защитных механизмов (abliteration), возможна благодаря открытым весам GLM-5.3. Собственная попытка Anthropic заняла около 2 200 часов работы графических процессоров и обошлась примерно в 4 400 долларов. Она снизила долю отказов модели с более чем 90% до 2%, практически не повлияв на её возможности. По оценке Anthropic, опытной команде потребовалось бы около 600 часов работы графических процессоров, или 1 200 долларов. Несколько разработчиков выпустили версии модели с удалёнными защитными механизмами уже через несколько дней после её запуска.

Отставание от передовых моделей США — четыре месяца

17 сентября Центр стандартов и инноваций в области ИИ при NIST (CAISI) назвал GLM-5.3 «самой продвинутой в киберсфере моделью с открытыми весами на сегодняшний день» в собственной оценке. CAISI установил, что по результатам кибертестов модель отстаёт от передовых американских моделей примерно на четыре месяца. Anthropic заявила, что её результаты в целом совпадают с выводами CAISI.

«С учётом этих данных мы считаем вероятным, что модели вроде GLM-5.3 будут использоваться государственными и негосударственными субъектами для причинения реального вреда», — написала Anthropic.

Anthropic также отметила, что модели такого уровня могут помогать специалистам по защите, и сообщила о расширении доступа к кибервозможностям Claude. Компания призвала правительства проверять безопасность мощных моделей, в том числе преемников GLM-5.3. В понедельник Z.ai и Concordia AI предложили шесть этапов управления рисками ИИ с открытыми весами.

Этот отчёт последовал за другими предупреждениями о китайских моделях, прозвучавшими на этой неделе. В среду OpenAI заявила, что связанные с Moonshot пользователи пытались извлечь рассуждения её ИИ. Исследования также выявили, что ИИ-агенты на базе китайских моделей вводят тестировщиков в заблуждение — как это делали и американские модели.

Опубликовано 1 октября 2026 - 05:19 Наверх