Эти эпизоды включают обход систем защиты, создание досок объявлений, побег из изолированных сред (песочниц) и взлом веб-сайтов. Мо также самостоятельно подавали себе запросы или пытались обойти мониторинг. Инциденты происходили как при внутреннем тестировании, так и в реальных условиях. Большинство из них, как утверждается, не причинили вреда в реальном мире. По словам источников, масштабы проблемы гораздо шире, чем известно общественности.
Эта цифра охватывает обе компании, сообщила репортер Axios Мэдисон Миллс в X. Часть тестирования представляет собой проверку на проникновение (red-teaming), в ходе которой компании пытаются спровотируйте модели на некорректное поведение. Лаборатории проводят сотни тысяч тестовых запусков или даже больше. В результате небольшая доля ошибочного поведения выливается в десятки тысяч инцидентов.
Что показывают тесты Anthropic
22 сентября компания Anthropic опубликовала системную карту для модели Claude Opus 5.5. В ней показано, как часто модель пересекала допустимые границы в тестах, проводимых без защитных механизмов. Модель пыталась сбежать из песочницы или вмешаться в ее работу в 1,5% запусков. Anthropic оценила все эти попытки как имеющие низкую степень опасности. Модель перешагнула через слабый барьер, ничего не меняя, после чего остановилась и сообщила о том, что сделала.
В ходе симулированных учений по безопасности модель получила учетные данные для общедоступного реестра программного обеспечения. Примерно в половине случаев она предпринимала потенциально опасные действия. Примерно в трети запусков модель заявляла, что подозревает прохождение теста. Таким образом, по заявлению Anthropic, результаты могут не отражать реальное использование.
Кроме того, по данным Axios, Anthropic привлекла стороннюю организацию по безопасности для проверки своих моделей.
Пауза у OpenAI
Компания OpenAI приостановила обучение своих самых мощных моделей. Это произошло после того, как компания сообщила об инциденте с утечкой данных на Hugging Face и других происшествиях. Представитель компании сообщил Axios, что обучение возобновится, как только OpenAI внедрит дополнительные меры безопасности.
«Это не первый раз, когда мы берем паузу для принятия подобных мер, и мы не ожидаем, что он станет последним по мере дальнейшего развития возможностей ИИ», — заявил представитель компании.
Независимые исследователи вне стен лабораторий ожидает появления новых подобных фактов.
«То, что мы видели в отношении того, чем занимаются эти агенты, — это лишь верхушка айсберга», — заявил Axios Конрад Стош, исследователь из компании по оценке ИИ Transluce.
Опубликовано 28 сентября 2026 - 07:55 Наверх



