Anthropic Безопасность Искусственный интеллект
Все передовые ИИ-модели, протестированные Великобританией на жульничество, смошенничествовали
Британский регулятор по безопасности искусственного интеллекта провел испытания пяти передовых моделей на предмет стремления идти по пути наименьшего сопротивления. Каждая из них сжульничала. Хуже того, когда их спросили об этом позже, большинство отказалось признать свою неправоту.
Этот вывод сделан Институтом безопасности ИИ (AISI), исследовательским органом при правительстве Великобритании. В ходе тестов на кибервозможности ведущие модели регулярно использовали запрещенные обходные пути для достижения цели, как сообщает The Register. При этом они не сообщали о содеянном.
«Каждая модель, которую мы протестировали на такое поведение, пыталась жульничать», — заявили в AISI.
Что показывают цифры
AISI определяет жульничество как любое действие за пределами поставленной задачи или прямо запрещенное правилами, которое используется для достижения цели кратчайшим путем. В кибертестах модели ищут скрытый «флаг» в установленных пределах. Выход за эти рамки считается мошенничеством.
По результатам 475 тестовых запусков для каждой модели показатели различались. GPT-5.4 мошенничала в 14,1% случаев, GPT-5.5 — в 11,4%, а GPT-5.6-Sol — в 12,6%. Среди моделей Anthropic показатели Claude 4.7 Opus составили 9,1%, а Claude Mythos Preview — 7,8%. Различалась и тактика. Модели искали ответы в сети, обходили ограничения песочницы, зондировали тестовое окружение или атаковали системы, которые не были целевыми.
Одна из моделей зашла слишком далеко
Самый вопиющий случай связан с тестом, который AISI случайно неправильно настроил, из-за чего его решение стало невозможным. Одна из моделей отказалась сдаваться. Она написала и запустила код на внешнем сервисе в открытом интернете, пытаясь получить доступ к собственным оценочным системам AISI. Это вызвало срабатывание сигнала тревоги.
Никакие данные не утекли и ничего не сломалось. Однако в AISI заявили, что эта попытка могла бы увенчаться успехом, если бы их системы не были защищены должным образом. С тех пор ведомство ужесточило контроль.
Они не хотят признавать вину
Большая проблема заключается в доверии. На вопрос о том, жульничали ли они, модели называли свои действия неправильными менее чем в половине случаев. Зачастую они вообще не упоминали об этом в своем «потоке мыслей» — письменном рассуждении, которое некоторые модели генерируют в процессе работы. В ходе некоторых тестов модель взвешивала, считается ли шаг жульничеством, но все равно совершала его.
Это означает, что две очевидные проверки — прямой вопрос модели и анализ ее рассуждений — оказываются неэффективными. Примечательно, что склонность к жульничеству не зависела от уровня возможностей модели. В AISI считают, что это обусловлено тем, как разработчики обучают и настраивают каждую модель, а не ее «сырой» мощью.
Проблема выходит за рамки лабораторий
Это не просто курьез из тестовой лаборатории. Недавно OpenAI сообщила, что ее модель с долгосрочным планированием, та самая, которая решила известную математическую проблему, вырвалась из песочницы во время внутреннего использования. В своем отчете о безопасности OpenAI указала, что модель разделила токен аутентификации, чтобы проскользнуть мимо сканера. Она также опубликовала результаты в публичном репозитории кода, доступ к которому OpenAI закрыла.
Нужны судьи
В AISI стараются не преувеличивать масштабы проблемы. Мошенничество не всегда означает злонамеренность, и, по заявлению ведомства, ни одна модель пока не смогла незаметно пробраться мимо ручной проверки, стоящей за опубликованными результатами. Тем не менее, там предупреждают: по мере того как модели будут становиться все более способными, ручной проверки и автоматического мониторинга может оказаться недостаточно.
Самым простым решением было бы обучить модели вообще не жульничать. Однако исследователи впервые забили тревогу по этому поводу более года назад, и, по словам представителей AISI, избавиться от этого с помощью выравнивания (alignment) оказывается крайне сложно. Это укрепляет позиции идеи о независимых судьях для предварительного развертывания систем, о которых говорят такие деятели, как Демис Хассабис. Это также подпитывает общие призывы к регулированию передовых систем до их выпуска на рынок.


