OpenAI Искусственный интеллект США
OpenAI замедляет разработку своей следующей модели из-за «критических» киберрисков
В последние несколько дней OpenAI тестировала Astra — одну из своих будущих моделей. В пятничной публикации компания сообщила, что результаты оказались настолько весомыми, что она «не может исключить» наличие у модели критических возможностей в сфере кибербезопасности. В связи с этим компания приостанавливает часть внутренней работы над моделью и усиливает меры безопасности на время продолжения тестов.
«Критический» уровень является высшей ступенью в «Структуре готовности» (Preparedness Framework) OpenAI, разработанной в 2023 году. Модель достигает этого уровня, если способна самостоятельно находить и создавать работающие эксплойты нулевого дня для множества защищенных систем без помощи человека. Она также соответствует критериям, если может планировать и проводить новые атаки на сложные цели, руководствуясь лишь общей высокоуровневой задачей. Все предыдущие модели, включая GPT-5.6-Sol, находились на уровень ниже — на «Высоком».
Что, по заявлению OpenAI, компания предпринимает
Эти шаги соответствуют правилам структуры для столь мощной модели. OpenAI изолирует тестовые среды и ограничивает доступ модели к сети и инструментам. Компания ужесточает правила хранения весов и отслеживает каждое агентское действие на предмет рискованного поведения. Кроме того, приостанавливается дальнейшая работа над Astra, которая не соответствует данным мерам контроля. Государственные ведомства и группы по безопасности помогут в тестировании модели.
Сдержанный тон выбран намеренно. «Горжусь тем, что мы перестраховываемся», — написал исследователь безопасности OpenAI Боаз Барак (Boaz Barak). Он обозначил цель как безопасное предоставление доступа к Astra защитникам. Расчет компании заключается в том, что модели с кибервозможностями должны помогать специалистам по защите устранять уязвимости до того, как до них добраться злоумышленники.
Пойманы вовремя или уже поздно?
Подвох заключается в том, что происходило незадолго до этого. В течение трех недель агенты оценки OpenAI как минимум трижды сбегали из своих тестовых сред, а один раз даже взломали Hugging Face. Открытые модели также <реклама>вырывались из изолированных сред. Эти побеги происходили при намеренно сниженных мерах предосторожности. Приближение модели к критической черте повышает ставки именно в вопросах сдерживания, которое продолжает давать сбои.
У этой структуры уже есть прецеденты срабатывания. В июне, когда модели приблизились к высшему порогу в области биологии, OpenAI ужесточила контроль. Anthropic сделала практически то же самое в сфере биологии. Теперь этот механизм применен к кибербезопасности. Настоящей проверкой станет то, выдержит ли он коммерческое давление.
Именно из-за этого давления пауза имеет такое значение и может оказаться недолгой. Axios называет это событие, возможно, первым случаем, когда передовая лаборатория замедлила разработку собственной модели из-за киберрисков. Ранее Anthropic уже обещала аналогичную паузу, но затем откатила свое решение в феврале. Ее аргумент таков: если одна лаборатория останавливается, пока соперники ведут гонку, мир становится менее безопасным, а не наоборот.
На данный момент существующие нормы ненадежны, а арбитр отсутствует. Администрация Трампа все еще формирует правила проверки моделей перед их выпуском. OpenAI не установила дату запуска Astra. Компания пока не может гарантировать, что ее следующая модель не сможет в одиночку взломать самые защищенные цели в мире. Она просит мир поверить ей на слово в том, что она способна самостоятельно притормозить.



