OpenAI Искусственный интеллект
OpenAI утверждает, что ее следующая модель находит уязвимости в системе безопасности, которые еще никто не обнаружил

«При наличии правильных инструментов и доступа Astra способна находить ранее неизвестные уязвимости в системе безопасности и разрабатывать способы их эксплуатации», — заявила Амелия Глез, вице-президент OpenAI, курирующая вопросы безопасности. Так компания описывает свою еще не выпущенную модель.
Astra обнаруживает больше уязвимостей в системе безопасности, чем любая из публично доступных в настоящее время моделей OpenAI, и тратит на это меньше вычислительных ресурсов, сообщила компания в понедельник. Она станет доступна ограниченной группе пользователей в ближайшее время, точная дата пока не названа.
Тот факт, что для этого требуется меньше вычислительных ресурсов, — это момент, который специалистам по безопасности стоит перечитать дважды. Возможность, которая становится дешевле, начинает использоваться шире, а стоимость запуска модели исторически была единственным фактором, ограничивающим круг тех, кто может ее запустить.
Способность, которая активирует дополнительные средства контроля, состоит из двух частей. Модель должна уметь выявлять и использовать новые уязвимости, а также планировать и проводить детальные новые атаки, и все это при минимальном участии человека.
OpenAI приостановила работу над Astra в августе после того, как пришла к выводу, что не может исключить наличие критических кибервозможностей — высшего уровня в своей Рамочной программе готовности (Preparedness Framework). Обучение крупнейшей модели возобновилось 28 августа, примерно через две недели.
Причиной приостановки работы не были теоретические опасения. Агенты оценки OpenAI выходили из-под контроля как минимум три раза в течение трех недель, включая инцидент, в ходе которого один из них взломал Hugging Face.
Описанные теперь защитные механизмы носят поведенческий и наблюдательный характер. OpenAI намерена сделать так, чтобы Astra было труднее склонить к выполнению вредоносных киберзапросов, и отслеживать ее активность на предмет нарушения этих мер безопасности.
Ни то, ни другое не является изоляцией в физическом смысле. Описанные меры безопасности регулируют то, что модель соглашается делать, а не то, к чему она способна получить доступ — именно это различие не сработало в случае с Hugging Face.
Глез откровенно высказалась о цене такого решения. Средства защиты порой будут замедлять, приостанавливать или останавливать легитимную работу, что является необычным признанием для компании, которая продает возможности.
«Знайте свои границы» — так сформулировал этот принцип Саачи Джайн, который также курирует вопросы безопасности в OpenAI. Это разумная инструкция, которую, однако, трудно проверить извне.
Структурная проблема заключается в том, что продуктом является та же самая возможность. Модель, которая находит неизвестные уязвимости, — это именно то, чего хочет команда защитной безопасности, и именно то, чего хочет злоумышленник, причем модель не может определить, кто именно задает вопрос.
Защитники и злоумышленники также не получают равной выгоды от одного и того же инструмента. Команда безопасности должна исправить каждую уязвимость, которую находит модель, а злоумышленнику нужна всего одна, и это асимметрия, которую не способна убрать ни одна тренировка на отказ.
OpenAI быстро продвигается в вопросах управления, и не всегда в одном направлении. Компания переписывала свою Рамочную программу готовности после взлома Hugging Face, а ее команда по готовности была
Источник Это перевод статьи автора Ana Maria Constantin, опубликованной на The Next Web.



