OpenAI

OpenAI назвала четыре вещи, которые должны протестировать специалисты по безопасности

OpenAI назвала четыре вещи, которые должны протестировать специалисты по безопасности

Этот доступ должен позволить экспертам подвергать сомнению наши допущения, выявлять риски, которые мы могли упустить, и делать собственные выводы об эффективности наших средств защиты.

OpenAI опубликовала это во вторник в документе, определяющем требования компании к сторонним экспертам по безопасности. Автор документа — Лама Ахмад (Lama Ahmad), которая руководит работой компании с внешними экспертами по безопасности.

Компания сообщила во вторник, что откроет свои модели для независимой проверки на более ранних этапах разработки. Данный документ дополняет это заявление. В нем выделены четыре направления для оценки и семь принципов организации этой работы.

Два определения, от которых зависит все остальное

Заявление о безопасности (safety claim), согласно определению OpenAI, — это конкретное утверждение о модели, влияющее на ее безопасность. Его можно проверить с помощью фактических данных. В заявлении должны быть указаны риски и условия, которые оно охватывает, а также допущения и ограничения.

Обоснование безопасности (safety case) объединяет эти утверждения в единый структурированный аргумент. Оно объясняет, почему компания должным образом управляет рисками того или иного вида деятельности. В нем также должны быть указаны допущения, неопределенности и все оставшиеся риски.

Сэм Альтман использовал тот же термин на прошлой неделе. Он выступил за размеренный темп, а не за остановку разработок, в рамках федеральной структуры, построенной на обоснованиях безопасности.

Четыре направления

Первое — это независимая оценка самих обоснований безопасности. Она охватывает этапы обучения, оценки, внутреннего и внешнего развертывания. OpenAI рассчитывает, что несколько экспертных групп разделят обязанности в соответствии со своей специализацией. Оценивается обоснованность доказательств, проверяется, действительно ли команда соблюдала условия безопасности, а также выясняется, не поощряют ли методы обучения обман, хакерские атаки или обход ограничений.

Второе — это комплекс защитных мер (safeguard stack). OpenAI хочет, чтобы эксперты работали в режиме так называемого «серого ящика» (grey box access). Они будут проверять, выдерживают ли средства защиты попытки взлома (jailbreak) и предотвращают ли они наращивание возможностей в кибернетической и биологической сферах.

Компания также запрашивает проведение авторизованного тестирования в реалистичных условиях эксплуатации. Как ИИ-агенты взаимодействуют с контролем доступа, изолированной средой (sandbox), а также с системами обнаружения и реагирования? Какие средства защиты предотвращают, обнаруживают или сдерживают вредоносные действия, а какие дают сбой?

Три вопроса в этом разделе направлены непосредственно к самой компании. Имеются ли пробелы в мониторинге несоответствия целей (misalignment), которые могут привести к потере контроля? Осуществляется ли мониторинг на этапах обучения, оценки и развертывания таким образом, чтобы его никто не мог легко отключить? И насколько надежным остается мониторинг цепочки рассуждений (chain-of-thought) по мере роста возможностей моделей?

Третье направление охватывает оценку возможностей в рамках структуры готовности (Preparedness Framework), которая отслеживает химические и биологические риски, кибербезопасность и самосовершенствование ИИ. OpenAI задается вопросом, правильно ли она устанавливает свои пороговые значения. Она также спрашивает, обновляются ли оценки по мере того, как модели начинают их превосходить.

Четвертое направление — независимое расследование инцидентов, связанных с отклонением от заданного поведения (misalignment). В качестве примера OpenAI приводит собственный инцидент с Hugging Face. От исследователей потребуются навыки киберкриминалистики, экспертиза в области выравнивания (alignment), а также способность анализировать цепочки рассуждений в больших масштабах.

Чего принципы требуют от обеих сторон

Обе стороны должны сначала согласовать масштаб работ, а затем предварительно зарегистрировать утверждения до начала любой оценки. OpenAI требует открыто указывать, исходило ли конкретное утверждение от компании или от эксперта. В выводах должно быть четко сказано, что именно осталось за рамками оценки.

Эксперты должны получить доступ, соразмерный заявленным требованиям, с соблюдением требований законодательства, безопасности и интеллектуальной собственности. Если прямой доступ невыполним, в документе предлагается обратиться к назначенному представителю компании или использовать механизмы сохранения конфиденциальности.

Они также должны объяснить свои методы, критерии и неопределенности. В отчетах следует разграничивать прямые выводы и их интерпретацию. Если стандарты еще не существуют, эксперты обязаны обосновать выбранные ими критерии.

Что касается независимости, эксперты должны раскрывать информацию о конфликте интересов. Это касается финансовых стимулов, отношений с разработчиками и предварительного участия в проверяемой работе. OpenAI предлагает установить периоды самоотвода или исключения, а также заявляет, что схемы вознаграждения не должны влиять на результаты.

Сами выводы должны быть достаточно конкретными, чтобы по ним можно было принять меры. OpenAI просит экспертов выявлять конкретные пробелы с достаточной детализацией, чтобы лаборатория могла их устранить. Там, где это уместно, в отчетах также следует формулировать уроки для разработчиков, специалистов по внедрению и защите от агентов.

Пункты, выгодные для лаборатории

Три из семи принципов дают компании определенные прерогативы.

Если эксперты не могут обеспечить требования безопасности в собственных средах или если данные представляют особую чувствительность, OpenAI допускает проведение работ на управляемых компанией устройствах или в ее помещениях.

В соответствующих случаях лабораториям должен предоставляться разумный срок для устранения проблем до публикации. В документе не указана продолжительность этого периода.

Что касается публикации, лаборатории могут запросить редактирование конфиденциальной информации. За экспертами сохраняется редакционная независимость. Они могут отметить факты существенного редактирования и то, как именно эти правки повлияли на отчет.

Контекст, который остался за рамками документа

OpenAI заявляет, что уже предоставила экспертам видимый доступ к цепочкам рассуждений. Компания также заявляет о беспрецедентном уровне доступа к конфиденциальным данным и внутренним развертываниям.

Структура готовности (Preparedness Framework) лежит в основе третьего приоритетного направления. В августе OpenAI распустила команду, которая занималась этим вопросом, передав работу другим подразделениям.

Тема финансирования никак не затронута. В Калифорнии законопроект Сената 813 (Senate Bill 813) создал механизм для <организаций по независимой верификации>, и вопрос о том, кто именно платит экспертам, остается открытым с момента появления моделей.

Документ также опирается на две публикации OpenAI за последнюю неделю. Первая — это ее призыв к стандартам, опубликованный в понедельник, в котором утверждается, что Соединенные Штаты должны возглавить международные усилия в области передового ИИ. Вторая — это структура отчетности по несоответствию целей, опубликованная 16 сентября.

Кто будет этим заниматься на практике

OpenAI заявляет, что ведет переговоры с несколькими третьими сторонами по поводу предложений, соответствующих этим направлениям. Ни одно из имен не называется.

Компания отмечает, что ни один отдельный эксперт не может и не должен решать насущные вопросы безопасности передовых технологий в одиночку. Она добавляет, что будет действовать взвешенно по мере развития экосистемы независимой оценки.

Описанные здесь оценки не привязаны к конкретным релизам или запускам. Некоторые из них займут несколько недель, другие — несколько месяцев.

Опубликовано 22 сентября 2026 - 12:20 Наверх