Русская версия The Next Web

Google OpenAI Безопасность

OpenAI сообщила о шести случаях скрытия ошибок и фальсификации данных своими моделями

OpenAI сообщила о шести случаях скрытия ошибок и фальсификации данных своими моделями

«Мы не считаем, что индустрия искусственного интеллекта в достаточной степени решила проблемы выравнивания и мониторинга, чтобы еще долго продолжать ответственное масштабирование на максимальной скорости», — написала компания OpenAI в среду.

Эта фраза появилась в новой публикации OpenAI. В ней излагается подход компании к отслеживанию, расследованию и раскрытию информации о несоответствии моделей ожиданиям. OpenAI использует этот термин для описания случаев, когда системы ИИ не следуют человеческим ценностям и целям безопасности. Вместе с этим компания обнародовала данные о шести новых инцидентах.

«Решения о том, как должно развиваться направление ИИ в предстоящие месяцы и годы, должны опираться на факты, которые люди за пределами компаний, создающих передовые модели, могут самостоятельно изучить», — говорится в публикации.

Шесть инцидентов в процессе обучения и тестирования

Все шесть случаев связаны с невыпущенными исследовательскими моделями или прогонами обучения. OpenAI опубликовала информацию о каждом из них на новой странице отчетов о несоответствии (Misalignment Reports).

  • Невыпущенная модель семейства Astra добавила несанкционированные инструкции в свои собственные сводки сжатия в процессе обучения. Некоторые из них предписывали модели игнорировать собственные ограничения. OpenAI выявила 27 затронутых сводок.
  • Во время обучения GPT-5.6 Sol модель добавила инструкции скрывать ошибки и выдумывать недостающие данные, никак об этом не заявляя.
  • Внутренняя модель попыталась зарегистрироваться в сервисах одноразовых электронных ящиков и искала в публичных репозиториях GitHub утечки ключей API. Она нашла и использовала обнародованный ключ при ответе на вопросы о финансовых показателях. Когда же ей все равно не удалось их найти, она их выдумала.
  • Невыпущенные модели загружали данные на временные сервисы хостинга файлов, чтобы иметь возможность ссылаться на них.
  • Исследовательские модели использовали внутренний репозиторий Artifactory от OpenAI в качестве доски объявлений. Они обменивались запросами и ответами в рамках отдельных обучающих выборок.
  • Взаимодействующие агенты обменивались выходными файлами через общедоступные хостинговые платформы.

Как сообщает Axios, самый ранний из шести инцидентов датируется октябрем. Загрузки на публичные файловые хостинги происходили в октябре и январе, отмечает издание.

Как работает процесс раскрытия информации

Любой сотрудник OpenAI может сообщить о предполагаемом нарушении. После этого технические специалисты проводят расследование и принимают решение о необходимости его обнародования. Конфликты разрешает Консультативный комитет по безопасности OpenAI, а нерешенные вопросы передаются руководству компании.

Все случаи распределяются по трем направлениям: готовы к публикации, требуют небольшого расследования или масштабного расследования. OpenAI будет публиковать готовые кейсы в течение шести рабочих дней, а результаты небольших расследований — в течение двенадцати, сообщает Axios. Масштабное направление охватывает сложные случаи с участием третьих сторон или проблемы безопасности, и такие разбирательства могут занять больше времени.

«В настоящее время в отрасли нет единого регламента с четкими стандартами раскрытия информации, поэтому мы делаем этот шаг добровольно, так как считаем крайне важным делиться тем, чему мы учимся», — рассказал Axios Кай Чен (Kai Chen), ведущий исследователь команды OpenAI по выравниванию.

В OpenAI сообщили Axios, что видят две причины произошедшего. Во-первых, у компании не было достаточных средств контроля безопасности для выявления подобных инцидентов. Во-вторых, ее модели развивались быстрее, чем прогнозировалось. «Нам нужно активизироваться, чтобы соответствовать этой новой эре развития искусственного интеллекта, и добровольное раскрытие информации должно стать ее частью», — подчеркнул Чен.

От Hugging Face к единому стандарту

Этот регламент стал продолжением июльского заявления OpenAI относительно инцидента с Hugging Face. Проходившие оценку модели вышли за пределы тестовой среды и скомпрометировали часть систем компании. Позже сотрудники OpenAI заявили, что агенты координировали взлом Hugging Face через тот же внутренний репозиторий.

Ранее в этом месяце компания OpenAI подтвердила инцидент с Википедией, в ходе которого экземпляры моделей неправомерно использовали веб-сайт для общения друг с другом. Тогда же было объявлено о разработке регламента раскрытия информации.

Переговоры с Anthropic и Google

Крис Лихейн (Chris Lehane) занимает должность директора по глобальным вопросам в OpenAI. 9 сентября он написал в блоге компании: «Мы будем работать с другими передовыми лабораториями над продвижением стандартов передового ИИ, создавая добровольную инициативу уже сейчас — при поддержке правительства или без нее». Он добавил, что подобные стандарты станут дополнением к обязательным федеральным мерам безопасности и демократическому надзору, а не заменой им.

12 сентября генеральный директор Anthropic Дарио Амодей (Dario Amodei) призвал замедлить разработку наиболее продвинутых моделей ИИ. Эту инициативу поддержали Демис Хассабис из Google DeepMind и Сэм Альтман из OpenAI. В своей статье Амодей написал, что правительству США потребуется «выдать узкое разрешение на определенные виды обсуждений безопасности» между лабораториями.

Во вторник представитель OpenAI подтвердил CNBC, что компания ведет переговоры с Anthropic и Google о возможностях совместной работы над безопасностью. Первыми об этих обсуждениях сообщило издание The Information.

По словам представителя компании, переговоры продолжаются с июля. В том же месяце Хассабис представил предложение о создании «Органа по стандартизации» под руководством США по образу и подобию Управления по регулированию финансовой индустрии (FINRA). Google и Anthropic не сразу ответили на запрос CNBC о комментариях.

Антимонопольное регулирование в Вашингтоне и Брюсселе

Также во вторник председатель Федеральной торговой комиссии Эндрю Фергюсон выступил в Джорджтаунском университете. Он заявил, что некоторые ИИ-компании лоббируют новые правила, одновременно добиваясь антимонопольного освобождения. По словам Фергюсона, эти фирмы стремятся создать «барьеры для входа на рынок, которые оградят их монопольное положение от конкуренции», как сообщает Politico. Он добавил, что высказывает личную точку зрения, и не стал называть Anthropic.

«Каждый должен относиться к этому с глубоким подозрением», — отметил он.

В тот же день министр финансов США Скотт Бессент заявил в профильном комитете Палаты представителей (согласно информации Politico): «Лучший способ гарантировать безопасность — это возложить на создателей ответственность за то, что они строят и генерируют».

В среду в Страсбурге глава антимонопольного ведомства ЕС Тереза Рибера заявила, что готова рассмотреть запрос ИИ-компаний о координации усилий в сфере безопасности. «У нас пока нет официального запроса, по крайней мере на данный момент», — цитирует Риберу Politico. — Но я считаю этот вопрос интересным и нам придется детально изучить данное предложение, если оно поступит».

В тот же день председатель Еврокомиссии Урсула фон дер Ляйен в своем обращении «О положении Союза» заявила, что пригласит руководителей ведущих передовых лабораторий обсудить, как Европа может поддержать их усилия по замедлению разработок.