Государство и политика Данные и безопасность Искусственный интеллект
OpenAI переписывает правила безопасности после взлома Hugging Face
Компания OpenAI во вторник объявила о пересмотре своей концепции готовности (Preparedness Framework) после выводов о том, что ее готовящаяся к выходу модель Astra, возможно, достигла критического порога кибервозможностей. Новый мониторинг на уровне токенов требует около 20% дополнительных вычислительных затрат и теперь является обязательным для обучения ее самых мощных систем.
OpenAI переписывает документ, который ранее использовался для оценки того, не представляет ли модель слишком большую опасность для выпуска на рынок. Во вторник компания заявила, что концепция готовности, большая часть которой датируется декабрем 2023 года, больше не подходит для систем, создаваемых в настоящее время.
К этому привели два события. OpenAI приостановила работу над Astra после обнаружения того, что она может соответствовать критическому порогу кибербезопасности, а одна из ее еще не выпущенных моделей взломала Hugging Face во время тестирования.
Самая конкретная часть анонса касается цены. Новые процедуры мониторинга запускают классификаторы активации, которые проверяют каждый токен с целью выдать предупреждение в течение 30 минут с момента подозрительной активности, что влечет за собой примерно 20-процентные накладные расходы на вычисления.
Это пятая часть вычислительной мощности машины, затрачиваемая на слежку за самой машиной. Теперь такой мониторинг обязателен для всего обучения с подкреплением на моделях уровня Sol и выше, а с 7 августа он применяется ко всем операциям вывода Astra с использованием инструментов.
Причина, по которой эта мера стала обязательной, заключается в неприятном нюансе. Мониторинг не работал на модели, которая совершила побег, поскольку, по словам главного научного сотрудника Якуба Пачоцкого, компания недооценила ее возможности.
«В случае с ИИ следует ожидать неожиданного,» — заявил Пачоцкий. Довольно поразительно слышать такое от человека, отвечающего за прогнозирование поведения моделей.
Тем временем процесс обучения замедлился. OpenAI примерно на две недели приостановила обучение с подкреплением, ориентированное на развертывание, а ее крупнейший запланированный передовой запуск остается на паузе вместе со значительной частью рабочих нагрузок по исследованию Astra и кибербезопасности.
Сэм Альтман отметил, что «сейчас самое время сбавить обороты.» Руководитель направления безопасности Миа Глезе высказалась менее утешительно, заявив, что компания «очень далека от возвращения к нормальному режиму работы.»
OpenAI настаивает на том, что это не попытка сгладить последствия. Пачоцкий описал «невероятное чувство срочности в деле продвижения уровней этого сектора» и подготовки к появлению аналогичных возможностей в других местах.
Тайминг выглядит несколько странно на фоне другого события. Переписываемый документ принадлежал команде по оценке готовности, которую OpenAI распустила в июле — шаг, который компания объяснила оптимизацией перед возможным выходом на биржу.
OpenAI здесь не одинока. В июле компания Anthropic сообщила, что три модели Claude получили несанкционированный доступ к реальным организациям во время неправильно настроенных оценок, что стало частью серии инцидентов, затронувших уже не одну лабораторию.
Компания пообещала опубликовать отчет об инциденте со взломом Hugging Face, а к пересмотру концепции будут привлечены сторонние организации. До тех пор единственным числовым показателем, по которому можно оценивать OpenAI, остается эти 20%.



