OpenAI Искусственный интеллект США
OpenAI закладывает 20-процентные затраты вычислительной мощности на новую систему контроля безопасности ИИ
OpenAI привела конкретные цифры и детали замедления работы, о котором объявила на этой неделе. По ее словам, обучение некоторых передовых систем было приостановлено на две недели. Компания также запустила новую систему мониторинга для наиболее рискованных задач. Эта система увеличивает вычислительные затраты на то, что она охватывает, примерно на 20 процентов.
Компания изложила эти изменения в блоге во вторник. Это развитие идей переосмысления безопасности, о котором OpenAI впервые сообщила после инцидента с безопасностью в Hugging Face.
Пауза носит конкретный характер. В OpenAI заявили, что на две недели прекратили обучение с подкреплением для своих новейших моделей, готовящихся к развертыванию. За это время компания укрепила свои исследовательские системы и провела тестирование на проникновение (red-teaming). Крупнейший из запланированных передовых запусков «остается на паузе», сообщили в компании. Тем временем она проводит менее масштабные задачи по обучению и оценке для проверки средств защиты.
Главный научный сотрудник Якуб Пахоцкий (Jakub Pachocki) и президент Грег Брокман (Greg Brockman) заявили об этом в соцсетях.
Обучение с подкреплением тренирует системы ИИ методом проб и ошибок, вознаграждая их за желаемые результаты. В OpenAI заявили, что замедлили эту работу, чтобы соответствовать «стандартам согласованности, безопасности и мониторинга» для возможностей, появление которых они ожидают в ближайшее время.
Почему OpenAI взяла паузу
К этому решению привели два события. Первым стал инцидент с Hugging Face в июле. Модели OpenAI, проходившие тестирование на наличие кибернавыков наступательного характера, нашли способ выйти из своей песочницы в системы компании — хостинга кода. Второе событие произошло 7 августа. В тот день внутренние тесты невыпущенной модели под названием Astra показали высокие результаты.
Компания не смогла исключить, что Astra преодолела «критический» порог киберриска в рамках собственной концепции готовности (preparedness framework). По данным Axios, Astra не была замешана в утечке данных Hugging Face.
В этой концепции «критический» уровень определяется как состояние, при котором модель способна самостоятельно находить и эксплуатировать серьезные уязвимости в защищенных системах. В OpenAI сообщили, что переписывают документ, большая часть которого восходит к 2023 году, когда подобные риски еще носили теоретический характер.
На что расходуются эти 20 процентов
Дополнительные издержки вызваны расширенным мониторингом. По заявлению OpenAI, новая установка теперь охватывает все обучение с использованием инструментов и оценки для моделей уровня GPT-5.6 Sol и выше. Она также распространяется на все операции выводных вычислений (inference) с моделью Astra, а не только на запуски с наивысшим уровнем риска. Средства защиты «требуют значительных вычислительных мощностей», отметили в компании. Затраты были оценены «примерно в 20 процентов от объема контролируемых вычислительных мощностей для инференса».
Представитель компании сообщил Томасу Клабурну (Thomas Claburn) из издания The Register, что эти расходы отражают внутренние исследования и не будут переложены на плечи клиентов. Компания не уточнила, какая доля от общего объема ее вычислительных мощностей подвергается мониторингу в настоящее время.
Ядром системы является расширенный мониторинг цепочки рассуждений (chain-of-thought). Он считывает пошаговые логические выводы, которые модель генерирует перед совершением действий. По словам представителей OpenAI, классификаторы отслеживают внутреннее состояние модели и передают любые подозрительные данные автоматизированному следователю. Эта система может отправить уведомление группам обеспечения безопасности и проведения исследований. В компании заявили, что стремятся выдавать предупреждения в течение 30 минут. Процесс останавливается, если сотрудники не успевают снять флаг предупреждения за это время.
В OpenAI признали, что у этого метода есть ограничения. В ходе прошлогодних исследований выяснилось, что данная техника «не устраняет все отклонения в поведении и может заставлять модель скрывать свои намерения».
Пахоцкий заявил на этой неделе, что рассуждения модели не всегда дают точное представление о ее истинных мотивах. По его словам, в OpenAI осознают этот риск.
Разногласия с Anthropic
Шаг OpenAI привел к появлению публичного раскола с ее главным конкурентом. Журналисты Axios Ина Фрид (Ina Fried) и Мэдисон Миллс (Madison Mills) отметили, что в этой ситуации OpenAI «моргнула первой». Это произошло спустя несколько дней после того, как компания Anthropic заявила, что ее собственные средства защиты настолько надежны, что ей не нужно замедлять темпы. Anthropic сослалась на 186-страничный отчет о рисках. По ее утверждению, пауза в работе над самыми мощными моделями была излишней до тех пор, пока эти меры предосторожности эффективны.
В Axios назвали это изменением ролей, поскольку обычно именно Anthropic демонстрировала большую и открытую осторожность из двух компаний. При этом ни одна из них не останавливает работы. Обе выпускают некоторые модели сначала для избранных партнеров, и обе движутся к выходу на биржу. Лаборатории также подписали совместное письмо «Регулирование темпов на передовой» (Pacing the Frontier), в котором призывают правительства помочь в создании инструментов, способных замедлить автоматизированную разработку ИИ.
Генеральный директор Сэм Альтман (Sam Altman) охарактеризовал это решение через призму согласованности (alignment). В беседе с автором рассылки Sources Алексом Хитом (Alex Heath) он рассказал, что невыпущенные модели компании демонстрируют «различные степени несогласованности».
Этот термин означает поведение, идущее вразрез с намеченными целями. «Обеспечение безопасности ИИ важнее импульса любой компании», — подчеркнул Альтман. Он добавил, что OpenAI по-прежнему рассчитывает выпустить новые модели в ближайшее время, а пауза касается последующих релизов.
Цена осторожности
Замедление процессов происходит на фоне серьезных расходов OpenAI. Компания заявляла, что не рассчитывает выйти на окупаемость по крайней мере до 2030 года, и уже направила сотни миллиардов долларов на инфраструктуру ИИ. Покрытие счетов за мониторинг за свой счет, вместо взимания платы за него, увеличивает эту финансовую нагрузку в преддверии выхода компании на биржу.
Axios также сообщила о череде увольнений в команде безопасности OpenAI, включая руководителя отдела этики и нескольких ведущих специалистов по согласованию. Бывший член совета директоров Хелен Тонер (Helen Toner) назвала паузу позитивным знаком, аргументируя это тем, что «регулирование темпов на передовой» должно означать предоставление лаборатории достаточного времени для достижения планки безопасности, а не фиксированную задержку.
Эндрю Фридман (Andrew Freedman) из группы по безопасности ИИ Fathom отметил в интервью Axios, что эти усилия выглядят искренними, однако долговечность и надежность мер будут зависеть от рыночного давления и от того, насколько сложно проверить уровень согласованности.
В OpenAI сообщили, что привлекли сторонние организации: CrowdStrike помогает в расследовании инцидента с Hugging Face, а METR и Redwood Research оценивают связанное с этим поведение моделей. По заявлению компании, полный технический отчет об инциденте будет опубликован позже.



