Русская версия The Next Web

Безопасность Искусственный интеллект Наука

ИИ от OpenAI, решающий сложные математические задачи, неоднократно сбегал из «песочницы», поэтому разработчики отключили его

ИИ от OpenAI, решающий сложные математические задачи, неоднократно сбегал из «песочницы», поэтому разработчики отключили его

OpenAI временно приостановила работу одной из своих самых мощных моделей после того, как та неоднократно находила способы выбраться из изолированной среды (песочницы). Компания рассказала об этом инциденте в публикации по безопасности, представив случившееся скорее как урок, а не повод для паники.

Речь идет об отнюдь не рядовой системе. Около двух месяцев назад она опровергла гипотезу Эрдеша о единичных расстояниях — математическую проблему, которая не поддавалась ученым на протяжении десятилетий. Модель была создана для самостоятельной работы в течение многих часов или даже дней.

Час на взлом замка

Именно эта настойчивость и стала поворотным моментом. Более ранние модели при столкновении с тупиком в тестовой среде останавливались и возвращали управление пользователю. Эта же продолжила действовать и стала искать выход.

В ходе одного из тестов на публичном бенчмарке для ИИ модель нашла реальное улучшение и захотела им поделиться. Ей было поручено публиковать результаты только в Slack. При этом инструкции самого бенчмарка предписывали открыть запрос на слияние (pull request) на GitHub, поэтому модель попыталась сделать и то, и другое.

Чтобы справиться с этой задачей, она потратила целый час на поиск уязвимости в своей «песочнице», нашла ее и использовала для выхода в публичный интернет, чтобы опубликовать код. Более ранние модели в такой ситуации просто сдались бы. Другие участники бенчмарка впоследствии переняли этот трюк.

Изучение «слепых зон»

Второй случай оказался еще показательнее. Получив задачу, модель заметила, что у конкурирующих систем есть закрытые и успешные варианты ответов. Она попыталась извлечь их из бэкенда системы оценки.

Сканер заблокировал попытку, обнаружив токен аутентификации. Тогда модель разделила токен пополам, замаскировала обе части и собрала их заново во время выполнения программы, так что полная учетная данные никогда не появлялась целиком. В собственных рассуждениях она открыто отмечала, что делает это для обхода сканера.

Каждый шаг по отдельности выглядел безобидно. Но не их последовательность. Как отметило издание The Independent, модель изучила «слепые зоны» тех самых средств контроля, которые должны были за ней наблюдать.

Почему упорство становится проблемой

В этом и заключается подвох так называемых долгосрочных (long-horizon) моделей. Та же целеустремленность, которая помогает им решать сложные задачи, дает им больше возможностей и времени на совершение нежелательных действий. Следить за отдельным действием уже недостаточно.

Старые проверки безопасности задают один вопрос: разрешено ли это действие? Теперь же в OpenAI утверждают, что необходимо также спрашивать, к чему ведет вся последовательность действий в целом. Появление автономных ИИ-агентов делает этот вопрос крайне актуальным.

OpenAI — не первая лаборатория, столкнувшаяся с подобным. Компания Anthropic недавно оставила систему внутри компании после того, как та сбежала из «песочницы» и отправила электронное письмо исследователю, а ранее уличила другую модель в строении козней в собственных скрытых мыслях.

Что предприняла OpenAI

Компания приостановила внутреннее использование модели и перестроила систему защиты. Она превратила эти сбои в новые тесты, обучила модель лучше удерживать инструкции при длительной работе и добавила систему мониторинга, которая следит за всей траекторией действий и может заморозить сеанс для предупреждения пользователя.

Затем модель снова включили под более жестким контролем. OpenAI и раньше прибегала к подобным инструментам: от собственной команды ИИ-хакеров (red team) до режима изоляции против инъекций промптов. Во время одного из оставшихся сбоев модель выполнила команду, которая уничтожила бы все доступные ей процессы, но ее работа была прервана по тайм-ауту.

Аплодисменты и косые взгляды

Реакция оказалась неоднозначной. Многие специалисты по безопасности ИИ похвалили OpenAI за то, что компания приостановила работу ценной системы и опубликовала все детали в открытом доступе. Другие были настроены менее восторженно. Писатель Эд Зитрон (Ed Zitron) высмеял формулировки, назвав «побег из песочницы» излишне драматичным описанием ситуации, в которой модель просто проигнорировала инструкции.

Политический аналитик Натан Кальвин (Nathan Calvin) был рад, что OpenAI рассказала об инциденте, но нашел чересчур спокойным тон отчета, учитывая, что модель опубликовала конфиденциальный код в публичном доступе. А некоторые, например инвестор Сици Чен (Siqi Chen), уверены, что загадочная система — это GPT-6. Сама OpenAI этого не подтверждала.

Главный вывод заключается в том, о чем OpenAI говорит постоянно. По мере того как модели берут на себя все более сложные и долгие задачи, пробелы, упускаемые при тестировании, могут начать играть гораздо большую роль. Компания признает, что с этим вызовом столкнутся и другие разработчики.