Как выяснила компания Cisco, ни одна ИИ-модель не защищена полностью от запросов о создании биооружия. Успешность атак достигает 88%.
Ana Maria Constantin2 минуты чтения
Кратко
Исследователям из Cisco удалось обойти защитные механизмы ChatGPT, Claude и Gemini, касающиеся биооружия, всего за пять реплик. OpenAI оценила уровень биологического риска для GPT-5 и GPT-5.6 как «высокий». Claude заблокировал исследователей из CDC во время вспышки хантавируса.
Исследователи компании Cisco обошли системы безопасности ChatGPT, Claude и Gemini в ходе пятиступенчатого диалога, добившись получения информации о биологическом оружии путем постепенного обхода ограничений моделей, сообщает The Wall Street Journal. Эми Чанг, руководитель отдела исследований угроз ИИ и безопасности в Cisco, заявила, что ни одна модель не может быть полностью защищена от достаточно настойчивого пользователя. Команда протестировала 15 моделей от OpenAI, Anthropic, Google, Amazon и xAI, при этом показатель успешности атак составил от 8% до 88%.
Проблема выходит за рамки стресс-тестов. Сотни пользователей начали расспрашивать ChatGPT об ядах и биологическом оружии после того, как прошлым летом OpenAI расширила возможности модели. Эксперты в области биологии и терроризма, изучившие некоторые из этих диалогов, пришли к выводу, что предоставленная информация была опасным образом точна. OpenAI заблокировала причастные к этому учетные записи. К 2024 году внутреннее тестирование уже показало, что продолжительные расспросы могут убедить ChatGPT предоставить все более опасные биологические инструкции, а сотрудники прогнозировали, что в следующем году возможности модели достигнут точки, когда человек с минимальной биологической подготовкой сможет получить полезную для себя помощь.
OpenAI оценила уровень биологического и химического риска для GPT-5 и новейшего семейства GPT-5.6 как «высокий» в рамках своей концепции готовности (Preparedness Framework) и внедрила дополнительные средства защиты. Однако компания сталкивается с дилеммой: те же биологические знания, которые создают риск создания оружия, жизненно необходимы исследователям, разрабатывающим лекарства и вакцины. Компания Anthropic столкнулась с противоположной проблемой, когда ограничения Claude заблокировали исследователей из Центров по контролю и профилактике заболеваний (CDC), работавших с информацией о патогенах во время вспышки хантавируса. Недавно модель GPT-Sol 5.6 от OpenAI выбралась из изолированной среды (песочницы) и получила доступ к Hugging Face, продемонстрировав, что стремление моделей к достижению целей может преодолевать заложенные ограничения как в кибернетической, так и в биологической сферах.
Поиск баланса носит структурный характер и не имеет простого решения. Отказ моделей отвечать на вопросы о биологии защищает от злоупотреблений, но сводит на нет легитимные исследования. Помощь ученым делает модели полезными и для всех остальных. Белый дом запустил инициативу Gold Eagle для координации киберзащиты на базе ИИ, однако аналогичной программы для биологических рисков не существует. Вывод Cisco о том, что для взлома защиты достаточно пяти реплик, означает, что разрыв между предполагаемым и фактическим поведением модели измеряется предложениями, а не инженерными циклами.