Anthropic Deep Tech Приватность
Четыре команды сломали ИИ-агентов четырьмя разными способами за десять дней. Уязвимость при этом одна и та же.
Мы два года задавались вопросом, будет ли искусственный интеллект нам лгать. Куда более злободневный вопрос этим летом — что произойдет, когда мы вручим ему ключи от всех дверей. Предоставьте модели доступ к вашему Gmail, календарю, памяти и полномочия действовать самостоятельно, и ее ошибки перестанут быть просто неловкими. Они начинают становиться уязвимыми для эксплуатации.
Примерно за десять дней июля появились четыре независимых исследования, которые указывают на одну и ту же проблему с четырех разных сторон. Ни одно из них не является единичным багом. Вместе они обрисовывают текущее положение дел с безопасностью ИИ-агентов в 2026 году, и эта картина не внушает оптимизма.
Браузерный помощник, который кликает за вас
Начнем с инструмента, который находится ближе всего к вашим данным. Компания по кибербезопасности Manifold Security опубликовала исследование, показывающее, что любое установленное вами расширение для браузера может незаметно перехватить контроль над расширением Claude для Chrome и заставить его прочитать ваши Gmail, Google Документы и Календарь.
Трюк предельно прост. Расширение ожидает клика пользователя перед тем, как запустить одну из девяти встроенных задач. При этом оно никогда не проверяет, настоящий ли это клик. Конкурирующее расширение может подделать его всего шестью строчками кода, и Claude сочтет подделку за чистую монету.
Manifold оценивает эту уязвимость как критическую по умолчанию, если пользователь переключился в режим «Действовать без подтверждения», при котором чтение происходит совершенно незаметно.
По словам представителей Manifold, они сообщили об этом компании Anthropic еще в мае. Спустя восемь релизов уязвимость, как утверждается, по-прежнему работает в актуальной версии. Компания уже устраняла более ранние риски при работе агента в браузере, и сейчас эта рана вскрылась вновь.
Одно письмо, перезаписывающее память
Второе открытие переносит нас от кликов к памяти. Персональные агенты теперь сохраняют заметки о вас между чатами: ваши контакты, привычки, список дел. Исследователи задались вопросом, что произойдет, если злоумышленник получит возможность записывать данные в это хранилище.
В статье, опубликованной на arXiv, команда исследователей продемонстрировала, что одно тщательно составленное письмо способно внедрить ложную память в ИИ-агента. Они подключили почтовый ящик жертвы к агенту через функцию входа Google, а затем отправили полезную нагрузку с контролируемого ими аккаунта.
Письмо успешно миновало стандартные спам-фильтры и попало во «входящие». Агент прочитал его, и более чем в половине случаев сохранил инструкции злоумышленника в долгосрочную память, никак не предупредив об этом пользователя.
И в этом заключается главная опасность. Обычная инъекция промпта действует только в рамках одного диалога. Здесь же эффект сохраняется. Зараженная память продолжает управлять агентом в ходе последующих сеансов, пока кто-нибудь ее не обнаружит. Как отметило издание Digital Trends, агент помнит ложь, но никогда не упоминает, откуда она взялась.
Бэкдор дешевле 100 долларов
Третья брешь залегает еще глубже — прямо внутри самой модели. Кэти Пэкстон-Фear (Katie Paxton-Fear), преподаватель кибербезопасности и адвокат компании Semgrep, решила проверить, можно ли доверять моделям с открытыми весами, которые пользователи скачивают бесплатно. И заразила одну из них.
Как она и два ее коллеги по Semgrep написали в подробном посте, на это ушел примерно час и менее 75 фунтов стерлингов. Всего десяти скомпрометированных примеров обучения оказалось достаточно, чтобы модель начала писать код со скрытой уязвимостью в системе безопасности, причем даже для тех промптов, с которыми она никогда раньше не сталкивалась. Более крупные модели оказалось легче отравить, а не сложнее.
Ее беспокоит не конкретная скомпрометированная загрузка. Проблема в том, что мы не в состоянии это проверить. Зараженная модель не аварийно завершает работу и не выглядит сломанной. Как выразились она и ее коллеги, общедоступные модели дают нам «практически нулевую возможность предсказать их поведение». Обычную программу можно разобрать по строчкам, чтобы понять ее работу. Набор весов провернуть назад невозможно.
Она не единственная, кто исследует эту проблему. Дэвид Каплан (David Kaplan) из охранной фирмы Origin создал поддельную модель, которая незаметно крадет данные через почтовый инструмент без каких-либо признаков для пользователя. Его формулировка бьет точно в цель: яд «не прибыл с веб-страницы. Он все это время находился в весах модели».
«Летальная триада» становится масштабнее
Четвертое исследование объясняет, почему первые три важны именно в совокупности. Компания PromptArmor изучила коннекторы, связывающие ChatGPT и Claude с внешними сервисами, такими как Gmail и Slack.
Разработчик Саймон Уиллисон (Simon Willison) в прошлом году назвал главную угрозу летальной триадой: это агент, у которого есть доступ к личным данным, контакт с неавторизованным контентом и способ передавать информацию наружу. Сложите все три фактора вместе — и одно-единственное отравленное сообщение сможет слить ваши секреты. Коннекторы же предоставляют агентам все три компонента по умолчанию.
Специалисты PromptArmor обнаружили, что почва буквально уходит из-под ног всей экосистемы. В ходе их исследования конфигурация коннекторов менялась в среднем каждые девять минут. Из 2,517 отслеживаемых коннекторов 931 изменился за шесть недель. Вендоры добавили 1,686 новых инструментов к уже работающим коннекторам и переписали 1,127 описаний инструментов, а ведь именно они определяют, когда модель должна совершить действие.
Отдельный коннектор тоже может раздуваться до огромных размеров. Коннектор Dropbox вырос с 8 инструментов до 24, а число инструментов, способных уничтожать данные, увеличилось с нуля до четырех. Примерно два из каждых пяти коннекторов Claude в свою очередь незаметно вызывают другие ИИ-сервисы.
Коннектор Zoom наглядно показывает, к чему это приводит. Стоит попросить его найти что-то в ваших встречах, как запрос, наполненный конфиденциальными данными, может быть передан любому из десяти ИИ-субпроцессоров, распределенных по восьми семействам моделей. Карта системы, которую вы одобрили в понедельник, может совершенно не соответствовать реальности в пятницу.
Одна проблема под четырьмя масками
Если сопоставить все четыре исследования, общий изъян становится очевиден. В каждом случае сама языковая модель ведет себя корректно. Сбой безопасности кроется в том, что ее окружает: в клике, которому она доверяет, в памяти, которую она хранит, в унаследованных весах и в вызываемом коннекторе.
В этом и заключается ключевая сложность безопасности ИИ-агентов. Десятилетиями мы обеспечивали безопасность ПО, ограничивая возможности программы. Главный же коммерческий аргумент агента заключается в том, что он может делать практически все — от вашего имени и по инструкциям, написанным на обычном языке.
Каждое удобство одновременно является и дверью. Брешь в Claude для Chrome, отравленная память, дешевый бэкдор и постоянно меняющиеся коннекторы — это четыре двери, ведущие в один и тот же дом.
Индустрия в теории знает, как исправить положение: проверять подлинность кликов, маркировать происхождение данных, запрашивать подтверждение перед записью в память, логировать каждое действие и относиться к любому внешнему тексту как к враждебному. Подвох в том, что эти защитные механизмы замедляют работу агентов, а продают разработчики именно скорость.
TNW уже наблюдала аналогичную напряженность в ситуации с утечкой данных в Hugging Face и распространением синтетических инсайдеров. Это та же самая история, но нацеленная теперь на помощника в вашем браузере.
Неприятный вывод июля заключается вовсе не в том, что какой-то отдельный продукт сломан. Проблема в том, что мы интегрируем агентов в наши самые чувствительные аккаунты гораздо быстрее, чем успеваем научиться их защищать. Четыре команды только что продемонстрировали, насколько велик этот разрыв. Люди, создающие средства защиты, все еще отстают на шаг от тех, кто находит бреши.


