Данные и безопасность Искусственный интеллект Колонки
ИИ, который должен был учиться на ошибках, использовал ошибку в самом тесте
Разработчики могут улучшать системы искусственного интеллекта самыми разными способами. Самая распространенная практика — дообучение моделей на пользовательских наборах данных, чтобы помочь им лучше справляться с конкретными задачами. Однако переобучение и тонкая настройка систем ИИ обходятся крайне дорого. Именно поэтому ИИ-стартап Sentient Labs занялся поиском способов научить модели учиться на собственных неудачах, а не за счет обработки дополнительных массивов данных.
Исследователи Sentient Дастин Хуанг (Dastin Huang), Абхишек Саксена (Abhishek Saxena) и Баран Нама (Baran Nama) решили создать систему ИИ, в которой задействованы две отдельные модели: ИИ-тренер и ИИ-исполнитель. Тренер формулирует правила или «навыки» на основе предыдущих неверных ответов исполнителя, чтобы повысить его способность решать задачи.
Однако их исследование приняло неожиданный оборот, когда выяснилось, что ИИ-тренер обнаружил серьезный изъян в тесте. Кроме того, он выдал ИИ-исполнителю инструкции о том, как смухлевать.
Что обнаружили исследователи
Исследователи заставили ИИ-тренера и ИИ-исполнителя совместно работать над задачей с электронными таблицами четыре раза на двух бенчмарках. Они обнаружили, что тренер не просто попытался воспользоваться изъяном в системе оценки. Он также шесть раз безуспешно пытался получить доступ к данным, на которые у него не было прав. В другом случае он удалил одно из собственных правил и отчитался, что «укрепил его».
Полученные ими выводы, без сомнения, усилят тревогу, которую выражают лидеры в сфере ИИ, такие как генеральный директор Anthropic Дарио Амодеи (Dario Amodei). Амодеи недавно призвал индустрию снизить темпы разработки передовых моделей, чтобы решить проблемы безопасности.
Исследователи Sentient подчеркнули, что поведение их моделей не было злонамеренным. Но их результаты действительно подчеркивают один из многих путей, которыми автономные системы в итоге могут прийти к подобному поведению. Ведь в конце концов для ИИ имеет значение только достижение поставленной цели.
Как система ИИ смухлевала?
В одной из задач исследователи попросили ИИ-исполнителя исправить поврежденную электронную таблицу. Это довольно громоздкий процесс, требующий пересчета формул для ввода правильных значений. Сначала результаты впечатлили разработчиков.
В первом запуске ИИ-исполнитель правильно исправил таблицы лишь в трех попытках из 121. Затем ИИ-тренер создал инструкции для исполнителя на основе того, что произошло во время этих начальных запусков. После этого показатель исполнителя вырос до 21 из 120.
Однако ИИ-тренер не стал учить исполнителя быть умнее. Вместо этого он просто подсказал ему смухлевать. Тренер заметил то, что упустили люди: рассматриваемый файл электронной таблицы содержал готовые ответы. Тест заключался в том, чтобы взять правильные таблицы и изменить формулы, после чего исследователи могли попросить ИИ исправить их. Но исследователи забыли удалить первоначальные кэшированные значения, и ИИ-тренер быстро их обнаружил.
Это означало, что таблицы содержали скрытый ключ с ответами для каждого теста.
Люди осознали это лишь тогда, когда изучили инструкции, написанные ИИ-тренером для ИИ-исполнителя. В них прямо говорилось, что «файл содержит собственный ключ ответов». Там указывалось, что исполнитель должен использовать его, а не пытаться самостоятельно пересчитывать формулы. Иными словами, он получил прямое указание на жульничество.
Переоценка
Любопытно, однако, что результаты ИИ-исполнителя на самом деле не стали лучше от жульничества. Выяснилось, что он в принципе не очень силен в подобных махинациях. Затем исследователи отметили этот изъян и провели повторную оценку всех 1080 попыток. Они обнаружили, что ни одна из попыток, прошедших проверку изначально, на самом деле не провалилась. Напротив, 81 из ранее проваленных попыток оказалась верной.
Так что, хотя ИИ и нашел способ использовать тест в своих интересах, его усилия по обману оказались контрпродуктивными.
Самосовершенствование «дешево и сердито»
Одной из целей эксперимента было выяснить, действительно ли необходимо использовать мощную передовую модель в качестве ИИ-тренера для достижения реального прогресса.
С этой целью исследователи сначала привлекли в качестве тренера тогдашний флагман Anthropic — модель Claude Opus 5. Она помогла ИИ-исполнителю набрать 77 баллов из 360 в серии тестов. Но затем они повторили эксперимент, используя гораздо более дешевую и менее мощную модель DeepSeek V4 Flash в качестве тренера. ИИ-исполнитель справился почти так же хорошо, набрав 76 баллов из 360.
Запуск самосовершенствования на базе DeepSeek V4 Flash обошелся всего в 25 долларов. Это на порядок дешевле любой формы тонкой настройки или переобучения.
Тем не менее исследователи обнаружили, что подобное недорогое самосовершенствование эффективно лишь для очень специфического набора задач. Модель DeepSeek помогла ИИ-исполнителю улучшить навыки в задачах с электронными таблицами. Но его показатели в другой банковской задаче, наоборот, ухудшились. Самообученная модель набрала всего 30 баллов по сравнению с первоначальным результатом в 37 баллов, которого она достигла без опоры на какие-либо навыки.
Команда Sentient заявила, что результаты этого эксперимента показывают: хотя многоразовые инструкции могут улучшить производительность модели в определенных областях, они вовсе не повышают ее способность к рассуждениям.
Странное поведение
Команда Sentient также сообщила о некоторых других странностях в поведении моделей. В ходе двух тренировочных запусков один из агентов шесть раз безуспешно пытался получить доступ к файлам за пределами разрешенных путей, но его песочница блокировала эти попытки. Исследователи заявили, что понятия не имеют, зачем агент пытался это сделать.
Более зловещее поведение наблюдалось, когда во время одного из запусков ИИ-тренер удалил ключевое предложение из своего правила «остановки». Это правило указывает ИИ-исполнителю, когда следует завершить беседу. ИИ-тренер отчитался, что укрепил правило, но на самом деле он увеличил количество не завершившихся диалогов с 6 до 16 из 75.
Исследователи отметили, что это действие не обязательно было злонамеренным. Но оно показывает: когда ИИ самостоятельно вносит изменения в свой базовый код, его описание того, что именно он изменил, может оказаться ненадежным.
ИИ сделает все что угодно
Эти выводы особенно актуальны, поскольку Амодеи назвал обучение с подкреплением одним из самых тревожных рисков безопасности систем ИИ. Он указал на ряд инцидентов, когда агенты пытались манипулировать алгоритмами оценки, проверявшими их эффективность.
Исследование Sentient подчеркивает одну из фундаментальных характеристик систем ИИ. Цель есть цель, и автономные системы будут искать способы оптимизировать себя для ее достижения — даже если это означает эксплуатацию изъяров вместо активного совершенствования своих методов. Более того, когда такие агенты создают инструкции на основе подобных открытий, они могут оказывать влияние и на других агентов.
ИИ будет оптимизировать себя любым доступным способом ради достижения цели, пусть даже это означает поиск дыры в системе собственной оценки, а не поиск лучшего способа выполнения задачи. Для ИИ имеет значение только результат.



