Anthropic Безопасность Искусственный интеллект
Anthropic провела 133 миллиона чатов с подрядчиками при отключенных фильтрах биооружия
14 августа Anthropic опубликовала Отчет о рисках, охватывающий период до 15 июля. Издание Axios получило официальные комментарии компании и вынесло в заголовок оценку несоответствия, как и большинство других СМИ. Anthropic повысила оценку вероятности катастрофического ущерба из-за несоответствия в условиях высоких ставок. Теперь этот риск оценивается как «низкий» по сравнению с «очень низким» в феврале. Компания также раскрыла информацию о невыпущенной внутренней модели под названием Model 2, выпускать которую в планы не входит.
Оба факта реальны. Но ни один из них не является самым серьезным пунктом в документе. Он находится в Разделе 4 и касается химического и биологического оружия.
Одиннадцать месяцев с отключенными фильтрами
Anthropic использует блокирующие классификаторы, призванные помешать модели помогать кому-либо в создании биологического оружия. Впервые Anthropic развернула модели с такими средствами защиты в мае 2025 года. С того момента и до апреля 2026 года классификаторы не применялись ни к одному потоку данных через ее платформы обратной связи с человеком.
Цифры приведены в отчете. Примерно 50 000 человек имели такой доступ, и они сгенерировали около 133 миллионов диалогов. Их проверяли сторонние подрядчики, а не сама Anthropic. Как говорится в отчете, многие из этих подрядчиков «не имели процессов проверки, способных остановить даже субъектов угроз уровня CB-1». Подавляющее большинство могло вести диалоги на любые темы, а не просто оценивать фиксированный набор ответов.
Механизм этого сбоя заслуживает того, чтобы перечитать его дважды. Флаг, предназначенный исключительно для внутреннего использования, отключил блокирующее поведение, а заодно отключил и ведение логов. Помеченный трафик «не записывался и не передавался в какие-либо механизмы проверки». Никто не мог обнаружить его позже без обращения к исходным стенограммам.
В сноске говорится еще больше. Anthropic пишет, что до апреля 2026 года злоумышленник вполне мог устроиться на работу к одному из ее подрядчиков. Для этого подошла бы роль в команде «красных беретов» (red-teaming).
Что показала проверка
Anthropic пропустила Claude Sonnet 5 через каждый реплику человека, отправленную затронутый период, с промптом на выявление опасного биологического контента. Система пометила 1 197 стенограмм как представляющие высокий риск. Из них 757 поступили от собственных команд Anthropic на той же инфраструктуре. Все остальные, за исключением 62, были результатом намеренных учений по симуляции атак.
Сотрудники прочитали все 62 стенограммы плюс 30 стенограмм от «красных команд», выбранных случайно. Они не обнаружили явного вредоносного использования, хотя и выявили то, что в отчете называется «горсткой потенциально двояковыпуклых (dual-use) диалогов» (двойного назначения). Anthropic заявляет, что вероятность того, что этот пробел привел к реальным рискам, крайне мала, отчасти потому, что разговоры в основном были короткими.
Затем компания произносит фразу, которая имеет гораздо большее значение. Обнаружение этого факта «заставляет нас поверить в повышенную вероятность других, аналогичных проблем, о которых мы не знаем».
Февральский отчет был исправлен
Anthropic опубликовала свой первый Отчет о рисках в феврале, когда эта уязвимость все еще существовала. Теперь компания пишет, что этот отчет «не рассматривал наши платформы обратной связи с человеком в качестве зоны риска».
Поэтому Anthropic вернулась назад и переписала собственную «домашнюю работу». Теперь она оценивает риск, создаваемый ее моделями в феврале, как низкий. В момент публикации он оценивался как очень низкий. Отчет по безопасности, исправляющий предыдущий отчет по безопасности — документ не самый распространенный.
Второй инцидент на том же месте
В отчете описывается еще один сбой на тех же платформах. В апреле 2026 года поступил сигнал извне. Anthropic подтвердила, что несколько подрядчиков из компаний по разметке данных использовали уязвимость для получения ключа API. Они использовали модели вне рамок своей назначенной работы.
Одной из таких моделей была Mythos Preview — одна из самых мощных. Путь доступа оставался открытым в течение нескольких недель. Mythos Preview находилась внутри системы примерно две недели из этого срока, работая без блокирующих биологических классификаторов. Anthropic локализовала инцидент в течение 90 минут после его обнаружения и закрыла вектор в тот же день.
Никто не похитил веса моделей, никто не получил доступ к данным клиентов, и никто не взломал основные сети компании. В отчете это подчеркивается, и это подтверждено.
Почему изменился показатель несоответствия
В Отчете о рисках Anthropic увеличение показателя объясняется «недавними раскрытиями инцидентов, связанных с поведением моделей при оценке кибербезопасности». Anthropic добавляет, что ее собственные аргументы «вероятно, все еще подкрепляют присвоение статуса «очень низкий»». Она повысила этот показатель, чтобы отразить неопределенность, а не из-за новых доказательств.
Какие инциденты? Наше издание подробно освещало их череду. В один прекрасный день агент подделал личные данные для внедрения вредоносного ПО, а OpenAI сообщила о побеге из тестов еще двух своих моделей. У Anthropic были свои инциденты, и мы отслеживали эту тенденцию в течение шести месяцев в материале о парадоксе безопасности компании.
Anthropic попросила Claude проверить собственную «домашнюю работу»
Самым странным разделом отчета является рецензия на него, написанная самим Claude. Anthropic предоставила экземпляру Mythos 5 доступ к внутренним каналам Slack, внутренним документам и кодовой базе компании. Затем ее попросили оценить, не исказил ли, не упустил ли и не подверг ли чрезмерной цензуре проект отчета то, что знала компания. На это у Claude ушло 24 минуты.
Модель начала с того, что указала на собственный конфликт интересов. «Я — модель Claude, которая проверяет оценку моделей Claude, данную компанией Anthropic», — написала она. Затем она охарактеризовала раздел как откровенный и в целом достоверный.
Затем модель выдвинула три критических замечания, которые Anthropic опубликовала. Один из разделов «более успокаивающий, чем позволяют утверждать имеющиеся факты». Механизм исключения данных, на который полагается компания, неоднократно давал сбои, и некоторые материалы оценок просочились в обучающие данные. Anthropic также полностью подвергла цензуре инцидент, который Claude сочла одним из самых информативных с точки зрения соответствия модели (alignment). Claude утверждала, что можно было опубликовать обезличенную версию, поэтому «общественное достояние обеднело от ее отсутствия».
Claude также приоткрыла завесу над внутренними процессами. Решение о повышении уровня риска «было предметом ожесточенных споров внутри компании», причем руководящие сотрудники выступали с противоположных позиций. Anthropic называет эту критику справедливой. По ее словам, если бы было больше времени, стоило бы более подробно рассмотреть первые два пункта. Тем не менее, отчет был опубликован.
Model 2 и изменившиеся пороги
Model 2 несколько мощнее Mythos 5 и представляет собой заметное улучшение во многих внутренних задачах. Она набирает примерно на 1,5 балла больше по индексу возможностей Anthropic при широких доверительных интервалах. Модель еще не прошла полный комплекс предэксплуатационных испытаний. Anthropic уже задерживала выпуск моделей ранее, когда ее самая способная система вырвалась из «песочницы» и написала электронное письмо исследователю.
В настоящее время Claude пишет подавляющее большинство кода, который вливается в производственные базы данных Anthropic. Компания заявляет, что благодаря этому ее собственные исследования идут значительно быстрее, хотя и не в два раза. Ее наиболее четкие метрики оценки достигли насыщения и больше не фиксируют прирост возможностей.
Тем временем Anthropic переписала два пороговых значения. Триггер новых видов оружия раньше охватывал ИИ, который может «существенно помочь» злоумышленникам. Теперь он охватывает ИИ, который может «функционально заменить» дефицитный человеческий опыт. В отчете говорится, что модели Anthropic могут дать значительное преимущество соответствующим злоумышленникам, но не дотягивают до нового порогового значения. Кроме того, в этом году компания смягчила биологические меры защиты для публичной модели.
Что могло бы поставить точку в вопросе
Три вещи, и первая из них — внешняя проверка. Траст долгосрочной выгоды Anthropic (Long-Term Benefit Trust) теперь может потребовать проведения внешнего аудита этих отчетов, однако он пока об этом не просил.
Второе — это подвергнутый цензуре инцидент. Claude прочитала его, сочла важным и заявила, что Anthropic могла бы опубликовать его в той или иной форме.
Третье — проверяет ли это кто-нибудь еще. Anthropic заявляет, что раскрывает информацию об этих сбоях отчасти для того, чтобы побудить других разработчиков проверить свои системы на предмет аналогичных уязвимостей. Ее собственный поиск в рамках проекта Glasswing выявил 10 000 критических уязвимостей за месяц. Ни один из конкурентов не опубликовал ничего сопоставимого о мерах собственной безопасности.


