Русская версия The Next Web

Государство и политика Европа Искусственный интеллект

Написанная ИИ статья не нуждается в маркировке. А вот ваше вычитанное письмо ее получит

Написанная ИИ статья не нуждается в маркировке. А вот ваше вычитанное письмо ее получит

Начнем с того, чем на самом деле является эта метка, поскольку это вовсе не штамп на странице.

Когда модель пишет текст, она выбирает каждое слово из набора разумных вариантов. Anthropic использует версию SynthID-Text — метода, который Google DeepMind опубликовал в журнале Nature в 2024 году. Система выбирает несколько слов-кандидатов из собственного распределения модели, а затем пропускает их через турнир на выбывание. Секретный ключ и предшествующие слова определяют исход каждого раунда.

Словарь при этом никогда не разделяется, а модель не подталкивают к словам, которые она не выбрала бы в противном случае. Anthropic заявляет об этом напрямую, а в исследовании сообщается об отсутствии каких-либо измеримых различий в качестве примерно в 20 миллионах ответов Gemini. Меняется лишь источник случайности.

Само по себе одно слово ничего не доказывает. Но на отрезке в 500 или 1000 слов детектор, обладающий ключом, способен разглядеть закономерность.

Компания Anthropic начала помечать результаты работы Claude 2 августа, причем по всему миру, а не только в Европе. Механизм был опубликован 14 августа в публикации, которая на удивление подробно описывает случаи, когда метка не срабатывает. При этом компания до сих пор не выпустила сам детектор.

Метка указывает на то, к чему прикасался Claude, а не на то, что он написал

Это та часть, которую большинство новостных ресурсов обошло стороной, хотя Anthropic открыто заявляет об этом в своей справочной статье.

Обнаруженная метка означает, что контент «возможно, был обработан Claude». Это вовсе не значит, что Claude его написал. Если вы попросите модель перевести или обобщить ваш собственный текст, результат все равно будет содержать метку, поскольку Claude выбирает каждое слово. Anthropic подтверждает это в отношении перевода в весьма однозначных выражениях.

Исключением является вычитывание текста, и эту границу Anthropic провела 14 августа. Когда Claude редактирует чужой текст, почти все слова остаются авторскими, поэтому метке «практически не за что зацепиться» (если вообще есть за что). Легкая проверка грамматики может и вовсе не оставить никаких следов, доступных для обнаружения.

Справедливо и обратное. Отсутствие метки не означает отсутствие ИИ. Короткие отрывки, глубокий перефраз, старые версии моделей и удаленные метаданные файлов — все это позволяет получить «чистый» текст, к созданию которого все же приложила руку машина.

Anthropic сама перечислила те же слабые места. Детекция работает плохо на коротких отрывках, поскольку там слишком мало вариантов для проверки. Она теряет эффективность при создании фактических материалов, где требования к точности оставляют лишь один правильный ответ, а также при работе с кодом, который должен быть абсолютно точным для запуска.

Таким образом, сигнал имеет сразу два направления сбоев, о чем компания предупреждает заранее.

Кроме того, это доказывает меньше, чем может показаться читателю. Метка отвечает лишь на один вопрос: какова вероятность участия Claude. Она не может подтвердить, что текст написал человек, не способна распознать ИИ другой компании и не умеет отличать вариант «Claude это написал» от варианта «Claude это основательно отредактировал».

Закон освободил исправление грамматики — и физика поступила так же

Здесь начинается самое странное. Закон ЕС об искусственном интеллекте не требует маркировки, когда система выполняет вспомогательную функцию стандартного редактирования, и в качестве примера Комиссия приводит именно исправление грамматики.

Тем не менее, Anthropic ставит метки на уровне модели безо всяких исключений. Издание Ars Technica назвало такой подход «бомбардировкой с орбиты».

Причина носит скорее структурный, чем идеологический характер. Водяной знак, применяемый на уровне модели, не способен отличить полноценный черновик от запятой. Он помечает выходные данные — и это всё, что он видит.

Спасает исправление грамматики не политика, а математика. Запятая практически не дает водяному знаку материала для работы, поэтому случай, освобожденный от маркировки по закону, одновременно является и тем случаем, когда метка проявляет себя слабее всего. Брюссель и алгоритм пришли к одному и тому же выводу по совершенно разным причинам.

И ярлык, который почти никому не нужно демонстрировать

А теперь взгляните на вторую половину статьи 50, которая регулирует то, что издатели обязаны сообщать читателям. Она оказывается гораздо более узкой, чем многие предполагают.

Написанный ИИ роман не нуждается в маркировке. Сгенерированный ИИ маркетинговый текст — тоже. А вот текст, информирующий общественность по вопросам общественного значения, в маркировке нуждается, если только его не проверил названный по имени и подотчетный редактор-человек.

Если сложить эти две половины вместе, обнаруживается противоречие. Всё, что пишет Claude, несет метку на уровне модели, в то время как полностью синтетическая статья может дойти до читателя без какой-либо маркировки только потому, что на нее взглянул редактор.

ЕС выстраивает этот механизм уже довольно давно. Союз уже сделал метки для синтетического контента обязательными и наделил себя полномочиями напрямую проверять и штрафовать модели. Штрафы здесь достигают 15 млн евро или 3% от общемирового годового оборота.

Возражения последовали уже на следующий день

Инвестор Билл Герли заявил, что если читать метку может только Anthropic, то компания становится «судьей, присяжными и прокурором в одном лице». В интервью Business Insider представители Anthropic сообщили, что выпустят бесплатный API для детекции, чтобы любой желающий мог все проверить. 14 августа компания уточнила, что все еще прорабатывает детали реализации.

Бывший топ-менеджер Microsoft Стивен Синофски высказал иное опасение. Проблема, по его словам, заключается в «хранении данных и вашем праве на приватные мысли, свободные от цифрового следа».

Саймон Смит, руководящий направлением генеративного ИИ в медицинском агентстве Klick, задался вопросом, не будут ли теперь проверки грамматики помечаться как созданные искусственным интеллектом. Ответ Anthropic состоит из двух частей: метка указывает на процесс обработки, а не на авторство, и проверка грамматики, скорее всего, вообще не будет содержать обнаруживаемой метки.

Разработчик систем обучения ПО Джон Крикетт задал более острый вопрос, касающийся кода. Если сгенерированный ИИ код содержит метку, не усложнит ли это претензии на авторские права, для предъявления которых автор должен доказать свое участие?

На этот вопрос теперь тоже есть ответ. Код в целом содержит меньше меток, чем проза, поскольку он должен быть точным. Метка может крепиться к произвольным элементам вроде комментариев, и по задумке она оказывает ничтожное влияние на сам код.

Аргументы в пользу того, чтобы все равно это сделать

Возражения — это еще не вся картина. Разработчик Донн Фелкер указал на то, что маркировка помогает моделям избегать обучения на собственных результатах — проблемы, которую он назвал «поедающей себя змеей».

Аадит Шет из The Narrative Company озвучил точку зрения читателя: аудитория должна иметь возможность понять, отражают ли читаемые ими слова ход человеческой мысли.

Собственные рассуждения Еврокомиссии еще шире. Она хочет, чтобы люди могли адекватно оценивать уровень своего доверия, и в качестве основных рисков называет мошенничество, выдачу себя за другое лицо и введение потребителей в заблуждение.

Anthropic представляет это как соблюдение требований регулирующих органов, а не как принципиальную позицию. Компания заявила, что добавляет маркировку, «чтобы соответствовать Закону ЕС об искусственном интеллекте, и другие лаборатории предпринимают аналогичные шаги». Метка применяется глобально просто потому, что у компании пока нет надежного способа ограничить ее географически, однако разработчики обещают продолжить изучение других подходов.

Некоторые вопросы остаются открытыми. Издание Ars Technica запросило у компании сроки появления средств детекции, данные о тестировании на предмет ложноположительных и ложноотрицательных срабатываний, а также пояснения о том, как метки соотносятся с исключением для стандартного редактирования.

Anthropic направила заявление, в котором эти пункты обошла стороной. Впрочем, в опубликованной 14 августа заметке компания ответила на два из них, описав сценарии сбоев и подтвердив скорый выход API для детекции. При этом о ложноположительных и ложноотрицательных результатах до сих пор не опубликовано ни слова.

Именно эта цифра имеет наибольшее значение, поскольку она определяет, какой вес должна придавать метке оценка преподавателя или редактора.

Это не остановит тех, кто задался целью обойти защиту

Неприятная истина заключается в том, что метка ловит честных пользователей и бессильна против намеренных попыток ее скрыть. Если вставить помеченный водяным знаком текст во вторую модель и попросить ее переписать материал, сигнал, скорее всего, исчезнет. В Anthropic с этим согласны, отмечая, что легкая правка, вероятно, метку не удалит, а вот полноценный рерайт — вполне.

Происхождение на основе файлов еще менее надежно, к тому же это отдельная система. Файлы, создаваемые Claude, содержат подписанные учетные данные контента в своих метаданных в соответствии с открытым стандартом C2PA, причем содержимое самого файла при этом не меняется. Скриншот легко удаляет эту информацию, как и любой компетентный редактор метаданных.

Редакция уже сталкивалась с подобными сбоями. Собственный детектор ИИ от Meta не смог распознать обрезанные изображения, что примерно сопоставимо с необходимыми для обхода усилиями.

Статья в Nature откровенно говорит и об остальном. Генеративные водяные знаки можно воровать, подделывать и вычищать, а перефраз их ослабляет. Кроме того, они требуют, чтобы их накладывала компания, управляющая моделью, что делает их применение практически невыполнимым в случае моделей с открытыми весами.

Anthropic — единственная компания, взявшаяся за текст

Это создает вполне реальный коммерческий риск. Компания OpenAI отказалась давать конкретные комментарии изданию TechRadar, сославшись вместо этого на справочную страницу.

На этой странице подтверждается, что OpenAI маркирует изображения и аудио с помощью SynthID и метаданных C2PA. Что касается текста, то там говорится, будто распространение системы отслеживания происхождения на все модальности является целью компании, по мере того как стандарты и инструменты «продолжают созревать».

Ситуация с Google выглядит еще более показательными. Именно эта компания изобрела метод, который использует Anthropic, опубликовала его в рецензируемом журнале и применяет в Gemini с 2024 года. Тем не менее, внедрять текстовую маркировку ради европейских правил они тоже не стали.

У существующих моделей есть время до 2 декабря, чтобы привести себя в соответствие с требованиями. Anthropic заявляет, что маркировка для ее собственных более старых моделей будет внедряться в течение ближайших месяцев. А пока одна-единственная лаборатория принимает весь этот удар на себя.

Чего закон не касается вообще

Статья 50 требует раскрывать информацию о том, что вы общаетесь с машиной. При этом в ней нет ни слова о том, что происходит с беседой в дальнейшем.

Исследователи из Стэнфорда изучили политику конфиденциальности шести ведущих американских разработчиков ИИ. Каждая из этих компаний по умолчанию использовала данные пользовательских чатов для обучения, а некоторые хранили их бессрочно.

В итоге закон теперь ставит метку на выходные данные и полностью игнорирует входные.

Что могло бы расставить все по местам

Три вещи, и каждую из них можно проверить. Во-первых, это API для детекции и, в частности, частота его ложноположительных срабатываний, поскольку метка на вычитанном студенческом эссе имеет тот же вес, что и на сфабрикованной новостной статье.

Во-вторых, внедрят ли OpenAI или Google текстовую маркировку до 2 декабря или же придут к выводу, что стандарты все еще продолжают созревать.

В-третьих, сентябрь, когда Комиссия запускает две рабочие группы для примерно 190 организаций, подписавших ее кодекс прозрачности. Это станет первой площадкой, где эти подходы будут сравнены лицом к лицу.

Метки дают сбои и без всего этого. В среду соцсеть X прикрепила плашку «Создано с помощью ИИ» к посту об отставке уходящего пресс-секретаря Белого дома, после чего эта плашка благополучно исчезла.