Microsoft Искусственный интеллект Право
Ученый из Microsoft назвал обучение ИИ величайшей кражей труда
В рассекреченном в четверг 92-страничном исковом заявлении дважды цитируется один и тот же сотрудник Microsoft. Д-р Брент Хехт (Brent Hecht), директор компании по прикладным наукам, написал, что люди неизбежно начнут воспринимать поглощение их работ большими моделями как «ошеломляющую кражу беспрецедентных масштабов». Во втором документе он назвал это, пожалуй, «крупнейшей кражей труда в истории человечества».
Хехт — ученый-исследователь. Он не входит в совет директоров и не является генеральным директором, что имеет значение, учитывая резонанс этой фразы.
Сводное ходатайство истцов о вынесении решения в порядке упрощенного судопроизводства фигурирует в объединенном деле о нарушении авторских прав против OpenAI, которое рассматривает судья Сидни Х. Стайн. До четверга большая часть наиболее компрометирующих фрагментов была скрыта цензурой. Джейсон Кинт (Jason Kint) из торговой ассоциации Digital Content Next обнаружил нередактированную версию. Джордж Хаммонд (George Hammond) и Стивен Моррис (Stephen Morris) сообщили об этом в тот же день в Financial Times, Скотт Новер (Scott Nover) и Геррит Де Винк (Gerrit De Vynck) — в Washington Post, Джейсон Кеблер (Jason Koebler) — в 404 Media, а Карен Вайза (Karen Weise) и Майк Айзек (Mike Isaac) — в The New York Times (которая также выступает истцом). Приведенные ниже цитаты взяты непосредственно из судебного материала.
Истцами выступает не только The New York Times. Среди них — медиагруппа Daily News и Центр журналистских расследований (Center for Investigative Reporting). В их число также входит Ziff Davis, издающая такие ресурсы, как CNET, ZDNET, PCMag и Mashable. Иными словами, судебный иск подали непосредственные коллеги этого издания.
Петля деградации в цифрах самой Microsoft
В иске приводится цитата из документа Microsoft, описывающего то, что создала компания. В документе говорится, что ее контент-стратегия в сфере ИИ «запустила «петлю деградации» (doom loop)», которая нанесет ущерб как ее собственным моделям, так и всему Интернету в целом. В документе такая ситуация названа необычной: конечный продукт теперь угрожает экономическим основам собственных поставщиков.
Цифры, лежащие в основе этого утверждения, принадлежат самой Microsoft. В материалах дела приводятся данные компании о падении показателей кликабельности (CTR) на 87–93% для веб-сайтов Times, на 83–91% для сайтов группы Daily News и на 51–94% для сайтов Ziff Davis. Сравнение проводилось между Copilot и традиционным поиском Bing.
Хехт написал этот документ вскоре после подачи данного иска. Он пояснил, что системы работают путем воспроизведения паттернов из обучающего контента. Не существует способа вернуть экономическую стоимость обратно по цепочке поставок. По его словам, это «неизбежно ставит под угрозу экономическую стабильность тех, кто создает контент». Он добавил, что решение в пользу его собственного работодателя, пожалуй, «превратит в абсолютную насмешку саму идею «добросовестного использования» (fair use)».
Другие материалы Microsoft, попавшие в иск, идут еще дальше. В одном из документов предупреждается о «реальном риске» того, что эта технология может «серьезно подорвать занятость именно тех людей, которые создали данные, послужившие основой для обучения базовой модели». В другом документе суть выражена всего восемью словами: «Языковые модели (LLM) — это продукт, который уничтожает собственную цепочку поставок».
«Пользователи не будут кликать»
Самое резкое высказывание в материалах дела принадлежит безымянному инженеру-программисту OpenAI. «Как бы заметно мы ни показывали ссылки, пользователи не будут на них кликать».
Ник Тёрли (Nick Turley), руководящий разработкой ChatGPT, написал, что издатели сталкиваются с «экзистенциальной угрозой». По его словам, эти продукты «в значительной степени взаимозаменяемы, и точка», и эта тенденция будет усиливаться по мере их совершенствования. Джек Кларк (Jack Clark), директор по политике OpenAI, выразился иначе. Работа компании будет все больше сводиться к созданию систем, заменяющих труд людей, которые формируют культуру общества.
Сатья Наделла (Satya Nadella) под присягой согласился с тем, что чат-боты заменили обращение к первоисточникам. Во внутренних документах OpenAI чат-боты ChatGPT называются «современными газетными киосками».
Что они осознанно использовали для обучения
Вице-президент OpenAI по исследованиям сделал заявление, которое юристы компании явно оценят по достоинству: «Мы обучаем наши сети запоминать обучающие данные. В этом их цель». К ноябре 2019 года компания уже выражала внутренние опасения по поводу регенерации произведений, защищенных авторским правом.
В иске приводятся конкретные объемы копирования. Промежуточные обучающие наборы данных OpenAI содержат более 91 692 копий работ истцов. Набор WebText2 содержал не менее 6 552 материалов от Times, 18 609 — от Daily News и 66 780 — от Ziff Davis.
Отдельно OpenAI получила «Антологию материалов New York Times» (New York Times Annotated Corpus), насчитывающую более 1,8 миллиона статей за период с 1987 по 2007 год, на условиях лицензии, ограниченной некоммерческими исследованиями.
Около 2017 года Грег Брокман (Greg Brockman) писал, что им «движет глубокое стремление заработать миллиарды», которые он надеялся получить от коммерциализации технологий OpenAI.
Затем следует диалог, к которому обозреватели возвращаются снова и снова. Ник Райдер (Nick Ryder) рассказал Брокману о «лайфхаке для обхода пейволла nytimes». Брокман ответил: «а, круто» (ah nice). В собственном магазине OpenAI представлены кастомные GPT под названиями «Bypass Paywall» (Обойти пейволл) и «Remove Paywall» (Удалить пейволл). Наделла же дал показания о том, что «все, что находится за пейволлом, должно лицензироваться».
Торг уместен
В иске целый раздел озаглавлен «Торг» (Horse Trading). В материалах утверждается, что Microsoft занималась веб-скрейпингом для Bing, а затем передавала этот контент OpenAI. OpenAI в ответ предоставила Microsoft весь набор данных для обучения GPT-3. Две совместные инициативы, Taxi и Mango, осуществляли обратную передачу данных, причем только набор данных Mango содержал не менее 160 903 уникальных работ истцов.
Что правительство заявило тому же суду
За шестнадцать дней до рассекречивания документов Соединенные Штаты подали собственное заявление о заинтересованности (statement of interest) в рамках этого же судебного процесса. В нем утверждается, что обучение на тексте, защищенном авторским правом, является добросовестным использованием (fair use). TNW писали об этом в свое время, однако 20-страничный документ теперь читается совершенно иначе.
Его основной аргумент заключается в том, что обучение моделей и генерация результатов — это два разных вида использования. Копирование произведения для обучения модели ничего не раскрывает публике, поэтому оно не может служить заменой оригиналу. Ущерб рынку имеет значение только тогда, когда результат существенно схож с источником. Общая конкуренция под это определение не подпадает.
В документе также лицензирование преподносится как антимонопольная проблема. Авторы утверждают, что такие сборы по карману только крупнейшим технологическим компаниям, что в итоге превратится в «крупные субсидии для старых мейнстримных медиакомпаний».
Обстоятельства появления этого заявления в суде также вызывают вопросы. Сара Фишер (Sara Fischer) и Керри Флинн (Kerry Flynn) сообщили об этом в пятницу на сайте Axios. Со ссылкой на источники они написали, что это заявление стало неожиданностью как для Патентного ведомства (Patent and Trademark Office), так и для Ведомства по авторским правам (Copyright Office). Под ним не подписался ни один штатный антимонопольный юрист наряду с высшими должностными лицами. Министерство юстиции никак не отреагировало на запрос Axios.
Чего не доказывает этот иск
Это документ истцов. Юристы, формирующие дело, тщательно отбирали каждую цитату, а лежащие в основе доказательства по-прежнему засекречены.
Microsoft уже ответила на ключевую цитату. В компании заявили Financial Times, что слова Хехта «отражают личную точку зрения одного сотрудника и не являются юридическим анализом». Там также отметили, что показания Наделла касались общих принципов, а не подводили итог под вопросами авторского права.
OpenAI не ответила на запрос FT. Ранее компания называла этот иск попыткой «незаслуженно сорвать куш за счет прогресса, который идет на пользу всем».
Ответчики также не признали юридическую сторону обвинений. В иске цитируется собственный экономический эксперт Microsoft, д-р Такер, проводящий различие, на которое будут опираться их юристы. Поисковые системы выдают ранжированный список ссылок. Модели с опорой на источники синтезируют информацию извлеченного контента. Является ли этот синтез заменой в том смысле, в каком его признает закон об авторском праве, — именно этот вопрос предстоит решить судье.
Суды до сих пор склонялись на сторону ИИ-компаний. Anthropic урегулировала иск о пиратстве книг на сумму 1,5 млрд долларов, предпочесть не доводить дело до прецедента, в то время как иски издателей против Google из-за Gemini все еще продолжаются.
Европа задается противоположным вопросом
Весь этот месяц Брюссель интересовался у издателей, работает ли функция отказа от использования контента в ИИ-поиске Google, исходя из презумпции того, что издатель должен иметь право сказать «нет». Вашингтон же заявил суду, что предоставление им такого права на отказ станет нарушением антимонопольного законодательства.
Петля деградации влечет за собой сокращения штата по обе стороны Атлантики. Reach, издатель Daily Mirror, сократил в этом месяце 220 сотрудников редакций, указав на то, что ИИ-сводки отнимают у них трафик.
Теперь оба документа находятся у судья Стайна. В одном утверждается, что обучение носило преобразующий характер, а нанесенный ущерб не относится к числу тех, что признаются авторским правом. В другом ответчики собственными словами называют это кражей. Решение по ходатайству о вынесении решения в порядке упрощенного судопроизводства покажет, какую именно трактовку закона признает суд.

