Русская версия The Next Web

Бизнес Искусственный интеллект Медиа

ИИ-компании скупают старые книги, потому что это последние данные без «мусора»

ИИ-компании скупают старые книги, потому что это последние данные без «мусора»

Предложение от дата-брокера ISBNdb звучит прямолинейно: лучшие в мире данные для обучения ИИ пылятся на полках. Подвох в том, что добраться до них означает срезать корешки у миллионов книг, а затем никогда не признаваться, какая именно лаборатория заплатила за эту работу.

У искусственного интеллекта проблемы с загрязнением данных, которые он создал сам. Большая часть интернета сейчас написана машинами, поэтому модели рискуют питаться собственными отходами. Одна компания считает, что противоядие лежит на полке: старые печатные книги, изданные до появления чат-ботов.

Издание 404 Media сообщило, что ISBNdb теперь поставляет физические книги оптом для ИИ-лабораторий с целью их сканирования в обучающие данные. Компания называет себя крупнейшей в мире базой данных книг. «Лучшие в мире данные для обучения ИИ лежат на полке», — заявляет ее сайт. Книги, добавляет он, «емкие, отредактированные, авторитетные».

Почему именно старые книги

Вся ценность — в дате. ISBNdb утверждает, что книги, напечатанные до 2022 года, появились до эпохи больших языковых моделей, поэтому они не могут содержать сгенерированный ИИ текст. Это имеет значение из-за деградации моделей. Речь идет о задокументированном спаде качества, который наступает, когда модели обучаются на синтетических результатах работы предыдущих моделей. Каждое новое поколение в итоге оказывается немного хуже предыдущего.

Открытый интернет подобных гарантий не дает. Быстро растущая доля текстов в сети теперь создается машинами и является частью того же потока информационного мусора, к созданию которого приложили руку сами лаборатории. Печатный тираж до 2022 года, напротив, представляет собой фиксированный документ, созданный человеком, который никто не сможет незаметно переписать.

Гонка вооружений с отравлением данных

Есть и вторая причина, почему лаборатории хотят заполучить чистую бумагу. Авторы начали давать отпор с помощью отравления данных. Они заимствуют приемы из таких инструментов, как Nightshade, насыщая текст символами, которые человек воспринимает нормально, но которые модель прочитать не может. В собственном блоге ISBNdb приводятся исследования Anthropic, согласно которым для внедрения бэкдора в корпус из триллионов токенов достаточно всего 250–500 искусно созданных документов.

Книги до 2022 года выпуска, написанные до появления всех этих инструментов, позволяют обойти эту проблему. ISBNdb продает это как происхождение: покупайте бумагу, сохраняйте чеки, и ваша юридическая служба получает чистую цепочку поставок.

Проблема восприятия

Существует подвох, о котором компания заявляет открыто. Масштабное сканирование обычно уничтожает книгу. Рабочие срезают корешок, чтобы незакрепленные страницы проходили через аппарат, что быстрее и дешевле, чем бережная альтернатива. Поэтому ISBNdb предлагает своим клиентам конфиденциальность. «Строгое соглашение о неразглашении для каждого заказа», — говорится на ее сайте. Имена покупателей «никогда не раскрываются».

Причина кроется в их собственных маркетинговых материалах. «Проблема восприятия реальна, — гласит сайт. — Заголовок «ИИ-компания уничтожает два миллиона книг» не вызывает сочувствия». Один из предлагаемых вариантов обхода проблемы — чистая пиар-игра: переформулировать это действие как цифровую консервацию книг.

Знакомая борьба

Все это напрямую упирается в уже бушующую патентную и авторскую войну. Американский судья одобрил мировое соглашение компании Anthropic на 1,5 миллиарда долларов из-за пиратских книг и постановил, что обучение на приобретенных и отсканированных книгах подпадает под добросовестное использование. Часть его аргументации заключалась в том, что копирование уничтожает каждый печатный оригинал, поэтому одна легальная копия просто заменяет другую. Другими словами, покупка и измельчение бумаги — это путь, который одобряют суды.

Таким образом, индустрия, которая обещала оцифровать человеческие знания, теперь платит за то, чтобы скупать их и превращать в макулатуру целыми грузовиками. Ingram, крупнейший книжный дистрибьютор в США, уже предупредил издателей и предложил им способ отказаться от участия. Оказывается, самой дефицитной вещью в сфере ИИ является предложение, к которому не прикасалась ни одна машина.