Русская версия The Next Web

Бизнес Искусственный интеллект Экосистемы

По данным Pew, 10% страниц в интернете теперь имеют признаки создания с помощью ИИ

По данным Pew, 10% страниц в интернете теперь имеют признаки создания с помощью ИИ

В июле 2026 года специалисты Pew обнаружили явные признаки авторства ИИ примерно на 10% веб-страниц из случайной выборки. Этот показатель возрастает более чем до трети среди страниц, опубликованных после выпуска ChatGPT. Основной объем приходится на коммерческие домены: около 10% в зоне .com против примерно 1% в зонах .edu и .gov.

Около десятой части Всемирной паутины теперь демонстрирует явные признаки того, что она написана машиной. В июле 2026 года организация Pew исследовала случайную выборку из 10 000 страниц и обнаружила, что примерно на 10% из них присутствуют сигналы авторства ИИ.

Главная цифра, которую все цитируют, — другая. Среди страниц, опубликованных после появления ChatGPT в ноябре 2022 года, эти сигналы проявляются более чем на трети, что говорит об иной ситуации в гораздо меньшем сегменте интернета.

Это различие имеет значение, поскольку интернет велик. Большая часть существующих материалов была опубликована до появления моделей, поэтому средний показатель по всем страницам занижает масштабы происходящего с новыми текстами.

Стоит четко пояснить примененный метод. Pew классифицировала почти 500 000 англоязычных страниц из архива Common Crawl в период с января 2021 года по июль 2026 года с помощью Open Pangram — детектора, который взял на вооружение Substack для выявления созданных машиной рассылок.

Детекторы ошибаются в оценке отдельных документов, и Pew открыто об этом говорит. Их аргумент носит статистический характер: при анализе сотен тысяч страниц закономерности выделяются надежно, даже если какой-то конкретный вердикт может оказаться неверным.

Разделение по доменам — это и есть главный результат исследования. Около 10% страниц в зоне .com показали признаки авторства ИИ по сравнению с 4,6% в зоне .org и примерно по 1% в зонах .edu и .gov.

Это наглядная карта того, где создание текстов является издержками, а не самоцелью. Коммерческие страницы существуют ради того, чтобы их находили, а оптимизированный под поисковые системы текст — это самое дешевое, что может произвести языковая модель.

Pew также каталогизировала типичные маркеры, что станет неприятным сюрпризом для любого редактора со своим фирменным стилем. Использование длинного тире с 2023 года удвоилось, употребление оксфордской запятой выросло на 63%, а слова «delve» (погружаться) и «pivotal» (ключевой) продолжают всплывать наряду с конструкцией «это не просто X, это Y».

Платформы уже встраивают средства обнаружения в свою инфраструктуру. В LinkedIn заявляют, что их собственная система распознает типовой контент с точностью 94%, а ресурс arXiv теперь вводит запреты для исследователей, которые отправляют на публикацию непроверенный текст, созданный ИИ.

Объем — не то же самое, что видимость, и в этом заключается здравый смысл ситуации. Отдельное исследование, проведенное компанией Graphite, показало, что число статей, написанных ИИ, приближается к половине от всех новых публикаций, в то время как материалы, созданные людьми, по-прежнему доминируют в результатах поиска Google и цитированиях ИИ.

Что действительно изменилось, так это базовое предположение. Страница, опубликованная в этом году, скорее всего, так или иначе создавалась с участием модели, и реакция индустрии сводится к тому, чтобы продавать всем подряд инструменты для проверки.