Инсайдер

Обладатель премии Тьюринга назвал решение индустрии проблемы дефицита данных «большой ошибкой»

Ричард Саттон считает ответ индустрии ИИ на нехватку обучающих данных ошибкой и выбирает для этого резкие выражения. «

Обладатель премии Тьюринга назвал решение индустрии проблемы дефицита данных «большой ошибкой»

Это просто большая ошибка», — заявил он, говоря о переходе на синтетические данные в подкасте Sequoia Capital Training Data, который вышел во вторник, а его ведущими выступили Соня Хуанг и Пэт Грейди.

Это высказывание весит гораздо больше, чем типичные цитаты из подкастов. Саттон разделил премию Тьюринга 2024 года с Эндрю Барто за основание обучения с подкреплением, написал программное эссе 2019 года «Горький урок» (The Bitter Lesson), которое теперь цитируют все кому не лень, и в июле покинул компанию Джона Кармака Keen Technologies, чтобы основать собственную лабораторию.

Его возражение сводится не к огульному вердикту, а к двум конкретным аспектам. «У нас нет никакой возможности получить синтетические данные для чужих разумов», — отметил он, а говоря о симуляции физического мира, добавил: «Мир бесконечно сложен, и любая его симуляция — это нечто микроскопическое».

В основе этого лежит так называемая гипотеза большого мира — идея о том, что реальность всегда шире, чем модель этой реальности у агента, из-за чего любой симулятор по своей сути является сжатием с потерями.

Второе возражение более тонкое: кому-то приходится решать, какие именно синтетические данные генерировать, а это возвращает человеческое суждение ровно в тот самый процесс, против которого предостерегал «Горький урок».

Вместо этого он хочет видеть эмпирические данные (полученные на основе опыта), которые собираются агентом, действующим в своей среде, а не подготавливаются кем-то заранее. Этот тезис не нов — он был изложен совместно с Дэвидом Силвером в статье «Добро пожаловать в эру опыта» (Welcome to the Era of Experience) в апреле 2025 года, но прежде Саттон не направлял его столь прицельно против синтетических данных.

Причины, по которым индустрия тянется к ним, в общем-то, не вызывают споров. По прогнозам Epoch AI, запасы публичного человеческого текста, составляющие около 300 триллионов токенов, будут полностью исчерпаны в период с 2026 по 2032 год, и с тех пор лаборатории только и делают, что импровизируют.

Часть этой импровизации носит вполне физический характер. Компании, занимающиеся ИИ, скупают и разрезают подержанные книги ради текстов, созданных до 2022 года, руководствуясь соображением, что все, что было опубликовано позже, заражено сгенерированным машинами мусором.

К тому же нехватка данных касается не только английского языка. Китайские лаборатории сталкиваются с точно такой же стеной в своем собственном языке, причем даже раньше.

Опасения, которые озвучивает Саттон, находят подтверждение в рецензируемых научных работах. В исследовании 2024 года, опубликованном в журнале Nature Илией Шумайловым и его коллегами, было обнаружено, что модели, которые рекурсивно обучаются на собственных результатах, деградируют — этот эффект в литературе теперь называют коллапсом модели.

Однако существуют и другие опубликованные работы, и здесь они имеют ключевое значение. Исследования Маттиаса Герстграссера, Райлана Шеффера и их соавторов показали, что коллапс зависит от того, заменяют ли синтетические данные человеческие; если же те и другие накапливаются параллельно друг другу, этот эффект не проявляется.

На практике лаборатории уже давно перешагнули через эти споры. Модель Phi-4 от Microsoft обучалась примерно на 400 миллиардах синтетических токенов, распределенных по 50 типам датасетов, а Nvidia выпустила корпус синтетических данных для предварительного обучения объемом около 10 триллионов токенов для своих моделей Nemotron.

Кроме того, это как раз те области, где возражения Саттона бьют менее всего, поскольку у математики и кода есть проверяемые ответы — в отличие от чужих разумов. Его ограничения касаются моделирования людей и физических систем, а не генерации обучающих примеров как таковых.

Андрей Карпати сформулировал самый известный контраргумент, утверждая, что языковые модели меньше похожи на животных, выращенных благодаря опыту, и больше — на призраков, дистиллированных из человеческой письменности, и что их настройка — это вполне легитимный путь, а не поворот не туда. Сам же Саттон заявил в подкасте, что на язык приходится, пожалуй, лишь четверть интеллекта.

Он называет это следующим большим уроком, и Sequoia с радостью преподносит его как второй горький урок — отличная формулировка для венчурного фонда, который также поддерживает новую лабораторию Дэвида Силвера. Собственная же лаборатория Саттона, основанная им совместно с его бывшим студентом Хуррамом Джаведом, ставит своей целью в течение пяти-десяти лет создать разум с триллионом параметров, который никогда не перестает учиться и работает при мощности 20 ватт.

Опубликовано 19 августа 2026 - 03:13 Наверх