Новое узкое место для китайского ИИ — это не чипы. У Китая заканчиваются данные для обучения на китайском языке.
Alina Maria Stan2 минуты чтения
Кратко
Китай столкнулся с острой нехваткой данных для ИИ. На китайском языке создано всего 1,3% веб-контента по сравнению с 49% на английском. Пекин планирует создать национальные наборы данных к 2028 году. WeChat и Douyin не делятся данными с внешними разработчиками. Издательства вводят запреты на обучение ИИ.
В гонке искусственного интеллекта в Китае возникло новое препятствие, и дело вовсе не в чипах. В стране заканчиваются высококачественные данные для обучения на китайском языке. В то время как экспортный контроль США в отношении передовых полупроводников доминировал в дискуссиях о возможностях Китая в сфере ИИ, китайские эксперты все чаще предупреждают, что нехватка данных может оказаться не менее серьезным ограничением, причем в отличие от чипов, аппаратного обходного пути здесь не существует. По данным интернет-трекера W3Techs, на долю китайского языка приходится всего 1,3% мирового веб-контента, в то время как на английский — почти половина, на испанский — 6%, а на японский — 5%.
Эта проблема носит глобальный характер, но по Китаю она бьет сильнее. По оценкам Epoch AI, мировые запасы высококачественного общедоступного текста могут быть полностью исчерпаны в течение шести лет. Сооснователь OpenAI Андрей Карпатый предупредил о приближении к «информационной стене» к концу десятилетия. Китайские разработчики уже платят больше за каждый полезный токен, чем их западные коллеги, поскольку их моделям приходится работать интенсивнее с меньшим количеством материалов на родном языке. Цифровая экосистема Китая усугубляет нехватку: такие платформы, как WeChat и Douyin, не делятся данными со сторонними разработчиками, из-за чего лаборатории ИИ вынуждены обучаться на менее качественных источниках.
Пекин реагирует на это, рассматривая данные как стратегическую инфраструктуру. В июне Национальное управление данных представило общенациональный план по созданию проверенных наборов данных для обучения ИИ к 2028 году, охватывающий производство, энергетику, здравоохранение, финансы, сельское хозяйство, автономное вождение и воплощенный ИИ. «Конкуренция в эпоху ИИ идет не только за модели и вычислительную мощность, но и за системы поставок высококачественных данных,» — заявил Юй Сяохуэй, президент аффилированной с государством Китайской академии информационных и коммуникационных технологий. Специалист по компьютерам из Университета Цинхуа Сун Маосун призвал власти оцифровать исторические архивы, древние рукописи, научную литературу и региональные диалекты.
Впрочем, оцифровываться хотят далеко не все. Издательство Huaxia Publishing House недавно добавило предупреждение к новому переводу: «Запрещено использовать содержание этой книги для обучения искусственного интеллекта. Нарушители будут нести юридическую ответственность.» Китай уже испытывает беспокойство по поводу американских моделей ИИ, с которыми не может тягаться, и дефицит данных отчасти объясняет этот разрыв. В США существует проект Project Panama компании Anthropic, в рамках которого было куплено и уничтожено миллионы физических книг для их сканирования. У Китая есть 1,3% интернета и издательская индустрия, которая начинает запирать двери на замок.