Deep Tech Искусственный интеллект Роботы
Китай тихо победил в сфере видеогенерации на базе ИИ. Главный приз — научить машины понимать, как устроен мир
Рейтинг составлен на платформе Artificial Analysis, где пользователи оценивают конкурирующие ролики вслепую. На первом месте расположилась модель Gemini Omni Flash от Google. Все следующие девять позиций заняли китайские разработки: H3 от MiniMax, Seedance 2.0 от ByteDance, две версии Wan от Alibaba, две версии HappyHorse от нее же, две версии Kling от Kuaishou и SkyReels от Skywork.
Одна из этих моделей появилась неожиданно. HappyHorse от Alibaba, открытая модель с примерно 15 миллиардами параметров, дебютировала анонимно в апреле и сразу взлетела на вершину, прежде чем компания заявила на нее права. Если добавить к этому Vidu от ShengShu и множество стартапов, становится очевидно, что конкуренция в этой области крайне высока. Эти инструменты уже используют рекламные агентства, киностудии и стремительно развивающаяся <индустрия микродрам>индустрия микродрам> индустрия микродрам.
Китай заполнил нишу, которую США оставили пустой. OpenAI закрыла Sora в марте, а Anthropic так и не вышла на этот рынок. Google с ее моделями Gemini и Veo остается главным американским игроком.
Почему видео — это больше, чем просто видео
Главная новость заключается в том, к чему именно ведет видеотехнология — именно об этом пишет обозреватель Bloomberg Opinion Катрин Торбеке (Catherine Thorbecke). Чтобы создать убедительный фальшивый ролик, модель должна усвоить основы физики. Ей требуется базовое понимание движения, причинно-следственных связей и того, как ведут себя объекты. Этот навык становится фундаментом для создания «модели мира» (world model).
Модели мира — это новая цель для многих лабораторий. Их задача — научиться понимать, как устроен физический мир, а не только текст. Некоторые исследователи видят в них более надежный путь к созданию ИИ человеческого уровня, чем в постоянном увеличении чат-ботов. Результатом станут действующие машины: гуманоидные роботы и беспилотные автомобили.
Подобный подход популярен не только в Китае. Американская компания Runway и немецкая Black Forest Labs движутся в том же направлении. Runway уже продает свой симулятор компаниям, занимающимся робототехникой и беспилотниками, поскольку тестировать действия в программной среде проще и эффективнее, чем в реальном мире. Генеральный директор компании Крис Валенсуэла (Cris Valenzuela) отметил в беседе с Торбеке, что это естественный этап эволюции.
Лидерство реально, но прорыв еще не доказан
Переход от видео к моделям мира находится на ранней стадии, а физика в таких симуляциях пока несовершенна. Собственное исследование Sora от OpenAI показало, что масштабируемые видеомодели усваивают трехмерную согласованность и постоянство объектов, но всё еще допускают грубые ошибки в базовых событиях, например при падении и разбитии стекла. Убедительный видеоролик не то же самое, что истинное понимание мира.
Другая проблема — авторское право. Скрыть источники, на которых обучалась видеомодель, гораздо сложнее, чем в случае с чат-ботом. Это уже привело к трудностям за рубежом. Издание The Information сообщало, что ByteDance приостановила запуск новой модели из-за споров с Голливудом по поводу авторских прав.
Тем не менее стратегический потенциал этого направления трудно отрицать. Китай уже производит большинство человекоподобных роботов в мире и нуждается в «мозге», чтобы ими управлять. Если видео станет полигоном для обучения, ставка на модели мира может иметь значение далеко за пределами индустрии развлечений. Торбеке предупреждает, что Вашингтон сосредоточен на шумном соревновании, но упускает из виду куда более тихое и важное.



