Колонки

Почему видео становится первой точкой притяжения по мере того, как ИИ учится понимать физический мир

Почему видео становится первой точкой притяжения по мере того, как ИИ учится понимать физический мир

Коротко

Сотни миллионов камер уже установлены по всему миру, но для анализа большинства записей по-прежнему нужен человек, знающий, что именно искать. Компания Lumana, основанная бывшими руководителями подразделений компьютерного зрения Intel, ежедневно обрабатывает более миллиарда изображений с более чем 50 000 камер с помощью своей модели VIA-1. Она определяет, что является нормой для каждой отдельной камеры, и фиксирует любые отклонения. Компания выполняет фильтрацию данных локально перед отправкой в облако, руководствуясь принципом «фильтруй до того, как тратить». Видео может стать естественной отправной точкой для физического ИИ, поскольку необходимая инфраструктура уже существует.

Камера, направленная на погрузочную платформу, может записывать двенадцать часов прибытия грузовиков, перемещения рабочих по площадке и отгрузки коробок из здания. В большинстве случаев никому нет необходимости просматривать эти записи. Материалы становятся полезными лишь тогда, когда пропадает посылка, происходит несчастный случай или возникает необходимость восстановить хронологию событий и выяснить, что именно произошло.

Это на протяжении многих лет было одной из странных особенностей систем видеонаблюдения. Камеры стали цифровыми уже давно, но создаваемый ими видеопоток по-прежнему во многом зависит от человека, который должен знать, что именно искать и где это найти. ИИ начинает делать эти материалы более понятными и доступными для поиска в режиме реального времени, пока события еще развиваются.

По оценкам компании Axis Communications, к концу 2025 года за пределами Китая было установлено 562 миллиона камер видеонаблюдения. Кроме того, все больше таких камер поступает в продажу со встроенными интеллектуальными функциями. Согласно исследованию компании, около двух третей камер, отгруженных в 2024 году, включали аналитику на базе глубокого обучения.

Таким образом, для компаний, создающих то, что все чаще называют физическим ИИ, значительная часть инфраструктуры уже закреплена на стенах и потолках. Возможность заключается в том, чтобы сделать эти существующие камеры более полезными, научив программное обеспечение понимать происходящее перед ними.

Lumana — одна из компаний, делающих ставку на этот переход. Ее основатели пришли в проект с многолетним опытом работы в области компьютерного зрения в Intel. Генеральный директор Саги Бен Моше ранее руководил направлением RealSense в Intel, а технический директор Офир Мулла работал над архитектурой ее 3D- и LiDAR-камер.

Базирующийся в Калифорнии стартап привлек $40 млн в июле 2025 года в ходе раунда финансирования серии А под руководством Wing Venture Capital при участии Norwest Venture Partners и S Capital, доведя общий объем привлеченных средств до $64 млн. К декабрю компания сообщила, что к ее платформе подключено более 50 000 камер, а среди ее клиентов числятся компании из списка Fortune 500 по всей территории США.

По заявлению компании, ее системы видеонаблюдения на базе ИИ теперь обрабатывают более миллиарда изображений в день с более чем 50 000 камер. Однако для клиентов первые изменения обычно выглядят гораздо проще, чем может показаться на первый взгляд.

Во-первых, перестаньте таращиться в экраны

Десятилетиями привычной картиной в пультах охраны была стена из видеоэкранов и люди, от которых требовалось замечать признаки того, что что-то идет не так.

Photo of Ofir Mulla, CTO of Lumana
Офир Мулла, технический директор Lumana — Источник: Lumana

Технический директор Lumana Офир Мулла говорит, что первый месяц после развертывания технологии команды тратят в основном на решение гораздо более прозаических проблем. Сотрудники находят камеры, которые находятся в офлайне, выясняют, где покрытие оказывается неоднородным, и решают, кому должны поступать те или иные оповещения.

По мере того как эта работа налаживается, операторы могут тратить меньше времени на попытки уследить за каждым потоком и больше — на изучение событий, которые система отметила как требующие расследования.

«Вместо того чтобы тратить время на просмотр пассивных видеостен и попытки заметить что-то необычное, операторы могут сосредоточить свое внимание на событиях, заслуживающих расследования,» — отметил Мулла в интервью.

Успешное выполнение этой задачи во многом зависит от контекста — того фактора, с которым традиционное обнаружение движения и фиксированные правила справлялись с трудом.

Человек, стоящий у двери склада в 14:00, может вести себя абсолютно нормально, но его появление в 2:00 ночи заслуживает проверки. Доставка груза грузовиком, припаркованным у погрузочной рампы в течение 20 минут, является штатной ситуацией. Тот же грузовик, стоящий там три часа подряд, — уже нет.

Модель VIA-1 от Lumana разработана таким образом, чтобы обучаться на основе особенностей среды каждой конкретной камеры, а не применять повсеместно единое определение нормы. Компания заявляет, что это позволяет снизить количество ложных срабатываний до 90% по сравнению с устаревшими системами обнаружения движения и правилами, хотя Мулла подчеркивает, что эта цифра отражает скорее верхний предел наблюдаемых показателей Lumana, а не гарантированный результат для каждого клиента.

Но гораздо более сложная проверка наступает тогда, когда меняется сама окружающая обстановка.

Что происходит, когда норма меняется?

То, что камера считает нормальным, может быстро измениться. На складе за выходные могут переставить стеллажи, торговой точке внезапно приходится справляться с рождественским ажиотажем, а на заводе вводится ночная смена, выводящая десятки людей в зону, которая в это время суток раньше пустовала. В каждом подобном случае активность, которая вчера могла вызвать тревогу, сегодня становится абсолютно рутинной.

Мулла говорит, что VIA-1 способна корректировать свое представление об отдельной камере по мере изменения окружения, а обратная связь от операторов помогает ей в тех случаях, когда происходят существенные изменения. Он не стал называть фиксированное время, необходимое для такой адаптации, отметив, что оно зависит от масштаба и характера изменений.

Эффективная система видеонаблюдения на базе ИИ должна научиться воспринимать новый график смен как рутину, продолжая при этом замечать активность, которая должна вызывать вопросы. Поскольку время, необходимое для адаптации, зависит от характера изменений, отзывы операторов остаются частью этого процесса, особенно если на объекте произошли серьезные перестановки. На практике система обучается параллельно с окружающей средой, которая не стоит на месте.

Упрощение поиска и анализа таких видеоматериалов также поднимает вопросы конфиденциальности, особенно на рабочих местах и в других пространствах, где ведется постоянная запись людей. Lumana позволяет клиентам настраивать правила хранения данных и доступа к ним, а также отключать такие функции, как распознавание лиц и пола в зависимости от местных требований. Но по мере того как возможности существующих камер растут, компаниям также приходится задумываться о том, что именно им следует собирать, кому разрешать поиск по этим данным и как долго хранить такую информацию.

Сегодня большая часть работы по-прежнему сводится к тому, чтобы помогать людям определять, куда именно стоит смотреть. Lumana видит для этой технологии более масштабную роль по мере совершенствования таких систем.

Мулла описывает концепцию «физических агентов ИИ», способных распределять задачи мониторинга, верификации и реагирования. Платформа Lumana уже поддерживает действия от отправки уведомлений и вызова веб-хуков до активации связанных систем при обнаружении определенных событий.

Это меняет роль камеры в структуре бизнеса. Видеозаписи могут стать входящими данными для программного обеспечения, которое интерпретирует событие и в некоторых случаях инициирует дальнейшие действия.

Фильтруйте до того, как тратить

Реализация такого подхода на десятках тысяч камер быстро становится дорогостоящей задействованной задачей, поскольку передача и обработка видео в больших масштабах требуют значительных ресурсов. Отправка каждого кадра в облако для более интенсивной обработки с помощью ИИ моментально стала бы неподъемной по затратам, особенно с учетом роста разрешений камер и масштабов развертывания.

Вместо этого Lumana выполняет большую часть непрерывной обработки локально. Ее аппаратные модули Core располагаются в непосредственной близости от камер и осуществляют первичную обработку на месте. Согласно обзору платформы компании, основная часть обработки видео происходит локально, в то время как облако обеспечивает дополнительную обработку, удаленный доступ и управление между объектами.

«Подавляющее большинство видеоматериалов носит рутинный характер и никогда не покидает пределы объекта,» — отметил Мулла.

В более дорогостоящей обработке нуждаются только те кадры, которые действительно заслуживают углубленного анализа. Принцип компании звучит предельно просто: «Фильтруем до того, как тратим.»

Подобная экономика, вероятно, будет иметь решающее значение и далеко за пределами Lumana. Камеры и другие датчики генерируют слишком много информации, чтобы каждый кадр получал одинаковый объем вычислений, поэтому определение того, что заслуживает более глубокого анализа, становится частью как технической, так и экономической задачи.

Кроме того, у видео есть одно преимущество перед некоторыми более амбициозными идеями в сфере физического ИИ. Компаниям не нужно ждать появления миллионов новых роботов или перестраивать свои площадки под новое железо. Сотни миллионов камер уже направлены на фабрики, магазины, университеты, склады и улицы.

Большинство этих камер устанавливалось для фиксации прошлого. Если ИИ сможет надежно понимать все больший объем этих записей в процессе их создания, та же самая инфраструктура поможет компаниям понимать происходящее в режиме реального времени и, в некоторых случаях, решать, каким должен быть следующий шаг. И именно это вполне может сделать видео столь естественной отправной точкой для проникновения ИИ в физический мир.

Опубликовано 3 сентября 2026 - 14:46 Наверх