Русская версия The Next Web

Deep Tech Google Искусственный интеллект

Новый ИИ от Google теперь может провести гуманоида через комнату и навести порядок — от стоп до кончиков пальцев

Новый ИИ от Google теперь может провести гуманоида через комнату и навести порядок — от стоп до кончиков пальцев

Google DeepMind хочет создать единый мозг на базе искусственного интеллекта для управления любыми роботами, и компания только что научила этот мозг задействовать всё тело машины. Была представлена система Gemini Robotics 2 — семейство моделей, способных управлять гуманоидом от стоп до кончиков пальцев. Система также может координировать работу нескольких устройств одновременно и адаптироваться к новому телу робота всего за несколько часов.

Это самое яркое на сегодняшний день свидетельство того, что в индустрии называют «физическим ИИ», а издание Wired охарактеризовало его как реальный шаг к «физическому ОИИ» (AGI). Суть подхода проста. Тот же тип модели, который пишет ваши электронные письма, теперь учится ходить по загроможденной комнате и наводить в ней порядок.

От манипуляторов ко всему телу

Главное изменение кроется в управлении. Предыдущие модели роботов от DeepMind в основном двигали верхней частью туловища для выполнения задач на столе. Gemini Robotics 2 управляет всей машиной целиком. Она позволяет гуманоиду ходить, приседать, вытягиваться и удерживать равновесие, одновременно манипулируя объектами в тесных пространствах, созданных для людей.

В ходе демонстрации робот Apollo 2 от компании Apptronik получил простую инструкцию: положить лейку в зеленый контейнер на нижней полке. Он подошел к столу, взял лейку, направился к стеллажам, наклонился и поставил её. Звучит тривиально. Но координировать ноги, торс, руки и кисти на основе одной текстовой или голосовой команды — вовсе нет.

Ловкость тоже улучшилась. Модель может управлять пятипалой рукой Apollo с 22 суставами, чтобы завязывать узлы и закрывать пакеты с застежкой-молнией, а также запускать более простые двупалые захваты на других платформах. «Наша цель — перенести ИИ в физический мир, а затем создать интеллектуальный слой, который сможет использовать каждый робот», — заявила Каролина Парада (Carolina Parada), руководитель отдела робототехники в DeepMind.

Три модели, одна система

Фактически этот релиз включает в себя три модели. Gemini Robotics 2 — это мультимодальная модель (зрение-язык-действие), которая преобразует то, что робот видит и слышит, в моторные команды. Она отвечает за физические действия.

Gemini Robotics ER 2 представляет собой уровень рассуждений — высокоуровневый мозг, планирующий многоэтапные задачи. В ходе своего брифинга для разработчиков компания Google продемонстрировала, как система отслеживает собственный прогресс по видеопотоку в реальном времени. Она может вызывать такие инструменты, как Google Search, и даже направлять робота Boston Dynamics Spot за легкой закуской. Кроме того, она позволяет разным роботам работать в команде, когда колесная машина и гуманоид делят задачу пополам. Система уже доступна разработчикам через Gemini API и Google AI Studio.

Третья модель, On-Device 2, работает локально без подключения к интернету. Её можно установить на совершенно новое тело робота, используя менее 200 примеров и всего несколько часов обучения. Этот последний пункт имеет решающее значение, поскольку перенос приобретенного навыка с одной машины на другую долгое время оставался одной из самых сложных задач в робототехнике.

Впечатляюще, но пока медленно

DeepMind необычайно откровенно рассказала об ограничениях. Собственные данные компании показывают существующие пробелы. Как сообщает Bloomberg, система способна открутить лампочку в 92 процентах случаев, однако с более тонкими манипуляциями дела обстоят намного хуже. По данным газеты Chosun Daily, успешное завязывание пакета для мусора составляет 44 процента, а запечатывание пакета с молнией — 40 процентов.

Роботы также действуют медленно. Они делают паузы, чтобы обдумать движения, которые человек совершает не задумываясь. Канишка Рао (Kanishka Rao), директор по робототехнике в DeepMind, отметил, что подлинная ловкость остается отдаленной целью, и что роботы по-прежнему учатся гораздо менее эффективно, чем люди, которые корректируют свое поведение после одной-двух ошибок.

Такая тенденция наблюдается по всей отрасли. Аналогичные разработки от стартапов в области базовых моделей для робототехники, а также работы по развитию ловкости у конкурирующих гуманоидов продолжают сталкиваться с одними и теми же препятствиями. Демонстрации поражают воображение, но машины все еще далеки от готовности к использованию в быту.

Безопасность выходит на первый план

Поскольку роботы приобретают способность перемещаться рядом с людьми, DeepMind уделяет больше внимания безопасности. Gemini Robotics ER 2, по заявлению компании, является ее самой безопасной моделью на сегодняшний день: она лучше распознает приближение человека и останавливается до тех пор, пока зона не освободится. Работа возобновляется только тогда, когда пространство снова становится пустым.

Компания также выпустила бенчмарк ASIMOV-Agentic, который проверяет, способна ли модель рассуждений отклонить небезопасную команду от модели действий, а также умеет ли она фиксировать невозможность выполнения задачи или обращаться за помощью к человеку. Назвать бенчмарк по безопасности роботов в честь Айзека Азимова — шаг довольно прямолинейный. Но лежащая в его основе тревога — риск выполнения машинами ошибочных инструкций — вполне реальна.

Проблема с «железом», которую Google не может решить

Существует и не самый удобный контекст. Google создает программное обеспечение, а не роботов, в то время как поставки «железа» приобретают политический оттенок. Как отмечает Axios, США недавно предприняли шаги по запрету будущих продаж роботов китайского производства из соображений безопасности. При этом многие корпуса роботов, на которых может запускаться это ПО, производятся в Китае.

Google сотрудничает с западными партнерами, включая Apptronik, Boston Dynamics и Agile Robots, а также более чем с 100 доверенными тестировщиками. Ее конкуренты борются за ту же награду. OpenAI и Nvidia также создают модели для роботов, и все они преследуют одну и ту же идею: одна модель для любого тела.

DeepMind осторожно называет это вехой, а не финишной прямой. Gemini Robotics 2 делает роботов более универсальными и полезными, чем раньше. Она также наглядно показывает, как далеко машинам еще до непринужденной ловкости человека, убирающего комнату.