Google представила Gemini Robotics 2: ИИ управляет гуманоидом от ног до кончиков пальцев

Google DeepMind представила Gemini Robotics 2 - семейство моделей, которое впервые управляет гуманоидным роботом целиком, от походки до пальцев. Анонс состоялся 30 июля. Модель рассуждения уже открыта разработчикам, управляющие модели отдали партнёрам раннего доступа.
Google представила Gemini Robotics 2: ИИ управляет гуманоидом от ног до кончиков пальцев

Gemini Robotics - линейка моделей Google DeepMind, которая превращает Gemini (Джемини) в управляющий слой для роботов: камера и голосовая команда на входе, движения механики на выходе. Прошлые версии работали с верхней частью корпуса и решали задачи в пределах стола. Второе поколение вышло из-за стола и встало на ноги.

Три модели под разными доступами

Релиз Gemini Robotics 2 состоит из трёх моделей, и доступ к ним разный:

  • Gemini Robotics 2 - основная VLA-модель (vision-language-action), переводит картинку и текстовую команду в моторное управление. Отдана партнёрам раннего доступа.
  • Gemini Robotics ER 2 - модель рассуждения, построена на Gemini 3.5 Flash, принимает текст, изображения, видео и звук с контекстом до 128 тысяч токенов. Доступна в открытом предварительном доступе через Gemini API и Google AI Studio.
  • Gemini Robotics On-Device 2 - облегчённая версия, работает прямо на роботе без интернета. Выдаётся по программе доверенных тестировщиков.

Разделение труда простое. ER 2 держит план и следит за прогрессом, а моторику вызывает у VLA - разработчик подключает её как инструмент, наравне с навигационным API.

Лейка, полка и походка Apollo

Показательный ролик Google снят на гуманоиде Apollo 2 компании Apptronik. Роботу говорят: «поставь лейку в зелёный ящик на нижней полке». Apollo идёт к столу, берёт лейку, делает несколько шагов к стеллажу и опускает её в нужное место. Ходьба, наклон, удержание равновесия и захват здесь считаются одной моделью, а не сшиты из отдельных заранее написанных программ.

Скорость Google не прячет: в блоге прямо сказано, что роботам ещё предстоит прибавить в темпе движения. По ролику это видно - Apollo идёт неторопливо.

Где цифры проседают

Google опубликовала успешность по задачам, и картина неровная. Взять предмет с полки Apollo 2 удаётся в 76,3 % попыток, со стола - в 68,4 %, с пола - уже в 45,7 %. Точная вставка деталей на двухпалом захвате Franka Duo идёт лучше всего, 89,6 %.

Слабое место - пятипалая рука SharpaWave с 22 степенями свободы. Выкрутить лампочку получается в 92 % случаев, а вкрутить обратно - только в 36 %. Завязать мусорный пакет - 44 %, работа с совком - 32 %. Google эти цифры не прячет и сама называет многопальцевую моторику нерешённой задачей, что для анонса такого масштаба редкость.

ER 2 следит за процессом

Отдельная работа в Gemini Robotics ER 2 - понимание времени. Модель разбирает непрерывный видеопоток и определяет, на какой стадии находится задача, а также ловит момент ключевого события: например, когда пора перестать наливать кофе. По второму показателю точность 91,3 % со средней ошибкой около секунды, по оценке стадии выполнения - 57,4 %.

Сюда же добавили командную работу. Разные по конструкции машины обмениваются пониманием задачи и передают друг другу подзадачи: в демонстрации гуманоид Apollo 2 работает в паре со стационарной платформой Franka Duo. Ещё один сценарий Google собрала на четвероногом Spot от Boston Dynamics, где ER 2 дирижирует его навигацией и манипулятором.

Новое тело за несколько часов

Gemini Robotics On-Device 2 переносится на незнакомую двурукую платформу за несколько часов и меньше чем на 200 примерах, даже если у неё другая форма, другие датчики и другое число степеней свободы. На платформе SO101 успешность выросла с 6,7 до 53,3 %, на Dexmate - с 24,4 до 75,6 %; прошлое поколение на том же SO101 доползало только до 6,7 %.

Ограничения записаны в карточке модели: локальная версия хуже справляется с задачами, которых не было в обучении, и с роботами, у которых много подвижных суставов.

Стоп рядом с человеком

Вместе с релизом Google выпустила ASIMOV-Agentic - набор тестов на безопасность агентного управления. Он проверяет, откажется ли модель рассуждения выполнять небезопасный вызов от VLA, сумеет ли предсказать невыполнимость задачи и попросит ли помощи у человека, когда не уверена. По заявлению Google, ER 2 лучше прежних моделей замечает людей поблизости и останавливает робота, если кто-то подошёл слишком близко.

Проверочная точка - открытие VLA

Разработчикам сейчас достался только «мозг»: планирование, разбор видео, координация. Модель, которая двигает ногами и пальцами, остаётся у партнёров, и до её выхода из закрытого доступа управление всем телом живёт в формате демонстрационных роликов. Понятно станет тогда, когда чужие команды покажут Apollo или другую машину на своих задачах - без сценария и без монтажа.

11:30
49
Нет комментариев. Ваш будет первым!