Google представила Gemini Robotics 2: ИИ управляет гуманоидом от ног до кончиков пальцев

Gemini Robotics - линейка моделей Google DeepMind, которая превращает Gemini (Джемини) в управляющий слой для роботов: камера и голосовая команда на входе, движения механики на выходе. Прошлые версии работали с верхней частью корпуса и решали задачи в пределах стола. Второе поколение вышло из-за стола и встало на ноги.
Три модели под разными доступами
Релиз Gemini Robotics 2 состоит из трёх моделей, и доступ к ним разный:
- Gemini Robotics 2 - основная VLA-модель (vision-language-action), переводит картинку и текстовую команду в моторное управление. Отдана партнёрам раннего доступа.
- Gemini Robotics ER 2 - модель рассуждения, построена на Gemini 3.5 Flash, принимает текст, изображения, видео и звук с контекстом до 128 тысяч токенов. Доступна в открытом предварительном доступе через Gemini API и Google AI Studio.
- Gemini Robotics On-Device 2 - облегчённая версия, работает прямо на роботе без интернета. Выдаётся по программе доверенных тестировщиков.
Разделение труда простое. ER 2 держит план и следит за прогрессом, а моторику вызывает у VLA - разработчик подключает её как инструмент, наравне с навигационным API.
Лейка, полка и походка Apollo
Показательный ролик Google снят на гуманоиде Apollo 2 компании Apptronik. Роботу говорят: «поставь лейку в зелёный ящик на нижней полке». Apollo идёт к столу, берёт лейку, делает несколько шагов к стеллажу и опускает её в нужное место. Ходьба, наклон, удержание равновесия и захват здесь считаются одной моделью, а не сшиты из отдельных заранее написанных программ.
Скорость Google не прячет: в блоге прямо сказано, что роботам ещё предстоит прибавить в темпе движения. По ролику это видно - Apollo идёт неторопливо.
Где цифры проседают
Google опубликовала успешность по задачам, и картина неровная. Взять предмет с полки Apollo 2 удаётся в 76,3 % попыток, со стола - в 68,4 %, с пола - уже в 45,7 %. Точная вставка деталей на двухпалом захвате Franka Duo идёт лучше всего, 89,6 %.
Слабое место - пятипалая рука SharpaWave с 22 степенями свободы. Выкрутить лампочку получается в 92 % случаев, а вкрутить обратно - только в 36 %. Завязать мусорный пакет - 44 %, работа с совком - 32 %. Google эти цифры не прячет и сама называет многопальцевую моторику нерешённой задачей, что для анонса такого масштаба редкость.
ER 2 следит за процессом
Отдельная работа в Gemini Robotics ER 2 - понимание времени. Модель разбирает непрерывный видеопоток и определяет, на какой стадии находится задача, а также ловит момент ключевого события: например, когда пора перестать наливать кофе. По второму показателю точность 91,3 % со средней ошибкой около секунды, по оценке стадии выполнения - 57,4 %.
Сюда же добавили командную работу. Разные по конструкции машины обмениваются пониманием задачи и передают друг другу подзадачи: в демонстрации гуманоид Apollo 2 работает в паре со стационарной платформой Franka Duo. Ещё один сценарий Google собрала на четвероногом Spot от Boston Dynamics, где ER 2 дирижирует его навигацией и манипулятором.
Новое тело за несколько часов
Gemini Robotics On-Device 2 переносится на незнакомую двурукую платформу за несколько часов и меньше чем на 200 примерах, даже если у неё другая форма, другие датчики и другое число степеней свободы. На платформе SO101 успешность выросла с 6,7 до 53,3 %, на Dexmate - с 24,4 до 75,6 %; прошлое поколение на том же SO101 доползало только до 6,7 %.
Ограничения записаны в карточке модели: локальная версия хуже справляется с задачами, которых не было в обучении, и с роботами, у которых много подвижных суставов.
Стоп рядом с человеком
Вместе с релизом Google выпустила ASIMOV-Agentic - набор тестов на безопасность агентного управления. Он проверяет, откажется ли модель рассуждения выполнять небезопасный вызов от VLA, сумеет ли предсказать невыполнимость задачи и попросит ли помощи у человека, когда не уверена. По заявлению Google, ER 2 лучше прежних моделей замечает людей поблизости и останавливает робота, если кто-то подошёл слишком близко.
Проверочная точка - открытие VLA
Разработчикам сейчас достался только «мозг»: планирование, разбор видео, координация. Модель, которая двигает ногами и пальцами, остаётся у партнёров, и до её выхода из закрытого доступа управление всем телом живёт в формате демонстрационных роликов. Понятно станет тогда, когда чужие команды покажут Apollo или другую машину на своих задачах - без сценария и без монтажа.