Google DeepMind представила Gemini Robotics ER 2 как модель embodied reasoning, то есть рассуждения в физическом мире. Её роль не сводится к прямому управлению каждым мотором. Модель принимает видео, аудио или текст, формирует план, ведёт диалог с человеком и передаёт отдельные действия специализированной системе управления роботом.
Такое разделение напоминает архитектуру из нескольких уровней. ER 2 отвечает за понимание сцены и выбор следующего шага, а vision-language-action модель или навигационный API выполняет низкоуровневую команду. Это позволяет менять механику робота или исполнительный модуль, не переписывая всю логику планирования.
Ключевое отличие от сценария с одиночным снимком, это работа с непрерывным видеопотоком. Робот может видеть, что действие уже выполнено, обнаруживать ошибку, оценивать изменение положения объекта и не переходить к следующему шагу раньше времени. Для физической системы такая временная связь важна не меньше, чем способность правильно описать предмет.
Google указывает на улучшения в понимании видео, пространственном рассуждении и task orchestration. В прикладном сценарии агент может разбить цель на серию операций, вызвать нужный инструмент, проверить промежуточный результат и скорректировать план. Инструментом может быть не только управление роботом, но и поиск информации или пользовательская функция.
Модель рассчитана на ситуации, где робот сталкивается с непривычной обстановкой. Она должна обобщать задачу на новые предметы и условия, а не только повторять заранее записанную траекторию. На практике качество по-прежнему зависит от камер, задержки канала, точности манипулятора и ограничений низкоуровневого контроллера.
Отдельное направление ER 2, это сотрудничество нескольких роботов. Модель может распределять работу между машинами в общем пространстве, согласовывать очередность действий и использовать разделяемую информацию о состоянии задачи. Так можно выполнять процессы, которые неудобны для одного робота из-за масштаба, времени или необходимости одновременно работать в разных точках.
Google сообщила о сравнении ER 2 с ER 1.6 в трёх режимах: с реальным VLA, с VLA в симуляции и с удалённым управлением человеком. В заявленных тестах новая версия лучше справляется с оркестрацией инструментов. Такие результаты важны как показатель архитектуры, но не заменяют отдельную проверку конкретной роботизированной платформы.
Система доступна разработчикам через Gemini API и Google AI Studio, а также в частном preview на Gemini Enterprise Agent Platform. Для production-сценария потребуется ограничить допустимые команды, добавить аварийную остановку и проверять каждое действие, которое может повредить объект или создать риск для человека.
Источник: Google DeepMind, Gemini Robotics ER 2.
Для физического агента задержка имеет отдельное значение. Модель должна успевать обрабатывать поток, пока объект ещё находится в ожидаемом положении. Google связывает ER 2 с Gemini Live API и двунаправленным потоковым взаимодействием, чтобы рассуждение могло идти одновременно с выполнением. Это полезнее пакетного анализа после завершения операции, но требует устойчивого канала, аккуратного управления состоянием и понятной реакции на пропущенные кадры.
В многоагентном сценарии координация не ограничивается распределением ролей. Роботы должны избегать взаимных помех, понимать занятость общей зоны и подтверждать завершение шага. Для безопасной эксплуатации потребуется внешний контроллер, который проверяет скорость, расстояния и доступность рабочей области. ER 2 может выбирать план, но ответственность за физические ограничения остаётся у системы управления и инженера, который её настроил.