Меню
Наш адрес: г.Воронеж, ул. Кольцовская ул. 39
г.Воронеж, ул. Кольцовская ул. 39
Пн-Пт: с 10 до 19
Сб-Вс: выходной
+7 (473) 200-65-47 +7 (905) 654-74-44 Заказать звонок

Google DeepMind показала Gemini Robotics ER 2 для управления роботами

Google DeepMind показала Gemini Robotics ER 2 для управления роботами

Google DeepMind представила Gemini Robotics ER 2 как модель embodied reasoning, то есть рассуждения в физическом мире. Её роль не сводится к прямому управлению каждым мотором. Модель принимает видео, аудио или текст, формирует план, ведёт диалог с человеком и передаёт отдельные действия специализированной системе управления роботом.

Такое разделение напоминает архитектуру из нескольких уровней. ER 2 отвечает за понимание сцены и выбор следующего шага, а vision-language-action модель или навигационный API выполняет низкоуровневую команду. Это позволяет менять механику робота или исполнительный модуль, не переписывая всю логику планирования.

Ключевое отличие от сценария с одиночным снимком, это работа с непрерывным видеопотоком. Робот может видеть, что действие уже выполнено, обнаруживать ошибку, оценивать изменение положения объекта и не переходить к следующему шагу раньше времени. Для физической системы такая временная связь важна не меньше, чем способность правильно описать предмет.

Google указывает на улучшения в понимании видео, пространственном рассуждении и task orchestration. В прикладном сценарии агент может разбить цель на серию операций, вызвать нужный инструмент, проверить промежуточный результат и скорректировать план. Инструментом может быть не только управление роботом, но и поиск информации или пользовательская функция.

Модель рассчитана на ситуации, где робот сталкивается с непривычной обстановкой. Она должна обобщать задачу на новые предметы и условия, а не только повторять заранее записанную траекторию. На практике качество по-прежнему зависит от камер, задержки канала, точности манипулятора и ограничений низкоуровневого контроллера.

Отдельное направление ER 2, это сотрудничество нескольких роботов. Модель может распределять работу между машинами в общем пространстве, согласовывать очередность действий и использовать разделяемую информацию о состоянии задачи. Так можно выполнять процессы, которые неудобны для одного робота из-за масштаба, времени или необходимости одновременно работать в разных точках.

Google сообщила о сравнении ER 2 с ER 1.6 в трёх режимах: с реальным VLA, с VLA в симуляции и с удалённым управлением человеком. В заявленных тестах новая версия лучше справляется с оркестрацией инструментов. Такие результаты важны как показатель архитектуры, но не заменяют отдельную проверку конкретной роботизированной платформы.

Система доступна разработчикам через Gemini API и Google AI Studio, а также в частном preview на Gemini Enterprise Agent Platform. Для production-сценария потребуется ограничить допустимые команды, добавить аварийную остановку и проверять каждое действие, которое может повредить объект или создать риск для человека.

Источник: Google DeepMind, Gemini Robotics ER 2.

Для физического агента задержка имеет отдельное значение. Модель должна успевать обрабатывать поток, пока объект ещё находится в ожидаемом положении. Google связывает ER 2 с Gemini Live API и двунаправленным потоковым взаимодействием, чтобы рассуждение могло идти одновременно с выполнением. Это полезнее пакетного анализа после завершения операции, но требует устойчивого канала, аккуратного управления состоянием и понятной реакции на пропущенные кадры.

В многоагентном сценарии координация не ограничивается распределением ролей. Роботы должны избегать взаимных помех, понимать занятость общей зоны и подтверждать завершение шага. Для безопасной эксплуатации потребуется внешний контроллер, который проверяет скорость, расстояния и доступность рабочей области. ER 2 может выбирать план, но ответственность за физические ограничения остаётся у системы управления и инженера, который её настроил.

Google DeepMind, Gemini Robotics, роботы, автоматизация, технологии