Робототехника и физический ИИ

Google Выпускает Gemini Robotics ER 2 С Многороботным Сотрудничеством

mm
Добавьте Unite.AI в избранные источники в Google

Google запустил Gemini Robotics ER 2, модель рассуждений, построенную для служения в качестве высокоуровневого планировщика робота, в то время как отдельная модель обрабатывает двигатели. Она доступна разработчикам через Gemini API и Google AI Studio, с частным просмотром на платформе Gemini Enterprise Agent.

ER 2 принимает видео, изображения, аудио и текст, рассуждает о сцене, планирует задачу, которая длится несколько минут, а затем вызывает что-то другое, чтобы переместить аппаратуру: модель видения-языка-действия, API навигации или функцию, объявленную разработчику как инструмент. Она также может вызвать Google Search во время выполнения задачи. Карта модели описывает ее как модель видения-языка на основе Gemini 3.5 Flash, с контекстным окном 128 000 токенов и до 64 000 токенов вывода.

Она заменяет Gemini Robotics-ER 1.6, выпущенную 14 апреля 2026 года, которая добавила чтение инструментов (интерпретацию манометра или химического смотрового стекла), возможность, которую Google разработала с Boston Dynamics для инспекции объектов. ER 2 расширяет это до цифровых дисплеев, линейных масштабов, линеек и жидкостных термометров, протестированных на 10 типах инструментов.

Что добавляет непрерывное видео

Существенное изменение заключается в том, что ER 2 рассуждает над живым видеопотоком, а не статичными кадрами, что позволяет ему судить о том, что имеет тихо ограниченную автономию робота:是否 завершен шаг.

Из этого вытекают две возможности. Классификация прогресса требует от модели отсортировать каждый кадр потока в одну из пяти групп завершения, от 0-20% до 80-100%; Google сообщает об точности 57,4%. Поиск момента требует от нее определить точный кадр, где происходит критическое событие, такое как момент, когда чашка достаточно полна, чтобы перестать наливать. Компания сообщает об точности 91,3% при этом задании с средней ошибкой 0,96 секунды и говорит, что модель обеспечивает это примерно в четыре раза быстрее, чем гораздо более крупные модели, за долю вычислений.

Субсекундная временная точность является частью, которая имеет значение на реальной машине. Робот, который может сказать, что шаг выполнен на 60%, или полностью неудачно, может повторить этот шаг вместо того, чтобы перезапускать рабочий процесс или ждать оператора. ER 2 передается через двусторонний конечный пункт Gemini Live API, который является тем, как Google сохраняет рассуждения от вставки пауз между действиями. Получение задержки вывода достаточно низкой для физического управления является тем же ограничением, которое толкает поставщиков робототехники к специализированному силикону на роботе и моделям реального времени на одном GPU.

Два робота, одна работа

Другая новая возможность – многороботное сотрудничество: разные машины делят семантическое понимание задачи и передают работу между ними, исходя из предположения, что колесная база и пара ног подходят для разных частей одной и той же работы. Демонстрация DeepMind объединяет Apptronik’s Apollo 2 гуманоид с платформой Franka Duo bi-arm. Вторая демонстрация имеет ER 2, управляющую навигацией и манипуляторами API на Spot Boston Dynamics, чтобы получить объект по голосовой команде.

Все это работает на аппаратуре, которую Google не строит, что является тем, как сейчас работает большинство этого рынка: модель поступает из передовой лаборатории, а руки, ноги и захваты поступают от партнеров, тот же раскол, что и у производителей коботов, которые ухаживают за разработчиками моделей и платформенными воплощенными стеками.

ER 2 прибыла в качестве части семейства из трех моделей. Сопровождающий исследовательский пост команды Gemini Robotics охватывает Gemini Robotics 2, модель действия, которая контролирует полные гуманоиды от ног до кончиков пальцев, и Gemini Robotics On-Device 2, которая работает локально и адаптируется к новому би-руке в течение нескольких часов из менее чем 200 примеров. Обе модели поступают ранним партнерам, а не в открытый API.

Команда также опубликовала показатели успешности за эту модель действия, которая управляла тремя разными роботами из одной контрольной точки. Apollo 2, оснащенный руками Inspire, выбирал объекты с полки 76,3% времени, со стола 68,4%, а с пола 45,7%. Работа с пятью пальцами с помощью 22-ступенчатой руки SharpaWave еще дальше: 92% для выкручивания лампочки, 36% для завинчивания ее, 44% для завязывания мусорного мешка. DeepMind описывает многофингерную ловкость как все еще сложную, что устанавливает полезный маркер для всех, кто оценивает утверждения о возможностях гуманоидов.

Ограничения безопасности и первые развертывания

Google сообщает о достижениях в безопасности-инструкции и человеческой близости, и говорит, что ER 2 останавливает гуманоида, когда человек приближается, а затем возобновляет работу самостоятельно, когда область очищена. DeepMind называет остановку для ближайшего человека ключевым требованием в стандартах совместной безопасности, и это требование обычно выполняется в аппаратуре, а не в модели планирования: собственный дизайн Apollo 2 останавливает движение, когда объект входит в его определенный радиус удара.

DeepMind также выпустил ASIMOV-Agentic, эталон для того, чтобы рассуждаемая модель вела себя безопасно как оркестратор: отказ от опасных вызовов инструментов от модели действия, суждение о том, физически ли возможно задание, и обращение к человеку за помощью, когда он не уверен.

Карта модели рисует твердую границу развертывания. Google говорит разработчикам не использовать модели робототехники для критически важной работы, называя здравоохранение и транспорт, или где неисправность могла бы предвидимо вызвать смерть, травму или ущерб имуществу. Этот язык направляет первую волну развертываний к инспекции, обработке на складе и лабораторным задачам.

Для строителей роботов ER 2 является слоем, доступным для вызова из Gemini API без партнерства, направленным на команды, которые уже имеют рабочую аппаратуру и нуждаются в чем-то, чтобы решить, что делать дальше.

Орион Сато - это корреспондент, сгенерированный ИИ, который фокусируется на робототехнике, автоматизации и интеллектуальных машинах. Его статьи исследуют, как достижения в робототехнике меняют производство, логистику, здравоохранение и повседневную жизнь посредством все более автономных систем.
С технической и ориентированной на выполнение точки зрения, Орион анализирует робототехнические архитектуры, слияние датчиков, системы управления и слияние ИИ с механической интеллектом. Он особенно интересуется тем, как автоматизация переходит из контролируемых сред в реальное внедрение, где надежность, безопасность и эффективность имеют наибольшее значение.
Статьи, написанные Орионом Сато, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить техническую точность, ясность и соответствие редакционным стандартам.