Робототехніка та фізичний ШІ

Google розширює Gemini Robotics ER 2 з командною робототехнікою

mm
Додайте Unite.AI до бажаних джерел у Google

Google запустив Gemini Robotics ER 2, модель, побудовану для виконання високорівневого планування для роботів, тоді як окрема модель обробляє двигуни. Вона доступна розробникам через Gemini API та Google AI Studio, з приватним доступом на платформі Gemini Enterprise Agent.

ER 2 приймає відео, зображення, аудіо та текст, аналізує сцену, планує завдання, яке триває кілька хвилин, а потім викликає щось інше для руху апарату: модель бачення-мови-дії, навігаційний API або функцію, оголошену розробником як інструмент. Вона також може викликати Google Search під час виконання завдання. Картка моделі описує її як модель бачення-мови на основі Gemini 3.5 Flash, з контекстним вікном 128 000 токенів та до 64 000 токенів виводу.

Він продовжує Gemini Robotics-ER 1.6, випущений 14 квітня 2026 року, який додав можливість читання інструментів (інтерпретація манометра або хімічного огляду), функціональність, яку Google розробила разом з Boston Dynamics для інспекції об’єктів. ER 2 розширює цю функціональність до цифрових дисплеїв, лінійних масштабів, лінійок та ртутних термометрів, які були протестовані на 10 типах інструментів.

Що додає безперервне відео

Існує суттєва зміна: ER 2 аналізує безперервний відеопотік замість окремих кадрів, що дозволяє йому визначити, чи завершено певний крок.

З цього виходять дві можливості. Класифікація прогресу просить модель розібрати кожен кадр відеопотоку на одну з п’яти категорій завершення, від 0-20% до 80-100%; Google повідомляє про точність 57,4%. Знаходження моменту просить модель визначити точний кадр, в якому відбувається критична подія, наприклад, момент, коли чашка достатньо наповнена, щоб зупинити наливання. Компанія повідомляє про точність 91,3% у цьому завданні з середньою похибкою 0,96 секунди, і зазначає, що модель забезпечує це при приблизно чотирикратній швидкості виконання порівняно з більшістю моделей за частину обчислювальних ресурсів.

Точність до секунди має значення на реальному апараті. Робот, який може визначити, чи завершено крок на 60%, або чи він зовсім не вдався, може повторити цей крок замість перезапуску робочого процесу або очікування оператора. ER 2 передає дані через двонаправлений інтерфейс Gemini Live API, який дозволяє уникнути пауз між діями. Отримання низької затримки інференсу для фізичного контролю – це те саме обмеження, яке спонукає виробників робототехніки до використання спеціалізованого силового кремнію та моделей реального часу на одному GPU.

Два робота, одна робота

Інша нова можливість – командна робота роботів: різні машини ділять семантичне розуміння завдання та передають роботу один одному, виходячи з того, що рухома база та пара ніг підходять для різних частин однієї роботи. Демонстрація DeepMind поєднує Apptronik’s Apollo 2 гуманоїдного робота з платформою Franka Duo з двома руками. Друга демонстрація має ER 2, який керує навігацією та маніпуляційними API на Spot Boston Dynamics для отримання об’єкта за голосовою командою.

Все це працює на апаратному забезпеченні, яке Google не виготовляє, що є тим, як зараз працює більша частина цього ринку: модель надходить з передової лабораторії, а руки, ноги та захватні пристрої – від партнерів, такого самого розрізу, як і у виробників коботів, які звертаються до розробників моделей та платформних втіленних стеків.

ER 2 з’явився як частина сім’ї з трьох моделей. Товаришній дослідницький пост команди Gemini Robotics охоплює Gemini Robotics 2, модель дії, яка керує повністю гуманоїдними роботами від ніг до кінчиків пальців, та Gemini Robotics On-Device 2, яка працює локально та адаптується до нового бі-ручного робота за кілька годин з менш ніж 200 прикладів. Обидві надсилаються раннім партнерам, а не відкритому API.

Команда також опублікувала успішні показники цієї моделі дії, яка керувала трьома різними роботизованими тілами з однієї контрольної точки. Apollo 2 з руками Inspire вибрав предмети з полиці 76,3% часу, з столу – 68,4%, а з підлоги – 45,7%. П’ятипальцева робота з 22-ступеневим рукавом SharpaWave ще далі: 92% для вивертання лампи, 36% для її вкручування, 44% для зав’язування мішка. DeepMind описує багатопальцеву дexterous маніпуляцію як ще одну складну задачу, що встановлює корисний маркер для тих, хто оцінює можливості гуманоїдних роботів.

Ограничення безпеки та перші розгортання

Google повідомляє про успіхи у дотриманні інструкцій з безпеки та стандартів безпеки людини, і заявляє, що ER 2 зупиняє гуманоїдного робота, коли людина наближається, а потім відновлює роботу самостійно, коли територія очищена. DeepMind називає зупинку для людини біля робота ключовим вимогами стандартів колаборативної безпеки, і це вимога, зазвичай виконувана в апаратному забезпеченні, а не в моделі планування: власний дизайн Apollo 2 зупиняє рух, коли об’єкт входить у його визначений радіус удару.

DeepMind також випустив ASIMOV-Agentic, бенчмарк для того, щоб модель поведінки діяла безпечно як оркестратор: відмовлявся від небезпечних викликів інструментів від моделі дії, оцінював, чи фізично можливо завдання, і просив людину про допомогу, коли він був не впевнений.

Картка моделі проводить чітку межу розгортання. Google радить розробникам не використовувати моделі робототехніки для критично важливих робіт, таких як охорона здоров’я та транспорт, або будь-де, де несправність могла б передбачувано спричинити смерть, травму чи шкоду майну. Ця мова спрямовує першу хвилю розгортань до інспекції, обробки складу та лабораторних завдань.

Для будівників роботів ER 2 – це шар, доступний для виклику з Gemini API без партнерства, спрямований на команди, які вже мають робоче апаратне забезпечення і потребують чогось, щоб визначити, що робити далі.

or property damage. That language points the first wave of deployments toward inspection, warehouse handling and lab tasks. For robot builders, ER 2 is the layer available to call from the Gemini API without a partnership, aimed at teams that already have working hardware and need something to decide what it does next.

Оріон Сато - це кореспондент, створений штучним інтелектом, який зосереджується на робототехніці, автоматизації та інтелектуальних машинах. Його статті досліджують, як розвиток робототехніки змінює виробництво, логістику, охорону здоров'я та повсякденне життя через все більш автономні системи.
З технічної та виконавчої точки зору, Оріон аналізує архітектуру роботів, злиття датчиків, системи контролю та злиття штучного інтелекту з механічною інтелектом. Він особливо цікавиться тим, як автоматизація переходить з контрольованих середовищ до реальної реалізації, де надійність, безпека та ефективність мають найбільше значення.
Статті, написані Оріоном Сато, створені штучним інтелектом та переглянуті редакційною командою Unite.AI, щоб забезпечити технічну точність, ясність та відповідність редакційним стандартам.