로보틱스 및 피지컬 AI

구글, 다중 로봇 협업 가능한 Gemini Robotics ER 2 출시

mm
Unite.AI를 Google의 선호 소스에 추가

구글은 Gemini Robotics ER 2를 출시했습니다. 이는 로봇의 고급 계획을 담당하는 모델로, 별도의 모델이 모터를 제어합니다. Gemini API와 Google AI Studio를 통해 개발자에게 제공되며, Gemini Enterprise Agent Platform에서는 비공개 미리 보기로 제공됩니다.

ER 2는 비디오, 이미지, 오디오 및 텍스트를 입력받아 장면을 이해하고, 수 분 동안 실행되는 작업을 계획한 후, 하드웨어를 제어하는 다른 모델을 호출합니다. 이는 비전-언어-행동 모델, 네비게이션 API 또는 개발자가 모델에 선언한 함수일 수 있습니다. 또한 작업 중에 구글 검색을 호출할 수 있습니다. 모델 카드는 Gemini 3.5 Flash를 기반으로 하는 비전-언어 모델로, 128,000토큰의 컨텍스트 창과 최대 64,000토큰의 출력을 가집니다.

이전 모델인 Gemini Robotics-ER 1.6의 후속 모델로, 2026년 4월 14日に 출시되었습니다. ER 1.6는 시설 점검 라운드에서 기기 읽기 기능을 추가했으며, 보스턴 다이내믹스와 함께 개발되었습니다. ER 2는 디지털 디스플레이, 선형 규모, 자 및 액체 온도계와 같은 10가지 기기 유형을 테스트한 디스플레이를 추가했습니다.

연속 비디오가 추가하는 것

중요한 변경은 ER 2가 정지 프레임 대신 라이브 비디오 피드에서 이유를 제공한다는 것입니다. 이는 로봇의 자율성을 제한하는 중요한 요소 중 하나인 단계가 완료되었는지 여부를 판단할 수 있습니다.

이로 인해 두 가지 기능이 제공됩니다. 진행 분류는 모델이 비디오 피드의 각 프레임을 0-20%에서 80-100%까지 5개의 완료 밴드 중 하나로 분류하도록 요청합니다. 구글은 57.4%의 정확도를 보고합니다. 순간 찾기에서는 모델이 비디오에서 중요한 이벤트가 발생하는 정확한 프레임을 찾도록 요청합니다. 예를 들어, 컵이 충분히 채워져서倒는 것을停止해야 하는 지점입니다. 구글은 이 작업에서 91.3%의 정확도와 0.96초의 평균 오류를 보고하며, 이는 더 큰 모델의 4배의 실행 속도에 불과한 컴퓨팅 비용으로 제공된다고 말합니다.

실제 기계에서 중요한 것은 서브초 타이밍입니다. 단계가 60% 완료되었거나 완전히 실패했다는 것을 알 수 있는 로봇은 워크플로를 다시 시작하거나 운영자를 기다리는 대신 해당 단계를 다시 시도할 수 있습니다. ER 2는 Gemini Live API의 양방향 엔드포인트를 통해 스트리밍되며, 이는 구글이 이유 루프에서 정지-思考-정지를 삽입하지 않도록 합니다. 물리적 제어를 위한 추론 지연을 낮추는 것은 로봇 공급업체를 전용 온-로봇 실리콘과 단일 GPU 실시간 모델로 밀어붙이는 동일한 제약입니다.

두 로봇, 하나의 작업

새로운 기능은 다중 로봇 협업입니다. 즉, 서로 다른 기계가 작업에 대한 의미론적 이해를 공유하고 작업을 나누어 수행합니다. 디프마인드의 데모는 Apptronik의 Apollo 2 휴머노이드와 Franka Duo 비암 플랫폼을 페어링합니다. 두 번째 데모에서는 ER 2가 보스턴 다이내믹스의 Spot에 네비게이션 및 매니퓰레이터 API를 호출하여 음성 명령으로 객체를 가져옵니다.

이 모든 것이 구글이 구축하지 않은 하드웨어에서 실행됩니다. 이는 대부분의 시장에서 현재 작동하는 방식입니다. 모델은 최전선 연구소에서 나옵니다. 그리고 팔, 다리 및 그리퍼는 파트너에서 나옵니다. 이는 코봇 메이커가Foundation 모델 개발자와 플랫폼 수준의 구현된 AI 스택을 구축하는 것과 같은 분할입니다.

ER 2는 세 모델 패밀리의 일부로 도착했습니다. Gemini Robotics 팀의 동반 연구 게시물은 Gemini Robotics 2, 즉 전체 휴머노이드를 제어하는 액션 모델과 Gemini Robotics On-Device 2, 즉 새로운 비암 로봇에 적응하는 로컬 모델을 다룹니다. 두 모델 모두 공개 API가 아닌 초기 액세스 파트너에게 제공됩니다.

팀은 또한 해당 액션 모델의 성공률을 발표했으며, 이는 단일 체크포인트에서 세 가지 다른 로봇 몸체를 구동했습니다. Inspire 손이 장착된 Apollo 2는 76.3%의 시간에 선반에서, 68.4%의 시간에 테이블에서, 45.7%의 시간에 바닥에서 물건을 집었습니다. 22 자유도 SharpaWave 손과 함께 작업하는 다섯 손가락 작업은 뒤처졌습니다. 92%는 라이트 불을 분리하는 데 성공했지만, 36%는 라이트 불을 조립하는 데 성공했으며, 44%는 쓰레기 봉지를 묶는 데 성공했습니다. 디프마인드는 다중 손가락의 정교한 조작이 여전히 도전적인 것으로 간주합니다. 이는 휴머노이드 능력 주장을 평가하는 데 유용한 마커를 제공합니다.

안전 제한 및 첫 배치

구글은 안전 지침 및 인간 근접 벤치마크에서 향상을 보고하며, ER 2가 사람이 가까이 오면 휴머노이드를 중지시키고 해당 지역이 비워지면 다시 시작한다고 말합니다. 디프마인드는 사람이 가까이 오면 정지를 요구하는 협동 안전 표준의 핵심 요구 사항으로 간주합니다. 이는 일반적으로 하드웨어에서滿足되는 요구 사항입니다. Apollo 2의 디자인은 정의된 영향 반경 내에 들어오는 객체에 대한 동작을 중지합니다.

디프마인드는 또한 ASIMOV-Agentic 벤치마크를 출시했습니다. 이는 이유 모델이 안전한 오케스트레이터로 행동하는지 여부를 평가하는 것입니다. 즉, 액션 모델에서 안전하지 않은 도구 호출을 거부하고, 작업이 물리적으로 가능하도록 판단하며, 불확실한 경우 인간에게 도움을 요청합니다.

모델 카드는 확고한 배포 경계를 그립니다. 구글은 개발자에게 로봇 공학 모델을 사용하여 안전에 중요한 작업, 즉 의료, 운송 또는 고장으로 인해 예상치 못한 사고나 재산 피해를 초래할 수 있는 작업을 수행하지 않도록 지시합니다. 이러한 언어는 첫 번째 배포를 점검, 창고 처리 및 실험실 작업으로 направляет.

로봇 빌더를 위한 ER 2는 Gemini API에서 파트너십 없이 호출할 수 있는 계층입니다. 이는 이미 작동하는 하드웨어가 있는 팀을 대상으로하며, 다음에 무엇을 할지 결정할 수 있도록 설계되었습니다.

오리온 사토는 로봇공학, 자동화, 지능형 기계에 초점을 맞춘 AI 생성 기자입니다. 그의 글은 로봇공학의 발전이 제조, 물류, 의료, 일상 생활을 점점 더 자율적인 시스템으로 바꾸는 방법을 탐구합니다.
기술적이고 실행 가능한 관점에서 오리온은 로봇 아키텍처, 센서 퓨전, 제어 시스템, 그리고 기계 지능과 AI의 융합에 대해 분석합니다. 그는 자동화가 제어 환경에서 실제 배치로 이동하는 방법, 특히 신뢰성, 안전성, 효율성이 가장 중요하게 여겨지는 곳에 대해 관심을 가지고 있습니다.
오리온 사토가 작성한 기사들은 AI로 생성되어 Unite.AI의 편집 팀에 의해 기술적 정확성, 명확성, 편집 표준 준수를 보장하기 위해 검토됩니다.