Robot học và AI vật lý

Google Phát Hành Gemini Robotics ER 2 Với Hợp Tác Đa Robot

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Google đã phát hành Gemini Robotics ER 2, một mô hình lý luận thể hiện được xây dựng để phục vụ như một nhà lập kế hoạch cấp cao cho robot trong khi một mô hình riêng biệt xử lý động cơ. Nó có sẵn cho các nhà phát triển thông qua Gemini API và Google AI Studio, với quyền truy cập xem trước riêng trên Gemini Enterprise Agent Platform.

ER 2 nhận vào video, hình ảnh, âm thanh và văn bản, lý luận về cảnh, lập kế hoạch nhiệm vụ chạy trong vài phút, sau đó gọi một thứ khác để di chuyển phần cứng: một mô hình ngôn ngữ-hành động, một API điều hướng hoặc một hàm riêng của nhà phát triển được khai báo với mô hình như một công cụ. Nó cũng có thể gọi Google Search giữa nhiệm vụ. Thẻ mô hình mô tả nó như một mô hình ngôn ngữ-vision dựa trên Gemini 3.5 Flash, với cửa sổ ngữ cảnh 128.000 token và tối đa 64.000 token đầu ra.

Nó kế thừa Gemini Robotics-ER 1.6, được phát hành vào ngày 14 tháng 4 năm 2026, đã thêm khả năng đọc thiết bị (giải thích áp kế hoặc thủy tinh nhìn化学), một khả năng mà Google đã phát triển với Boston Dynamics cho các vòng kiểm tra cơ sở. ER 2 mở rộng khả năng đó sang hiển thị kỹ thuật số, thước kẻ, thước đo và nhiệt kế lỏng, được thử nghiệm trên 10 loại thiết bị.

Điều gì được thêm vào video liên tục

Thay đổi thực chất là ER 2 lý luận trên một luồng video trực tiếp thay vì khung hình tĩnh, điều này cho phép nó phán đoán điều gì đã hạn chế tự chủ robot một cách im lặng: liệu một bước đã hoàn thành.

Hai khả năng xuất phát từ đó. Phân loại tiến trình yêu cầu mô hình phân loại mỗi khung hình của luồng vào một trong năm băng hoàn thành, từ 0-20% đến 80-100%; Google báo cáo độ chính xác 57,4%. Tìm thời điểm yêu cầu nó xác định chính xác khung hình nơi một sự kiện quan trọng xảy ra, chẳng hạn như điểm mà một cốc đủ đầy để ngừng đổ. Công ty báo cáo độ chính xác 91,3% trong nhiệm vụ đó với sai số trung bình 0,96 giây, và cho biết mô hình cung cấp nó với tốc độ thực hiện nhanh hơn khoảng bốn lần so với các mô hình lớn hơn với một phần nhỏ tính toán.

Đồng hồ thời gian dưới giây là phần quan trọng trên một máy thực. Một robot có thể nói rằng một bước đã hoàn thành 60% hoặc đã thất bại hoàn toàn, có thể thử lại bước đó thay vì khởi động lại quy trình làm việc hoặc chờ một vận hành viên. ER 2 truyền qua điểm cuối bidirectional của Gemini Live API, đó là cách Google giữ vòng lặp lý luận từ chèn các khoảng dừng nghĩ giữa các hành động. Việc nhận độ trễ suy luận đủ thấp cho kiểm soát vật lý là ràng buộc tương tự như đẩy các nhà cung cấp robot hướng tới silicon chuyên dụng trên robotmô hình thời gian thực trên một GPU.

Hai robot, một công việc

Khả năng mới khác là hợp tác đa robot: các máy khác nhau chia sẻ một sự hiểu biết ngữ nghĩa về nhiệm vụ và trao đổi công việc giữa chúng, dựa trên lý do rằng một cơ sở bánh xe và một đôi chân phù hợp với các phần khác nhau của cùng một công việc. Demonstration của DeepMind ghép Apptronik’s Apollo 2 humanoid với một nền tảng bi-arm Franka Duo. Một demo khác có ER 2 điều khiển các API điều hướng và manipulator trên Spot của Boston Dynamics để lấy một vật thể theo lệnh nói.

Tất cả điều đó chạy trên phần cứng mà Google không xây dựng, đó là cách thị trường này hoạt động: mô hình đến từ một phòng thí nghiệm tiền phong và cánh tay, chân và gắp đến từ các đối tác, cùng sự chia tách như cobot makersplatform-level embodied stacks.

ER 2 đến như một phần của gia đình mô hình ba. Bài đăng nghiên cứu đồng hành từ đội Gemini Robotics bao gồm Gemini Robotics 2, một mô hình hành động điều khiển toàn bộ humanoid từ chân đến ngón tay, và Gemini Robotics On-Device 2, chạy cục bộ và thích nghi với một robot bi-arm mới trong vài giờ từ ít hơn 200 ví dụ. Cả hai đều đi đến các đối tác truy cập sớm chứ không phải API mở.

Đội cũng đã xuất bản tỷ lệ thành công đằng sau mô hình hành động đó, điều khiển ba cơ thể robot khác nhau từ một điểm kiểm tra. Apollo 2 được trang bị tay Inspire chọn các vật thể từ một kệ 76,3% thời gian, từ một bảng 68,4% và từ sàn 45,7%. Công việc năm ngón tay với tay SharpaWave 22 độ tự do còn xa: 92% cho việc tháo ốc vít bóng đèn, 36% cho việc vặn ốc vít, 44% cho việc buộc túi rác. DeepMind mô tả việc thao tác dexterous đa ngón tay vẫn còn thách thức, điều này đặt ra một dấu hiệu hữu ích cho bất kỳ ai đánh giá khả năng humanoid.

Giới hạn an toàn và triển khai đầu tiên

Google báo cáo những lợi ích về việc tuân thủ hướng dẫn an toàn và chuẩn mực gần gũi con người, và cho biết ER 2 dừng một humanoid khi một người đến gần, sau đó tự động tiếp tục khi khu vực được làm sạch. DeepMind gọi việc dừng lại cho một người gần đó là một yêu cầu quan trọng trong các tiêu chuẩn an toàn hợp tác, và đó là một yêu cầu thường được đáp ứng trong phần cứng chứ không phải trong mô hình lập kế hoạch: thiết kế Apollo 2 tự động dừng chuyển động khi một vật thể vào trong bán kính tác động được xác định.

DeepMind cũng đã phát hành ASIMOV-Agentic, một chuẩn mực cho việc một mô hình lý luận có hành vi an toàn như một người điều phối: từ chối các cuộc gọi công cụ không an toàn từ mô hình hành động, phán đoán xem một nhiệm vụ có khả thi về mặt vật lý hay không, và yêu cầu một người giúp đỡ khi nó không chắc chắn.

Thẻ mô hình vẽ một ranh giới triển khai chắc chắn. Google cho các nhà phát triển biết không sử dụng các mô hình robot cho công việc quan trọng về an toàn, đặt tên cho chăm sóc sức khỏe và vận tải, hoặc bất kỳ nơi nào một sự cố có thể dự đoán được gây tử vong, thương tích hoặc thiệt hại tài sản. Ngôn ngữ đó chỉ hướng đầu tiên của các triển khai đến kiểm tra, xử lý kho hàng và nhiệm vụ phòng thí nghiệm.

Đối với những người xây dựng robot, ER 2 là lớp có sẵn để gọi từ Gemini API mà không cần đối tác, nhằm vào các đội đã có phần cứng hoạt động và cần một thứ gì đó để quyết định nó làm gì tiếp theo.

Orion Sato là một phóng viên được tạo bởi AI, tập trung vào robotics, tự động hóa và máy thông minh. Các bài viết của ông khám phá cách các tiến bộ trong lĩnh vực robot đang thay đổi việc sản xuất, hậu cần, chăm sóc sức khỏe và cuộc sống hàng ngày thông qua các hệ thống tự động hóa ngày càng tăng.

Với quan điểm kỹ thuật và định hướng thực thi, Orion phân tích kiến trúc robot, hợp nhất cảm biến, hệ thống điều khiển và sự hội tụ của AI với trí tuệ cơ học. Ông đặc biệt quan tâm đến cách tự động hóa di chuyển từ môi trường được kiểm soát vào triển khai thực tế, nơi độ tin cậy, an toàn và hiệu quả quan trọng nhất.

Các bài viết được viết bởi Orion Sato được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác kỹ thuật, sự rõ ràng và tuân thủ các tiêu chuẩn biên tập.