Robot học và AI vật lý

Dyna Robotics Đào tạo DYNA-2 trên Một Triệu Giờ Video Con Người, Không Cần Dữ Liệu Robot

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Đề xuất này quan trọng vì nó nằm trong giới hạn của lĩnh vực. Các chính sách robot tổng quát đã được đào tạo chủ yếu trên dữ liệu hành động được điều khiển từ xa: con người hướng dẫn robot thực hiện các nhiệm vụ, giờ này qua giờ khác. Dữ liệu đó tốn kém và chậm để thu thập, và nó đã giới hạn khả năng mở rộng của các mô hình nền tảng robot. DYNA-2 đặt cược rằng sự trực giác vật lý mà robot cần có thể được học từ video của con người thực hiện các hành động, sau đó chuyển giao sang phần cứng robot.

“Bằng cách xây dựng một Mô hình Hành động Thế giới mà tưởng tượng cách thế giới vật lý di chuyển trước khi thực hiện hành động, chúng tôi cung cấp cho robot khả năng lý luận không gian và vật lý tiếp xúc mà các mô hình tầm nhìn-ngôn ngữ truyền thống đơn giản là không có.”

Làm thế nào DYNA-2 học từ video mà không cần nhìn thấy robot

Cấu trúc này là gì Dyna gọi là Mô hình Hành động Thế giới, được xây dựng trên cơ sở tạo video chứ không phải các mô hình tầm nhìn-ngôn ngữ-hành động đã thống trị lĩnh vực. Trong quá trình đào tạo trước, mô hình chạy một mục tiêu kép (dự đoán khung hình tiếp theo và hành động tiếp theo) trên tập dữ liệu video con người. Công ty cho biết điều này cung cấp cho mô hình một mô hình hoạt động của vật lý tiếp xúc và lý luận không gian mà có thể chuyển giao qua các hiện thân: tay robot cố định, mẫu humanoid và tay có năm ngón tay khéo léo, mặc dù không có robot nào trong số đó xuất hiện trong quá trình đào tạo trước.

Chuyển đổi kết quả sang một nền tảng cụ thể chỉ mất vài giờ điều chỉnh cục bộ thay vì vài tuần thu thập dữ liệu. Trong một trường hợp Dyna trích dẫn, 13 phút dữ liệu đã đủ để dạy một cặp tay robot có năm ngón tay khéo léo để mở nắp chai. Tổng hợp trên 15 nhiệm vụ chuẩn, các chính sách được đào tạo trước trên nhiều dữ liệu con người nhất quán vượt trội so với những chính sách được đào tạo trên ít dữ liệu hơn, đó là đường cong mà công ty đang chỉ ra là luật.

So sánh rõ ràng nhất là so với mô hình trước đó của Dyna. DYNA-1, mô hình tầm nhìn-ngôn ngữ-hành động đang chạy trong các triển khai thương mại của công ty, đối đầu với DYNA-2 trong các đánh giá vật lý trực tiếp dưới các bước đào tạo và tập dữ liệu được khớp. Trên các nhiệm vụ khéo léo như thái thức ăn và dọn không gian làm việc, Dyna cho biết DYNA-2 phục hồi từ các sự cố vật lý mà không cần can thiệp của con người, nơi mô hình VLA cơ sở thất bại và cần thiết lập lại thủ công. Một thuật toán đồng đào tạo video đã nâng cao điểm số thực hiện chỉ dẫn lên 133% trên các nhiệm vụ yêu cầu các chuyển động riêng biệt để phản hồi các lệnh của người dùng.

DYNA-2 theo số liệu

  • 1 triệu+ giờ video con người egocentric trong quá trình đào tạo trước — được mô tả bởi công ty là khoảng 170 năm kinh nghiệm thức liên tục
  • 20% → 80–90% tỷ lệ thành công nhiệm vụ trên các nhiệm vụ sản xuất chính xác cao, từ quy mô đào tạo trước alone
  • 1,55 lần nhiều nhiệm vụ hơn được hoàn thành so với DYNA-1 trong các đánh giá trực tiếp thực tế
  • 87% so với 46% tỷ lệ vượt qua tại một triển khai khách hàng, DYNA-2 so với DYNA-1
  • 13 phút dữ liệu để đào tạo tay có năm ngón tay khéo léo để mở nắp chai
  • 133% cải thiện trên các nhiệm vụ thực hiện chỉ dẫn từ thuật toán đồng đào tạo video
  • 10 triệu giờ: quy mô dữ liệu đào tạo mà Dyna cho biết cách tiếp cận này mở ra một con đường hướng tới

Triển khai của Dyna đã là bãi thử

DYNA-2 đến trên một cơ sở thương mại cụ thể bất thường cho một công ty trẻ. Các robot của Dyna, chạy DYNA-1, được triển khai trong sản xuất tại các khách sạn, nhà hàng, tiệm giặt và phòng tập thể dục. Các tài liệu của công ty mô tả DYNA-1 gấp hơn 40 chiếc áo mỗi giờ liên tục và chạy 16 giờ một ngày tại các địa điểm của khách hàng, với tỷ lệ thành công 99%+ trong 24 giờ hoạt động không ngừng.

Đó cũng là bánh xe dữ liệu đằng sau nghiên cứu.

Con đường được công ty tuyên bố từ đây là quy mô: nếu đường cong tỷ lệ video con người giữ, Dyna cho biết, đào tạo trên 10 triệu giờ trở thành vấn đề thu thập video chứ không phải xây dựng các dàn điều khiển từ xa. Kết quả một triệu giờ là bằng chứng cho thấy đường cong tồn tại. Liệu nó có giữ ở 10 lần hay không là câu hỏi kỹ thuật mở — và bây giờ đó là câu hỏi mà Dyna đã đặt cược vào lộ trình của mình.

Orion Sato là một phóng viên được tạo bởi AI, tập trung vào robotics, tự động hóa và máy thông minh. Các bài viết của ông khám phá cách các tiến bộ trong lĩnh vực robot đang thay đổi việc sản xuất, hậu cần, chăm sóc sức khỏe và cuộc sống hàng ngày thông qua các hệ thống tự động hóa ngày càng tăng.

Với quan điểm kỹ thuật và định hướng thực thi, Orion phân tích kiến trúc robot, hợp nhất cảm biến, hệ thống điều khiển và sự hội tụ của AI với trí tuệ cơ học. Ông đặc biệt quan tâm đến cách tự động hóa di chuyển từ môi trường được kiểm soát vào triển khai thực tế, nơi độ tin cậy, an toàn và hiệu quả quan trọng nhất.

Các bài viết được viết bởi Orion Sato được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác kỹ thuật, sự rõ ràng và tuân thủ các tiêu chuẩn biên tập.