Robot học và AI vật lý
mimic robotics Giới thiệu FLUX-mimic để Mang lại Mô hình Hành động Video đến Sàn Nhà máy của Audi

mimic robotics đã giới thiệu FLUX-mimic, một Mô hình Hành động Video mới được thiết kế để giúp robot công nghiệp học các nhiệm vụ thao tác phức tạp từ lượng dữ liệu trình diễn nhỏ hơn đáng kể.
Được phát triển hợp tác với công ty trí tuệ nhân tạo trực quan Black Forest Labs, hệ thống này đã được thử nghiệm và triển khai với Audi trên các nhiệm vụ sản xuất mà trước đây khó tự động hóa, bao gồm công việc liên quan đến vật liệu linh hoạt, cấu hình phần thay đổi và thao tác chính xác.
Thông báo này cho thấy một sự thay đổi tiềm năng trong trí tuệ nhân tạo vật lý. Thay vì dựa chủ yếu vào các bộ sưu tập lớn các bản trình diễn robot, FLUX-mimic cố gắng chuyển giao kiến thức đã được học bởi một mô hình video tạo ra vào một hệ thống có khả năng điều khiển máy móc vật lý.
Một Cách Tiếp cận Mới để Học tập Robot
Nhiều hệ thống robot tổng quát ngày nay dựa trên Mô hình Ngôn ngữ-Hành động, thường được gọi là VLAs. Những hệ thống này thường kết hợp một mô hình được đào tạo trên hình ảnh và ngôn ngữ với một thành phần bổ sung dự đoán các chuyển động mà robot nên thực hiện.
Cách tiếp cận này cung cấp cho robot một mức độ hiểu biết ngữ nghĩa, chẳng hạn như nhận dạng đối tượng hoặc giải thích một hướng dẫn viết. Tuy nhiên, hình ảnh tĩnh không thể nắm bắt đầy đủ cách các đối tượng uốn cong, di chuyển, va chạm hoặc phản ứng với tiếp xúc vật lý.
Kiến thức bị thiếu phải do đó được học từ các bản trình diễn robot, điều này có thể tốn kém và mất thời gian để thu thập. Mỗi bản trình diễn yêu cầu một robot vật lý, một vận hành viên, một không gian làm việc phù hợp và dữ liệu hành động được ghi lại cẩn thận.
FLUX-mimic đi theo một con đường khác. Nó sử dụng các biểu diễn trực quan được tạo ra bởi mô hình FLUX 3 của Black Forest Labs làm nền tảng để dự đoán cách một nhiệm vụ nên diễn ra theo thời gian. Black Forest Labs mô tả FLUX 3 như một mô hình đa phương thức có khả năng tạo ra hình ảnh, video, âm thanh và hành động, chứ không phải là một hệ thống giới hạn ở việc tạo ra hình ảnh tĩnh.
Một bộ giải mã hành động sau đó dịch dự đoán trực quan của mô hình thành các lệnh mà robot có thể thực hiện. Về mặt thực tế, hệ thống đầu tiên ước tính việc hoàn thành thành công một nhiệm vụ nên trông như thế nào và sau đó xác định các chuyển động vật lý cần thiết để tạo ra kết quả đó.
Xây dựng Trên Kiến trúc mimic-video
FLUX-mimic xây dựng trên mimic-video, nghiên cứu trước đó của công ty về việc sử dụng các mô hình video được đào tạo trước làm xương sống cho điều khiển robot.
Thay vì yêu cầu một mô hình tầm nhìn-ngôn ngữ thông thường suy luận chuyển động từ các khung hình riêng lẻ, mimic-video tạo ra một kế hoạch trực quan tiềm ẩn đại diện cho cách nhiệm vụ có thể phát triển. Một bộ giải mã hành động riêng biệt sử dụng biểu diễn nội bộ đó để tạo ra các chuyển động robot.
Trong bài báo nghiên cứu của mình, công ty đã báo cáo rằng mimic-video đạt được hiệu quả mẫu khoảng mười lần lớn hơn và tốc độ hội tụ đào tạo gấp đôi so với kiến trúc VLA tương đương trên các đánh giá của nó. Hệ thống thế giới thực được đào tạo bằng khoảng 500 đường dẫn từ một thiết lập robot hai tay khéo léo.
FLUX-mimic mở rộng khái niệm đó bằng cách sử dụng kiến trúc đằng sau FLUX 3 và một thiết kế được tạo riêng cho trí tuệ nhân tạo vật lý.
Theo mimic robotics, các nhiệm vụ mà trước đây có thể yêu cầu 30 giờ hoặc nhiều hơn các bản trình diễn robot có thể đạt được hiệu suất sẵn sàng sản xuất với chỉ 30 phút dữ liệu. Con số đó đại diện cho kết quả được báo cáo của công ty và cuối cùng sẽ cần được đánh giá trên một loạt các nhà máy, cấu hình phần cứng và điều kiện sản xuất.
Dù vậy, việc giảm yêu cầu dữ liệu đến mức độ đó có thể thay đổi đáng kể kinh tế của robot công nghiệp. Chi phí triển khai thường mở rộng xa hơn bản thân robot, với nhiều tài nguyên được dành cho lập trình, tích hợp, mô phỏng, thử nghiệm và tái kỹ thuật mỗi khi sản phẩm hoặc quy trình thay đổi.
Audi Cung cấp Một Bài Kiểm tra Công nghiệp Khắt khe
Audi đang làm việc với mimic robotics để đánh giá FLUX-mimic trong môi trường sản xuất thực, nơi các hệ thống tự động hóa phải đối mặt với sự thay đổi sản phẩm, yêu cầu sản xuất chặt chẽ và các nhiệm vụ không thể giảm xuống thành các chuyển động lặp đi lặp lại.
Nhà sản xuất ô tô cho biết các robot đã thực hiện công việc thao tác cơ thể mềm phức tạp mà sẽ rất khó giải quyết bằng robot thông thường. Vật liệu mềm đặc biệt khó khăn vì hình dạng của chúng thay đổi trong quá trình xử lý, khiến việc định nghĩa mọi chuyển động thông qua tọa độ cố định hoặc quy tắc trở nên khó khăn.
Nghiên cứu tự động hóa rộng hơn của Audi minh họa tại sao sự thích nghi đang trở nên quan trọng. Tại cơ sở Böllinger Höfe, công ty đã thử nghiệm trí tuệ nhân tạo, robot di động, tầm nhìn máy tính và công nghệ chọn mới trong một phòng thí nghiệm thế giới thực. Audi đã lưu ý rằng mức độ tùy chỉnh cao trong các phương tiện như e-tron GT tạo ra các quy trình hậu cần phức tạp liên quan đến số lượng lớn các bộ phận khác nhau.
Các robot công nghiệp truyền thống vẫn rất hiệu quả khi môi trường được cấu trúc và mọi đối tượng đến một vị trí có thể dự đoán. Chúng trở nên ít hiệu quả hơn khi các bộ phận, vật liệu hoặc biến thể sản phẩm thay đổi thường xuyên đến mức yêu cầu công việc kỹ thuật lặp đi lặp lại.
Các hệ thống dựa trên học tập có thể làm cho các quy trình có sản lượng thấp hơn và biến thể cao hơn trở nên thực tế hơn để tự động hóa. Thay vì viết một chương trình mới cho mỗi nhiệm vụ, các nhà sản xuất có thể trình diễn hành vi mong muốn và cho phép hệ thống học cách tái tạo nó.
Kết hợp Mô hình, Phần cứng và Trình diễn Con người
Mô hình là một phần của nền tảng robot toàn diện đang được phát triển bởi mimic robotics.
Công ty xây dựng phần cứng tay robot khéo léo của riêng mình, thiết bị thu thập dữ liệu đeo được, mô hình học robot, và cơ sở hạ tầng triển khai. Hệ thống đeo được của họ được thiết kế để ghi lại chuyển động tay của con người trong một định dạng có thể được chuyển trực tiếp hơn đến tay robot của công ty.
Sự tập trung vào tay chứ không phải robot hình người phản ánh một cách tiếp cận có mục tiêu hơn đối với tự động hóa công nghiệp. Tay robot khéo léo có thể được gắn vào cánh tay robot thông thường đã được sử dụng trong các nhà máy, giảm nhu cầu giới thiệu một hình thức robot hoàn toàn mới. ETH Zurich mô tả cách tiếp cận này là kết hợp thao tác giống con người với phần cứng công nghiệp đã thành lập để giải quyết các nhiệm vụ đòi hỏi sự thích nghi và tự sửa lỗi.
Được thành lập như một công ty spin-off của ETH Zurich vào năm 2024, mimic robotics đã phát triển đến hơn 50 nhân viên trên Zurich và San Francisco. Đội ngũ của họ bao gồm nghiên cứu mô hình, robot, phát triển phần cứng, hoạt động dữ liệu và triển khai công nghiệp.
Ảnh hưởng Wider đối với Tự động hóa Nhà máy
Tầm quan trọng của FLUX-mimic sẽ phụ thuộc ít hơn vào các bản trình diễn riêng lẻ mà vào việc liệu công nghệ có thể duy trì tỷ lệ thành công cao trên hàng nghìn chu kỳ sản xuất.
Các nhà máy yêu cầu hiệu suất nhất quán, thời gian chu kỳ có thể dự đoán, hoạt động an toàn xung quanh nhân viên, phục hồi nhanh từ lỗi và tích hợp với các hệ thống sản xuất hiện có. Một mô hình học nhanh nhưng hành vi không thể dự đoán sẽ không mang lại lợi thế nào so với tự động hóa thông thường.
Tuy nhiên, nếu các mô hình hành động video có thể giữ được hiệu quả dữ liệu được báo cáo trong khi đáp ứng các yêu cầu độ tin cậy công nghiệp, chúng có thể mở rộng robot vào các loại công việc mà vẫn còn được thực hiện thủ công vì chúng quá biến đổi hoặc tốn kém để lập trình.
Điều đó có thể bao gồm lắp ráp các thành phần linh hoạt, xử lý hàng tồn kho hỗn hợp, phân loại các đối tượng không đều, đóng gói sản phẩm thường xuyên thay đổi và hỗ trợ công nhân trong các quy trình đòi hỏi thể chất.
Cơ hội dài hạn không chỉ là một tay robot khéo léo hơn. Đó là một mô hình triển khai khác trong đó các nhà sản xuất dạy máy móc thông qua trình diễn thay vì chỉ định mọi chuyển động trước.
Sự tham gia của Audi mang lại cho FLUX-mimic cơ hội chứng minh rằng cách tiếp cận này có thể vượt ra ngoài môi trường nghiên cứu được kiểm soát. Thành công trên sàn nhà máy ô tô sẽ cung cấp một dấu hiệu quan trọng rằng các mô hình video tạo ra có thể trở thành hơn là công cụ để tạo ra phương tiện truyền thông kỹ thuật số, phục vụ thay vào đó như một phần của lớp thông minh điều khiển máy móc trong thế giới vật lý.












