Robot học và AI vật lý

Các nhà nghiên cứu MIT kết hợp dữ liệu chuyển động robot với mô hình ngôn ngữ để cải thiện việc thực hiện nhiệm vụ

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Các robot gia đình đang ngày càng được dạy để thực hiện các nhiệm vụ phức tạp thông qua học tập bắt chước, một quá trình trong đó chúng được lập trình để sao chép các chuyển động được thể hiện bởi con người. Mặc dù các robot đã chứng minh mình là những người bắt chước xuất sắc, nhưng chúng thường gặp khó khăn khi điều chỉnh để phù hợp với các tình huống gián đoạn hoặc không mong muốn mà chúng gặp phải trong quá trình thực hiện nhiệm vụ. Không có lập trình rõ ràng để xử lý các sai lệch này, các robot buộc phải bắt đầu nhiệm vụ từ đầu. Để giải quyết thách thức này, các kỹ sư MIT đang phát triển một phương pháp mới nhằm cung cấp cho các robot một cảm giác về “trí thông minh” khi đối mặt với các tình huống không mong muốn, cho phép chúng thích nghi và tiếp tục thực hiện nhiệm vụ mà không cần can thiệp thủ công.

Phương pháp mới

Các nhà nghiên cứu MIT đã phát triển một phương pháp kết hợp dữ liệu chuyển động robot với “kiến thức thông thường” của mô hình ngôn ngữ lớn (LLM). Bằng cách kết nối hai yếu tố này, phương pháp này cho phép các robot phân tích logic một nhiệm vụ gia đình thành các nhiệm vụ con và điều chỉnh vật lý để phù hợp với các gián đoạn trong mỗi nhiệm vụ con. Điều này cho phép robot tiếp tục mà không cần phải bắt đầu lại toàn bộ nhiệm vụ từ đầu, và loại bỏ nhu cầu về các kỹ sư lập trình rõ ràng để sửa lỗi cho mọi khả năng thất bại trên đường đi.

Khi sinh viên tốt nghiệp Yanwei Wang từ Bộ phận Điện và Khoa học Máy tính (EECS) của MIT giải thích, “Với phương pháp của chúng tôi, một robot có thể tự sửa lỗi thực hiện và cải thiện thành công nhiệm vụ tổng thể.”

Để chứng minh phương pháp mới của họ, các nhà nghiên cứu đã sử dụng một nhiệm vụ đơn giản: xúc các viên bi từ một bát và đổ chúng vào một bát khác. Thông thường, các kỹ sư sẽ di chuyển robot qua các chuyển động của việc xúc và đổ trong một đường cong liên tục, thường cung cấp nhiều bản thể hiện của con người để robot bắt chước. Tuy nhiên, như Wang chỉ ra, “bản thể hiện của con người là một đường cong liên tục dài.” Nhóm nghiên cứu nhận ra rằng mặc dù con người có thể thể hiện một nhiệm vụ trong một lần, nhưng nhiệm vụ đó phụ thuộc vào một chuỗi các nhiệm vụ con. Ví dụ, robot phải先 đến một bát trước khi nó có thể xúc, và nó phải xúc các viên bi trước khi di chuyển đến bát rỗng.

Nếu một robot mắc lỗi trong bất kỳ nhiệm vụ con nào, cách duy nhất nó có thể làm là dừng lại và bắt đầu từ đầu, trừ khi các kỹ sư rõ ràng dán nhãn cho từng nhiệm vụ con và lập trình hoặc thu thập các bản thể hiện mới cho robot để phục hồi từ sự thất bại. Wang nhấn mạnh rằng “mức độ lập kế hoạch đó rất繁 tạp.” Đây là nơi phương pháp mới của các nhà nghiên cứu phát huy tác dụng. Bằng cách tận dụng sức mạnh của LLM, robot có thể tự động xác định các nhiệm vụ con trong nhiệm vụ tổng thể và xác định các hành động phục hồi tiềm năng trong trường hợp gián đoạn. Điều này loại bỏ nhu cầu về các kỹ sư lập trình robot để xử lý mọi kịch bản thất bại có thể xảy ra, làm cho robot trở nên linh hoạt và hiệu quả hơn trong việc thực hiện các nhiệm vụ gia đình.

Vai trò của mô hình ngôn ngữ lớn

LLM đóng vai trò quan trọng trong phương pháp mới của các nhà nghiên cứu MIT. Những mô hình học sâu này xử lý các thư viện văn bản lớn, thiết lập các kết nối giữa các từ, câu và đoạn văn. Thông qua các kết nối này, một LLM có thể tạo ra các câu mới dựa trên các mẫu đã học, về cơ bản là hiểu loại từ hoặc cụm từ có thể theo sau từ cuối cùng.

Các nhà nghiên cứu nhận ra rằng khả năng này của LLM có thể được tận dụng để tự động xác định các nhiệm vụ con trong một nhiệm vụ lớn hơn và các hành động phục hồi tiềm năng trong trường hợp gián đoạn. Bằng cách kết hợp “kiến thức thông thường” của LLM với dữ liệu chuyển động robot, phương pháp mới này cho phép các robot phân tích logic một nhiệm vụ thành các nhiệm vụ con và thích nghi với các tình huống không mong muốn. Sự tích hợp này của LLM và robot có tiềm năng cách mạng hóa cách các robot gia đình được lập trình và đào tạo, làm cho chúng trở nên linh hoạt và có khả năng xử lý các thách thức của thế giới thực hơn.

Khi lĩnh vực robot tiếp tục phát triển, việc tích hợp các công nghệ AI như LLM sẽ trở nên ngày càng quan trọng. Phương pháp của các nhà nghiên cứu MIT là một bước quan trọng hướng tới tạo ra các robot gia đình có thể không chỉ bắt chước hành động của con người mà còn hiểu logic và cấu trúc cơ bản của các nhiệm vụ chúng thực hiện. Sự hiểu biết này sẽ là chìa khóa để phát triển các robot có thể hoạt động tự chủ và hiệu quả trong các môi trường thực tế phức tạp.

Hướng tới một tương lai thông minh và linh hoạt hơn cho các robot gia đình

Bằng cách cho phép các robot tự sửa lỗi thực hiện và cải thiện thành công nhiệm vụ, phương pháp này giải quyết một trong những thách thức chính trong lập trình robot: khả năng thích nghi với các tình huống thực tế.

Các ý nghĩa của nghiên cứu này vượt ra ngoài nhiệm vụ đơn giản của việc xúc các viên bi. Khi các robot gia đình trở nên phổ biến hơn, chúng sẽ cần có khả năng xử lý nhiều loại nhiệm vụ trong các môi trường động và không có cấu trúc. Khả năng phân chia nhiệm vụ thành các nhiệm vụ con, hiểu logic cơ bản và thích nghi với các gián đoạn sẽ là điều thiết yếu để các robot này hoạt động hiệu quả và hiệu quả.

Hơn nữa, sự tích hợp của LLM và robot thể hiện tiềm năng của các công nghệ AI trong việc cách mạng hóa cách chúng ta lập trình và đào tạo robot. Khi các công nghệ này tiếp tục phát triển, chúng ta có thể mong đợi thấy nhiều robot thông minh, linh hoạt và tự chủ hơn trong các ngôi nhà và nơi làm việc của chúng ta.

Công việc của các nhà nghiên cứu MIT là một bước quan trọng hướng tới tạo ra các robot gia đình có thể thực sự hiểu và điều hướng các phức tạp của thế giới thực. Khi phương pháp này được tinh chỉnh và áp dụng cho nhiều nhiệm vụ hơn, nó có tiềm năng biến đổi cách chúng ta sống và làm việc, làm cho cuộc sống của chúng ta dễ dàng và hiệu quả hơn.

Alex McFarland là một nhà báo và nhà văn về trí tuệ nhân tạo, khám phá những phát triển mới nhất trong lĩnh vực trí tuệ nhân tạo. Ông đã hợp tác với nhiều công ty khởi nghiệp và xuất bản về trí tuệ nhân tạo trên toàn thế giới.