Robot học và AI vật lý
Robot Có Thể Học Các Nhiệm Vụ Phức Tạp Từ Một Vài Demonstration
Trong một trong những phát triển mới nhất trong lĩnh vực robot, các nhà nghiên cứu tại Đại học Nam California (USC) đã phát triển một hệ thống nơi robot có thể học các nhiệm vụ phức tạp với chỉ một vài demonstration. Thậm chí ấn tượng hơn, một số demonstration có thể không hoàn hảo.
Nghiên cứu này được trình bày tại Hội nghị về Học tập Robot (CoRL) vào ngày 18 tháng 11, với tiêu đề “Học tập từ Demonstration Sử dụng Logic Thời gian Tín hiệu.”
Hệ Thống
Chất lượng của mỗi demonstration được đo để hệ thống có thể học từ thành công và thất bại của nó. Không giống như các phương pháp hiện tại, yêu cầu ít nhất 100 demonstration để dạy một nhiệm vụ cụ thể, hệ thống mới chỉ cần một vài demonstration. Theo cách trực quan, cách robot học là tương tự như cách con người học từ nhau. Ví dụ, con người xem và học từ những người khác hoàn thành nhiệm vụ thành công hoặc không hoàn hảo.
Aniruddh Puranic là tác giả chính của nghiên cứu và là sinh viên tiến sĩ khoa học máy tính tại Trường Kỹ thuật Viterbi của USC.
“Nhiều hệ thống học máy và học tăng cường yêu cầu lượng dữ liệu lớn và hàng trăm demonstration – bạn cần một người để demonstrate lại và lại, điều này không khả thi,” Puranic nói.
“Ngoài ra, hầu hết mọi người không có kiến thức lập trình để chỉ định rõ ràng những gì robot cần làm, và một người không thể demonstrate mọi thứ mà robot cần biết,” anh tiếp tục. “Nếu robot gặp phải điều gì đó nó chưa từng thấy trước đây? Đây là một thách thức chính.”
Các nhà nghiên cứu đã sử dụng “logic thời gian tín hiệu” hoặc STL để xác định chất lượng của demonstration, xếp hạng chúng và tạo ra phần thưởng nội tại.
Có hai lý do chính khiến các nhà nghiên cứu quyết định sử dụng STL:
- Bằng cách học thông qua demonstration, robot có thể học được những khiếm khuyết hoặc thậm chí là hành vi không an toàn và không mong muốn.
- Demonstration có thể khác nhau về chất lượng tùy thuộc vào người dùng cung cấp chúng, và một số demonstration là những chỉ số tốt hơn về hành vi mong muốn so với những demonstration khác.
Bằng cách phát triển hệ thống theo cách này, robot vẫn có thể học từ demonstration không hoàn hảo, ngay cả khi chúng không đáp ứng các yêu cầu logic. Nói cách khác, nó đưa ra kết luận của riêng mình về độ chính xác hoặc thành công.
Stefanos Nikolaidis là đồng tác giả và là giáo sư trợ lý khoa học máy tính tại USC Viterbi.
“Hãy nói rằng robot học từ các loại demonstration khác nhau – nó có thể là một demonstration trực tiếp, video hoặc mô phỏng – nếu tôi làm điều gì đó rất không an toàn, các phương pháp tiêu chuẩn sẽ làm một trong hai điều: hoặc chúng sẽ hoàn toàn bỏ qua nó, hoặc thậm chí tồi tệ hơn, robot sẽ học điều sai,” Nikolaidis nói.
“Ngược lại, trong một cách rất thông minh, công việc này sử dụng một số suy luận thông thường dưới dạng logic để hiểu những phần nào của demonstration là tốt và những phần nào không,” anh tiếp tục. “Về bản chất, đây chính là những gì con người cũng làm.”
Logic Thời gian Tín hiệu
Robot có thể suy luận về kết quả hiện tại và tương lai thông qua STL, là một ngôn ngữ biểu tượng toán học biểu cảm. Trước đây, nghiên cứu dựa trên “logic thời gian tuyến tính”.
Jyo Deshmukh là một kỹ sư Toyota cũ và là giáo sư trợ lý khoa học máy tính tại USC.
“Khi chúng ta đi vào thế giới của các hệ thống vật lý mạng, như robot và ô tô tự lái, nơi thời gian là rất quan trọng, logic thời gian tuyến tính trở nên有点 cồng kềnh, vì nó suy luận về các chuỗi giá trị true/false cho các biến, trong khi STL cho phép suy luận về tín hiệu vật lý,” Deshmukh nói.
Đội ngũ nghiên cứu đã ngạc nhiên trước mức độ thành công của hệ thống.
“So với một thuật toán hiện đại, được sử dụng rộng rãi trong các ứng dụng robot, bạn sẽ thấy sự khác biệt về cấp độ trong số lượng demonstration cần thiết,” Nikolaidis nói.
Theo các nhà nghiên cứu, hệ thống có thể học từ các mô phỏng lái xe và cuối cùng là video. Bước tiếp theo là thử nghiệm nó trên các robot thực, vì thử nghiệm ban đầu được thực hiện trên một trình mô phỏng trò chơi. Hệ thống sẽ hữu ích cho các ứng dụng như những ứng dụng trong môi trường gia đình, kho hàng và robot thăm dò không gian.
“Nếu chúng ta muốn robot trở thành những người đồng đội tốt và giúp đỡ con người, trước tiên chúng cần phải học và thích nghi với sở thích của con người một cách hiệu quả,” Nikolaidis nói. “Phương pháp của chúng tôi cung cấp điều đó.”












