Robot học và AI vật lý

Mô hình học máy hiểu mối quan hệ giữa các đối tượng

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Các nhà nghiên cứu tại Viện Công nghệ Massachusetts (MIT) đã phát triển một mô hình học máy (ML) mới hiểu mối quan hệ cơ bản giữa các đối tượng trong một cảnh. Mô hình này đại diện cho các mối quan hệ cá nhân một lần trước khi kết hợp các đại diện để mô tả toàn bộ cảnh.

Thông qua cách tiếp cận mới này, mô hình ML có thể tạo ra hình ảnh chính xác hơn từ các mô tả văn bản và nó có thể làm điều này ngay cả khi cảnh có nhiều dự án được sắp xếp theo các mối quan hệ khác nhau với nhau.

Sự phát triển này rất quan trọng vì nhiều mô hình học sâu không thể hiểu mối quan hệ rối ren giữa các đối tượng riêng lẻ.

Mô hình của nhóm có thể được sử dụng trong các trường hợp robot công nghiệp phải thực hiện các nhiệm vụ thao túng nhiều bước, chẳng hạn như xếp chồng các vật phẩm hoặc lắp ráp thiết bị. Nó cũng giúp dẫn đến việc máy móc cuối cùng có thể học hỏi và tương tác với môi trường của chúng, giống như con người.

Yilun Du là một sinh viên tiến sĩ tại Phòng thí nghiệm Khoa học và Trí tuệ Nhân tạo (CSAIL) và là đồng tác giả đầu tiên của bài báo. Du đã dẫn đầu nghiên cứu cùng với Shuang Li, một sinh viên tiến sĩ CSAIL, và Nan Liu, một sinh viên sau đại học tại Đại học Illinois tại Urbana-Champaign. Nó cũng bao gồm Joshua B. Tenenbaum, Giáo sư Phát triển Sự nghiệp Paul E. Newton về Khoa học nhận thức và tính toán trong Bộ phận Khoa học não và nhận thức, và tác giả cao cấp Antonio Torralba, Giáo sư Điện tử Delta và Khoa học máy tính. Cả Tenenbaum và Torralba đều là thành viên của CSAIL.

Khung mới

“Khi tôi nhìn vào một bàn, tôi không thể nói rằng có một đối tượng tại vị trí XYZ. Tâm trí của chúng ta không hoạt động như vậy. Trong tâm trí của chúng ta, khi chúng ta hiểu một cảnh, chúng ta thực sự hiểu nó dựa trên mối quan hệ giữa các đối tượng. Chúng tôi nghĩ rằng bằng cách xây dựng một hệ thống có thể hiểu mối quan hệ giữa các đối tượng, chúng tôi có thể sử dụng hệ thống đó để thao túng và thay đổi môi trường của mình một cách hiệu quả hơn,” Du nói.

Khung mới có thể tạo ra hình ảnh của một cảnh dựa trên mô tả văn bản của các đối tượng và mối quan hệ của chúng.

Hệ thống sau đó có thể chia các câu này thành các phần nhỏ hơn mô tả từng mối quan hệ cá nhân. Mỗi phần sau đó được mô hình hóa riêng, và các phần được kết hợp thông qua một quá trình tối ưu hóa tạo ra hình ảnh của cảnh.

Với các câu được chia thành các phần nhỏ hơn, hệ thống sau đó có thể tái kết hợp chúng theo các cách khác nhau, cho phép nó thích nghi với các mô tả cảnh mà nó chưa từng gặp.

“Các hệ thống khác sẽ lấy tất cả các mối quan hệ một cách tổng thể và tạo ra hình ảnh một lần từ mô tả. Tuy nhiên, các phương pháp như vậy thất bại khi chúng tôi có các mô tả ngoài phân phối, chẳng hạn như mô tả có nhiều mối quan hệ, vì các mô hình này không thể thực sự thích nghi một lần để tạo ra hình ảnh chứa nhiều mối quan hệ. Tuy nhiên, vì chúng tôi đang tạo thành các mô hình nhỏ hơn, riêng biệt này cùng nhau, chúng tôi có thể mô hình hóa một số lượng lớn hơn các mối quan hệ và thích nghi với các kết hợp mới,” Du nói.

Hệ thống cũng có thể thực hiện quá trình này theo hướng ngược lại. Nếu nó được cung cấp một hình ảnh, nó có thể tìm thấy các mô tả văn bản phù hợp với mối quan hệ giữa các đối tượng trong cảnh.

Đánh giá mô hình

Các nhà nghiên cứu đã yêu cầu con người đánh giá liệu hình ảnh được tạo ra có khớp với mô tả cảnh ban đầu hay không. Khi mô tả chứa ba mối quan hệ, là loại phức tạp nhất, 91% người tham gia cho biết mô hình mới hoạt động tốt hơn các phương pháp học sâu khác.

“Một điều thú vị chúng tôi tìm thấy là đối với mô hình của chúng tôi, chúng tôi có thể tăng câu của mình từ có một mô tả mối quan hệ thành có hai, hoặc ba, hoặc thậm chí bốn mô tả, và cách tiếp cận của chúng tôi vẫn có thể tạo ra hình ảnh được mô tả chính xác bởi các mô tả đó, trong khi các phương pháp khác thất bại,” Du nói.

Mô hình cũng thể hiện khả năng ấn tượng khi làm việc với các mô tả mà nó chưa từng gặp trước đó.

“Điều này rất hứa hẹn vì đó là gần giống với cách con người hoạt động. Con người có thể chỉ nhìn thấy một vài ví dụ, nhưng chúng tôi có thể trích xuất thông tin hữu ích từ chỉ những vài ví dụ đó và kết hợp chúng lại với nhau để tạo ra vô số kết hợp. Và mô hình của chúng tôi có tính chất cho phép nó học hỏi từ ít dữ liệu hơn nhưng tổng quát hóa sang các cảnh hoặc hình ảnh phức tạp hơn,” Li nói.

Nhóm sẽ hiện đang thử nghiệm mô hình trên các hình ảnh thế giới thực phức tạp hơn và khám phá cách tích hợp mô hình vào các hệ thống robot.

Alex dẫn dắt hoạt động tin tức của Unite.AI, được hỗ trợ bởi AI, kết hợp báo chí, nghiên cứu và tự động hoá để hỗ trợ việc đưa tin về trí tuệ nhân tạo một cách kịp thời và mở rộng. Công việc của anh giúp đảm bảo các phát triển AI mới được đưa ra một cách hiệu quả đồng thời duy trì tiêu chuẩn biên tập của tờ báo.