Mô hình và nền tảng AI
Kỹ Thuật Cho Phép Trí Tuệ Nhân Tạo Tư Duy Về Tương Lai Xa
Một nhóm nghiên cứu từ MIT, MIT-IBM Watson AI Lab và các tổ chức khác đã phát triển một cách tiếp cận mới cho phép các tác nhân trí tuệ nhân tạo (AI) đạt được một quan điểm xa. Nói cách khác, AI có thể suy nghĩ về tương lai khi xem xét cách hành vi của chúng có thể bao gồm hành vi của các tác nhân AI khác khi hoàn thành một nhiệm vụ.
Nghiên cứu này sẽ được trình bày tại Hội nghị về Xử lý Thông tin Neural.
Trí Tuệ Nhân Tạo Xem Xét Các Hành Động Tương Lai Của Các Tác Nhân Khác
Khung máy học được nhóm tạo ra cho phép các tác nhân hợp tác hoặc cạnh tranh xem xét những gì các tác nhân khác sẽ làm. Điều này không chỉ trong các bước tiếp theo mà còn khi thời gian tiến đến vô cùng. Các tác nhân điều chỉnh hành vi của mình để ảnh hưởng đến hành vi tương lai của các tác nhân khác, giúp họ đạt được các giải pháp tối ưu, dài hạn.
Theo nhóm, khung này có thể được sử dụng, ví dụ, bởi một nhóm máy bay không người lái tự động làm việc cùng nhau để tìm một người đi bộ lạc. Nó cũng có thể được sử dụng bởi các phương tiện tự lái để dự đoán các động thái tương lai của các phương tiện khác để cải thiện an toàn cho hành khách.
Dong-Ki Kim là một sinh viên sau đại học tại Phòng thí nghiệm Thông tin và Quyết định của MIT (LIDS) và là tác giả chính của bài báo nghiên cứu.
“Khi các tác nhân AI hợp tác hoặc cạnh tranh, điều quan trọng nhất là khi hành vi của chúng hội tụ tại một điểm nào đó trong tương lai,” Kim nói. “Có rất nhiều hành vi chuyển tiếp dọc theo đường đi mà không quan trọng lắm trong dài hạn. Đạt được hành vi hội tụ này là điều chúng tôi thực sự quan tâm, và bây giờ chúng tôi đã có một cách toán học để cho phép điều đó.”
Vấn đề mà các nhà nghiên cứu giải quyết được gọi là học tăng cường đa tác nhân, với học tăng cường là một hình thức học máy nơi các tác nhân AI học bằng thử và sai.
Bất cứ khi nào có nhiều tác nhân hợp tác hoặc cạnh tranh cùng học, quá trình có thể trở nên phức tạp hơn nhiều. Khi các tác nhân xem xét nhiều bước tương lai của các tác nhân khác, cũng như hành vi của chính họ và cách nó ảnh hưởng đến người khác, vấn đề đòi hỏi quá nhiều sức mạnh tính toán.
Trí Tuệ Nhân Tạo Tư Duy Về Vô Cùng
“Trí tuệ nhân tạo thực sự muốn suy nghĩ về kết thúc của trò chơi, nhưng họ không biết khi nào trò chơi sẽ kết thúc,” Kim nói. “Họ cần suy nghĩ về cách tiếp tục điều chỉnh hành vi của mình vào vô cùng để họ có thể thắng tại một thời điểm nào đó trong tương lai. Bài báo của chúng tôi基本 đề xuất một mục tiêu mới cho phép trí tuệ nhân tạo suy nghĩ về vô cùng.”
Không thể tích hợp vô cùng vào một thuật toán, vì vậy nhóm thiết kế hệ thống theo cách các tác nhân tập trung vào một điểm tương lai nơi hành vi của họ sẽ hội tụ với các tác nhân khác. Điều này được gọi là trạng thái cân bằng, và một điểm cân bằng xác định hiệu suất dài hạn của các tác nhân.
Có thể có nhiều trạng thái cân bằng trong một kịch bản đa tác nhân, và khi một tác nhân hiệu quả chủ động ảnh hưởng đến hành vi tương lai của các tác nhân khác, họ có thể đạt được một trạng thái cân bằng mong muốn từ góc độ của tác nhân. Khi tất cả các tác nhân ảnh hưởng lẫn nhau, họ hội tụ đến một khái niệm chung được gọi là “trạng thái cân bằng chủ động.”
Khung FURTHER
Khung học máy của nhóm được gọi là FURTHER, và nó cho phép các tác nhân học cách điều chỉnh hành vi của mình dựa trên tương tác với các tác nhân khác để đạt được trạng thái cân bằng chủ động.
Khung này dựa trên hai mô












