Mô hình và nền tảng AI

Hệ Thống Trí Tuệ Nhân Tạo Mới Của DeepMind Có Thể Học Các Quy Tắc Của Trò Chơi Trong Quá Trình Chơi

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Công ty con của Alphabet (GOOG ) (GOOGL ), DeepMind, gần đây đã phát triển một hệ thống trí tuệ nhân tạo có khả năng học các quy tắc của một trò chơi trong khi chơi. Trong khi DeepMind đã tạo ra các mô hình trí tuệ nhân tạo ấn tượng có thể làm chủ các trò chơi như Cờ vua, Shogi, Cờ vây và trò chơi điện tử trước đó, những mô hình này phải được cung cấp các quy tắc của trò chơi trước. Vì vậy, hệ thống trí tuệ nhân tạo mới của DeepMind đại diện cho một bước tiến đáng kể so với các thuật toán trí tuệ nhân tạo trước đó học cách chơi trò chơi thông qua học tăng cường.

Hệ Thống Trí Tuệ Nhân Tạo – MuZero

Trong một bài báo được xuất bản gần đây trên tạp chí Nature, DeepMind đã mô tả cách hệ thống trí tuệ nhân tạo mới của họ hoạt động. Hệ thống trí tuệ nhân tạo mới, được gọi là MuZero, có thể học các quy tắc của một trò chơi trong khi chơi nhờ vào nguyên tắc gọi là “tìm kiếm trước”. Theo Engadget, MuZero sử dụng tìm kiếm trước để xác định các bước nên được thực hiện dựa trên các phản hồi có thể từ đối thủ.

Khi xem xét tất cả các bước có thể được thực hiện trong các trò chơi như cờ vua, MuZero có thể ưu tiên, thu hẹp các bước xuống chỉ các bước có thể và liên quan nhất. MuZero sẽ học hỏi từ cả các động thái thành công và không thành công. Thay vì xây dựng tất cả các yếu tố có thể, nó chỉ xem xét các yếu tố liên quan nhất đến quyết định đang được xem xét. MuZero基本上 lấy hàng loạt các biến số có thể được xem xét và cô lập chúng xuống chỉ các tính năng quan trọng nhất. Những tính năng này được thể hiện trong một thuật toán tìm kiếm dựa trên cây. Các khả năng trong cây được kết hợp với một mô hình đã học dựa trên các tính năng của môi trường thử nghiệm. Tìm kiếm trước được thực hiện sau khi các khía cạnh quan trọng nhất của một môi trường đã được xác định.

Để đưa ra quyết định cuối cùng, ba yếu tố được xem xét.

MuZero xem xét kết quả của lựa chọn trước, vị trí hiện tại nó chiếm và các hành động có thể thực hiện tiếp theo. Cách tiếp cận này vượt qua các cách tiếp cận trước đây được sử dụng bởi DeepMind, bao gồm tìm kiếm trước cơ bản và các mô hình dựa trên cây. MuZero đã chứng minh là ít nhất cũng tốt như AlphaZero trong cờ vua, shogi và cờ vây, và khi nó chơi trò chơi Ms. Pac-Man, MuZero chỉ có thể xem xét khoảng sáu hoặc bảy bước tại một thời điểm. Mặc dù có giới hạn này, trí tuệ nhân tạo vẫn có thể hoạt động khá tốt. DeepMind cũng đã thử nghiệm khả năng của MuZero bằng cách giới hạn số lượng mô phỏng nó có thể thực hiện trước khi phải cam kết với một bước. Generally, càng nhiều thời gian chương trình được cho để xem xét các bước có thể, nó hoạt động càng tốt.

Nhà khoa học nghiên cứu chính tại DeepMind, David Silver, giải thích qua TechXplore rằng MuZero là mô hình trí tuệ nhân tạo đầu tiên có thể tạo ra bản đại diện của các quy tắc của một môi trường, sử dụng bản đại diện đó để lên kế hoạch cho các hành động.

“Sự thật là chúng tôi hiện có một hệ thống có thể xây dựng sự hiểu biết của riêng nó về cách thế giới hoạt động và sử dụng sự hiểu biết đó để thực hiện loại lập kế hoạch tìm kiếm trước tinh vi mà bạn đã từng thấy cho các trò chơi như cờ vua,” Silver nói. “(MuZero) có thể bắt đầu từ không và chỉ thông qua thử nghiệm và sai lầm, khám phá ra các quy tắc của thế giới và sử dụng các quy tắc đó để đạt được hiệu suất siêu phàm.”

Ứng Dụng Khả Dĩ

Một trí tuệ nhân tạo thực sự có thể học các ràng buộc của một nhiệm vụ và hoạt động trong các ràng buộc đó có nhiều ứng dụng khả dĩ. MuZero có thể được sử dụng cho các nhiệm vụ như nén video, đã từng khó khăn để tự động hóa bằng trí tuệ nhân tạo do nhiều định dạng video và chế độ nén khác nhau. MuZero đã đạt được khoảng 5% cải thiện nén. Điều này có thể có ý nghĩa đối với số lượng lớn video được lưu trữ bởi Google và YouTube. Ngoài video, DeepMind cũng đang xem xét việc sử dụng các kỹ thuật MuZero tương tự cho thiết kế kiến trúc protein và lập trình robot.

Theo Wendy Hall, giáo sư Khoa học Máy tính tại Đại học Southampton, MuZero đại diện cho “một bước tiến đáng kể” cho các thuật toán học tăng cường. Tuy nhiên, Hall lo ngại rằng các thuật toán có thể bị lạm dụng. Ví dụ, Lực lượng Không quân Hoa Kỳ đã tham khảo các bài báo nghiên cứu ban đầu về MuZero để tạo ra một hệ thống trí tuệ nhân tạo có thể phóng tên lửa từ máy bay do thám U-2. Điều này mặc dù các nhà nghiên cứu của DeepMind đã thể hiện sự phản đối việc sử dụng các thuật toán của họ cho bất kỳ vũ khí chết người nào, ký vào Lời hứa Vũ khí Tự động Chết người để lập luận rằng bất kỳ công nghệ chết người nào nên vẫn nằm dưới sự kiểm soát của con người.

Silver giải thích rằng DeepMind đang nhìn về tương lai, nhằm phát triển các thuật toán mạnh mẽ và linh hoạt như não bộ. Bước đầu tiên trong việc tạo ra các thuật toán linh hoạt là hiểu được ý nghĩa của một hệ thống thông minh, và trí tuệ được liên kết với khả năng phân biệt các mẫu và quy tắc của một môi trường phức tạp.

Blogger và lập trình viên với chuyên môn về Machine Learning Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.