Mô hình và nền tảng AI

Các nhà nghiên cứu AI tạo ra mô hình chơi trò chơi điện tử có thể nhớ lại các sự kiện trong quá khứ

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một nhóm nghiên cứu tại phòng thí nghiệm AI của Uber đã phát triển một hệ thống các thuật toán AI có thể vượt qua cả người chơi và các hệ thống AI khác trong các trò chơi điện tử cổ điển của Atari. Hệ thống AI được phát triển bởi các nhà nghiên cứu có khả năng nhớ lại các chiến lược thành công trước đó, tạo ra các chiến lược mới dựa trên những gì đã hoạt động trong quá khứ. Nhóm nghiên cứu tin rằng các thuật toán họ phát triển có thể được áp dụng trong các lĩnh vực kỹ thuật khác như xử lý ngôn ngữ và robot.

Phương pháp thông thường để tạo ra các hệ thống AI có thể chơi trò chơi điện tử là sử dụng thuật toán học tăng cường. Các thuật toán học tăng cường học cách thực hiện một nhiệm vụ bằng cách khám phá một loạt các hành động có thể, và sau mỗi hành động, chúng được cung cấp một loại tăng cường (một phần thưởng hoặc hình phạt). Theo thời gian, mô hình AI học cách xác định các hành động dẫn đến phần thưởng lớn hơn và trở nên có khả năng thực hiện các hành động đó. Tuy nhiên, các mô hình học tăng cường gặp khó khăn khi chúng gặp phải các điểm dữ liệu không phù hợp với các điểm khác trong tập dữ liệu.

Theo nhóm nghiên cứu, lý do tại sao phương pháp của họ chưa được các nhà nghiên cứu AI khác xem xét là vì chiến lược khác với phương pháp “động lực nội tại” thường được sử dụng trong học tăng cường. Vấn đề với phương pháp động lực nội tại là mô hình có thể dễ bị “quên” về các khu vực có thể mang lại phần thưởng mà vẫn đáng được khám phá. Hiện tượng này được gọi là “tách rời”. Do đó, khi mô hình gặp phải dữ liệu không mong đợi, nó có thể quên mất các khu vực nên được khám phá.

Theo TechXplore, nhóm nghiên cứu đã thiết lập để tạo ra một mô hình học có thể linh hoạt và phản ứng với dữ liệu không mong đợi. Các nhà nghiên cứu đã vượt qua vấn đề này bằng cách giới thiệu một thuật toán có thể nhớ lại tất cả các hành động được thực hiện bởi một phiên bản trước của mô hình khi nó cố gắng giải quyết một vấn đề. Khi mô hình AI gặp phải một điểm dữ liệu không nhất quán với những gì nó đã học được cho đến nay, mô hình sẽ kiểm tra bản đồ nhớ của nó. Mô hình sẽ xác định các chiến lược thành công và thất bại và chọn chiến lược phù hợp.

Khi chơi một trò chơi điện tử, mô hình thu thập các ảnh chụp màn hình của trò chơi khi nó chơi, tạo ra một nhật ký của các hành động. Các ảnh được nhóm lại với nhau dựa trên sự tương đồng, tạo thành các điểm rõ ràng trong thời gian mà mô hình có thể tham khảo lại. Thuật toán có thể sử dụng các ảnh đã đăng để quay lại một điểm thú vị trong thời gian và tiếp tục khám phá từ đó. Khi mô hình phát hiện ra nó đang thua, nó sẽ tham khảo lại các ảnh chụp màn hình đã chụp và thử một chiến lược khác.

Theo BBC, cũng có vấn đề về việc xử lý các tình huống nguy hiểm cho tác nhân AI chơi trò chơi. Nếu tác nhân gặp phải một nguy hiểm có thể giết nó, điều đó sẽ ngăn cản nó quay lại các khu vực đáng được khám phá, một vấn đề được gọi là “tắc nghẽn”. Mô hình AI xử lý các vấn đề tắc nghẽn thông qua một quá trình riêng biệt từ quá trình được sử dụng để khuyến khích khám phá các khu vực cũ.

Nhóm nghiên cứu đã cho mô hình chơi qua 55 trò chơi Atari. Các trò chơi này thường được sử dụng để đánh giá hiệu suất của các mô hình AI, nhưng các nhà nghiên cứu đã thêm một yếu tố mới cho mô hình của họ. Các nhà nghiên cứu đã giới thiệu các quy tắc bổ sung cho các trò chơi, chỉ dẫn cho mô hình không chỉ đạt được điểm số cao nhất có thể mà còn cố gắng đạt được điểm số cao hơn mỗi lần. Khi kết quả của hiệu suất mô hình được phân tích, các nhà nghiên cứu đã phát hiện ra rằng hệ thống AI của họ đã vượt qua các hệ thống AI khác trong các trò chơi khoảng 85% thời gian. AI đã thực hiện đặc biệt tốt trong trò chơi Montezuma’s Revenge, một trò chơi nền tảng nơi người chơi tránh các chướng ngại vật và thu thập kho báu. Trò chơi đã đánh bại kỷ lục của một người chơi và cũng đạt điểm cao hơn bất kỳ hệ thống AI nào khác.

Theo các nhà nghiên cứu AI của Uber, các chiến lược được sử dụng bởi nhóm nghiên cứu có ứng dụng trong các ngành công nghiệp như robot. Các robot được hưởng lợi từ khả năng nhớ lại các hành động thành công, những hành động không hiệu quả và những hành động chưa được thử.

Blogger và lập trình viên với chuyên môn về Machine Learning Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.