Mô hình và nền tảng AI

Trí tuệ nhân tạo gặp khó khăn khi làm chủ Minecraft thông qua học tập bắt chước

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Trong vài tháng qua, Microsoft (MSFT ) và các công ty khác nghiên cứu học máy đã thách thức các nhóm nhà phát triển trí tuệ nhân tạo tạo ra một hệ thống trí tuệ nhân tạo có thể chơi Minecraft và tìm một viên kim cương trong trò chơi. Theo báo cáo của BBC, trong khi các nền tảng trí tuệ nhân tạo đã quản lý để thống trị cờ vua và cờ go, nhưng nó đã gặp khó khăn trong việc làm chủ một nhiệm vụ trong Minecraft.

Thử thách của Microsoft dựa trên Minecraft được gọi là MineRL, và kết quả của cuộc thi đã được công bố chính thức tại hội nghị NeurIPS gần đây. Mục đích của cuộc thi là đào tạo một trí tuệ nhân tạo thông qua phương pháp “học tập bắt chước”. Học tập bắt chước là một phương pháp trong đó một trí tuệ nhân tạo được đào tạo thông qua việc quan sát. Học tập bắt chước nhằm mục đích cho phép các hệ thống trí tuệ nhân tạo học các hành động bằng cách quan sát con người thực hiện các hành động đó, học thông qua việc quan sát. Học tập bắt chước, so với học tập tăng cường, là một phương pháp đào tạo trí tuệ nhân tạo ít tốn kém về mặt tính toán và hiệu quả hơn nhiều.

Học tập tăng cường thường yêu cầu nhiều máy tính mạnh kết nối với nhau và hàng trăm hoặc hàng nghìn giờ đào tạo để trở nên hiệu quả trong một nhiệm vụ. Ngược lại, một trí tuệ nhân tạo được đào tạo bằng phương pháp học tập bắt chước có thể được đào tạo nhanh hơn, vì trí tuệ nhân tạo đã có một kiến thức cơ bản để làm việc với sự giúp đỡ của các nhà vận hành con người đã đi trước.

Học tập bắt chước có ứng dụng thực tế trong đào tạo một trí tuệ nhân tạo nơi trí tuệ nhân tạo không thể khám phá an toàn cho đến khi nó tìm ra các hành động chính xác. Các tình huống như vậy sẽ bao gồm đào tạo một phương tiện tự động, vì xe hơi không thể được phép đi lang thang trên đường cho đến khi nó đã học được các hành vi mong muốn. Sử dụng dữ liệu của người trình diễn con người để đào tạo xe có thể giúp quá trình trở nên nhanh hơn và an toàn hơn.

Hành động tìm một viên kim cương trong Minecraft đòi hỏi phải thực hiện nhiều bước theo trình tự, chẳng hạn như chặt cây để làm công cụ, khám phá các hang động chứa kim cương và thực sự tìm thấy một viên kim cương trong hang động. Mặc dù nhiệm vụ này phức tạp, nhưng một người chơi quen thuộc với trò chơi nên có thể tìm thấy một viên kim cương trong khoảng 20 phút.

Hơn 660 tác nhân trí tuệ nhân tạo khác nhau đã được gửi đến cuộc thi, nhưng không một trong số các trí tuệ nhân tạo nào có thể tìm thấy một viên kim cương. Dữ liệu được cung cấp để đào tạo trí tuệ nhân tạo là một tập dữ liệu chứa hơn 60 triệu khung hình gameplay thu thập từ nhiều người chơi. Vị trí của các viên kim cương được ngẫu hóa khi một phiên bản của trò chơi được bắt đầu, vì vậy điều này có nghĩa là các trí tuệ nhân tạo không thể chỉ tìm kiếm nơi các người chơi con người đã tìm thấy các viên kim cương. Nói cách khác, các trí tuệ nhân tạo cần phải hình thành một sự hiểu biết về cách các khái niệm như làm công cụ, sử dụng công cụ, khám phá và tìm kiếm tài nguyên được liên kết với nhau.

Mặc dù không một trong số các tác nhân trí tuệ nhân tạo nào có thể tìm thấy một viên kim cương thành công, nhưng đội tổ chức vẫn hài lòng với kết quả của cuộc thi và nhiều điều đã được học từ thí nghiệm. Nghiên cứu mà các nhóm trí tuệ nhân tạo đã thực hiện có thể giúp thúc đẩy lĩnh vực trí tuệ nhân tạo, tìm ra các phương pháp thay thế cho các chiến lược học tập tăng cường.

Học tập tăng cường thường mang lại hiệu suất vượt trội so với học tập bắt chước, với một thành công đáng chú ý của học tập tăng cường là AlphaGo của DeepMind. Tuy nhiên, như đã lưu ý trước đó, học tập tăng cường đòi hỏi tài nguyên tính toán lớn, hạn chế việc sử dụng nó bởi các tổ chức không thể chi trả cho các bộ xử lý máy tính ở quy mô lớn.

William Guss, sinh viên tiến sĩ tại Đại học Carnegie Mellon và là người tổ chức chính của cuộc thi, đã giải thích với BBC rằng cuộc thi MineRL được thiết kế để điều tra các phương pháp thay thế cho trí tuệ nhân tạo đòi hỏi tính toán lớn. Guss nói:

“… Ném một lượng tính toán lớn vào các vấn đề không nhất thiết là cách đúng đắn để chúng ta thúc đẩy tình trạng nghệ thuật của lĩnh vực này… Nó hoạt động trực tiếp chống lại việc dân chủ hóa việc tiếp cận các hệ thống học tập tăng cường này và để lại khả năng đào tạo các tác nhân trong môi trường phức tạp cho các tập đoàn có lượng tính toán lớn.”

Blogger và lập trình viên với chuyên môn về Machine Learning Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.