Mô hình và nền tảng AI

Các tác nhân AI thể hiện các thuộc tính trí tuệ nổi bật trong trò chơi ẩn nấp ảo

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một trong những sự thật thú vị về nghiên cứu AI là nó có thể thực hiện các hành động và theo đuổi các chiến lược mà ngay cả những nhà nghiên cứu thiết kế chúng cũng ngạc nhiên. Điều này đã xảy ra trong một trò chơi ảo gần đây, nơi nhiều tác nhân AI được đặt đối diện với nhau. Các nhà nghiên cứu tại OpenAI, một công ty AI có trụ sở tại San Francisco, đã ngạc nhiên khi thấy rằng các tác nhân AI của họ đã khai thác các chiến lược trong thế giới trò chơi mà các nhà nghiên cứu không thậm chí biết tồn tại.

OpenAI đã đào tạo một nhóm các tác nhân AI để chơi một trò chơi ẩn nấp với nhau. Các chương trình AI được đào tạo với học tăng cường, một kỹ thuật trong đó hành vi mong muốn được tạo ra từ các thuật toán AI bằng cách cung cấp cho các thuật toán phản hồi. AI bắt đầu bằng cách thực hiện các hành động ngẫu nhiên, và mỗi lần nó thực hiện một hành động đưa nó đến gần mục tiêu, tác nhân sẽ được thưởng. AI muốn đạt được số lượng phần thưởng tối đa có thể, vì vậy nó sẽ thử nghiệm để xem hành động nào sẽ mang lại cho nó nhiều phần thưởng hơn. Thông qua thử nghiệm và sai lầm, AI có thể phân biệt các chiến lược sẽ đưa nó đến chiến thắng, những chiến lược sẽ mang lại cho nó nhiều phần thưởng nhất.

Học tăng cường đã chứng minh thành công ấn tượng trong việc học các quy tắc của trò chơi. OpenAI gần đây đã đào tạo một đội AI để chơi trò chơi MMORPG DOTA 2, và AI đã đánh bại một đội chơi người thế giới năm ngoái. Một điều tương tự đã xảy ra với trò chơi StarCraft khi một AI được đào tạo trên trò chơi bởi DeepMind. Học tăng cường cũng đã được sử dụng để dạy các chương trình AI chơi Pictionary với con người, học cách giải thích hình ảnh và sử dụng lý luận cơ bản.

Trong trò chơi ẩn nấp ảo được tạo bởi các nhà nghiên cứu, nhiều tác nhân AI được đặt đối diện với nhau. Kết quả là một cuộc chạy đua vũ trang, nơi mỗi tác nhân muốn vượt qua đối thủ và đạt được nhiều điểm thưởng nhất. Một chiến lược mới được một tác nhân áp dụng sẽ khiến đối thủ tìm kiếm một chiến lược mới để đối phó, và ngược lại. Igor Mordatch, một nhà nghiên cứu tại OpenAI, giải thích với IEEE Spectrum rằng thí nghiệm chứng minh rằng quá trình thử nghiệm và sai lầm giữa các tác nhân “đủ để các tác nhân học các hành vi bất ngờ của riêng họ – giống như trẻ em chơi với nhau.”

Các hành vi bất ngờ chính xác là gì? Các nhà nghiên cứu đã có bốn chiến lược cơ bản mà họ dự kiến các tác nhân AI sẽ học, và họ đã học những chiến lược này khá nhanh, trở nên thành thạo trong chúng sau chỉ 25 triệu trò chơi mô phỏng. Trò chơi diễn ra trong một môi trường 3D đầy các ramp, khối và tường. Các tác nhân AI đã học cách đuổi nhau, di chuyển các khối để xây dựng các pháo đài mà chúng có thể ẩn náu, và di chuyển các ramp. Các tác nhân tìm kiếm đã học cách kéo các ramp xung quanh để vào trong các pháo đài của những người ẩn náu, trong khi những người ẩn náu đã học cách cố gắng đưa các ramp vào trong pháo đài của mình để những người tìm kiếm không thể sử dụng chúng.

Tuy nhiên, xung quanh mốc 380 triệu trò chơi, điều gì đó không ngờ đã xảy ra. Các tác nhân AI đã học cách sử dụng hai chiến lược mà các nhà nghiên cứu không dự kiến. Các tác nhân tìm kiếm đã học cách bằng cách nhảy lên một hộp và nghiêng / cưỡi hộp tới một pháo đài gần đó, chúng có thể nhảy vào pháo đài và tìm thấy người ẩn náu. Các nhà nghiên cứu thậm chí không nhận ra rằng điều này là có thể trong môi trường trò chơi. Những người ẩn náu đã học cách đối phó với vấn đề này bằng cách kéo các hộp vào vị trí trong pháo đài của mình.

Mặc dù hành vi không ngờ của các tác nhân được đào tạo với các thuật toán học tăng cường là vô hại trong trường hợp này, nhưng nó đã gây ra một số lo ngại về cách học tăng cường được áp dụng cho các tình huống khác. Một thành viên của nhóm nghiên cứu OpenAI, Bowen Baker, giải thích với IEEE Spectrum rằng những hành vi không ngờ này có thể là nguy hiểm. Sau tất cả, điều gì sẽ xảy ra nếu các robot bắt đầu hành động theo những cách không ngờ?

“Xây dựng những môi trường này là khó,” Baker giải thích. “Các tác nhân sẽ nghĩ ra những hành vi không ngờ, điều này sẽ là một vấn đề an toàn trong tương lai khi bạn đặt chúng vào các môi trường phức tạp hơn.”

Tuy nhiên, Baker cũng giải thích rằng các chiến lược tăng cường có thể dẫn đến các giải pháp sáng tạo cho các vấn đề hiện tại. Các hệ thống được đào tạo với học tăng cường có thể giải quyết một loạt các vấn đề với các giải pháp mà chúng ta thậm chí không thể tưởng tượng.

Blogger và lập trình viên với chuyên môn về Machine Learning Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.