Mô hình và nền tảng AI

POKELLMON: Một tác nhân ngang bằng con người với LLM cho các trận đấu Pokémon

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Các mô hình ngôn ngữ lớn và trí tuệ nhân tạo tạo ra đã chứng minh sự thành công chưa từng có trên một loạt các nhiệm vụ xử lý ngôn ngữ tự nhiên. Sau khi chinh phục lĩnh vực NLP, thách thức tiếp theo cho các nhà nghiên cứu GenAI và LLM là khám phá cách các mô hình ngôn ngữ lớn có thể hoạt động tự chủ trong thế giới thực với một khoảng cách tạo ra từ văn bản đến hành động, do đó đại diện cho một mô hình đáng kể trong việc theo đuổi Trí tuệ nhân tạo tổng quát. Các trò chơi trực tuyến được coi là một nền tảng thử nghiệm phù hợp để phát triển các tác nhân nhúng LLM tương tác với môi trường hình ảnh theo cách mà con người làm.

Ví dụ, trong một trò chơi mô phỏng trực tuyến phổ biến như Minecraft, các tác nhân ra quyết định có thể được sử dụng để hỗ trợ người chơi trong việc khám phá thế giới cùng với phát triển kỹ năng tạo công cụ và giải quyết nhiệm vụ. Một ví dụ khác về các tác nhân LLM tương tác với môi trường hình ảnh có thể được trải nghiệm trong một trò chơi trực tuyến khác, The Sims, nơi các tác nhân đã chứng minh sự thành công đáng kể trong các tương tác xã hội và thể hiện hành vi giống như con người. Tuy nhiên, so với các trò chơi hiện có, các trò chơi chiến thuật có thể chứng minh là một lựa chọn tốt hơn để đánh giá khả năng của các mô hình ngôn ngữ lớn trong việc chơi trò chơi ảo. Lý do chính tại sao các trò chơi chiến thuật làm cho một tiêu chuẩn tốt hơn là vì tỷ lệ thắng có thể được đo trực tiếp, và các đối thủ nhất quán, bao gồm cả người chơi và AI, luôn có sẵn.

Xây dựng trên cùng, POKELLMON, nhằm trở thành tác nhân nhúng đầu tiên trên thế giới đạt được hiệu suất ngang bằng con người trên các trò chơi chiến thuật, tương tự như những gì được chứng kiến trong các trận đấu Pokémon. Tại lõi của nó, khuôn khổ POKELLMON bao gồm ba chiến lược chính.

  1. Học tăng cường trong ngữ cảnh tiêu thụ phản hồi dựa trên văn bản được dẫn xuất từ các trận đấu tức thời để tinh chỉnh chính sách lặp lại.
  2. Sáng tạo tăng cường tri thức thu thập tri thức bên ngoài để chống lại ảo giác, cho phép tác nhân hành động đúng lúc và cần thiết.
  3. Tạo hành động nhất quán để giảm thiểu tình huống chuyển đổi hoảng loạn khi tác nhân gặp phải một đối thủ mạnh, và muốn tránh đối đầu với họ.

Bài viết này nhằm mục đích bao phủ khuôn khổ POKELLMON một cách sâu sắc, và chúng tôi khám phá cơ chế, phương pháp luận, kiến trúc của khuôn khổ cùng với so sánh với các khuôn khổ hiện có. Chúng tôi cũng sẽ thảo luận về cách khuôn khổ POKELLMON thể hiện các chiến lược trận đấu giống như con người, và khả năng ra quyết định đúng lúc, đạt được tỷ lệ thắng đáng kính gần 50%. Vậy hãy bắt đầu.

POKELLMON: Một tác nhân ngang bằng con người với LLM cho các trận đấu Pokémon

Sự phát triển trong khả năng và hiệu quả của các mô hình ngôn ngữ lớn và khuôn khổ trí tuệ nhân tạo tạo ra trong những năm gần đây đã là điều kỳ diệu, đặc biệt là trên các nhiệm vụ xử lý ngôn ngữ tự nhiên. Gần đây, các nhà phát triển và nhà nghiên cứu AI đã làm việc trên cách làm cho trí tuệ nhân tạo tạo ra và LLM trở nên nổi bật hơn trong các tình huống thế giới thực với khả năng hoạt động tự chủ trong thế giới vật lý. Để đạt được hiệu suất tự chủ trong các tình huống thế giới thực, các nhà nghiên cứu và nhà phát triển coi các trò chơi là một nền tảng thử nghiệm phù hợp để phát triển các tác nhân nhúng LLM với khả năng tương tác với môi trường ảo theo cách giống như con người.

Trước đây, các nhà phát triển đã cố gắng phát triển các tác nhân nhúng LLM trên các trò chơi mô phỏng ảo như Minecraft và Sims, mặc dù người ta tin rằng các trò chơi chiến thuật như Pokémon có thể là một lựa chọn tốt hơn để phát triển các tác nhân này. Các trận đấu Pokémon cho phép các nhà phát triển đánh giá khả năng của một huấn luyện viên trong việc chiến đấu trong các trò chơi Pokémon nổi tiếng, và cung cấp một số lợi thế so với các trò chơi chiến thuật khác. Vì không gian hành động và trạng thái là rời rạc, nó có thể được dịch thành văn bản mà không mất mát. Hình ảnh sau minh họa một trận đấu Pokémon điển hình nơi người chơi được yêu cầu tạo ra một hành động để thực hiện tại mỗi lượt cho trạng thái hiện tại của Pokémon từ cả hai phía. Người dùng có tùy chọn chọn từ năm Pokémon khác nhau và có tổng cộng bốn lượt trong không gian hành động. Hơn nữa, trò chơi giúp giảm bớt căng thẳng về thời gian suy luận và chi phí suy luận cho LLM vì định dạng lượt loại bỏ yêu cầu về gameplay cường độ cao. Do đó, hiệu suất phụ thuộc chủ yếu vào khả năng suy luận của mô hình ngôn ngữ lớn. Cuối cùng, mặc dù các trận đấu Pokémon dường như đơn giản, nhưng thực tế thì phức tạp hơn và chiến lược cao. Một người chơi giàu kinh nghiệm không chọn một Pokémon ngẫu nhiên cho trận đấu, nhưng xem xét nhiều yếu tố bao gồm loại, thống kê, khả năng, loài, vật phẩm, lượt của Pokémon, cả trên và ngoài sân đấu.

POKELLMON: Phương pháp luận và Kiến trúc

Khuôn khổ và kiến trúc tổng thể của POKELLMON được minh họa trong hình ảnh sau.

Trong mỗi lượt, khuôn khổ POKELLMON sử dụng các hành động trước và phản hồi dựa trên văn bản tương ứng để tinh chỉnh chính sách lặp lại cùng với việc tăng cường thông tin trạng thái hiện tại với tri thức bên ngoài như hiệu ứng khả năng/dịch chuyển hoặc mối quan hệ ưu thế/điểm yếu. Đối với thông tin được đưa vào, khuôn khổ POKELLMON tạo ra nhiều hành động độc lập, và sau đó chọn những hành động nhất quán nhất làm đầu ra cuối cùng.

Học tăng cường trong ngữ cảnh

Các cầu thủ và vận động viên con người thường đưa ra quyết định không chỉ dựa trên trạng thái hiện tại, mà họ cũng phản ánh lại phản hồi từ các hành động trước đó cũng như kinh nghiệm của các cầu thủ khác. Nó sẽ an toàn khi nói rằng phản hồi tích cực là điều giúp một cầu thủ học hỏi từ sai lầm của mình, và ngăn chặn việc lặp lại cùng một hành động sai lầm. Không có phản hồi phù hợp, các tác nhân POKELLMON có thể gắn bó với cùng một hành động sai, như được minh họa trong hình ảnh sau.

Như có thể quan sát được, tác nhân trong trò chơi sử dụng một lượt dựa trên nước để chống lại một nhân vật Pokémon có khả năng “Da khô” cho phép nó vô hiệu hóa thiệt hại từ các cuộc tấn công dựa trên nước. Trò chơi cố gắng cảnh báo người dùng bằng cách nhấp nháy thông điệp “Miễn nhiễm” trên màn hình có thể khiến một người chơi phải xem xét lại hành động của mình, và thay đổi chúng, ngay cả khi không biết về “Da khô”. Tuy nhiên, nó không được bao gồm trong mô tả trạng thái cho tác nhân, dẫn đến việc tác nhân lặp lại cùng một sai lầm.

Để đảm bảo rằng tác nhân POKELLMON học hỏi từ sai lầm trước đó, khuôn khổ thực hiện phương pháp Học tăng cường trong ngữ cảnh. Học tăng cường là một phương pháp phổ biến trong học máy, và nó giúp các nhà phát triển tinh chỉnh chính sách vì nó yêu cầu phần thưởng số để đánh giá hành động. Vì mô hình ngôn ngữ lớn có khả năng diễn giải và hiểu ngôn ngữ, các mô tả dựa trên văn bản đã xuất hiện như một hình thức mới của phần thưởng cho LLM. Bằng cách bao gồm phản hồi dựa trên văn bản từ các hành động trước đó, tác nhân POKELLMON có thể tinh chỉnh chính sách lặp lại tức thời, đó là Học tăng cường trong ngữ cảnh. Khuôn khổ POKELLMON phát triển bốn loại phản hồi,

  1. Thiệt hại thực tế gây ra bởi một lượt tấn công dựa trên sự khác biệt về HP trong hai lượt liên tiếp.
  2. Hiệu quả của lượt tấn công. Phản hồi chỉ ra hiệu quả của lượt tấn công về mặt không có hiệu quả hoặc miễn nhiễm, không hiệu quả, hoặc siêu hiệu quả do khả năng/dịch chuyển hoặc ưu thế loại.
  3. Thứ tự ưu tiên cho việc thực hiện một lượt. Vì thống kê chính xác cho nhân vật Pokémon đối thủ không có sẵn, phản hồi thứ tự ưu tiên cung cấp một ước tính thô về tốc độ.
  4. Hiệu quả thực sự của các lượt được thực hiện trên đối thủ. Cả lượt tấn công và trạng thái có thể dẫn đến kết quả như hồi phục HP, tăng thống kê hoặc giảm, gây ra tình trạng như đóng băng, cháy hoặc nhiễm độc.

Hơn nữa, việc sử dụng phương pháp Học tăng cường trong ngữ cảnh dẫn đến sự tăng cường đáng kể về hiệu suất như được minh họa trong hình ảnh sau.

Khi so sánh với hiệu suất ban đầu trên GPT-4, tỷ lệ thắng tăng lên gần 10% cùng với sự tăng gần 13% về điểm trận đấu. Hơn nữa, như được minh họa trong hình ảnh sau, tác nhân bắt đầu phân tích và thay đổi hành động nếu các lượt được thực hiện trong các lượt trước đó không thể đáp ứng được kỳ vọng.

Sáng tạo tăng cường tri thức hoặc KAG

Mặc dù việc thực hiện Học tăng cường trong ngữ cảnh giúp giảm ảo giác đến một mức độ nào đó, nhưng nó vẫn có thể dẫn đến hậu quả nghiêm trọng trước khi tác nhân nhận được phản hồi. Ví dụ, nếu tác nhân quyết định chiến đấu chống lại một Pokémon loại lửa với một Pokémon loại cỏ, loại trước có khả năng thắng trong một lượt. Để giảm ảo giác thêm và cải thiện khả năng ra quyết định của tác nhân, khuôn khổ POKELLMON thực hiện phương pháp Sáng tạo tăng cường tri thức hoặc KAG, một kỹ thuật sử dụng tri thức bên ngoài để tăng cường tạo ra.

Bây giờ, khi mô hình tạo ra bốn loại phản hồi được thảo luận ở trên, nó chú thích các lượt và thông tin Pokémon cho phép tác nhân suy luận về mối quan hệ ưu thế loại của riêng nó. Trong một nỗ lực để giảm ảo giác trong suy luận thêm, khuôn khổ POKELLMON chú thích rõ ràng về ưu thế loại và điểm yếu của Pokémon đối thủ và Pokémon của tác nhân với các mô tả đầy đủ. Hơn nữa, việc ghi nhớ các lượt và khả năng với các hiệu ứng riêng biệt của Pokémon đặc biệt là khó khăn vì có rất nhiều. Bảng sau minh họa kết quả của sáng tạo tăng cường tri thức. Điều đáng chú ý là bằng cách thực hiện phương pháp Sáng tạo tăng cường tri thức, khuôn khổ POKELLMON có thể tăng tỷ lệ thắng lên khoảng 20% từ 36% hiện có lên 55%.

Hơn nữa, các nhà phát triển quan sát thấy rằng khi tác nhân được cung cấp tri thức bên ngoài về Pokémon, nó bắt đầu sử dụng các lượt đặc biệt vào đúng thời điểm, như được minh họa trong hình ảnh sau.

Tạo hành động nhất quán

Các mô hình hiện có cho thấy rằng việc thực hiện các phương pháp nhắc và suy luận có thể tăng cường khả năng của LLM trong việc giải quyết các nhiệm vụ phức tạp. Thay vì tạo ra một hành động một lần, khuôn khổ POKELLMON đánh giá các chiến lược nhắc hiện có bao gồm CoT hoặc Chuỗi suy nghĩ, ToT hoặc Cây suy nghĩ, và Tự nhất quán. Đối với Chuỗi suy nghĩ, tác nhân ban đầu tạo ra một suy nghĩ phân tích kịch bản trận đấu hiện tại, và đầu ra một hành động có điều kiện dựa trên suy nghĩ đó. Đối với Tự nhất quán, tác nhân tạo ra ba hành động, và chọn đầu ra đã nhận được số phiếu bầu tối đa. Cuối cùng, đối với phương pháp Cây suy nghĩ, khuôn khổ tạo ra ba hành động giống như trong phương pháp Tự nhất quán, nhưng chọn hành động mà nó coi là tốt nhất sau khi đánh giá tất cả bằng chính mình. Bảng sau tóm tắt hiệu suất của các phương pháp nhắc.

Chỉ có một hành động cho mỗi lượt, điều này ngụ ý rằng ngay cả khi tác nhân quyết định chuyển đổi và đối thủ quyết định tấn công, Pokémon chuyển đổi sẽ phải chịu thiệt hại. Thông thường, tác nhân quyết định chuyển đổi vì nó muốn chuyển đổi một Pokémon ngoài sân đấu để có lợi thế loại, và do đó Pokémon chuyển đổi có thể chịu được thiệt hại, vì nó có khả năng chống lại các lượt của Pokémon đối thủ. Tuy nhiên, như trên, đối với tác nhân có suy nghĩ CoT, ngay cả khi đối thủ mạnh buộc phải luân chuyển, nó hành động không nhất quán với nhiệm vụ, vì nó có thể không muốn chuyển đổi sang Pokémon nhưng nhiều Pokémon và trở lại, điều mà chúng tôi gọi là chuyển đổi hoảng loạn. Chuyển đổi hoảng loạn loại bỏ cơ hội thực hiện lượt và do đó thất bại.

POKELLMON: Kết quả và Thử nghiệm

Trước khi chúng tôi thảo luận về kết quả, điều quan trọng là chúng tôi phải hiểu môi trường trận đấu. Vào đầu mỗi lượt, môi trường nhận được một thông điệp yêu cầu hành động từ máy chủ và sẽ trả lời thông điệp đó vào cuối lượt, cũng chứa kết quả thực hiện từ lượt trước.

  1. Trước tiên, phân tích thông điệp và cập nhật các biến trạng thái cục bộ, 2. sau đó dịch các biến trạng thái thành văn bản. Mô tả văn bản chủ yếu có bốn phần: 1. Thông tin đội của riêng bạn, chứa các thuộc tính của Pokémon trên sân và ngoài sân (chưa sử dụng).
  2. Thông tin đội đối thủ, chứa các thuộc tính của Pokémon đối thủ trên sân và ngoài sân (một số thông tin không xác định).
  3. Thông tin sân đấu, bao gồm thời tiết, các vật cản khi vào sân và địa hình.
  4. Thông tin nhật ký lượt trước, chứa các hành động trước đó của cả hai Pokémon và được lưu trong một hàng đợi nhật ký. LLM lấy trạng thái dịch làm đầu vào và đầu ra hành động cho bước tiếp theo. Hành động sau đó được gửi đến máy chủ và được thực hiện cùng lúc với hành động được thực hiện bởi con người.

Trận đấu chống lại người chơi

Bảng sau minh họa hiệu suất của tác nhân POKELLMON chống lại người chơi.

Như có thể quan sát được, tác nhân POKELLMON cung cấp hiệu suất tương đương với người chơi trên thang, những người có tỷ lệ thắng cao hơn khi so sánh với người chơi được mời cùng với kinh nghiệm trận đấu rộng lớn.

Phân tích kỹ năng trận đấu

Khuôn khổ POKELLMON hiếm khi mắc sai lầm khi chọn lượt hiệu quả, và chuyển sang một Pokémon khác phù hợp nhờ vào chiến lược Sáng tạo tăng cường tri thức.

Như được minh họa trong ví dụ trên, tác nhân chỉ sử dụng một Pokémon để đánh bại toàn bộ đội đối thủ vì nó có thể chọn các lượt tấn công khác nhau, những lượt hiệu quả nhất cho đối thủ trong tình huống đó. Hơn nữa, khuôn khổ POKELLMON cũng thể hiện chiến lược tiêu hao giống như con người. Một số Pokémon có lượt “Độc” có thể gây thêm thiệt hại tại mỗi lượt, trong khi lượt “Hồi phục” cho phép nó hồi phục HP. Lợi dụng điều này, tác nhân đầu tiên gây độc cho Pokémon đối thủ, và sử dụng lượt Hồi phục để ngăn chặn việc ngất xỉu.

Lời kết

Trong bài viết này, chúng tôi đã thảo luận về POKELLMON, một phương pháp cho phép các mô hình ngôn ngữ lớn chơi các trận đấu Pokémon chống lại con người một cách tự chủ. POKELLMON, nhằm trở thành tác nhân nhúng đầu tiên trên thế giới đạt được hiệu suất ngang bằng con người trên các trò chơi chiến thuật, tương tự như những gì được chứng kiến trong các trận đấu Pokémon. Khuôn khổ POKELLMON giới thiệu ba chiến lược chính: Học tăng cường trong ngữ cảnh tiêu thụ phản hồi dựa trên văn bản như một “phần thưởng” để tinh chỉnh chính sách tạo hành động lặp lại mà không cần đào tạo, Sáng tạo tăng cường tri thức thu thập tri thức bên ngoài để chống lại ảo giác và đảm bảo tác nhân hành động đúng lúc và cần thiết, và Tạo hành động nhất quán để ngăn chặn vấn đề chuyển đổi hoảng loạn khi gặp phải đối thủ mạnh.

Kunal Kejriwal là một kỹ sư backend chuyên về Python, PostgreSQL, Redis và hạ tầng đám mây trên GCP và AWS. Với ba năm kinh nghiệm trong việc xây dựng và mở rộng các hệ thống sản xuất, anh viết về cơ sở hạ tầng AI, các hệ thống phân tán và kiến trúc triển khai các khối tải học máy.