โมเดลและแพลตฟอร์ม AI

โปเกลมอน: เอเย่นต์ที่มีความสามารถเทียบเท่ามนุษย์ด้วย LLM สำหรับการต่อสู้โปเกมอน

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

โมเดลภาษาขนาดใหญ่และปัญญาประดิษฐ์สร้างข้อมูลใหม่ได้แสดงให้เห็นถึงความสำเร็จที่ไม่เคยเกิดขึ้นมาก่อนในงานประมวลผลภาษาธรรมชาติ หลังจากที่ได้พิชิตสาขาภาษาธรรมชาติแล้ว ความท้าทายต่อไปสำหรับนักวิจัยและนักพัฒนาคือการสำรวจวิธีการที่โมเดลภาษาขนาดใหญ่จะสามารถกระทำได้อย่างอิสระในโลกแห่งความเป็นจริงด้วยช่องว่างการสร้างที่กว้างขวางจากข้อความถึงการกระทำ ซึ่งเป็นรูปแบบที่สำคัญในการสืบค้นปัญญาประดิษฐ์แบบทั่วไป เกมออนไลน์ถือเป็นรากฐานที่เหมาะสมในการพัฒนาเอเย่นต์ที่มีร่างกายที่มีโมเดลภาษาขนาดใหญ่ที่สามารถโต้ตอบกับสภาพแวดล้อมที่มองเห็นได้เหมือนมนุษย์

ตัวอย่างเช่น ในเกมจำลองออนไลน์ที่ได้รับความนิยมอย่าง Minecraft เอเย่นต์ที่ตัดสินใจสามารถใช้ในการช่วยเหลือผู้เล่นในการสำรวจโลกและพัฒนาทักษะในการทำเครื่องมือและแก้ปัญหา อีกตัวอย่างหนึ่งของเอเย่นต์ LLM ที่โต้ตอบกับสภาพแวดล้อมที่มองเห็นได้คือเกม The Sims ซึ่งเอเย่นต์ได้แสดงให้เห็นถึงความสำเร็จที่น่าประทับใจในการโต้ตอบทางสังคมและแสดงพฤติกรรมที่คล้ายกับมนุษย์ อย่างไรก็ตาม เมื่อเปรียบเทียบกับเกมที่มีอยู่แล้ว เกมยุทธวิธีอาจเป็นตัวเลือกที่ดีกว่าในการประเมินความสามารถของโมเดลภาษาขนาดใหญ่ในการเล่นเกมเสมือนจริง สาเหตุหลักคือว่าเกมยุทธวิธีสามารถวัดอัตราการชนะได้โดยตรง และมีผู้เล่นและ AI ที่สม่ำเสมอ

โดยสร้างบนพื้นฐานเดียวกัน โปเกลมอนมีเป้าหมายที่จะเป็นเอเย่นต์ที่มีร่างกายที่สามารถบรรลุผลลัพธ์ที่เทียบเท่ามนุษย์ในเกมยุทธวิธี เช่นเดียวกับที่เห็นในการต่อสู้โปเกมอน โครงสร้างโปเกลมอนประกอบด้วยกลยุทธ์หลักสามประการ

  1. การเรียนรู้เสริมแรงในบริบทที่ใช้ข้อคิดเห็นข้อความที่ได้รับจากการต่อสู้ทันทีเพื่อปรับปรุงนโยบายอย่างต่อเนื่อง
  2. การสร้างที่เพิ่มความรู้ที่ใช้ความรู้ภายนอกเพื่อต่อต้านการหลอกลวง ทำให้เอเย่นต์สามารถกระทำได้อย่างถูกต้องและเมื่อจำเป็น
  3. การสร้างการกระทำที่สอดคล้องกันเพื่อลดปัญหาในการเปลี่ยนอย่างต่อเนื่องเมื่อเผชิญกับผู้เล่นที่มีพลัง

บทความนี้มีจุดมุ่งหมายเพื่อครอบคลุมโครงสร้างโปเกลมอนอย่างลึกซึ้ง และเราจะสำรวจกลไก วิธีการ และสถาปัตยกรรมของโครงสร้างนี้พร้อมกับการเปรียบเทียบกับโครงสร้างที่มีอยู่แล้ว เราจะพูดถึงวิธีการที่โครงสร้างโปเกลมอนแสดงให้เห็นถึงกลยุทธ์การต่อสู้ที่คล้ายกับมนุษย์และความสามารถในการตัดสินใจที่เหมาะสม

โปเกลมอน: เอเย่นต์ที่มีความสามารถเทียบเท่ามนุษย์ด้วย LLM สำหรับการต่อสู้โปเกมอน

การเติบโตของความสามารถและประสิทธิภาพของโมเดลภาษาขนาดใหญ่และปัญญาประดิษฐ์สร้างข้อมูลใหม่ในช่วงไม่กี่ปีที่ผ่านมานั้นเป็นเรื่องที่น่าประทับใจ โดยเฉพาะอย่างยิ่งในงานประมวลผลภาษาธรรมชาติ เมื่อเร็วๆ นี้ นักพัฒนาและนักวิจัยได้ทำงานอย่างหนักเพื่อทำให้ปัญญาประดิษฐ์สร้างข้อมูลใหม่และโมเดลภาษาขนาดใหญ่มีบทบาทสำคัญในสถานการณ์จริงมากขึ้น โดยมีความสามารถในการกระทำได้อย่างอิสระในสถานการณ์จริง

ก่อนหน้านี้ นักพัฒนามีประสบการณ์ในการสร้างเอเย่นต์ที่มีร่างกายที่มีโมเดลภาษาขนาดใหญ่ในเกมจำลองเสมือนจริง เช่น Minecraft และ The Sims แม้ว่าจะเชื่อกันว่าเกมยุทธวิธี เช่น โปเกมอน อาจเป็นตัวเลือกที่ดีกว่าในการพัฒนาเอเย่นต์เหล่านี้ การต่อสู้โปเกมอนช่วยให้นักพัฒนามีประโยชน์หลายประการในการประเมินความสามารถของผู้ฝึกในการต่อสู้ในเกมโปเกมอนที่มีชื่อเสียง

โปเกลมอน: วิธีการและสถาปัตยกรรม

โครงสร้างและสถาปัตยกรรมโดยรวมของโครงสร้างโปเกลมอนแสดงไว้ในรูปด้านล่าง

ในแต่ละเทิร์น โครงสร้างโปเกลมอนใช้การกระทำก่อนหน้าและข้อคิดเห็นข้อความที่เกี่ยวข้องเพื่อปรับปรุงนโยบายอย่างต่อเนื่อง พร้อมทั้งเพิ่มความรู้ภายนอก เช่น ผลกระทบของการเคลื่อนไหวหรือความสัมพันธ์ระหว่างความได้เปรียบ/ความอ่อนแอ

การเรียนรู้เสริมแรงในบริบท

ผู้เล่นและนักกีฬามนุษย์มักตัดสินใจไม่เพียงแต่จากสถานะปัจจุบัน แต่ยังสะท้อนถึงข้อคิดเห็นจากการกระทำก่อนหน้าและประสบการณ์ของผู้เล่นคนอื่นๆ

การเรียนรู้เสริมแรงเป็นวิธีการที่ช่วยให้เอเย่นต์โปเกลมอนสามารถเรียนรู้จากข้อผิดพลาดและปรับปรุงนโยบายการกระทำได้อย่างต่อเนื่อง

การเรียนรู้เสริมแรงในบริบทช่วยให้เอเย่นต์โปเกลมอนสามารถปรับปรุงนโยบายการกระทำได้อย่างต่อเนื่องและเพิ่มประสิทธิภาพในการต่อสู้

การสร้างที่เพิ่มความรู้หรือ KAG

การสร้างที่เพิ่มความรู้เป็นเทคนิคที่ใช้ความรู้ภายนอกเพื่อเพิ่มการสร้างและลดการหลอกลวง

การสร้างที่เพิ่มความรู้ช่วยให้เอเย่นต์โปเกลมอนสามารถตัดสินใจได้อย่างถูกต้องและเหมาะสมในสถานการณ์ต่างๆ

การสร้างการกระทำที่สอดคล้องกัน

การสร้างการกระทำที่สอดคล้องกันช่วยให้เอเย่นต์โปเกลมอนสามารถสร้างการกระทำที่สอดคล้องกันและลดปัญหาในการเปลี่ยนอย่างต่อเนื่อง

โปเกลมอน: ผลลัพธ์และการทดลอง

ก่อนที่เราจะพูดถึงผลลัพธ์ มันสำคัญที่เราจะต้องเข้าใจสภาพแวดล้อมของการต่อสู้

  1. สภาพแวดล้อมรับข้อความคำขอการกระทำจากเซิร์ฟเวอร์และจะตอบกลับข้อความนั้นที่สิ้นสุดเทิร์น ซึ่งรวมถึงผลการดำเนินการจากเทิร์นก่อนหน้า
  2. สภาพแวดล้อมวิเคราะห์ข้อความและอัปเดตตัวแปรสถานะท้องถิ่น
  3. สภาพแวดล้อมแปลตัวแปรสถานะเป็นข้อความ
  4. สภาพแวดล้อมส่งการกระทำไปยังเซิร์ฟเวอร์และดำเนินการพร้อมกับการกระทำของมนุษย์

การต่อสู้กับผู้เล่นมนุษย์

ตารางต่อไปนี้แสดงผลลัพธ์ของเอเย่นต์โปเกลมอนในการต่อสู้กับผู้เล่นมนุษย์

การวิเคราะห์ทักษะการต่อสู้

เอเย่นต์โปเกลมอนมักไม่ทำผิดพลาดในการเลือกการเคลื่อนไหวที่มีประสิทธิภาพและเปลี่ยนไปใช้โปเกมอนที่เหมาะสมอื่น

ความคิดสุดท้าย

ในบทความนี้ เราได้พูดถึงโปเกลมอน ซึ่งเป็นวิธีการที่ช่วยให้โมเดลภาษาขนาดใหญ่สามารถเล่นการต่อสู้โปเกมอนได้อย่างอิสระ โปเกลมอนมีเป้าหมายที่จะเป็นเอเย่นต์ที่มีความสามารถเทียบเท่ามนุษย์ในการเล่นเกมยุทธวิธี เช่น การต่อสู้โปเกมอน โครงสร้างโปเกลมอนประกอบด้วยกลยุทธ์หลักสามประการ: การเรียนรู้เสริมแรงในบริบท การสร้างที่เพิ่มความรู้ และการสร้างการกระทำที่สอดคล้องกัน

Kunal Kejriwal เป็นวิศวกรแบ็กเอนด์ที่เชี่ยวชาญด้าน Python, PostgreSQL, Redis และโครงสร้างพื้นฐานคลาวด์บน GCP และ AWS. ด้วยประสบการณ์สามปีในการสร้างและขยายระบบการผลิต เขาเขียนเกี่ยวกับโครงสร้างพื้นฐาน AI, ระบบกระจาย, และสถาปัตยกรรมที่อยู่เบื้องหลังการปรับใช้งานแมชชีนเลิร์นนิง