โมเดลและแพลตฟอร์ม AI

โมบาย-เอเย่นต์: เอเย่นต์อัตโนมัติแบบมัลติโมดัลสำหรับอุปกรณ์โมบายด้วยการรับรู้ภาพ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การมาถึงของโมเดลภาษาขนาดใหญ่แบบมัลติโมดัล (MLLM) ได้สร้างยุคใหม่ของเอเย่นต์อุปกรณ์โมบายที่สามารถเข้าใจและโต้ตอบกับโลกผ่านข้อความ ภาพ และเสียง เอเย่นต์เหล่านี้เป็นการพัฒนาที่สำคัญจาก AI แบบดั้งเดิม โดยให้ประสบการณ์ที่ดีขึ้นและเป็นธรรมชาติมากขึ้นสำหรับผู้ใช้ในการโต้ตอบกับอุปกรณ์ของตน ด้วยการนำ MLLM มาใช้ เอเย่นต์เหล่านี้สามารถประมวลผลและสร้างข้อมูลจำนวนมากจากหลายรูปแบบ ทำให้สามารถให้ความช่วยเหลือส่วนบุคคลและปรับปรุงประสบการณ์ของผู้ใช้ในรูปแบบที่ไม่เคยคิดมาก่อน

เอเย่นต์เหล่านี้ได้รับการขับเคลื่อนด้วยเทคนิคการเรียนรู้ของเครื่องและความสามารถในการประมวลผลภาษา自然ที่ทันสมัย ทำให้สามารถเข้าใจและสร้างข้อความที่เหมือนมนุษย์ รวมทั้งสามารถตีความข้อมูลภาพและเสียงได้ด้วยความแม่นยำสูง ตั้งแต่การรับรู้วัตถุและฉากในภาพถึงการเข้าใจคำสั่งพูดและการวิเคราะห์ความรู้สึกของข้อความ เอเย่นต์แบบมัลติโมดัลเหล่านี้สามารถจัดการกับข้อมูลเข้าได้อย่างหลากหลายและไม่มีข้อจำกัด ความสามารถของเทคโนโลยีนี้มีศักยภาพที่จะนำไปสู่การบริการที่ซับซ้อนและตระหนักถึงบริบทมากขึ้น เช่น ผู้ช่วยเสมือนที่ตอบสนองต่ออารมณ์ของมนุษย์และเครื่องมือการศึกษาที่ปรับให้เหมาะสมกับรูปแบบการเรียนรู้ของแต่ละบุคคล นอกจากนี้ยังมีศักยภาพที่จะปฏิวัติวิธีการเข้าถึงเทคโนโลยี ทำให้เทคโนโลยีเปิดกว้างและเข้าถึงได้มากขึ้นโดยไม่จำกัดภาษาหรืออุปสรรคทางประสาทสัมผัส

ในบทความนี้ เราจะพูดถึง Mobile-Agents ซึ่งเป็นเอเย่นต์อัตโนมัติแบบมัลติโมดัลที่ใช้ความสามารถในการรับรู้ภาพเพื่อระบุและวางตำแหน่งองค์ประกอบภาพและข้อความภายในอินเทอร์เฟซของแอปพลิเคชันบนมือถืออย่างแม่นยำ โดยใช้ข้อมูลภาพที่รับรู้นี้ แฟรมเวิร์ก Mobile-Agent จะวางแผนและแบ่งย่อยงานที่ซับซ้อนออกเป็นขั้นตอนๆ และนำทางผ่านแอปพลิเคชันบนมือถือทีละขั้นตอน แฟรมเวิร์ก Mobile-Agent แตกต่างจากวิธีแก้ปัญหาแบบเดิมๆ ในการไม่พึ่งพาเมตาดาต้าของระบบมือถือหรือไฟล์ XML ของแอปพลิเคชันบนมือถือ ทำให้มีความยืดหยุ่นมากขึ้นในการปรับใช้กับสภาพแวดล้อมการทำงานที่หลากหลายบนมือถือ โดยมุ่งเน้นไปที่การประมวลผลที่มีศูนย์กลางอยู่ที่ภาพ การเข้าถึงที่ใช้โดยแฟรมเวิร์ก Mobile-Agent ช่วยลดความจำเป็นในการปรับแต่งระบบให้เหมาะสม ซึ่งนำไปสู่การเพิ่มประสิทธิภาพและลดความต้องการในการคำนวณ

โมบาย-เอเย่นต์: เอเย่นต์อัตโนมัติแบบมัลติโมดัลสำหรับอุปกรณ์โมบาย

ในโลกของเทคโนโลยีมือถือที่เปลี่ยนแปลงอย่างรวดเร็ว ความคิดริเริ่มใหม่ๆ กำลังเกิดขึ้น โดยเฉพาะโมเดลภาษาขนาดใหญ่ (LLM) ที่สามารถสร้างข้อความ ภาพ วิดีโอ และเสียงได้หลากหลาย โดยเฉพาะโมเดลภาษาขนาดใหญ่แบบมัลติโมดัล (MLLM) ที่สามารถสร้างข้อมูลได้หลากหลายรูปแบบ การพัฒนาของ MLLM ในช่วงไม่กี่ปีที่ผ่านมาได้นำไปสู่การประยุกต์ใช้ใหม่ๆ ของ MLLM เช่น เอเย่นต์อัตโนมัติสำหรับอุปกรณ์โมบาย เอเย่นต์อัตโนมัติเหล่านี้เป็นหน่วยซอฟต์แวร์ที่สามารถดำเนินการได้เองโดยไม่ต้องมีการควบคุมโดยตรงจากมนุษย์ และสามารถเคลื่อนที่หรือดำเนินการผ่านเครือข่ายหรืออุปกรณ์เพื่อทำงานหรือแก้ปัญหา

เอเย่นต์บนมือถือได้รับการออกแบบมาเพื่อดำเนินการบนอุปกรณ์มือถือของผู้ใช้ตามคำสั่งของผู้ใช้และภาพหน้าจอ ซึ่งเป็นงานที่ต้องการความเข้าใจเชิงความหมายและความสามารถในการรับรู้ภาพ อย่างไรก็ตาม เอเย่นต์บนมือถือแบบเดิมๆ ยังไม่สมบูรณ์แบบ เนื่องจากพวกมันพึ่งพาโมเดลภาษาขนาดใหญ่แบบมัลติโมดัล และแม้แต่ MLLM ที่ทันสมัยที่สุด เช่น GPT-4V ก็ยังขาดความสามารถในการรับรู้ภาพที่จำเป็นในการทำงานเป็นเอเย่นต์บนมือถือที่มีประสิทธิภาพ นอกจากนี้ แฟรมเวิร์กที่มีอยู่สามารถสร้างการดำเนินการได้อย่างมีประสิทธิภาพ แต่ก็ยังต้องดิ้นรนในการวางตำแหน่งการดำเนินการเหล่านั้นบนหน้าจออย่างแม่นยำ ซึ่งจำกัดความสามารถของเอเย่นต์บนมือถือในการทำงานบนอุปกรณ์มือถือ

เพื่อแก้ไขปัญหานี้ บางแฟรมเวิร์กเลือกที่จะใช้ไฟล์レイアウトของอินเทอร์เฟซผู้ใช้เพื่อช่วยให้ GPT-4V หรือ MLLM อื่นๆ มีความสามารถในการระบุตำแหน่ง โดยบางแฟรมเวิร์กสามารถขยายการดำเนินการไปยังตำแหน่งที่ถูกต้องบนหน้าจอได้โดยการเข้าถึงไฟล์ XML ของแอปพลิเคชัน ในขณะที่แฟรมเวิร์กอื่นๆ เลือกที่จะใช้โค้ด HTML จากเว็บแอปพลิเคชัน ดูเหมือนว่าแฟรมเวิร์กส่วนใหญ่จะพึ่งพาไฟล์ใต้และไฟล์เฉพาะของแอปพลิเคชัน ซึ่งทำให้วิธีการนี้ไม่มีประสิทธิภาพหากแฟรมเวิร์กไม่สามารถเข้าถึงไฟล์เหล่านั้นได้ เพื่อแก้ไขปัญหานี้และกำจัดความต้องการของเอเย่นต์บนมือถือที่จะเข้าถึงไฟล์ใต้สำหรับการระบุตำแหน่ง ผู้พัฒนาได้ทำงานเกี่ยวกับ Mobile-Agent ซึ่งเป็นเอเย่นต์อัตโนมัติแบบมัลติโมดัลที่มีความสามารถในการรับรู้ภาพที่น่าประทับใจ โดยใช้โมดูลการรับรู้ภาพ Mobile-Agent ใช้ภาพหน้าจอจากอุปกรณ์มือถือเพื่อระบุการดำเนินการอย่างแม่นยำ โมดูลการรับรู้ภาพประกอบด้วยโมเดล OCR และการตรวจจับที่รับผิดชอบในการระบุข้อความภายในหน้าจอและอธิบายเนื้อหาภายในบริเวณเฉพาะของหน้าจอมือถือ

นอกจากนี้ แฟรมเวิร์ก Mobile-Agent มุ่งหวังที่จะใช้ความสามารถเชิงบริบทของ MLLM ที่ทันสมัย เช่น GPT-4V เพื่อให้ได้ความสามารถในการวางแผนเองที่ช่วยให้โมเดลสามารถวางแผนงานตามประวัติการดำเนินการ คำสั่งของผู้ใช้ และภาพหน้าจอโดยรวม เพื่อเพิ่มความสามารถของเอเย่นต์ในการระบุคำสั่งที่ไม่สมบูรณ์และการดำเนการที่ไม่ถูกต้อง แฟรมเวิร์ก Mobile-Agent นำเสนอวิธีการสะท้อนกลับตนเองภายใต้คำสั่งที่สร้างขึ้นอย่างรอบคอบ เมื่อเอเย่นต์สะท้อนกลับตนเองอย่างต่อเนื่องและหยุดการดำเนินการเมื่อเสร็จสิ้นงานหรือคำสั่ง

โดยรวมแล้ว สิ่งที่ Mobile-Agent Framework สามารถทำได้คือ

  1. Mobile-Agent ทำหน้าที่เป็นเอเย่นต์อัตโนมัติสำหรับอุปกรณ์มือถือ โดยใช้เครื่องมือการรับรู้ภาพเพื่อทำการระบุตำแหน่งการดำเนินการ โมดูลนี้วางแผนและสะท้อนกลับตนเองอย่างเป็นระบบ โดยไม่ต้องใช้โค้ดระบบหรือไฟล์ XML ของแอปพลิเคชัน ทำให้เป็นวิธีแก้ปัญหาที่ขึ้นอยู่กับการรับรู้ภาพอย่างแท้จริง
  2. Mobile-Agent นำเสนอ Mobile-Eval ซึ่งเป็นมาตรฐานที่ออกแบบมาเพื่อประเมินเอเย่นต์บนอุปกรณ์มือถือ มาตรฐานนี้ประกอบด้วยแอปพลิเคชันที่ใช้บ่อยที่สุด 10 รายการ พร้อมคำสั่งที่ชาญฉลาดสำหรับแอปพลิเคชันเหล่านั้น ซึ่งแบ่งออกเป็นสามระดับความยาก

โมบาย-เอเย่นต์ : สถาปัตยกรรมและวิธีการ

ในแก่นกลาง แฟรมเวิร์ก Mobile-Agent ประกอบด้วยโมเดลภาษาขนาดใหญ่แบบมัลติโมดัลที่ทันสมัย เช่น GPT-4V และโมดูลการตรวจจับข้อความที่ใช้สำหรับการระบุตำแหน่งข้อความ นอกจากนี้ Mobile-Agent ยังใช้โมดูลการตรวจจับไอคอนสำหรับการระบุตำแหน่งไอคอน

การรับรู้ภาพ

ตามที่กล่าวไว้ก่อนหน้านี้ MLLM GPT-4V ให้ผลลัพธ์ที่น่าพอใจสำหรับคำสั่งและภาพหน้าจอ แต่ไม่สามารถระบุตำแหน่งที่จะดำเนินการได้อย่างมีประสิทธิภาพ เนื่องจากข้อจำกัดนี้ แฟรมเวิร์ก Mobile-Agent ที่ใช้ GPT-4V จึงต้องอาศัยเครื่องมือภายนอกเพื่อช่วยในการระบุตำแหน่งการดำเนินการ

การระบุตำแหน่งข้อความ

แฟรมเวิร์ก Mobile-Agent ใช้เครื่องมือ OCR เพื่อตรวจจับตำแหน่งของข้อความที่เกี่ยวข้องบนหน้าจอเมื่อเอเย่นต์ต้องคลิกที่ข้อความนั้นบนหน้าจอมือถือ มีสามสถานการณ์ในการระบุตำแหน่งข้อความที่แตกต่างกัน

สถานการณ์ที่ 1: ไม่มีข้อความที่ระบุ

ปัญหา: OCR ไม่สามารถตรวจจับข้อความที่ระบุได้ ซึ่งอาจเกิดขึ้นในภาพที่ซับซ้อนหรือเนื่องจากข้อจำกัดของ OCR

การตอบสนอง: สั่งให้เอเย่นต์เลือกข้อความใหม่เพื่อคลิก หรือเลือกการดำเนินการทางเลือก เช่น ใช้วิธีการเข้าข้อมูลอื่นหรือดำเนินการอื่นที่เกี่ยวข้องกับงานที่ทำ
เหตุผล: ความยืดหยุ่นนี้จำเป็นต่อการรับมือกับความไม่ถูกต้องหรือการหลอกลวงที่อาจเกิดขึ้นของ GPT-4V เพื่อให้เอเย่นต์สามารถดำเนินการต่อได้อย่างมีประสิทธิภาพ

สถานการณ์ที่ 2: ตรวจจับข้อความที่ระบุได้เพียงตัวเดียว

การดำเนินการ: สร้างการดำเนินการโดยอัตโนมัติเพื่อคลิกที่พิกัดศูนย์กลางของกล่องข้อความที่ตรวจจับได้

เหตุผล: เมื่อตรวจจับข้อความเพียงตัวเดียว ความน่าจะเป็นที่จะระบุถูกต้องสูง ทำให้สามารถดำเนินการได้อย่างตรงไปตรงมา

สถานการณ์ที่ 3: ตรวจจับข้อความที่ระบุได้หลายตัว

การประเมิน: ประเมินจำนวนข้อความที่ตรวจจับได้ก่อน:

หลายตัว: บ่งชี้ว่าหน้าจอเต็มไปด้วยเนื้อหาที่คล้ายกัน ทำให้กระบวนการคัดเลือกซับซ้อน

การดำเนินการ: สั่งให้เอเย่นต์เลือกข้อความใหม่เพื่อปรับหรือปรับเปลี่ยนพารามิเตอร์ของการค้นหา

ไม่มาก: จำนวนการตรวจจับที่จัดการได้ทำให้สามารถเข้าใกล้ได้ละเอียดขึ้น

การดำเนินการ: ตัดภาพในบริเวณที่มีข้อความเหล่านั้นเพื่อขยายกล่องตรวจจับข้อความออกไป เพื่อรักษาข้อมูลเพิ่มเติมและช่วยในการตัดสินใจ

ขั้นตอนต่อไป: วาดกล่องตรวจจับบนภาพที่ตัดออกและนำเสนอให้กับเอเย่นต์ การช่วยเหลือภาพนี้ช่วยให้เอเย่นต์สามารถตัดสินใจได้ว่าจะโต้ตอบกับข้อความใดโดยอาศัยสัญญาณเชิงบริบทหรือความต้องการของงาน

การเข้าถึงที่มีโครงสร้างนี้เพิ่มความน่าเชื่อถือและความยืดหยุ่นของระบบในการจัดการกับงานที่เกี่ยวข้องกับข้อความบนหน้าจอต่างๆ โดยการนำเสนอข้อความที่ถูกต้องและแม่นยำให้กับเอเย่นต์

การระบุตำแหน่งไอคอน

แฟรมเวิร์ก Mobile-Agent ใช้เครื่องมือการตรวจจับไอคอนเพื่อระบุตำแหน่งของไอคอนเมื่อเอเย่นต์ต้องคลิกที่ไอคอนบนหน้าจอมือถือ โดยเฉพาะ แฟรมเวิร์กจะขอให้เอเย่นต์ให้ข้อมูลเฉพาะของภาพ รวมถึงรูปร่างและสี จากนั้นใช้วิธีการ Grounding DINO พร้อมคำสั่งไอคอนเพื่อระบุไอคอนทั้งหมดที่อยู่ในภาพหน้าจอ สุดท้าย Mobile-Agent ใช้แฟรมเวิร์ก CLIP เพื่อคำนวณความคล้ายคลึงระหว่างคำอธิบายของพื้นที่คลิกและไอคอนที่ถูกลบ และเลือกพื้นที่ที่มีความคล้ายคลึงมากที่สุดเพื่อคลิก

การดำเนินการตามคำสั่ง

เพื่อแปลการดำเนินการให้เป็นปฏิบัติการบนหน้าจอโดยเอเย่นต์ แฟรมเวิร์ก Mobile-Agent นิยามการดำเนินการ 8 ประเภท

  • เปิดแอปพลิเคชัน (ชื่อแอป): เริ่มแอปพลิเคชันที่กำหนดจากอินเทอร์เฟซเดสก์ท็อป
  • คลิกที่ข้อความ (ป้ายกำกับข้อความ): โต้ตอบกับส่วนหน้าจอที่แสดงป้ายกำกับ “ป้ายกำกับข้อความ”
  • โต้ตอบกับไอคอน (คำอธิบายไอคอน, ตำแหน่ง): เลือกและคลิกพื้นที่ไอคอนที่กำหนด โดยที่ “คำอธิบายไอคอน” ระบุลักษณะเช่น สีและรูปร่าง และเลือก “ตำแหน่ง” จากตัวเลือก เช่น บน, ล่าง, ซ้าย, ขวา หรือกลาง เพื่อการนำทางที่แม่นยำ
  • ป้อนข้อความ (ข้อความที่ป้อน): ป้อน “ข้อความที่ป้อน” ลงในฟิลด์ข้อความที่กำลังใช้งาน
  • เลื่อนขึ้นและลง: เลื่อนขึ้นหรือลงผ่านเนื้อหาของหน้าปัจจุบัน
  • กลับ: กลับไปยังหน้าที่แสดงก่อนหน้านี้
  • ปิด: กลับไปยังเดสก์ท็อปโดยตรงจากหน้าจอปัจจุบัน
  • หยุด: สิ้นสุดการดำเนินการเมื่องานเสร็จสิ้น

การวางแผนเอง

การดำเนินการแต่ละขั้นตอนจะถูกดำเนินการโดยแฟรมเวิร์กอย่างต่อเนื่อง และก่อนเริ่มการวนซ้ำแต่ละครั้ง ผู้ใช้ต้องให้คำสั่ง输入 และโมเดล Mobile-Agent จะใช้คำสั่งนั้นเพื่อสร้างคำสั่งระบบสำหรับกระบวนการทั้งหมด นอกจากนี้ ก่อนเริ่มการวนซ้ำแต่ละครั้ง แฟรมเวิร์กจะบันทึกภาพหน้าจอและให้เอเย่นต์ตรวจสอบ จากนั้นเอเย่นต์จะสังเกตภาพหน้าจอ ประวัติการดำเนินการ และคำสั่งระบบเพื่อสร้างการดำเนินการถัดไป

การสะท้อนกลับตนเอง

ระหว่างการดำเนินการ เอเย่นต์อาจพบกับข้อผิดพลาดที่ทำให้ไม่สามารถดำเนินการตามคำสั่งได้ เพื่อเพิ่มอัตราการเติมคำสั่งให้สมบูรณ์ วิธีการสะท้อนกลับตนเองถูกนำมาใช้ภายใต้สองสถานการณ์ เมื่อเอเย่นต์ทำการดำเนการที่ไม่ถูกต้องหรือไม่สมบูรณ์ ซึ่งจะหยุดการดำเนินการ และเมื่อเอเย่นต์อาจพลาดบางส่วนของคำสั่งที่ซับซ้อน หลังจากที่เอเย่นต์ทำการดำเนินการตามแผนเบื้องต้นแล้ว จะถูกสั่งให้ตรวจสอบลำดับการดำเนินการ ล่าสุดหน้าจอ และคำสั่งของผู้ใช้เพื่อประเมินว่างานเสร็จสิ้นหรือไม่ หากพบความไม่สอดคล้อง เอเย่นต์จะถูกสั่งให้สร้างการดำเนินการใหม่เพื่อเติมเต็มคำสั่ง

โมบาย-เอเย่นต์ : การทดลองและผลลัพธ์

เพื่อประเมินความสามารถอย่างครอบคลุม แฟรมเวิร์ก Mobile-Agent นำเสนอ Mobile-Eval ซึ่งเป็นมาตรฐานที่ประกอบด้วยแอปพลิเคชันที่ใช้บ่อย 10 รายการ และออกแบบคำสั่ง 3 ชุดสำหรับแต่ละแอปพลิเคชัน โดยแบ่งออกเป็นสามระดับความยาก

ต่อไป เพื่อประเมินประสิทธิภาพจากมุมมองที่แตกต่างกัน แฟรมเวิร์ก Mobile-Agent ออกแบบและนำไปใช้ 4 มาตรการ

  • ความสำเร็จหรือ Su: ถ้าเอเย่นต์บนมือถือสามารถทำตามคำสั่งได้สำเร็จ จะถือว่าเป็นความสำเร็จ
  • คะแนนกระบวนการหรือ PS: คะแนนกระบวนการเป็นมาตรการที่วัดความแม่นยำของการดำเนินการแต่ละขั้นตอนในการดำเนินคำสั่งของผู้ใช้ และคำนวณโดยการหารจำนวนขั้นตอนที่ถูกต้องด้วยจำนวนขั้นตอนทั้งหมด
  • ประสิทธิภาพสัมพัทธ์หรือ RE: คะแนนประสิทธิภาพสัมพัทธ์เป็นอัตราส่วนหรือการเปรียบเทียบระหว่างจำนวนขั้นตอนที่ต้องใช้ในการดำเนินการตามคำสั่งด้วยตนเอง และจำนวนขั้นตอนที่เอเย่นต์ใช้ในการดำเนินการตามคำสั่งเดียวกัน
  • อัตราการเติมเต็มหรือ CR: อัตราการเติมเต็มคำนวณโดยการหารจำนวนขั้นตอนที่เอเย่นต์ทำสำเร็จด้วยจำนวนขั้นตอนทั้งหมดที่ผู้ใช้ทำในการเติมเต็มคำสั่ง ค่าของ CR คือ 1 เมื่อเอเย่นต์เติมเต็มคำสั่งสำเร็จ

ผลลัพธ์แสดงอยู่ในภาพต่อไปนี้

ในตอนแรก สำหรับงานทั้งสาม งาน Mobile-Agent ได้รับอัตราการเติมเต็ม 91%, 82% และ 82% ตามลำดับ แม้ว่างานทั้งหมดจะไม่ได้ดำเนินการอย่างสมบูรณ์แบบ แต่การบรรลุผลในแต่ละประเภทของงานก็เกิน 90% นอกจากนี้ คะแนนกระบวนการ (PS) ยังแสดงให้เห็นว่า Mobile-Agent มีความน่าจะเป็นสูงในการดำเนินการตามขั้นตอนที่ถูกต้องสำหรับงานทั้งสาม โดยมีอัตราความสำเร็จเกิน 80% และตามคะแนนประสิทธิภาพสัมพัทธ์ (RE) Mobile-Agent แสดงให้เห็นถึงประสิทธิภาพในการดำเนินการใกล้เคียงกับการทำงานของมนุษย์ถึง 80% ผลลัพธ์เหล่านี้แสดงให้เห็นถึงความสามารถของ Mobile-Agent ในการเป็นเอเย่นต์บนมือถือที่มีประสิทธิภาพ

ภาพต่อไปนี้แสดงให้เห็นถึงความสามารถของ Mobile-Agent ในการเข้าใจคำสั่งของผู้ใช้และวางแผนการดำเนินการโดยอัตโนมัติ แม้ว่าจะไม่มีรายละเอียดการดำเนินการอย่างชัดเจนในคำสั่ง Mobile-Agent ก็สามารถตีความความต้องการของผู้ใช้และแปลงเป็นงานที่สามารถดำเนินการได้ จากนั้นจึงดำเนินการตามแผนการโดยกระบวนการวางแผนอย่างเป็นระบบ

ความคิดสุดท้าย

ในบทความนี้ เราพูดถึง Mobile-Agents ซึ่งเป็นเอเย่นต์อัตโนมัติแบบมัลติโมดัลที่ใช้เทคโนโลยีการรับรู้ภาพเพื่อระบุและวางตำแหน่งองค์ประกอบภาพและข้อความภายในอินเทอร์เฟซของแอปพลิเคชันบนมือถืออย่างแม่นยำ โดยใช้ข้อมูลภาพที่รับรู้นี้ แฟรมเวิร์ก Mobile-Agent จะวางแผนและแบ่งย่อยงานที่ซับซ้อนออกเป็นขั้นตอนๆ และนำทางผ่านแอปพลิเคชันบนมือถือทีละขั้นตอน แฟรมเวิร์ก Mobile-Agent แตกต่างจากวิธีแก้ปัญหาแบบเดิมๆ ในการไม่พึ่งพาเมตาดาต้าของระบบมือถือหรือไฟล์ XML ของแอปพลิเคชันบนมือถือ ทำให้มีความยืดหยุ่นมากขึ้นในการปรับใช้กับสภาพแวดล้อมการทำงานที่หลากหลายบนมือถือ โดยมุ่งเน้นไปที่การประมวลผลที่มีศูนย์กลางอยู่ที่ภาพ การเข้าถึงที่ใช้โดยแฟรมเวิร์ก Mobile-Agent ช่วยลดความจำเป็นในการปรับแต่งระบบให้เหมาะสม ซึ่งนำไปสู่การเพิ่มประสิทธิภาพและลดความต้องการในการคำนวณ

วิศวกรโดยอาชีพ นักเขียนโดยหัวใจ คุณ Kunal เป็นนักเขียนเทคนิคที่มีความรักและเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI และ ML มุ่งมั่นที่จะทำให้แนวคิดที่ซับซ้อนในด้านเหล่านี้ง่ายขึ้นผ่านเอกสารที่น่าสนใจและให้ข้อมูล