एआई मॉडल और प्लेटफ़ॉर्म
मोबाइल-एजेंट: स्वायत्त बहु-मोडल मोबाइल डिवाइस एजेंट विज़ुअल परसेप्शन के साथ

मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (एमएलएलएम) के आगमन ने मोबाइल डिवाइस एजेंट्स के एक नए युग की शुरुआत की है, जो पाठ, छवियों और वॉइस के माध्यम से दुनिया को समझने और बातचीत करने में सक्षम हैं। ये एजेंट पारंपरिक एआई की तुलना में एक महत्वपूर्ण उन्नति का प्रतिनिधित्व करते हैं, जो उपयोगकर्ताओं को अपने उपकरणों के साथ बातचीत करने के लिए एक समृद्ध और अधिक सहज तरीका प्रदान करते हैं। एमएलएलएम का लाभ उठाकर, ये एजेंट विभिन्न मोडलिटी से विशाल मात्रा में जानकारी को संसाधित और सिंथेसाइज़ कर सकते हैं, जिससे उन्हें व्यक्तिगत सहायता प्रदान करने और उपयोगकर्ता अनुभवों को पहले से अकल्पनीय तरीकों से बढ़ाने में सक्षम बनाता है।
इन एजेंट्स को राज्य-ऑफ-द-आर्ट मशीन लर्निंग तकनीकों और उन्नत प्राकृतिक भाषा प्रसंस्करण क्षमताओं द्वारा संचालित किया जाता है, जो उन्हें मानव-जैसे पाठ को समझने और उत्पन्न करने की अनुमति देता है, साथ ही साथ दृश्य और श्रवण डेटा को उल्लेखनीय सटीकता के साथ व्याख्या करने में सक्षम बनाता है। छवियों में वस्तुओं और दृश्यों को पहचानने से लेकर बोले गए कमांड को समझने और पाठ भावना का विश्लेषण करने तक, ये बहु-मोडल एजेंट विभिन्न प्रकार के इनपुट को सहजता से संभालने में सक्षम हैं। इस प्रौद्योगिकी की संभावना विशाल है, जो अधिक परिष्कृत और संदर्भ-जागरूक सेवाएं प्रदान करती है, जैसे कि मानव भावनाओं के प्रति संवेदनशील वर्चुअल सहायक और शैक्षिक उपकरण जो व्यक्तिगत शिक्षा शैलियों के अनुसार अनुकूलन करते हैं। वे पहुंच को क्रांतिकारी बनाने की भी क्षमता रखते हैं, जिससे प्रौद्योगिकी भाषा और संवेदी बाधाओं के पार अधिक सुलभ हो जाती है।
इस लेख में, हम मोबाइल-एजेंट्स के बारे में बात करेंगे, एक स्वायत्त बहु-मोडल डिवाइस एजेंट जो पहले दृश्य धारणा उपकरणों की क्षमता का लाभ उठाता है ताकि मोबाइल एप्लिकेशन के फ्रंट-एंड इंटरफेस के भीतर दृश्य और पाठ्य सामग्री को सटीक रूप से पहचान और स्थित कर सके। इस धारणा संदर्भ का उपयोग करके, मोबाइल-एजेंट फ्रेमवर्क जटिल ऑपरेशन कार्य को स्वतंत्र रूप से योजना बनाता है और कार्य को तोड़ता है, और चरण-दर-चरण ऑपरेशन के माध्यम से मोबाइल ऐप्स के माध्यम से नेविगेट करता है। मोबाइल-एजेंट फ्रेमवर्क मौजूदा समाधानों से अलग है क्योंकि यह मोबाइल सिस्टम मेटाडेटा या मोबाइल एप्लिकेशन के एक्सएमएल फाइलों पर निर्भर नहीं करता है, जिससे विभिन्न मोबाइल ऑपरेटिंग वातावरण में अनुकूलन में सुधार होता है। मोबाइल-एजेंट फ्रेमवर्क द्वारा अपनाई गई रणनीति सिस्टम-विशिष्ट अनुकूलन की आवश्यकता को समाप्त करती है, जिससे प्रदर्शन में सुधार और कम गणना आवश्यकताएं होती हैं।
मोबाइल-एजेंट: स्वायत्त बहु-मोडल मोबाइल डिवाइस एजेंट
मोबाइल प्रौद्योगिकी की तेजी से बदलती दुनिया में, एक अग्रणी अवधारणा उभरकर सामने आई है: लार्ज लैंग्वेज मॉडल, विशेष रूप से बहु-मोडल लार्ज लैंग्वेज मॉडल या एमएलएलएम, जो विभिन्न भाषाओं में व्यापक श्रृंखला के पाठ, छवियों, वीडियो और भाषण का उत्पादन करने में सक्षम हैं। एमएलएलएम फ्रेमवर्क के पिछले कुछ वर्षों में तेजी से विकास ने एक नए और शक्तिशाली एमएलएलएम के अनुप्रयोग को जन्म दिया है: स्वायत्त मोबाइल एजेंट। स्वायत्त मोबाइल एजेंट वे सॉफ्टवेयर इकाइयाँ हैं जो स्वतंत्र रूप से कार्य करती हैं, बिना मानव निर्देशों की आवश्यकता के, जो कार्यों को पूरा करने, जानकारी एकत्र करने या समस्याओं का समाधान करने के लिए नेटवर्क या उपकरणों को नेविगेट करने के लिए डिज़ाइन किए गए हैं।
मोबाइल एजेंट उपयोगकर्ता के निर्देशों और स्क्रीन दृश्यों के आधार पर उपयोगकर्ता के मोबाइल डिवाइस को संचालित करने के लिए डिज़ाइन किए गए हैं, जो एजेंट को सेमेंटिक समझ और दृश्य धारणा क्षमताओं दोनों को रखने की आवश्यकता है। हालांकि, मौजूदा मोबाइल एजेंट परिपूर्ण नहीं हैं क्योंकि वे बहु-मोडल लार्ज लैंग्वेज मॉडल पर आधारित हैं, और यहां तक कि वर्तमान राज्य-ऑफ-द-आर्ट एमएलएलएम फ्रेमवर्क, जिनमें जीपीटी-4वी शामिल है, दृश्य धारणा क्षमताओं की कमी है जो एक कुशल मोबाइल एजेंट के रूप में कार्य करने के लिए आवश्यक है। इसके अलावा, हालांकि मौजूदा फ्रेमवर्क प्रभावी ऑपरेशन उत्पन्न कर सकते हैं, वे स्क्रीन पर इन ऑपरेशनों के स्थान को सटीक रूप से स्थित करने में संघर्ष करते हैं, जो मोबाइल एजेंट्स को मोबाइल डिवाइस पर कार्य करने की उनकी क्षमता और अनुप्रयोगों को सीमित करता है।
इस मुद्दे को हल करने के लिए, कुछ फ्रेमवर्क ने उपयोगकर्ता इंटरफ़ेस लेआउट फ़ाइलों का लाभ उठाने का विकल्प चुना है ताकि जीपीटी-4वी या अन्य एमएलएलएम को स्थानीयकरण क्षमताओं में मदद मिल सके, जबकि अन्य फ्रेमवर्क ने वेब अनुप्रयोगों से एचटीएमएल कोड का उपयोग करने का विकल्प चुना है। जैसा कि देखा जा सकता है, इनमें से अधिकांश फ्रेमवर्क अंतर्निहित और स्थानीय अनुप्रयोग फ़ाइलों तक पहुंच पर निर्भर करते हैं, जो इस पद्धति को लगभग अप्रभावी बना देता है यदि फ्रेमवर्क इन फ़ाइलों तक पहुंच नहीं सकता है। इस मुद्दे को हल करने और स्थानीय एजेंटों को अंतर्निहित फ़ाइलों पर उनकी निर्भरता को समाप्त करने के लिए, विकासकर्ताओं ने मोबाइल-एजेंट पर काम किया है, एक स्वायत्त मोबाइल एजेंट जो दृश्य धारणा क्षमताओं में प्रभावशाली है। अपने दृश्य धारणा मॉड्यूल का उपयोग करके, मोबाइल-एजेंट फ्रेमवर्क मोबाइल डिवाइस से स्क्रीनशॉट का उपयोग करके ऑपरेशनों को सटीक रूप से स्थित करने के लिए करता है। दृश्य धारणा मॉड्यूल में ओसीआर और पता लगाने वाले मॉडल होते हैं जो स्क्रीन पर पाठ की पहचान करने और एक विशिष्ट क्षेत्र के भीतर स्क्रीन की सामग्री का वर्णन करने के लिए जिम्मेदार होते हैं। मोबाइल-एजेंट फ्रेमवर्क द्वारा सावधानी से तैयार किए गए प्रॉम्प्ट का उपयोग करके उपकरणों और एजेंटों के बीच कुशल बातचीत की सुविधा प्रदान करता है, जिससे मोबाइल डिवाइस ऑपरेशन को स्वचालित किया जा सकता है।
इसके अलावा, मोबाइल-एजेंट फ्रेमवर्क राज्य-ऑफ-द-आर्ट एमएलएलएम फ्रेमवर्क जैसे जीपीटी-4वी की संदर्भ क्षमताओं का लाभ उठाने का लक्ष्य रखता है ताकि स्व-योजन क्षमताओं को प्राप्त किया जा सके जो मॉडल को ऑपरेशन इतिहास, उपयोगकर्ता निर्देशों और स्क्रीनशॉट के आधार पर कार्यों की योजना बनाने की अनुमति देता है। मोबाइल-एजेंट फ्रेमवर्क एक स्व-प्रतिबिंब विधि भी पेश करता है ताकि एजेंट की क्षमता को अधूरी निर्देशों और गलत ऑपरेशनों की पहचान करने में सुधार किया जा सके। सावधानी से तैयार किए गए प्रॉम्प्ट के मार्गदर्शन में, एजेंट निरंतर रूप से अमान्य और गलत ऑपरेशन पर प्रतिबिंबित करता है, और एक बार कार्य या निर्देश पूरा हो जाने के बाद ऑपरेशन को रोक देता है।
कुल मिलाकर, मोबाइल-एजेंट फ्रेमवर्क के योगदानों को निम्नलिखित के रूप में सारांशित किया जा सकता है:
- मोबाइल-एजेंट एक स्वायत्त मोबाइल डिवाइस एजेंट के रूप में कार्य करता है, जो ऑपरेशन स्थानीयकरण के लिए दृश्य धारणा उपकरणों का उपयोग करता है। यह प्रत्येक चरण की योजना बनाता है और आत्म-निरीक्षण में संलग्न होता है। उल्लेखनीय रूप से, मोबाइल-एजेंट केवल डिवाइस स्क्रीनशॉट पर निर्भर करता है, किसी भी सिस्टम कोड का उपयोग किए बिना, जो एक दृष्टि-आधारित समाधान को प्रदर्शित करता है।
- मोबाइल-एजेंट मोबाइल-इवल की शुरुआत करता है, एक बेंचमार्क जो मोबाइल-डिवाइस एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इस बेंचमार्क में दस सबसे अधिक इस्तेमाल की जाने वाली मोबाइल ऐप्स शामिल हैं, साथ ही इन ऐप्स के लिए बुद्धिमान निर्देश भी शामिल हैं जो तीन कठिनाई स्तरों में वर्गीकृत किए गए हैं।

मोबाइल-एजेंट: आर्किटेक्चर और विधि
मोबाइल-एजेंट फ्रेमवर्क का मूल एक राज्य-ऑफ-द-आर्ट बहु-मोडल लार्ज लैंग्वेज मॉडल, जीपीटी-4वी, एक पाठ पता लगाने वाला मॉड्यूल है जो पाठ स्थानीयकरण कार्यों के लिए उपयोग किया जाता है। जीपीटी-4वी के साथ, मोबाइल-एजेंट एक आइकन पता लगाने वाला मॉड्यूल भी नियोजित करता है जो आइकन स्थानीयकरण के लिए उपयोग किया जाता है।
दृश्य धारणा
जैसा कि पहले उल्लेख किया गया है, जीपीटी-4वी एमएलएलएम निर्देशों और स्क्रीनशॉट के लिए संतोषजनक परिणाम प्रदान करता है, लेकिन यह स्थान को प्रभावी ढंग से आउटपुट नहीं करता है जहां ऑपरेशन होते हैं। इस सीमा के कारण, जीपीटी-4वी एमएलएलएम को लागू करने वाले मोबाइल-एजेंट फ्रेमवर्क को ऑपरेशन स्थानीयकरण में मदद करने के लिए बाहरी उपकरणों पर निर्भर रहने की आवश्यकता है।
पाठ स्थानीयकरण
मोबाइल-एजेंट फ्रेमवर्क एक ओसीआर टूल को लागू करता है ताकि जब एजेंट को मोबाइल स्क्रीन पर एक विशिष्ट पाठ पर टैप करने की आवश्यकता होती है, तो स्क्रीन पर संबंधित पाठ की स्थिति का पता लगाया जा सके। पाठ स्थानीयकरण के तीन अद्वितीय दृश्य हैं।
दृश्य 1: कोई निर्दिष्ट पाठ नहीं पाया गया
मुद्दा:ओसीआर निर्दिष्ट पाठ का पता नहीं लगा पाता है, जो जटिल छवियों में या ओसीआर सीमाओं के कारण हो सकता है।
प्रतिक्रिया:एजेंट को निर्देश दें:
- ओसीआर की उपेक्षा को मैनुअल रूप से सुधारने के लिए पाठ का पुनः चयन करें, या
- एक वैकल्पिक ऑपरेशन चुनें, जैसे कि एक अलग इनपुट विधि का उपयोग करना या कार्य के संदर्भ में एक अन्य कार्रवाई करना।
तर्क:यह लचीलापन जीपीटी-4वी की आकस्मिक असंगतियों या भ्रम को प्रबंधित करने के लिए आवश्यक है, यह सुनिश्चित करते हुए कि एजेंट अभी भी प्रभावी ढंग से आगे बढ़ सकता है।
दृश्य 2: एकल निर्दिष्ट पाठ का पता लगाया गया
ऑपरेशन:स्वचालित रूप से एक क्रिया उत्पन्न करें जो पता लगाए गए पाठ बॉक्स के केंद्रीय निर्देशांक पर क्लिक करती है।
स्पष्टीकरण:केवल एक उदाहरण का पता लगाने के साथ, सही पहचान की संभावना उच्च है, जो एक सीधी कार्रवाई को आगे बढ़ाने के लिए कुशल बनाती है।
दृश्य 3: कई निर्दिष्ट पाठ का पता लगाया गया
मूल्यांकन:सबसे पहले, पता लगाए गए उदाहरणों की संख्या का मूल्यांकन करें:
बहुत सारे उदाहरण: एक स्क्रीन को इंगित करता है जो समान सामग्री से भरा हुआ है, जो चयन प्रक्रिया को जटिल बना देता है।
कार्रवाई: एजेंट से पाठ का पुनः चयन करने का अनुरोध करें, पाठ का चयन करने या खोज मानदंडों को समायोजित करने के लिए।
कुछ उदाहरण: एक प्रबंधनीय संख्या में पता लगाने वाले एक अधिक सूक्ष्म दृष्टिकोण की अनुमति देते हैं।
कार्रवाई: इन उदाहरणों के आसपास के क्षेत्रों को फसलें, इन पाठ पता लगाने वाले बॉक्स को बाहर की ओर बढ़ाते हुए अधिक संदर्भ को कैप्चर करने के लिए। यह विस्तार निर्णय लेने में मदद करता है, साथ ही कार्य या कार्य की आवश्यकताओं के अनुसार।
अगला कदम: फसल वाली छवियों पर पता लगाने वाले बॉक्स खींचें और उन्हें एजेंट को प्रस्तुत करें। यह दृश्य सहायता एजेंट को संदर्भ संकेतों या कार्य आवश्यकताओं के आधार पर किस उदाहरण के साथ बातचीत करने का निर्णय लेने में मदद करती है।
यह संरचित दृष्टिकोण ओसीआर परिणामों और एजेंट ऑपरेशन के बीच बातचीत को अनुकूलित करता है, प्रणाली की विश्वसनीयता और विभिन्न दृश्यों में पाठ-आधारित कार्यों को संभालने की इसकी अनुकूलन क्षमता में सुधार करता है। पूरी प्रक्रिया निम्नलिखित छवि में प्रदर्शित की गई है।

आइकन स्थानीयकरण
मोबाइल-एजेंट फ्रेमवर्क एक आइकन पता लगाने वाला उपकरण लागू करता है ताकि जब एजेंट को मोबाइल स्क्रीन पर एक आइकन पर क्लिक करने की आवश्यकता होती है, तो आइकन की स्थिति का पता लगाया जा सके। विशेष रूप से, फ्रेमवर्क पहले एजेंट से आइकन की विशिष्ट विशेषताओं को प्रदान करने का अनुरोध करता है, जिसमें आकार और रंग शामिल हैं, और फिर ग्राउंडिंग डीआईएनओ विधि को प्रॉम्प्ट आइकन के साथ लागू करता है ताकि स्क्रीनशॉट में निहित सभी आइकनों की पहचान की जा सके। अंत में, मोबाइल-एजेंट सीएलआईपी फ्रेमवर्क का उपयोग करके क्लिक क्षेत्र के विवरण और मिटाए गए आइकनों के बीच समानता की गणना करता है, और उच्चतम समानता वाले क्षेत्र का चयन क्लिक के लिए करता है।

निर्देश निष्पादन
एजेंट द्वारा कार्यों को स्क्रीन पर ऑपरेशन में अनुवादित करने के लिए, मोबाइल-एजेंट फ्रेमवर्क 8 अलग-अलग ऑपरेशन परिभाषित करता है।
- एप्लिकेशन लॉन्च (एप्लिकेशन नाम): डेस्कटॉप इंटरफ़ेस से निर्दिष्ट एप्लिकेशन को प्रारंभ करें।
- पाठ पर टैप करें (पाठ लेबल): स्क्रीन के उस हिस्से के साथ बातचीत करें जो लेबल “पाठ लेबल” प्रदर्शित करता है।
- आइकन के साथ बातचीत करें (आइकन विवरण, स्थान): निर्दिष्ट आइकन क्षेत्र को लक्षित करें और टैप करें, जहां “आइकन विवरण” आइकन के रंग और आकार जैसी विशेषताओं का विवरण देता है। स्थान का चयन करें जो शीर्ष, नीचे, बाएं, दाएं, या केंद्र हो सकता है, संभावित रूप से दो को मिलाकर सटीक नेविगेशन और त्रुटियों को कम करने के लिए।
- पाठ दर्ज करें (इनपुट पाठ): दिए गए “इनपुट पाठ” को सक्रिय पाठ फ़ील्ड में दर्ज करें।
- स्क्रॉल अप और डाउन: वर्तमान पृष्ठ की सामग्री के माध्यम से ऊपर या नीचे नेविगेट करें।
- वापस जाएं: पिछले देखे गए पृष्ठ पर लौटें।
- बंद करें: वर्तमान स्क्रीन से सीधे डेस्कटॉप पर लौटें।
- रोकें: कार्य पूरा होने पर ऑपरेशन को समाप्त करें।
स्व-योजन
प्रत्येक ऑपरेशन को फ्रेमवर्क द्वारा पुनरावृत्ति रूप से निष्पादित किया जाता है, और प्रत्येक पुनरावृत्ति की शुरुआत से, उपयोगकर्ता को एक इनपुट निर्देश प्रदान करने की आवश्यकता होती है, और मोबाइल-एजेंट मॉडल निर्देश का उपयोग पूरी प्रक्रिया के लिए एक सिस्टम प्रॉम्प्ट उत्पन्न करने के लिए करता है। इसके अलावा, प्रत्येक पुनरावृत्ति की शुरुआत से, फ्रेमवर्क एक स्क्रीनशॉट को कैप्चर करता है और इसे एजेंट को खिलाता है। एजेंट तब स्क्रीनशॉट, ऑपरेशन इतिहास, और सिस्टम प्रॉम्प्ट को देखता है ताकि ऑपरेशन का अगला कदम आउटपुट किया जा सके।
स्व-प्रतिबिंब
अपने ऑपरेशन के दौरान, एजेंट को त्रुटियों का सामना करना पड़ सकता है जो इसे एक कमांड को सफलतापूर्वक निष्पादित करने से रोकती हैं। निर्देश पूर्ति दर को बढ़ाने के लिए, एक स्व-मूल्यांकन दृष्टिकोण लागू किया गया है, जो दो विशिष्ट परिस्थितियों के तहत सक्रिय होता है। पहले, यदि एजेंट एक दोषपूर्ण या अमान्य कार्रवाई को निष्पादित करता है जो प्रगति को रोकता है, जैसे कि जब यह मानता है कि स्क्रीनशॉट ऑपरेशन के बाद अपरिवर्तित रहता है या एक गलत पृष्ठ प्रदर्शित करता है, तो यह वैकल्पिक कार्यों पर विचार करने या मौजूदा ऑपरेशन के मापदंडों को समायोजित करने के लिए निर्देशित किया जाएगा। दूसरा, एजेंट जटिल निर्देश के कुछ तत्वों को याद कर सकता है। एक श्रृंखला की कार्रवाइयों को अपनी प्रारंभिक योजना के आधार पर निष्पादित करने के बाद, यह उपयोगकर्ता के निर्देश, नवीनतम स्क्रीनशॉट, और अपनी कार्रवाई श्रृंखला की समीक्षा करने के लिए प्रेरित किया जाएगा ताकि यह आकलन किया जा सके कि क्या कार्य पूरा हो गया है। यदि विसंगतियां पाई जाती हैं, तो एजेंट से निर्देश को पूरा करने के लिए स्वतंत्र रूप से नए कार्यों का उत्पादन करने का अनुरोध किया जाता है।
मोबाइल-एजेंट: प्रयोग और परिणाम
अपनी क्षमताओं का व्यापक मूल्यांकन करने के लिए, मोबाइल-एजेंट फ्रेमवर्क मोबाइल-इवल बेंचमार्क पेश करता है, जिसमें दस सामान्य रूप से इस्तेमाल की जाने वाली मोबाइल एप्लिकेशन शामिल हैं, और प्रत्येक एप्लिकेशन के लिए तीन निर्देश डिज़ाइन किए गए हैं। पहला ऑपरेशन सरल है, और केवल बुनियादी एप्लिकेशन ऑपरेशन को कवर करता है, जबकि दूसरा ऑपरेशन पहले से थोड़ा अधिक जटिल है क्योंकि इसमें कुछ अतिरिक्त आवश्यकताएं हैं। अंत में, तीसरा ऑपरेशन सबसे जटिल है क्योंकि यह एक अमूर्त उपयोगकर्ता निर्देश शामिल करता है, जहां उपयोगकर्ता स्पष्ट रूप से यह निर्दिष्ट नहीं करता है कि कौन सा ऐप उपयोग करना है या क्या ऑपरेशन करना है।
इसके अलावा, प्रदर्शन का विभिन्न दृष्टिकोणों से मूल्यांकन करने के लिए, मोबाइल-एजेंट फ्रेमवर्क चार अलग-अलग मेट्रिक्स डिज़ाइन और लागू करता है।
- सफलता या सु: यदि मोबाइल-एजेंट निर्देशों को पूरा करता है, तो इसे सफलता माना जाता है।
- प्रक्रिया स्कोर या पीएस: प्रक्रिया स्कोर मेट्रिक उपयोगकर्ता निर्देशों के निष्पादन के दौरान प्रत्येक चरण की सटीकता को मापता है, और यह निर्देशों के निष्पादन में सही कदमों की संख्या को कुल कदमों की संख्या से विभाजित करके गणना की जाती है।
- सापेक्ष कुशलता या आरई: सापेक्ष कुशलता स्कोर मानव द्वारा निर्देशों को मैनुअल रूप से निष्पादित करने में कदमों की संख्या और एजेंट द्वारा समान निर्देशों को निष्पादित करने में कदमों की संख्या के बीच एक अनुपात या तुलना है।
- पूर्णता दर या सीआर: पूर्णता दर मेट्रिक मानव-संचालित कदमों की संख्या को मापती है जिन्हें फ्रेमवर्क सफलतापूर्वक पूरा करता है, कुल मानव-निर्देशित कदमों की संख्या से विभाजित। सीआर मान 1 है जब एजेंट निर्देशों को सफलतापूर्वक पूरा करता है।
परिणाम निम्नलिखित आंकड़े में प्रदर्शित किए गए हैं।

प्रारंभ में, तीन दिए गए कार्यों के लिए, मोबाइल-एजेंट ने क्रमशः 91%, 82%, और 82% पूर्णता दर हासिल की। जबकि सभी कार्यों को निर्दोष रूप से निष्पादित नहीं किया गया था, प्रत्येक कार्य श्रेणी के लिए प्राप्ति दर 90% से अधिक थी। इसके अलावा, पीएस मेट्रिक से पता चलता है कि मोबाइल-एजेंट तीन कार्यों के लिए सटीक कार्रवाइयों को निष्पादित करने की एक उच्च संभावना प्रदर्शित करता है, जिसमें लगभग 80% की सफलता दर है। साथ ही, आरई मेट्रिक के अनुसार, मोबाइल-एजेंट मानव-आदर्श के स्तर पर 80% की कुशलता प्रदर्शित करता है। ये परिणाम सामूहिक रूप से मोबाइल-एजेंट की क्षमता को एक मोबाइल डिवाइस सहायक के रूप में प्रदर्शित करते हैं।
निम्नलिखित आंकड़ा मोबाइल-एजेंट की क्षमता को दर्शाता है कि यह उपयोगकर्ता निर्देशों को समझता है और स्वतंत्र रूप से अपनी कार्रवाइयों को निर्देशित करता है। यहां तक कि जब निर्देशों में विस्तृत ऑपरेशन विवरण नहीं होते हैं, तो मोबाइल-एजेंट उपयोगकर्ता की आवश्यकताओं को कुशलता से व्याख्या करता है और उन्हें कार्रवाई योग्य कार्यों में परिवर्तित करता है। इस समझ के बाद, एजेंट एक व्यवस्थित योजना प्रक्रिया के माध्यम से निर्देशों को निष्पादित करता है।

अंतिम विचार
इस लेख में, हमने मोबाइल-एजेंट्स के बारे में चर्चा की है, एक स्वायत्त बहु-मोडल डिवाइस एजेंट जो पहले दृश्य धारणा प्रौद्योगिकियों का उपयोग करके मोबाइल एप्लिकेशन के फ्रंट-एंड इंटरफ़ेस के भीतर दृश्य और पाठ्य सामग्री को सटीक रूप से पहचान और स्थित करने में सक्षम है। इस दृश्य संदर्भ को ध्यान में रखते हुए, मोबाइल-एजेंट फ्रेमवर्क जटिल ऑपरेशन कार्य को स्वतंत्र रूप से योजना बनाता है और कार्य को तोड़ता है, और चरण-दर-चरण ऑपरेशन के माध्यम से मोबाइल ऐप्स के माध्यम से नेविगेट करता है। यह फ्रेमवर्क मौजूदा विधियों से अलग है क्योंकि यह मोबाइल सिस्टम मेटाडेटा या मोबाइल ऐप्स की एक्सएमएल फ़ाइलों पर निर्भर नहीं करता है, जिससे विभिन्न मोबाइल ऑपरेटिंग सिस्टम में अनुकूलन में सुधार होता है। मोबाइल-एजेंट फ्रेमवर्क द्वारा अपनाई गई रणनीति सिस्टम-विशिष्ट अनुकूलन की आवश्यकता को समाप्त करती है, जिससे प्रदर्शन में सुधार और कम गणना आवश्यकताएं होती हैं।












