एआई मॉडल और प्लेटफ़ॉर्म

फेरेट: किसी भी ग्रैन्युलरिटी पर रेफर और ग्राउंडिंग कार्यों में उत्कृष्ट प्रदर्शन

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

दृष्टि-भाषा सीखने के मॉडल में स्थानिक समझ को सक्षम करना एक प्रमुख अनुसंधान चुनौती बना हुआ है। यह समझ दो महत्वपूर्ण क्षमताओं पर आधारित है: ग्राउंडिंग और रेफरिंग। रेफरिंग मॉडल को विशिष्ट क्षेत्रों के अर्थ को सटीक रूप से व्याख्या करने में सक्षम बनाता है, जबकि ग्राउंडिंग सेमेंटिक विवरण का उपयोग करके इन क्षेत्रों को स्थानीयकृत करने में शामिल है।

विकासकर्ताओं ने फेरेट पेश किया है, एक बहुमोडल बड़ा भाषा मॉडल (एमएलएलएम) जो किसी भी ग्रैन्युलरिटी या आकार में छवि में स्थानिक रेफरिंग को समझने और खुले शब्दावली विवरण को सटीक रूप से ग्राउंडिंग करने में सक्षम है। फेरेट एक नए हाइब्रिड प्रतिनिधित्व का उपयोग करता है जो निरंतर विशेषताओं और विच्छिन्न समन्वय को एक विशिष्ट क्षेत्र को संदर्भित करने के लिए जोड़ती है। इसका स्थानिक-जागरूक दृश्य नमूनाकार विभिन्न आकारों में विभिन्न घनत्व को संभालने में सक्षम है, जिससे यह विभिन्न क्षेत्र इनपुट जैसे कि मुक्त-रूप शेप, बाउंडिंग बॉक्स और बिंदुओं को संसाधित कर सकता है।

फेरेट की दृष्टि में यह क्षमता है कि यह क्लासिक ग्राउंडिंग और रेफरिंग कार्यों में उत्कृष्ट प्रदर्शन करे और अन्य एमएलएलएम को स्थानीयकरण-मांग वाले और क्षेत्र-आधारित बहुमोडल संचार में पार करे। यह लेख फेरेट के वास्तुकला और विधि में गहराई से जाता है, इसके विभिन्न बहुमोडल भाषा कार्यों में इसके प्रभावशाली प्रदर्शन को उजागर करता है। आइए इसे और गहराई से देखें।

फेरेट: ग्राउंडिंग और रेफरिंग कार्यों में उत्कृष्ट प्रदर्शन

मॉडल में रेफरिंग एक क्षमता है जो मॉडल को विशिष्ट क्षेत्रों के अर्थ को सटीक रूप से समझने में सक्षम बनाती है, जबकि ग्राउंडिंग मॉडल को सेमेंटिक विवरण का उपयोग करके क्षेत्रों को स्थानीयकृत करने में आवश्यक बनाती है। हालांकि वे अपने कार्यों में भिन्न हो सकते हैं, ग्राउंडिंग और रेफरिंग दोनों की मूल अवधारणा एक ही है: स्थानिक अर्थ और जानकारी का संरेखण। हालांकि, ग्राउंडिंग और रेफरिंग को अलग-अलग सीखने के बावजूद, मॉडल मानव जैसी क्षमता प्राप्त करने में बाधा का सामना करता है, क्योंकि मानव एक कार्य से सीख सकता है और दूसरे कार्य में इसका उपयोग कर सकता है। फेरेट फ्रेमवर्क इस अंतर को पूरा करने का प्रयास करता है और तीन मुख्य प्रश्नों का अध्ययन करता है:

  1. ग्राउंडिंग और रेफरिंग क्षमताओं को फ्रेमवर्क में कैसे एकजुट किया जाए और उनके संयोजन से एक दूसरे को कैसे लाभ हो?
  2. मानव विभिन्न प्रकार के क्षेत्रों जैसे बॉक्स, बिंदु, स्क्रिबल, मुक्त-रूप आकार का उपयोग रेफरिंग के लिए करते हैं? इन विविध क्षेत्रों का प्रतिनिधित्व कैसे किया जाए?
  3. ग्राउंडिंग और रेफरिंग निर्देशों को निर्देश-आधारित, मजबूत और खुले शब्दावली कैसे बनाया जाए, जो उनके व्यावहारिक और वास्तविक अनुप्रयोगों के लिए महत्वपूर्ण हैं?

फेरेट फ्रेमवर्क एक नए रेफर और ग्राउंड बहुमोडल बड़ा भाषा मॉडल है जो इन प्रश्नों को लक्षित करने का प्रयास करता है। फेरेट फ्रेमवर्क अपने आधार के रूप में बहुमोडल बड़ा भाषा मॉडल का चयन करता है, जो अपनी उल्लेखनीय वैश्विक दृष्टि और भाषा समझने की क्षमता के लिए जाना जाता है। इसके अलावा, ग्राउंडिंग और रेफरिंग क्षमताओं को एकजुट करने के लिए, फेरेट फ्रेमवर्क प्राकृतिक भाषा संख्यात्मक रूप में क्षेत्रों के समन्वय का प्रतिनिधित्व करता है। हालांकि, व्यवहार में, यह बॉक्स समन्वय या यहां तक कि एकल बिंदुओं का उपयोग करके विविध क्षेत्र आकार जैसे स्क्रिबल, स्ट्रोक, या जटिल बहुभुजों का प्रतिनिधित्व करना अकुशल है, क्योंकि वे सुधारित सटीकता और अधिक सार्वजनिक मानव-मॉडल इंटरैक्शन के लिए महत्वपूर्ण हैं। इस समस्या को हल करने के लिए, फेरेट फ्रेमवर्क एक स्थानिक-जागरूक दृश्य नमूनाकार का उपयोग करता है जो आकार की परवाह किए बिना क्षेत्रों के लिए दृश्य क्षेत्र प्राप्त करता है, जिससे विभिन्न आकारों में विभिन्न घनत्व के साथ समझौता किया जा सकता है। फिर फ्रेमवर्क निरंतर दृश्य विशेषताओं को विच्छिन्न समन्वय के साथ जोड़ती है, जिससे इनपुट में दृश्य क्षेत्रों का एक हाइब्रिड प्रतिनिधित्व बनता है।

फेरेट फ्रेमवर्क उपरोक्त तरीकों का उपयोग करके मुक्त-प्रारूप पाठ के साथ संदर्भित क्षेत्रों के मिश्रण के इनपुट को हल करने में सक्षम है, और संदर्भित वस्तुओं के लिए समन्वय और ग्राउंडिंग के लिए पाठ उत्पन्न करने में सक्षम है। फेरेट पहला फ्रेमवर्क है जो बहुमोडल बड़ा भाषा मॉडल में मुक्त-रूप इनपुट क्षेत्रों को संसाधित करता है। इसके अलावा, फेरेट फ्रेमवर्क स्थानिक स्थानीयकरण और समझ की उल्लेखनीय खुले शब्दावली क्षमताओं को अवशोषित करता है, जिससे यह पारंपरिक ग्राउंडिंग और रेफरिंग कार्यों पर मूल्यांकन के दौरान उत्कृष्ट प्रदर्शन प्राप्त करता है।

आगे बढ़ते हुए, फेरेट फ्रेमवर्क तीन मौजूदा एआई फ्रेमवर्क से प्रेरणा लेता है, जिनमें बहुमोडल बड़ा भाषा मॉडल, रेफरिंग और ग्राउंडिंग के लिए एमएलएलएम, और वीएल समझ के साथ ग्राउंडिंग को एकजुट करना शामिल है।

बड़े भाषा मॉडल जैसे जीपीटी, डीएएल-ई, पाल्म, एलएलएएमए, और ब्लूम की शुरुआत ने एनएलपी अनुसंधान के परिदृश्य को बदल दिया है, जिससे बहुमोडल भाषा मॉडल में महत्वपूर्ण प्रगति हुई है। पहले के बहुमोडल भाषा मॉडल मुख्य रूप से बड़े पैमाने पर छवि-पाठ जनरेशन पर केंद्रित थे, जिनमें पाली, सिमवीएलएम, जीआईटी, बीएलआईपी-2, फ्लेमिंगो, सीएम3, और पाली-एक्स जैसे कुछ उल्लेखनीय उदाहरण शामिल थे। हालांकि, फ्लेमिंगो फ्रेमवर्क ने पूर्व-प्रशिक्षित सीएलआईपी छवि एनकोडर के साथ एलएलएम को क्रॉस-गेटेड अटेंशन ब्लॉक के माध्यम से एकजुट करने में कुशल एकीकरण प्रदर्शित किया, जिससे उल्लेखनीय बहुमोडल फ्यू-शॉट लर्निंग क्षमताएं प्राप्त हुईं। वर्तमान अनुसंधान पूर्व-प्रशिक्षित बड़े भाषा मॉडल का उपयोग दृश्य निर्देश ट्यूनिंग के लिए करने के तरीकों की तलाश कर रहा है, जिनमें मिनीगपीटी-4, ओटर, इन्स्ट्रक्टब्लिप, और अधिक जैसे कुछ उल्लेखनीय उदाहरण शामिल हैं। इसके अलावा, हाल के मॉडल जैसे एमयू और जीआईएलएल ने एमएलएलएम का उपयोग छवि जनरेशन और छवि पुनर्प्राप्ति के लिए दिखाया है। फेरेट फ्रेमवर्क भी पूर्व अनुसंधान का हवाला देता है जो दृष्टि-भाषा मॉडल के लिए पाठ और बाउंडिंग बॉक्स आउटपुट को एकजुट करने पर केंद्रित है।

फेरेट: विधि और वास्तुकला

हाइब्रिड-रीजन प्रतिनिधित्व

बिंदु, बॉक्स, और मुक्त-रूप आकार तीन प्रमुख प्रारूप हैं जो एक भाषा मॉडल विशिष्ट क्षेत्रों को संदर्भित करने के लिए उपयोग करता है। एक ओर, बिंदु और बॉक्स प्रारूप को समन्वय द्वारा सटीक रूप से प्रतिनिधित्व किया जा सकता है, लेकिन मुक्त-रूप आकार को मैप करना अधिक चुनौतीपूर्ण है क्योंकि मुक्त-रूप आकार विविध हो सकते हैं। मुक्त-रूप आकार मास्क, बहुभुज, और स्क्रिबल जैसे विभिन्न क्षेत्रों को शामिल कर सकते हैं। मुक्त-रूप आकार को समन्वय द्वारा प्रतिनिधित्व करना जटिल है और मॉडल की क्षमता को प्रभावित करता है कि यह क्षेत्रों और उनके समन्वय के बीच संबंध स्थापित करे। इसके अलावा, मुक्त-रूप आकार को समन्वय द्वारा प्रतिनिधित्व करना गणनात्मक रूप से महंगा और अस्पष्ट है।

इस समस्या को हल करने के लिए, फेरेट फ्रेमवर्क एक हाइब्रिड क्षेत्र प्रतिनिधित्व प्रस्तावित करता है जो निरंतर दृश्य विशेषताओं को विच्छिन्न समन्वय के साथ जोड़ती है ताकि एक विशिष्ट क्षेत्र को संदर्भित किया जा सके।

निरंतर दृश्य विशेषताओं के लिए, फेरेट फ्रेमवर्क एक दिए गए क्षेत्र के लिए 2डी बाइनरी मास्क का निर्माण करता है, जो छवि के आकार के समान होता है, और मास्क के भीतर एक मान 1 और बाहर एक मान 0 निर्दिष्ट करता है। फिर मॉडल बाइनरी मास्क को निकाले गए छवि विशेषता मानचित्र के साथ जोड़ता है और इसे स्थानिक-जागरूक दृश्य नमूनाकार में भेजता है।

वास्तुकला

फेरेट मॉडल की वास्तुकला में तीन मुख्य घटक शामिल हैं

  1. छवि एनकोडर जो छवि एम्बेडिंग निकालता है।
  2. स्थानिक-जागरूक दृश्य नमूनाकार जो क्षेत्रीय निरंतर विशेषताएं निकालता है।
  3. बड़ा भाषा मॉडल जो पाठ, छवि, और क्षेत्र विशेषताओं को संयुक्त रूप से मॉडल करता है।

छवि को पहले पूर्व-प्रशिक्षित दृश्य एनकोडर में डाला जाता है ताकि छवि एम्बेडिंग निकाली जा सके। पाठ इनपुट के लिए, फ्रेमवर्क पहले पूर्व-प्रशिक्षित एलएलएम टोकनाइज़र का उपयोग करके पाठ अनुक्रम को टोकनाइज़ करता है, और फिर इन टोकनों को पाठ एम्बेडिंग में परियोजना करता है। संदर्भित क्षेत्रों के लिए, फेरेट एक विशेष टोकन और समन्वय को एक प्लेसहोल्डर के रूप में जोड़ता है निरंतर विशेषताओं के बाद क्षेत्र के नाम के बाद। यदि क्षेत्र का नाम अज्ञात है या इसका विवरण जटिल है क्योंकि इसमें कई वस्तुएं शामिल हैं, तो फ्रेमवर्क केवल क्षेत्र का नाम या क्षेत्र का उपयोग करता है।

संदर्भित क्षेत्रों से निपटने की एक प्रमुख चुनौती यह है कि उनका आकार बहुत भिन्न हो सकता है, अर्थात् वे विभिन्न आकारों में आ सकते हैं और केवल आयताकार बॉक्स या बिंदुओं तक सीमित नहीं हैं। अनियमित आकार के संदर्भित क्षेत्रों को पारंपरिक विधियों जैसे ग्रिड-आधारित प्रोसेसिंग, पैच अटेंशन या कन्वोल्यूशनल तकनीकों का उपयोग करके संसाधित नहीं किया जा सकता है। इस समस्या को हल करने के लिए, फेरेट फ्रेमवर्क एक स्थानिक-जागरूक दृश्य नमूनाकार प्रस्तावित करता है। एक निकाले गए फीचर मानचित्र और बाइनरी क्षेत्र मास्क के लिए, फेरेट मॉडल पहले बाइनरी क्षेत्र मास्क के भीतर एन नंबर के बिंदुओं को यादृच्छिक रूप से नमूना लेता है।

प्रत्येक बिंदु के लिए, मॉडल बिलीनियर इंटरपोलेशन द्वारा इसकी विशेषता प्राप्त करता है। एन बिंदुओं को तब एक पानी के झरने की श्रृंखला में तीन चरणों से गुजरना पड़ता है: नमूनाकरण, एकत्रीकरण, और पूलिंग। नमूनाकरण चरण में, एक निश्चित संख्या में बिंदुओं को एन बिंदुओं से नमूना लिया जाता है जो एफपीएस या दूरस्थ बिंदु नमूनाकरण अल्गोरिदम का उपयोग करके पर्याप्त कवरेज सुनिश्चित करता है। दूसरे चरण में, प्रत्येक नमूना बिंदु के लिए, फ्रेमवर्क इसके के निकटतम पड़ोसियों की खोज करता है। प्रत्येक समूह के लिए, मॉडल नमूना बिंदु की विशेषताओं को इसके पड़ोसी बिंदुओं के साथ जोड़ता है। अंतिम चरण में, फेरेट फ्रेमवर्क एक अधिकतम पूलिंग करता है ताकि के निकटतम पड़ोसी विशेषताओं को एक विशेषता में जोड़कर नमूना बिंदु का प्रतिनिधित्व किया जा सके। इन तीन चरणों को पूरा करने के बाद, फेरेट फ्रेमवर्क कम बिंदुओं के साथ लेकिन उच्च घनत्व वाले विशेषता स्थान के साथ छोड़ दिया जाता है क्योंकि यह न केवल स्थानीय पड़ोसियों की विशेषताओं को शामिल करता है, बल्कि उनकी सापेक्ष स्थितियों को भी शामिल करता है।

जीपीटी-सहायता प्राप्त दृश्य डेटा जनरेशन

संवाद निर्देश ट्यूनिंग डेटा बहुमोडल बड़े भाषा मॉडल के लिए महत्वपूर्ण है, क्योंकि वे न केवल मौजूदा डेटासेट को टेम्पलेट द्वारा परिवर्तित करने में मदद करते हैं, बल्कि मॉडल को मानवीय इरादे को समझने और उपयुक्त प्रतिक्रिया उत्पन्न करने में भी मदद करते हैं। अधिकांश एमएलएलएम फ्यू-शॉट प्रॉम्प्टिंग विधि का उपयोग करके दृश्य निर्देश ट्यूनिंग डेटा प्राप्त करते हैं, जहां मॉडल छवि में दृश्यों का पाठ विवरण प्रदान करता है साथ ही मानव-संज्ञानात्मक संवाद के रूप में फ्यू-शॉट प्रदर्शन। हालांकि, मौजूदा निर्देश ट्यूनिंग विधियां विशेष रूप से छवि का पूरा विवरण देने पर केंद्रित होती हैं और स्थानिक संबंधों की जानकारी को स्पष्ट रूप से प्रदान नहीं करती हैं। फेरेट फ्रेमवर्क क्षेत्र-आधारित ज्ञान पर जोर देता है और तीन चरणों में रेफर और ग्राउंड निर्देश ट्यूनिंग डेटा एकत्र करता है:

  1. वैश्विक कैप्शन और वस्तुओं के अलावा, फ्रेमवर्क सимвोलिक दृश्य विवरण प्रदान करता है जो क्षेत्र कैप्शन और वस्तुओं के बीच भौतिक संबंधों का वर्णन करता है और उनके समन्वय प्रदान करता है।
  2. मानव-संज्ञानात्मक संवाद के लिए, फ्रेमवर्क ग्राउंडेबल वस्तुओं या क्षेत्रों के बाद समन्वय जोड़ता है, जो संवाद में या दोनों में हो सकते हैं, जो संवाद को विशिष्ट क्षेत्रों पर केंद्रित करने में मदद करता है।
  3. यह संभव है कि मॉडल द्वारा उत्पन्न संवाद फ्यू-शॉट उदाहरणों द्वारा प्रदान किए गए पैटर्न और नियमों का पालन नहीं कर सकता है। इस समस्या को हल करने के लिए, फ्रेमवर्क मॉडल द्वारा उत्पन्न संवाद को सुधारने के लिए एक भाषा मॉडल का उपयोग करता है।

स्थानिक नकारात्मक खनन

पूर्व अनुसंधान ने दिखाया है कि बहुमोडल बड़े भाषा मॉडल हैल्यूसिनेशन की उच्च संभावना रखते हैं जब वे हां या ना प्रश्नों का उत्तर देते हैं। फेरेट मॉडल को इसी तरह की स्थितियों में हैल्यूसिनेशन से बचाने के लिए, फ्रेमवर्क स्थानिक नकारात्मक खनन दृष्टिकोण का उपयोग करता है जिसमें इमेज-शर्त की श्रेणी स्थानीयकरण और सेमेंटिक्स-शर्त श्रेणी स्थानीयकरण शामिल है। दोनों विधियां मॉडल को विशिष्ट वस्तु श्रेणियों को स्थानीयकृत करने के लिए कहती हैं जो मॉडल को वस्तुओं की अनुपस्थिति को पहचानने में मदद करती हैं।

फेरेट: परिणाम और प्रयोग

इसके प्रदर्शन का विश्लेषण करने के लिए, फेरेट फ्रेमवर्क का मूल्यांकन पारंपरिक ग्राउंडिंग और रेफरिंग बेंचमार्क पर किया जाता है, और फिर इसे एक अधिक जटिल बहुमोडल चैटिंग कार्य में और इसकी रेफर-एंड-ग्राउंड क्षमताओं के परीक्षण में मूल्यांकन किया जाता है।

मॉडल की रेफरिंग क्षमता का मूल्यांकन एक संदर्भित क्षेत्र दिए जाने पर मॉडल द्वारा संदर्भित क्षेत्र के अर्थ को कितनी सटीकता से समझने की क्षमता से किया जाता है। मॉडल की सटीकता को मापने के लिए, वस्तुएं, जो मूलभूत अर्थ हैं, पहले विचार की जाती हैं क्योंकि वे न केवल मूलभूत हैं बल्कि परिभाषित करने में भी आसान हैं। मानव-स्तर की बहुमुखी प्रतिभा की नकल करने के लिए, फ्रेमवर्क वस्तु के स्थान को छवि में एक मुक्त-रूप आकार, एक बॉक्स, और एक बिंदु से बदल देता है। एक मुक्त-रूप आकार के लिए, मॉडल ग्राउंड ट्रुथ वस्तु के भीतर यादृच्छिक रूप से स्ट्रोक उत्पन्न करता है। एक बॉक्स के लिए, फेरेट फ्रेमवर्क एलवीआईएस घटक द्वारा प्रदान किए गए ग्राउंड ट्रुथ बाउंडिंग बॉक्स का उपयोग करता है। अंत में, एक बिंदु के लिए, मॉडल ग्राउंड ट्रुथ वस्तु के भीतर एक बिंदु को यादृच्छिक रूप से नमूना लेता है जो ग्राउंड ट्रुथ वस्तु की सीमा के पास होता है। तीन प्रकार के रेफरिंग परिणाम निम्नलिखित छवि में दिखाए गए हैं।

फेरेट फ्रेमवर्क रेफरेंशियल संवाद कार्यों में उल्लेखनीय प्रदर्शन प्रदर्शित करता है, जो विभिन्न दृश्य सीखने कार्यों के साथ एकीकरण के लिए जगह बनाता है, विशेष रूप से उन लोगों के साथ जो ग्राउंडिंग आउटपुट के साथ हैं। फेरेट फ्रेमवर्क की ग्राउंडिंग क्षमता का मूल्यांकन करने के लिए, यह पहले दृश्य ग्राउंडिंग कार्यों के साथ एक जनरेटिव दृष्टिकोण में खुद को प्रस्तुत करता है, और फिर इसकी ग्राउंडेड कैप्शनिंग कार्यों पर इसकी क्षमता का मूल्यांकन करता है ताकि क्षेत्रों और शब्दों के बीच संरेखण को मापा जा सके।

दृश्य ग्राउंडिंग कार्यों में, फ्रेमवर्क का उद्देश्य भाषा प्रश्नों को छवि के संरेखित क्षेत्रों में ग्राउंड करना है, और जैसा कि निम्नलिखित छवि में देखा जा सकता है, फेरेट फ्रेमवर्क सभी बेंचमार्क पर उल्लेखनीय प्रदर्शन प्रदर्शित करता है, और प्रदर्शन विशेषज्ञ फाइन-ट्यूनिंग विधियों द्वारा प्राप्त प्रदर्शन के समान है।

ग्राउंडेड कैप्शनिंग कार्यों के लिए, मॉडल को एक कैप्शन उत्पन्न करना होता है और फिर उत्पन्न किए गए नामवाचक वाक्यांशों को छवि क्षेत्रों में ग्राउंड करना होता है। मॉडल का अंतिम पूर्वानुमान तीन घटकों से बना होता है: दृश्य क्षेत्र बॉक्स के रूप में, पाठ कैप्शन, और बॉक्स और शब्दों के बीच ग्राउंडिंग संरेखण। परिणाम निम्नलिखित छवि में दिखाए गए हैं, और जैसा कि देखा जा सकता है, फ्रेमवर्क राज्य-कला विधियों के समान प्रदर्शन प्रदान करता है।

अंत में, बहुमोडल चैटिंग एमएलएलएम की सबसे वांछित क्षमताओं में से एक है, और मौजूदा एमएलएलएम विस्तृत विवरण, संवाद, और जटिल तर्क का मूल्यांकन करते हैं जिसमें भाषा मॉडल एक निर्णायक के रूप में कार्य करता है। हालांकि, चूंकि कोई डेटासेट बहुमोडल चैटिंग का मूल्यांकन नहीं करता है जिसमें अनिवार्य रूप से रेफरिंग या ग्राउंडिंग कार्य शामिल हों, यह एक अंतर छोड़ देता है। इस अंतर को पाटने के लिए, फेरेट फ्रेमवर्क तीन क्षेत्र-आधारित प्रश्नों को शामिल करता है जो इसकी रेफरिंग और ग्राउंडिंग क्षमताओं का मूल्यांकन करने के लिए बहुमोडल चैटिंग कार्यों में इसकी क्षमता का परीक्षण करते हैं। परिणाम निम्नलिखित छवि में दिखाए गए हैं।

अंत में, फेरेट फ्रेमवर्क की तुलना सीधे राज्य-कला जीपीटी फ्रेमवर्क से की जाती है, और परिणाम नीचे दिखाए गए हैं।

अंतिम विचार

इस लेख में, हमने फेरेट के बारे में बात की है, जो एक बहुमोडल बड़ा भाषा मॉडल है जो उल्लेखनीय ग्राउंडिंग और रेफरिंग क्षमता प्रदर्शित करता है। फेरेट फ्रेमवर्क किसी भी आकार के छवि क्षेत्रों को संदर्भित कर सकता है और मॉडल द्वारा स्वचालित रूप से पूर्वानुमानित पाठ के लिए ग्राउंडिंग स्थापित कर सकता है। फेरेट एक स्थानिक-जागरूक दृश्य नमूनाकार का उपयोग करता है जो विभिन्न आकारों में विभिन्न घनत्व को संभालने में सक्षम है, जिससे यह विभिन्न क्षेत्र इनपुट जैसे कि मुक्त-रूप आकार, बाउंडिंग बॉक्स, और बिंदुओं को संसाधित कर सकता है।

एक इंजीनियर पेशे से, एक लेखक दिल से। कुनाल एक तकनीकी लेखक हैं जिन्हें एआई और एमएल के प्रति गहरा प्यार और समझ है, जो अपने आकर्षक और जानकारीपूर्ण दस्तावेज़ के माध्यम से इन क्षेत्रों में जटिल अवधारणाओं को सरल बनाने के लिए समर्पित हैं।