एआई की मूल बातें

ट्रांसफ़ॉर्मर न्यूरल नेटवर्क क्या हैं?

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

ट्रांसफ़ॉर्मर एक न्यूरल‑नेटवर्क वास्तुकला है जो टोकन के बीच संबंधों को ध्यान (attention) का उपयोग करके प्रोसेस करती है। पुनरावृत्त नेटवर्क के विपरीत, जिसे एक स्थिति से अगली स्थिति तक छिपी अवस्था (hidden state) ले जानी पड़ती है, ट्रांसफ़ॉर्मर प्रशिक्षण के दौरान कई टोकन‑टू‑टोकन इंटरैक्शन को समानांतर रूप से गणना कर सकता है।

ट्रांसफ़ॉर्मर कई भाषा, दृश्य, ऑडियो और मल्टीमॉडल सिस्टमों को शक्ति प्रदान करते हैं, लेकिन यह वास्तुकला डेटाबेस या तर्कसंगतता की गारंटी नहीं है। इसके आउटपुट केवल सीखे हुए पैरामीटर, प्रदान किए गए संदर्भ और डिकोडिंग प्रक्रिया के आधार पर भविष्यवाणियाँ होते हैं।

मुख्य बिंदु

  • सेल्फ‑अटेंशन प्रत्येक टोकन को अन्य अनुमत टोकनों से संदर्भ‑निर्भर प्रतिनिधित्व बनाने की अनुमति देता है।
  • स्थिति जानकारी जोड़ी जाती है क्योंकि केवल अटेंशन टोकन क्रम को एन्कोड नहीं करता।
  • एन्कोडर‑केवल, डिकोडर‑केवल और एन्कोडर‑डिकोडर ट्रांसफ़ॉर्मर विभिन्न उद्देश्यों की पूर्ति करते हैं।
  • संदर्भ की लंबाई, गणना, प्रशिक्षण डेटा और मूल्यांकन—केवल अटेंशन नहीं—क्षमता और विश्वसनीयता को निर्धारित करते हैं।
What Are Transformer Neural Networks? diagram showing tokens, embed + position, self-attention, feed-forward, stack blocks, output
अटेंशन संदर्भात्मक प्रतिनिधित्व बनाता है; मास्क और उद्देश्य यह निर्धारित करते हैं कि कौन‑सी जानकारी उपलब्ध है।

टोकन, एम्बेडिंग और स्थिति

पाठ को पहले टोकनों में विभाजित किया जाता है, जो शब्द, सबवर्ड या अक्षर हो सकते हैं। प्रत्येक टोकन आईडी एक सीखे हुए एम्बेडिंग वेक्टर का चयन करती है। विज़न ट्रांसफ़ॉर्मर छवि पैच को एम्बेड कर सकता है; ऑडियो ट्रांसफ़ॉर्मर फ्रेम या सीखे हुए ध्वनिक इकाइयों को एम्बेड कर सकता है।

क्योंकि साधारण अटेंशन ऑपरेशन क्रम‑परिवर्तन‑समतुल्य (permutation‑equivariant) होता है, मॉडल को स्थिति जानकारी की आवश्यकता होती है। कार्यान्वयन में सीखित या स्थायी स्थिति एन्कोडिंग जोड़ी जा सकती है, या सापेक्ष या रोटरी स्थिति योजनाओं से अटेंशन स्कोर बदले जा सकते हैं। परिणाम टोकन के क्या होने को उसकी स्थिति के साथ मिलाता है।

स्केल्ड डॉट‑प्रोडक्ट और मल्टी‑हेड अटेंशन

प्रत्येक स्थिति के लिए, सीखित प्रोजेक्शन क्वेरी, की और वैल्यू बनाते हैं। क्वेरी और अनुमत कीज़ के बीच समानता अटेंशन वज़न उत्पन्न करती है; उनका वज़नित वैल्यू आउटपुट बनाता है। डॉट‑प्रोडक्ट को स्केल करने से वेक्टर आयाम बढ़ने पर सॉफ्टमैक्स संख्यात्मक रूप से स्थिर रहता है।

मल्टी‑हेड अटेंशन इस ऑपरेशन को कई सीखित उपस्थान में दोहराता है। विभिन्न हेड विभिन्न संबंधों में विशेषज्ञता प्राप्त कर सकते हैं, हालांकि एक दृश्य रूप से आकर्षक अटेंशन पैटर्न को स्वचालित रूप से मॉडल के निर्णय की विश्वसनीय व्याख्या नहीं माना जाना चाहिए।

ट्रांसफ़ॉर्मर ब्लॉक

अटेंशन सबलेयर के बाद एक पोजीशन‑वाइज फीड‑फ़ॉरवर्ड नेटवर्क आता है। रेजिडुअल कनेक्शन प्रत्येक सबलेयर के आसपास पूर्व प्रतिनिधित्व को ले जाते हैं, जबकि नॉर्मलाइज़ेशन और रेग्युलराइज़ेशन ऑप्टिमाइज़ेशन को समर्थन देते हैं। कई ब्लॉकों को स्टैक करने से डीप लर्निंग के माध्यम से क्रमशः अधिक संदर्भात्मक विशेषताएँ बनती हैं।

कारणात्मक जनरेशन के दौरान, एक मास्क किसी स्थिति को भविष्य के टोकन पढ़ने से रोकता है। अनुमान के समय, डिकोडर एक टोकन की भविष्यवाणी करता है, उसे जोड़ता है और दोहराता है। की‑वैल्यू कैश पहले के सभी अटेंशन प्रोजेक्शन को पुनः गणना करने से बचाता है, जिससे जनरेशन लागत घटती है लेकिन पूरी तरह समाप्त नहीं होती।

एन्कोडर, डिकोडर और एन्कोडर‑डिकोडर परिवार

एन्कोडर‑केवल मॉडल द्विदिश प्रतिनिधित्व सीखते हैं जो वर्गीकरण, पुनः प्राप्ति और टोकन लेबलिंग के लिए उपयुक्त होते हैं। डिकोडर‑केवल मॉडल अगले टोकन जनरेशन के लिए कारणात्मक अटेंशन का उपयोग करते हैं। एन्कोडर‑डिकोडर मॉडल डिकोडर को एन्कोडेड इनपुट पर अटेंड करने देते हैं, जो अनुवाद और अन्य सीक्वेंस‑टू‑सीक्वेंस कार्यों में उपयोगी है।

आधुनिक सिस्टम अक्सर व्यापक प्री‑ट्रेनिंग से शुरू होते हैं और फिर ट्रांसफ़र लर्निंग, इंस्ट्रक्शन ट्यूनिंग या प्रेफ़रेंस ऑप्टिमाइज़ेशन का उपयोग करते हैं। इसलिए वही वास्तुकला अपने उद्देश्य और डेटा के आधार पर बहुत अलग व्यवहार का समर्थन कर सकती है।

सीमाएँ, दक्षता और मूल्यांकन

एक अनुक्रम पर पूर्ण अटेंशन में अनुक्रम लंबाई के साथ द्विघात (quadratic) युग्मीय इंटरैक्शन होते हैं, जिससे मेमोरी और गणना पर दबाव पड़ता है। स्पार्स या लीनियर अटेंशन, चंकिंग, रिट्रीवल, क्वांटाइज़ेशन और कैशिंग सटीकता, संदर्भ पहुँच, लेटेंसी और कार्यान्वयन जटिलता के बीच संतुलन बनाते हैं।

बड़ा संदर्भ विंडो यह गारंटी नहीं देता कि प्रत्येक प्रदान किया गया तथ्य सही ढंग से उपयोग होगा। तथ्यात्मकता, मजबूती, कैलिब्रेशन, लेटेंसी, लागत और कार्य‑विशिष्ट विफलता मोड का मूल्यांकन करें। इंटरैक्टिव सिस्टमों के लिए, प्रॉम्प्ट इंजीनियरिंग व्यवहार को आकार दे सकती है, लेकिन यह संभाव्य मॉडल को अभेद्य स्रोत नहीं बना सकती।

ट्रांसफ़ॉर्मर गणना टोकनों से संदर्भ तक

एक ट्रांसफ़ॉर्मर टोकनों को वेक्टर में मैप करता है, स्थिति जानकारी जोड़ता है, और उन्हें दोहराए गए अटेंशन और फीड‑फ़ॉरवर्ड ब्लॉकों के माध्यम से पास करता है। सेल्फ‑अटेंशन में, सीखित प्रोजेक्शन क्वेरी, की और वैल्यू बनाते हैं। स्केल्ड डॉट‑प्रोडक्ट प्रत्येक क्वेरी की कीज़ से तुलना करते हैं, सॉफ्टमैक्स वज़न उत्पन्न करता है, और वज़नित वैल्यू संदर्भ बनाते हैं। कई हेड विभिन्न प्रोजेक्शन स्पेस सीखते हैं। रेजिडुअल कनेक्शन और नॉर्मलाइज़ेशन डीप स्टैक्स को स्थिर करते हैं, जबकि फीड‑फ़ॉरवर्ड नेटवर्क प्रत्येक टोकन को अटेंशन लेयर्स के बीच स्वतंत्र रूप से बदलता है।

एन्कोडर‑केवल मॉडल द्विदिश संदर्भ का उपयोग करते हैं और वर्गीकरण या प्रतिनिधित्व कार्यों के लिए उपयुक्त होते हैं। डिकोडर‑केवल मॉडल कारणात्मक मास्क लागू करते हैं ताकि प्रत्येक स्थिति पूर्व टोकनों से भविष्यवाणी करे और जनरेटिव भाषा मॉडलिंग में प्रमुख हो। एन्कोडर‑डिकोडर मॉडल डिकोडर को अनुवाद और संरचित जनरेशन के लिए एन्कोडेड इनपुट पर अटेंड करने देते हैं। मानक रूप में अटेंशन लागत अनुक्रम लंबाई के साथ द्विघात बढ़ती है, जिससे स्पार्स, लीनियर, चंक्ड, रीकर्न्ट और स्टेट‑स्पेस विकल्पों की आवश्यकता उत्पन्न होती है। लंबा संदर्भ उपलब्ध प्रमाण बढ़ाता है, लेकिन याददाश्त या तर्कसंगतता की गारंटी नहीं देता।

प्रशिक्षण, अनुकूलन और अनुमान

प्री‑ट्रेनिंग उद्देश्यों में अगले‑टोकन की भविष्यवाणी, मास्क्ड‑टोकन पुनर्निर्माण, और सीक्वेंस‑टू‑सीक्वेंस करप्शन शामिल हैं। डेटा मिश्रण, डेडुप्लिकेशन, टोकनाइज़र, संदर्भ पैकिंग, ऑप्टिमाइज़र, शेड्यूल और कंप्यूट क्षमता को आकार देते हैं। फाइन‑ट्यूनिंग सभी पैरामीटर अपडेट कर सकता है या एडाप्टर और लो‑रैंक विधियों का उपयोग कर सकता है; इंस्ट्रक्शन और प्रेफ़रेंस ट्यूनिंग व्यवहार को बदलते हैं। बदलते तथ्यों के लिए रिट्रीवल अक्सर बेहतर होता है, जबकि ट्यूनिंग फ़ॉर्मेट और कार्य व्यवहार के लिए उपयोगी है। एक अपरिवर्तित मूल्यांकन सेट रखें और सार्वजनिक बेंचमार्क से संभावित संदूषण की जाँच करें।

ऑटोरिग्रेसिव अनुमान पिछले टोकनों के लिए की‑वैल्यू प्रोजेक्शन को संग्रहीत करता है ताकि पुनः गणना से बचा जा सके। लेटेंसी प्रॉम्प्ट प्रोसेसिंग और क्रमिक डिकोडिंग पर निर्भर करती है; थ्रूपुट बैचिंग, मेमोरी, कैश प्रबंधन, प्रिसीजन और हार्डवेयर पर निर्भर करता है। ग्रीडी, टेम्परेचर, टॉप‑k, टॉप‑p और बीम विधियाँ निर्धारकता और विविधता के बीच संतुलन बनाती हैं। क्वांटाइज़ेशन मेमोरी घटाता है लेकिन दुर्लभ क्षमताओं को प्रभावित कर सकता है। वास्तविक अनुक्रम लंबाई पर तैनात मॉडल, टोकनाइज़र, प्रॉम्प्ट टेम्पलेट, सैंपर और रनटाइम को सत्यापित करें।

मूल्यांकन और नियंत्रण

ट्रांसफ़ॉर्मर भ्रमित (hallucinate) हो सकते हैं, दुर्भावनापूर्ण रिट्रीव्ड निर्देशों का पालन कर सकते हैं, स्मरणीय डेटा उजागर कर सकते हैं, या विभिन्न भाषाओं और लंबी संदर्भों में प्रदर्शन घट सकता है। कार्य सफलता, तथ्यात्मक समर्थन, कैलिब्रेशन, अस्वीकृति, मजबूती, सुरक्षा, लेटेंसी और लागत का मूल्यांकन करें; साक्ष्य और टूल क्रियाओं को अलग‑अलग जांचें। अनुमति‑सजग रिट्रीवल, टाइप्ड टूल्स, बाहरी प्राधिकरण, रेट लिमिट और महत्वपूर्ण कार्यों के लिए मानव अनुमोदन का उपयोग करें। मॉडल और प्रॉम्प्ट संस्करण, इनपुट वितरण, टूल त्रुटियों और उपयोगकर्ता सुधारों की निगरानी रखें। ट्रांसफ़ॉर्मर अनुक्रम गणना की एक वास्तुकला है, न कि समझ का प्रमाण या सत्य आउटपुट की गारंटी।

व्यावहारिक उदाहरण: एक ट्रांसफ़ॉर्मर दस्तावेज़ सहायक

एक कंपनी अनुमोदित मैनुअल को दस्तावेज़ आईडी, संस्करण, सेक्शन, अनुमतियों और प्रभावी तिथि के साथ अनुक्रमित करती है। ट्रांसफ़ॉर्मर‑आधारित सहायक साक्ष्य को रिट्रीव और री‑रैंक करता है, फिर केवल अनुमत अंशों से उद्धरण सहित उत्तर देता है। मूल्यांकन सेट में उत्तर देने योग्य, उत्तर न देने योग्य, अस्पष्ट और विरोधाभासी प्रश्न विभिन्न भूमिकाओं और दस्तावेज़ प्रकारों में शामिल हैं। रिट्रीवल रिकॉल, सिटेशन प्रिसिशन, ठोस उत्तर की शुद्धता, अस्वीकृति, लंबी‑संदर्भ व्यवहार, लेटेंसी और लागत को अलग‑अलग स्कोर किया जाता है।

रिट्रीव किए गए दस्तावेज़ों को अविश्वसनीय डेटा माना जाता है, इसलिए एम्बेडेड निर्देश सिस्टम नीति को ओवरराइड या टूल्स को अधिकृत नहीं कर सकते। उपयोगकर्ता रिट्रीवल से पहले प्रमाणित होते हैं, और परिणामस्वरूप कार्य मॉडल के बाहर रहते हैं। लॉग साक्ष्य आईडी और संस्करण को अनावश्यक दस्तावेज़ सामग्री के बिना संरक्षित रखते हैं। मॉनिटरिंग कॉर्पस में बदलाव, असमर्थित उत्तर, अनुमति त्रुटियों और उपयोगकर्ता सुधारों का पता लगाती है। मॉडल या टोकनाइज़र में परिवर्तन को पूर्ण टेस्ट सेट पर पुनः चलाया जाता है, और नया सिस्टम समान या बेहतर सुरक्षा और गुणवत्ता दिखाने तक पूर्व कॉन्फ़िगरेशन उपलब्ध रहता है।

कार्यान्वयन प्रमाण और परिचालन तत्परता

एक उत्पादन निर्णय को सफल प्रदर्शन से अधिक की आवश्यकता होती है। इच्छित उपयोगकर्ता, संचालन वातावरण, इनपुट, आउटपुट, निर्भरताएँ, मालिक और प्रत्येक महत्वपूर्ण विफलता के परिणाम को परिभाषित करें। ट्यूनिंग से पहले पुनरुत्पादनीय बेसलाइन और संस्करणित मूल्यांकन सेट स्थापित करें। सामान्य मामलों, सीमा स्थितियों, विकृत या अनुपलब्ध इनपुट, वितरण परिवर्तन, निर्भरता आउटेज, दुरुपयोग, और सबसे अधिक सेवा‑रहित समूहों या वातावरण का परीक्षण करें। कार्य गुणवत्ता को कैलिब्रेशन या अनिश्चितता, लेटेंसी, थ्रूपुट, संसाधन लागत, पहुँच, गोपनीयता और सुरक्षा के साथ मापें। प्रत्येक परिवर्तन और थ्रेशोल्ड को रिकॉर्ड करें ताकि स्वतंत्र समीक्षक परिणाम को पुनः उत्पन्न कर सके और आकर्षक प्रोटोटाइप से प्रमाण को अलग कर सके।

लॉन्च से पहले, रिलीज़, अपवाद, परिवर्तन, रोलबैक और रिटायरमेंट के लिए अधिकार निर्धारित करें। चरणबद्ध रोलआउट का उपयोग करें, एक सुरक्षित फॉलबैक बनाए रखें, और जानबूझकर डाले गए विफलताओं के साथ मॉनिटरिंग सत्यापित करें। परिचालन टेलीमेट्री को इनपुट गुणवत्ता, आउटपुट व्यवहार, मॉडल या नियम संस्करण, निर्भरता स्वास्थ्य, मानव ओवरराइड और पुष्टि किए गए परिणाम दिखाने चाहिए, बिना अनावश्यक संवेदनशील डेटा एकत्र किए। अलर्ट थ्रेशोल्ड और प्रतिक्रिया मालिक को परिभाषित करें, फिर तैनाती के बाद वास्तविक‑दुनिया के प्रमाण की समीक्षा करें, न कि यह मानते हुए कि ऑफ़लाइन प्रदर्शन बना रहेगा। डेटा स्रोत, उपयोगकर्ता, मॉडल, विक्रेता, नीतियों, हार्डवेयर या उद्देश्यों में बदलाव होने पर पुनः‑मूल्यांकन करें। एक रखरखावित सिस्टम को दस्तावेज़ीकृत रिकवरी, घटना सीखना, विलोपन और प्रतिधारण प्रक्रियाओं, और एक स्पष्ट बिंदु की भी आवश्यकता होती है जहाँ इसे निष्क्रिय या प्रतिस्थापित किया जाना चाहिए।

अक्सर पूछे जाने वाले प्रश्न

क्या प्रत्येक बड़ा भाषा मॉडल ट्रांसफ़ॉर्मर है?

अधिकांश वर्तमान बड़े भाषा मॉडल ट्रांसफ़ॉर्मर रूपांतरों का उपयोग करते हैं, लेकिन भाषा मॉडल पुनरावृत्त, स्टेट‑स्पेस या हाइब्रिड आर्किटेक्चर से भी बनाए जा सकते हैं।

क्या सेल्फ‑अटेंशन का मतलब है कि मॉडल टेक्स्ट को इंसान की तरह समझता है?

नहीं। अटेंशन एक सीखित वज़न निर्धारण तंत्र है। मानव‑समान भाषा व्यवहार स्वयं मानव‑समान समझ, सत्यता या इरादा स्थापित नहीं करता।

मुख्य संदर्भ

ब्लॉगर और प्रोग्रामर जिनकी विशेषज्ञता मैशीन लर्निंग और डीप लर्निंग विषयों में है। डैनियल दूसरों को सामाजिक कल्याण के लिए एआई की शक्ति का उपयोग करने में मदद करना चाहता है।