نماذج ومنصات الذكاء الاصطناعي

data2vec: علامة فارقة في التعلم الذاتي الإشرافي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

اعتمدت نماذج التعلم الآلي بشكل كبير على البيانات المُ etiquetedة لتدريبها، وtraditionally speaking، فإن تدريب النماذج على البيانات المُ etiquetedة يُield نتائج دقيقة. ومع ذلك، فإن العيب الرئيسي لاستخدام البيانات المُ etiquetedة هو التكلفة العالية للتعليق التي تزداد مع زيادة حجم بيانات التدريب. التكلفة العالية للتعليق هي عائق كبير للمطورين، خاصة عند العمل على مشروع كبير يحتوي على كميات كبيرة من بيانات التدريب.

为了解决 مشكلة التعليق، قام المطورون بتطوير مفهوم SSL أو التعلم الذاتي الإشرافي. التعلم الذاتي الإشرافي هو عملية تعلم الآلة حيث يتعلم النموذج نفسه لتعلم جزء من الإدخال من جزء آخر من الإدخال. نموذج التعلم الذاتي الإشرافي يهدف إلى استغلال العلاقة بين البيانات بدلاً من استخدام الإشارات الإشرافية للبيانات المُ etiquetedة.

بالإضافة إلى التعلم الذاتي الإشرافي، هناك العديد من الطرق والنماذج الأخرى لتدريب نماذج التعلم الآلي بدون استخدام البيانات المُ etiquetedة. ومع ذلك، فإن معظم هذه الطرق لها مشاكل رئيسية

  1. هم thường ما تكون مخصصة لنمطية واحدة مثل الصورة أو النص.
  2. هم يتطلبون كمية كبيرة من القدرة الحاسوبية.

هذه القيود هي مشكلة رئيسية لماذا يمكن للعقل البشري التعلم من نوع واحد من البيانات بكفاءة أكبر مقارنة بنموذج تعلم آلي يعتمد على نماذج وبيانات تدريب منفصلة لتمييز بين الصورة والنص والكلام.

为了解决 مشكلة النمطية الواحدة، أصدرت Meta AI data2vec، وهو خوارزمية ذات أداء عالي وذاتية الإشراف لتعلم الأنماط المعلوماتية من ثلاث نمطيات مختلفة: الصورة والنص والكلام. مع تنفيذ خوارزمية data2vec، يمكن تطبيق فهم النص على مشكلة تقسيم الصورة، أو يمكن نشرها في مهمة التعرف على الكلام.

في هذه المقالة، سنناقش نموذج data2vec بالتفصيل. سنناقش نظرة عامة على الأسلوب، والعمل المرتبط، والهيكل، والنتائج للنموذج بعمق أكبر حتى يكون لديك فهم واضح لخوارزمية data2vec.

مقدمة data2vec: الفكرة الأساسية

على الرغم من أن المفهوم الأساسي للتعلم الذاتي الإشرافي يتم تطبيقه عبر النمطيات، فإن الأهداف والخوارزميات الفعلية تختلف عن بعضها البعض لأنها تم تصميمها فيما يتعلق بنمطية واحدة. تصميم نموذج لنمطية واحدة هو السبب في أن نفس خوارزمية التعلم الذاتي الإشرافي لا يمكن أن تعمل بشكل فعال عبر أنواع مختلفة من بيانات التدريب.

为了克服挑战 النمطية الواحدة والخوارزميات، أصدرت Meta AI data2vec، وهو خوارزمية تستخدم نفس منهجية التعلم للرؤية الحاسوبية أو معالجة اللغة الطبيعية أو الكلام.

الفكرة الأساسية وراء خوارزمية data2vec هي استخدام الإدخال المقنّع لتنبؤ بالمثيلات الكامنة للبيانات الإدخالية الكاملة في إعداد التقطير الذاتي بمساعدة هيكل Transformer القياسي. لذا، بدلاً من كائنات نمطية محددة مثل الصور أو النص أو الصوت المحلية، تنبئ خوارزمية data2vec بالمثيلات الكامنة التي تحتوي على معلومات من بيانات التدريب أو الإدخال الكاملة.

لماذا تحتاج صناعة الذكاء الاصطناعي إلى خوارزمية data2vec؟

نماذج التعلم الذاتي الإشرافي تبني تمثيلات لبيانات التدريب باستخدام علامات بشرية، وهي واحدة من الأسباب الرئيسية وراء تقدم تقنيات معالجة اللغة الطبيعية والرؤية الحاسوبية. هذه التمثيلات للتعلم الذاتي الإشرافي هي السبب في أن المهام مثل التعرف على الكلام والتعلم الآلي يعتمدون على التعلم غير الإشرافي في نماذجهم.

حتى الآن، تركز خوارزميات التعلم الذاتي الإشرافي على نمطيات فردية مما يؤدي إلى تحيزات في التعلم وتصاميم محددة في النماذج. النمطية الفردية لخوارزميات التعلم الذاتي الإشرافي تُشكل تحديات في تطبيقات الذكاء الاصطناعي المختلفة بما في ذلك الرؤية الحاسوبية ومعالجة اللغة الطبيعية.

على سبيل المثال، هناك مفردات لوحدات الكلام في معالجة الكلام التي يمكن أن تحدد مهمة تعلم ذاتي إشرافي في معالجة اللغة الطبيعية. في الرؤية الحاسوبية، يمكن للمطورين إما أن يُقدموا الإدخال أو يتعلموا رموز بصرية منفصلة أو يتعلموا تمثيلات غير متغيرة لتعزيز البيانات. على الرغم من أن هذه التحيزات في التعلم مفيدة، إلا أنه من الصعب التأكد من أن هذه التحيزات سوف تُعمم إلى نمطيات أخرى.

خوارزمية data2vec هي علامة فارقة في صناعة التعلم الذاتي الإشرافي لأنها تهدف إلى تحسين نمطيات متعددة بدلاً من نمطية واحدة فقط. بالإضافة إلى ذلك، لا تعتمد خوارزمية data2vec على إعادة بناء الإدخال أو التعلم الإشرافي.

لذلك، السبب في أن العالم يحتاج إلى data2vec هو أن خوارزمية data2vec لها إمكانية تسريع التقدم في الذكاء الاصطناعي، وتساهم في تطوير نماذج ذكاء اصطناعي قادرة على التعلم بسهولة عن جوانب مختلفة من بيئتها. يأمل العلماء أن خوارزمية data2vec سوف تمكنهم من تطوير نماذج ذكاء اصطناعي أكثر مرونة وقادرة على أداء مهام متقدمة للغاية أكثر من ما يمكن للنماذج الحالية القيام به.

ما هي خوارزمية data2vec؟

data2vec هي إطار موحد يهدف إلى تنفيذ التعلم الذاتي الإشرافي عبر نمطيات بيانات مختلفة بما في ذلك الصور والكلام والنص.

تهدف خوارزمية data2vec إلى تطوير نماذج تعلم آلي يمكنها تعلم الأنماط العامة في البيئة بشكل أفضل من خلال الحفاظ على هدف التعلم موحدًا عبر النمطيات المختلفة. يُحدد نموذج data2vec خوارزمية التعلم، ولكنه يتعلم تمثيلات لكل نمطية على حدة.

مع إدخال خوارزمية data2vec، تأمل Meta AI أن تجعل التعلم المتعدد النمطيات فعالًا وبسيطًا.

كيف تعمل خوارزمية data2vec؟

تجمع خوارزمية data2vec بين تعلم التمثيلات الكامنة مع التنبؤ المقنّع، على الرغم من أنها تستخدم طبقات شبكية متعددة كأهداف لتعميم التمثيلات الكامنة. يتم تدريب نموذج Transformer جاهز الاستخدام الذي يتم استخدامه إما في الوضع المعلم أو الطالب.

في وضع المعلم، يبني النموذج تمثيلات للبيانات الإدخالية التي تعمل كأهداف في مهمة التعلم. في وضع الطالب، يشفر النموذج إصدارًا مقنّعًا من بيانات الإدخال ويستخدمه لجعل تنبؤات على تمثيلات البيانات الكاملة.

الصور أعلاه تمثل كيفية استخدام نموذج data2vec نفس عملية التعلم للنمطيات المختلفة. في الخطوة الأولى، ينتج النموذج تمثيلات للبيانات الإدخالية (وضع المعلم). ثم يُقدم النموذج هذه التمثيلات على أساس إصدار مقنّع من بيانات الإدخال.

علاوة على ذلك، نظرًا لأن خوارزمية data2vec تستخدم تمثيلات كامنة للبيانات الإدخالية، يمكن اعتبارها نسخة مبسطة من التصاميم المحددة للنمطية مثل إنشاء أهداف مناسبة من خلال تطبيع الإدخال أو تعلم مجموعة ثابتة من الرموز البصرية. ومع ذلك، النقطة الحاسمة التي تميز data2vec عن الخوارزميات الأخرى هي أن خوارزمية data2vec تستخدم الانتباه الذاتي لجعل تمثيل الأهداف مُسيَّقًا ومُستمرًا. في حين أن نماذج التعلم الذاتي الإشرافي الأخرى تستخدم مجموعة ثابتة من الأهداف التي تعتمد على السياق المحلي.

طريقة نموذج data2vec

يتم تدريب نموذج data2vec من خلال التنبؤ بتمثيلات النموذج للبيانات الإدخالية بناءً على إصدار مقنّع من الإدخال. كما يمكن رؤية ذلك في الشكل المعروض، وجه الكلب مقنّع، جزء معين من ملاحظة الصوت مقنّع، وكلمة “مع” مقنّعة في النص.

يشفر النموذج إصدارًا مقنّعًا من عينة التدريب (وضع الطالب)، ثم يشفر الإصدار غير المقنّع من الإدخال لإنشاء أهداف تدريب مع نفس النموذج ولكن فقط عندما يتم PARAMETERIZE كمتوسط التحرك الأسي للوزن النموذجي (وضع المعلم).

هيكل النموذج

يستخدم نموذج data2vec هيكل Transformer القياسي مع ترميز نمطية محددة للإدخال. لمهام الرؤية الحاسوبية، يستخدم النموذج استراتيجية ViT لترميز الصورة كتسلسل من الباتشات حيث كل باتش يمتد على 16×16 بكسل، ويتم تقديمه كتحويل خطي.

علاوة على ذلك، للبيانات المتعلقة بالتعرف على الكلام، يشفر النموذج البيانات باستخدام شبكة عصبونية متعددة الطبقات ذات convolutional 1-D التي تعمل على 16 kHz waveform وتحولها إلى تمثيلات 50 Hz. لمعالجة بيانات النص، يعالج النموذج البيانات لاستخراج وحدات فرعية للكلمات، ثم يضمن البيانات في فضاء توزيعي عبر متجهات التضمين.

التقنيع

بعد أن يشفر النموذج بيانات الإدخال كتسلسل من الرموز، يقوم النموذج بتقنيع أجزاء من هذه الوحدات عن طريق استبدالها برمز تضمين، ثم يقدم التسلسل إلى شبكة Transformer.

أهداف التدريب

يهدف نموذج data2vec إلى التنبؤ بتمثيلات النموذج للعينة غير المقنعة بناءً على تشفير العينة المقنعة التي تم تقديمها إلى النموذج. يتنبأ النموذج بتمثيلات فقط للخطوات الزمنية المقنعة.

يتنبأ النموذج بتمثيلات مُسيَّقة التي لا تشفر فقط الخطوة الزمنية المعينة، ولكنها تشفر أيضًا معلومات أخرى من العينة لأنها تستخدم الانتباه الذاتي في شبكة Transformer. التمثيلات المُسيَّقة واستخدام شبكة Transformer هي ما يميز نموذج data2vec عن النماذج الأخرى مثل BERT و wav2vec و BEiT و SimMIM و MAE و MaskFeat التي تتنبأ بأهداف بدون معلومات سياقية.

PARAMETERIZE المعلم

يُحدد نموذج data2vec تشفير العينة غير المقنعة باستخدام متوسط التحرك الأسي للوزن النموذجي (θ) حيث يكون وزن النموذج في وضع الأهداف (△) على النحو التالي

                                           ∆ ← τ∆ + (1 − τ ) θ

علاوة على ذلك، يجدول النموذج τ الذي يزيد خطيًا من المعلمة من τ0 إلى τe (قيمة الهدف) خلال التحديثات الأولى τn. بعد هذه التحديثات، يحافظ النموذج على القيمة الثابتة حتى انتهاء التدريب.

أهداف

تعتمد بناء أهداف التدريب على إخراج الكتلة العليا K من شبكة المعلم للخطوات الزمنية المقنعة في وضع الطالب. يتم تمثيل إخراج الكتلة l في الوقت t باسم alt. ثم يطبق النموذج تطبيعًا على كل كتلة للحصول على alt قبل أن يُعدل الكتل العليا

للحصول على هدف التدريب yt للخطوة الزمنية t لشبكة ذات L كتل إجمالي.

يُشكل أهداف التدريب التي يُقدمها النموذج عندما يكون في وضع الطالب. في التجارب الأولية، أدى نموذج data2vec بشكل جيد في التنبؤ بكل كتلة بشكل منفصل مع مشروع مخصص، وكان أكثر كفاءة في نفس الوقت.

علاوة على ذلك، يسمح تطبيع الأهداف لنموذج data2vec بالحفاظ على تمثيلات غير متغيرة للخطوات الزمنية، ويتجنب طبقات مع تطبيع висок لتحديد الميزات في مجموعة الأهداف. للتعرف على الكلام، يستخدم النموذج تطبيع الحالة على العينة الإدخالية الحالية دون أي معلمات محددة.

أيضًا، وجد الباحثون أن تطبيع الأهداف يؤدي إلى أداء جيد دون الحاجة إلى معلمات إضافية.

إعداد التجارب

يتم تجريب نموذج data2vec مع حجمين نموذجيين: data2vec الكبير و data2vec القاعدي. من أجل استقرار رياضي، يتم إجراء تحديثات EMA في fp32، ويحتوي النماذج على L = 12 أو L = 24 كتل Transformer مع أبعاد مخفية (H) = 768 أو H = 1024.

الرؤية الحاسوبية

يضمن نموذج data2vec الصور كباتشات 16×16 بكسل، ويقدم تسلسلًا من 196 تمثيلًا إلى Transformer القياسي.

يتبع النموذج BEiT لتقنيع الكتلة المجاورة مع كل كتلة تحتوي على الحد الأدنى من 16 باتش مع نسبة جانبية عشوائية. ومع ذلك، بدلاً من تقنيع 40% من الباتش كما هو الحال في نموذج BEiT الأصلي، يقوم نموذج data2vec بتقنيع 60% من الباتش للحصول على دقة أفضل.

علاوة على ذلك، يقوم النموذج بتحجيم الصور العشوائية، والانعكاسات الأفقية، وتغيير الألوان. أخيرًا، يستخدم نموذج data2vec نفس الصورة المعدلة في كل من وضع المعلم ووضع الطالب.

يتم تدريب نموذج ViT-B مسبقًا لمدة 800 epoch، ويستخدم نموذج data2vec حجم批ة 8192 لنموذج ViT-L، و 2048 لنموذج ViT-B. يستخدم نموذج data2vec أيضًا جدول Adam وجدول cosine لتحديث معدل التعلم لمدة 80 epoch لتحقيق معدل تعلم 0.001 لنموذج ViT-L، و لمدة 40 epoch لتحقيق معدل تعلم 0.001 لنموذج ViT-B.

للمعالجة الصوتية، يستخدم نموذج data2vec Fairseq، وهو حزمة لتدريب نماذج تسلسلية مخصصة للتلخيص والترجمة والتحليل النصي.

يستخدم النموذج 16 kHz waveform كإدخال، ويتم معالجته باستخدام محول متعددي الطبقات الذي يحتوي على قنوات 512، وعرض نوافذ (10، 3، 3، 3، 3، 2، 2)، وخطوات (5، 2، 2، 2، 2، 2، 2). النتيجة هي أن تردد خرج المحول يصل إلى 50 Hz، ويتضمن خطوة زمنية تصل إلى 20 مللي ثانية بين كل عينة.

يستخدم نموذج data2vec استراتيجية تقنيع مشابهة لاستراتيجية Baevski لتعلم ذاتي إشرافي في معالجة الكلام.

النتائج

لتحليل أداء نموذج data2vec، يتم تدريبه على 960 ساعة من بيانات الصوت من مجموعة Librispeech (LS-960).

يتم مقارنة أداء نموذج data2vec مع HuBERT و wav2vec 2.0، وهما من الخوارزميات الأكثر شعبية لتعلم التمثيلات الصوتية التي تعتمد على وحدات كلام منفصلة.

المعالجة الصوتية

يتم تدريب نموذج data2vec على مجموعة Librispeech، ويتم تحليل أدائه في مختلف الإعدادات.

يتم مقارنة أداء نموذج data2vec مع HuBERT و wav2vec 2.0 فيما يتعلق bằng معدل الكلمة.

المعالجة اللغوية الطبيعية

يتم تدريب نموذج data2vec على مجموعة GLUE، ويتم تحليل أدائه فيما يتعلق بالمهام اللغوية.

يتم مقارنة أداء نموذج data2vec مع RoBERTa فيما يتعلق بالدقة.

دراسة الإلغاء

تُستخدم دراسة الإلغاء لتحليل أداء نموذج data2vec من خلال إزالة مكونات مختلفة.

أهداف الكتل المتوسطة

تُستخدم أهداف الكتل المتوسطة في نموذج data2vec لتحسين أدائه.

يتم تحليل أداء نموذج data2vec فيما يتعلق بأهداف الكتل المتوسطة.

نوع ميزة الهدف

يتم تحليل أداء نموذج data2vec فيما يتعلق بنوع ميزة الهدف.

يتم مقارنة أداء نموذج data2vec فيما يتعلق بنوع ميزة الهدف.

سياق الهدف

يتم تحليل أداء نموذج data2vec فيما يتعلق بسياق الهدف.

يتم مقارنة أداء نموذج data2vec فيما يتعلق بسياق الهدف.

مُستخلص

خوارزمية data2vec هي علامة فارقة في صناعة التعلم الذاتي الإشرافي لأنها تُظهر أن هناك طريقة واحدة للتعلم يمكن أن تعمل على نمطيات متعددة.

أداء نموذج data2vec يُظهر أن هناك طريقة واحدة للتعلم يمكن أن تعمل على نمطيات متعددة.

خوارزمية data2vec هي علامة فارقة في صناعة التعلم الذاتي الإشرافي لأنها تُظهر أن هناك طريقة واحدة للتعلم يمكن أن تعمل على نمطيات متعددة.

مهندس بالمهنة، كاتب بالقلب. كونال هو كاتب تقني مع حب عميق وفهم لتقنيات الذكاء الاصطناعي والتعلم الآلي، مخصص لتبسيط المفاهيم المعقدة في هذه المجالات من خلال توثيقه الممتع والمعلوماتي.