نماذج ومنصات الذكاء الاصطناعي

انظر، فكر، وافسر: صعود نماذج اللغة البصرية في الذكاء الاصطناعي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

قبل عقد من الزمن، كان الذكاء الاصطناعي مقسماً بين التعرف على الصور والفهم اللغوي. يمكن للنماذج البصرية تحديد الأجسام ولكنها لا تستطيع وصفها، والنماذج اللغوية يمكن أن تولد النصوص ولكنها لا تستطيع “رؤية” الصور. اليوم، يتلاشى هذا الانقسام بسرعة. تعمل نماذج اللغة البصرية (VLMs) الآن على الجمع بين المهارات البصرية واللغوية، مما يسمح لها بالتفسير الصور ووصفها بطرق تشبه الإنسان. ما يجعلها حقاً مذهلة هو عملية التفكير التتابعية، المعروفة باسم سلسلة الأفكار، والتي تساعد على تحويل هذه النماذج إلى أدوات قوية وعمليّة عبر الصناعات مثل الرعاية الصحية والتعليم. في هذا المقال، سنستكشف كيف تعمل نماذج اللغة البصرية، ولماذا يهم تفكيرها، وكيف تقوم بتحويل المجالات من الطب إلى السيارات ذاتية القيادة.

فهم نماذج اللغة البصرية

نماذج اللغة البصرية، أو VLMs، هي نوع من الذكاء الاصطناعي الذي يمكنه فهم الصور والنصوص في نفس الوقت. على عكس الأنظمة القديمة التي يمكنها التعامل فقط مع النصوص أو الصور، تجمع نماذج اللغة البصرية بين هذين المهاراتين. هذا يجعلها مرنة بشكل لا يصدق. يمكنها النظر إلى صورة ووصف ما يحدث، أو الإجابة على أسئلة حول فيديو، أو حتى إنشاء صور بناءً على وصف مكتوب.

على سبيل المثال، إذا سألت نموذج اللغة البصرية وصف صورة لكلب يركض في حديقة، فإن نموذج اللغة البصرية لا يقول فقط “هناك كلب”. يمكنه أن يقول “الكلب يركض وراء كرة بالقرب من شجرة البلوط الكبيرة”. إنه يرى الصورة ويربطها بالكلمات بطريقة معقولة. هذه القدرة على الجمع بين الفهم البصري واللغوي تخلق جميع أنواع الإمكانيات، من مساعدتك في البحث عن الصور على الإنترنت إلى مساعدتك في مهام أكثر تعقيداً مثل التصوير الطبي.

في جوهرها، تعمل نماذج اللغة البصرية عن طريق الجمع بين قطعتين رئيسيتين: نظام بصرية يتحليل الصور ونظام لغوي يعالج النص. الجزء البصري يكتشف التفاصيل مثل الأشكال والألوان، بينما الجزء اللغوي يحول هذه التفاصيل إلى جمل. يتم تدريب نماذج اللغة البصرية على مجموعات بيانات ضخمة تحتوي على مليارات من أزواج الصور والنص، مما يعطيها خبرة واسعة لتطوير فهم قوي ودقة عالية.

ما تعني سلسلة الأفكار في نماذج اللغة البصرية

سلسلة الأفكار، أو CoT، هي طريقة لجعل الذكاء الاصطناعي يفكر بشكل متسلسل، مثل طريقة تعاملنا مع مشكلة من خلال تقسيمها. في نماذج اللغة البصرية، يعني ذلك أن الذكاء الاصطناعي لا يقدم فقط إجابة عندما تسأله عن شيء ما في صورة، بل يفسر أيضًا كيف وصل إلى تلك الإجابة، ويفسر كل خطوة منطقية على طول الطريق.

لنفترض أنك تعرض نموذج اللغة البصرية صورة ل케이ك عيد ميلاد مع شموع وسألته “كم عمر الشخص؟” بدون سلسلة الأفكار، قد يخمن الرقم فقط. مع سلسلة الأفكار، يفكر نموذج اللغة البصرية على النحو التالي: “أنا أرى كعكة مع شموع. عادةً ما تمثل الشموع عمر الشخص. دعونا نعد، هناك 10 شموع. لذلك، الشخص يبلغ من العمر 10 سنوات”. يمكنك متابعة التفكير كما يتكشف، مما يجعل الإجابة أكثر موثوقية.

لماذا تهم سلسلة الأفكار في نماذج اللغة البصرية

تدمج سلسلة الأفكار في نماذج اللغة البصرية عدة مزايا رئيسية.

أولاً، تجعل الذكاء الاصطناعي أكثر موثوقية. عندما يفسر خطواته، تحصل على فهم واضح لطريقة وصوله إلى الإجابة. هذا الأمر مهم في مجالات مثل الرعاية الصحية. على سبيل المثال، عند النظر إلى صورة لأشعة رونتجن، قد يقول نموذج اللغة البصرية “أرى ظلاً في الجانب الأيسر من الدماغ. هذه المنطقة تتحكم في الكلام، والمرضى يعانون من صعوبات في التحدث، لذلك قد يكون ورمًا”. يمكن لأي طبيب أن يتبع المنطق ويشعر بالثقة في مدخلات الذكاء الاصطناعي.

ثانياً، تساعد الذكاء الاصطناعي على التعامل مع المشكلات المعقدة. من خلال تقسيم الأشياء، يمكنه التعامل مع الأسئلة التي تتطلب أكثر من مجرد نظرة سريعة. على سبيل المثال، عده شموع هو أمر بسيط، ولكن تحديد السلامة على طريق مزدحم يتطلب خطوات متعددة، بما في ذلك التحقق من الإشارات، وتحديد المركبات المتحركة، وتحديد السرعة. سلسلة الأفكار تمكن الذكاء الاصطناعي من التعامل مع هذه التعقيدات عن طريق تقسيمها إلى خطوات متعددة.

أخيراً، تجعل الذكاء الاصطناعي أكثر مرونة. عندما يفكر بشكل متسلسل، يمكنه تطبيق ما يعرفه على مواقف جديدة. إذا لم ير نوعًا معينًا من الكعك من قبل، يمكنه仍ًا تحديد العلاقة بين الشموع والعمر لأنها تفكر من خلالها، وليس فقط بالاعتماد على الأنماط المخزنة.

كيف ت改变 سلسلة الأفكار ونماذج اللغة البصرية الصناعات

التركيبة بين سلسلة الأفكار ونماذج اللغة البصرية تؤثر بشكل كبير على مختلف المجالات:

  • الرعاية الصحية: في الطب، تستخدم نماذج اللغة البصرية مثل Med-PaLM 2 سلسلة الأفكار لتحليل الأسئلة الطبية المعقدة وتنقسم إلى خطوات تشخيصية أصغر. على سبيل المثال، عند تقديم صورة لأشعة رونتجن وأعراض مثل السعال والصداع، قد تفكر نموذج اللغة البصرية على النحو التالي: “هذه الأعراض قد تكون نتيجة لمرض مثل البرد أو الحساسية أو شيء أسوأ. لا يوجد عقد لمفاوى متورمة، لذلك من غير المحتمل أن يكون هناك عدوى خطيرة. الرئتان واضحتان، لذلك من غير المحتمل أن يكون هناك ذات الرئة”. تقوم بتمشيط الخيارات وصولاً إلى إجابة، مما يوفر للطبيب تفسيراً واضحاً للعمل معه.
  • السيارات ذاتية القيادة: للسيارات ذاتية القيادة، تحسن نماذج اللغة البصرية المُحسنة بسلسلة الأفكار من السلامة وصنع القرار. على سبيل المثال، يمكن لسيارة ذاتية القيادة تحليل مشهد مروري خطوة تلو الأخرى: التحقق من إشارات المشاة، تحديد المركبات المتحركة، وصنع القرار حول ما إذا كان من الآمن المضي قدمًا. أنظمة مثل Wayve’s LINGO-1 تولد تعليقات لغة طبيعية لشرح أفعال مثل تباطؤ السيارة لمرور دراجة. هذا يساعد المهندسين وركاب السيارة على فهم عملية التفكير للسيارة. المنطق التتابعي يسمح أيضاً بمعالجة أفضل للظروف الطرقية غير العادية من خلال الجمع بين المدخلات البصرية ومعرفة السياق.
  • التحليل الجغرافي المكاني: يطبق نموذج Gemini من جوجل التفكير التسلسلي على البيانات المكانية مثل الخرائط والصور الفضائية. على سبيل المثال، يمكنه تقييم أضرار الإعصار من خلال دمج الصور الفضائية وتوقعات الطقس والبيانات السكانية، ثم توليد تصورات واضحة وإجابات على أسئلة معقدة. هذه القدرة تسرع استجابة الأزمات من خلال تزويد صانعي القرار بمعلومات hữu ích وفي الوقت المناسب دون الحاجة إلى خبرة تقنية.
  • الروبوتات: في مجال الروبوتات، تمكن التكامل بين سلسلة الأفكار ونماذج اللغة البصرية الروبوتات من التخطيط والتنفيذ للمهام متعددة الخطوات. على سبيل المثال، عندما يُكلف روبوت برفع كوب، يسمح نموذج اللغة البصرية المُحسّن بسلسلة الأفكار له بتحديد الكوب، وتحديد أفضل نقاط القبض، وتخطيط مسار خالي من الاصطدام، وتنفيذ الحركة، كل ذلك مع “تفسير” كل خطوة من عمليته. مشاريع مثل RT-2 تُظهر كيف تمكن سلسلة الأفكار الروبوتات من التكيف بشكل أفضل مع المهام الجديدة والاستجابة لأوامر معقدة بمنطق واضح.
  • التعليم: في التعليم، تستخدم أدوات تعليمية مثل Khanmigo سلسلة الأفكار لتعليم أفضل. لمشكلة رياضية، قد توجيه الطلاب على النحو التالي: “أولاً، اكتب المعادلة. ثم، احصل على المتغير وحده عن طريق طرح 5 من كلا الجانبين. الآن، اقسم على 2”. بدلاً من تقديم الإجابة، تقود الطلاب خلال العملية، مما يساعدهم على فهم المفاهيم خطوة تلو الأخرى.

الخلاصة

نماذج اللغة البصرية (VLMs) تمكن الذكاء الاصطناعي من تفسير البيانات البصرية وشرحها باستخدام التفكير المتسلسل البشري، من خلال عمليات سلسلة الأفكار. هذا النهج يعزز الثقة والتعامل مع المشكلات وتحسين القدرة على حلها عبر الصناعات مثل الرعاية الصحية والسيارات ذاتية القيادة والتحليل الجغرافي المكاني والروبوتات والتعليم. من خلال تحويل كيفية تعامل الذكاء الاصطناعي مع المهام المعقدة ودعم صنع القرار، تقوم نماذج اللغة البصرية بتحديد معيار جديد للتكنولوجيا الذكية الموثوقة والعمليّة.

الدكتور تيهسين زيا هو أستاذ مساعد دائم في جامعة كومساتس إسلام آباد، وحاصل على دكتوراه في الذكاء الاصطناعي من جامعة التكنولوجيا في فيينا، النمسا. يتخصص في الذكاء الاصطناعي وتعلم الآلة وعلوم البيانات ورؤية الكمبيوتر، وقدم مساهمات كبيرة من خلال منشورات في مجلات علمية مشهورة. كما قاد الدكتور تيهسين مشاريع صناعية مختلفة كمستслед رئيسي وقدم خدماته كمستشار في الذكاء الاصطناعي.