نماذج ومنصات الذكاء الاصطناعي

تطور الذكاء الاصطناعي المتعدد الوضع مع حصول ChatGPT على الرؤية مع GPT-4V(ision)

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

في الجهود المستمرة لجعل الذكاء الاصطناعي أكثر تشابهًا مع البشر، دفع نماذج GPT من OpenAI باستمرار الحدود. يمكن لـ GPT-4 الآن قبول مدخلات من النص والصور.

الوضعية المتعددة في الذكاء الاصطناعي التوليدي تشير إلى قدرة النموذج على إنتاج مخرجات متنوعة مثل النص أو الصور أو الصوت بناءً على المدخل. يتم تدريب هذه النماذج على بيانات محددة لتعلم الأنماط الأساسية لتوليد بيانات جديدة مشابهة، مما يثرى تطبيقات الذكاء الاصطناعي.

الخطوات الحديثة في الذكاء الاصطناعي المتعدد الوضع

خطوة ملحوظة最近 في هذا المجال هي دمج DALL-E 3 في ChatGPT، وهو تحسين كبير في تقنية النص إلى الصورة من OpenAI. يسمح هذا الدمج بالتفاعل الأسهل حيث يساعد ChatGPT في صياغة تعليمات دقيقة ل DALL-E 3، مما يتحول أفكار المستخدم إلى فن生成 بواسطة الذكاء الاصطناعي بشكل واضح.

يمكنك الاطلاع على المزيد حول DALL-E 3 ودمجها مع ChatGPT هنا. هذا التعاون لا يظهر فقط التقدم في الذكاء الاصطناعي المتعدد الوضع، بل يجعل إنشاء فن الذكاء الاصطناعي أمرًا سهلًا للمستخدمين.

من ناحية أخرى، قدمت Google (GOOGL ) Health Med-PaLM M في يونيو من هذا العام. وهو نموذج توليدي متعدد الوضع ماهر في ترميز وتفسير بيانات بيولوجية متنوعة. تم تحقيق ذلك من خلال تعدين PaLM-E، نموذج لغة، للاستجابة للمجالات الطبية باستخدام معيار مفتوح المصدر، MultiMedBench. يتكون هذا المعيار من أكثر من مليون عينة عبر 7 أنواع بيانات بيولوجية و 14 مهمة مثل الإجابة على الأسئلة الطبية وتوليد تقارير الأشعة.

تعتمد الصناعات المختلفة أدوات الذكاء الاصطناعي المتعددة الوضع المبتكرة لتعزيز التوسع التجاري، وتبسيط العمليات، وتعزيز تفاعل العملاء. يساهم تقدم القدرات الصوتية والفيديوية والنصية في دفع نمو الذكاء الاصطناعي المتعدد الوضع.

تسعى الشركات إلى تطبيقات الذكاء الاصطناعي المتعدد الوضع القادرة على إعادة هيكلة نماذج الأعمال والعمليات، مما يفتح مجالات نمو عبر نظام الذكاء الاصطناعي التوليدي، من أدوات البيانات إلى التطبيقات الناشئة.

بعد إطلاق GPT-4 في مارس، لاحظ بعض المستخدمين انخفاضًا في جودة الاستجابة بمرور الوقت، وهو موضوع أشار إليه المطورون البارزون ومناقشات منتدى OpenAI. في البداية، تم رفضه من قبل OpenAI، ولكن دراسة لاحقة أكدت القضية. كشفت عن انخفاض في دقة GPT-4 من 97.6% إلى 2.4% بين مارس و يونيو، مما يشير إلى انخفاض في جودة الإجابة مع تحديثات النموذج اللاحقة.

chatgpt-ai

ChatGPT (الأزرق) والذكاء الاصطناعي (الأحمر) اتجاهات البحث في Google

يعود الاهتمام حول Open AI’s ChatGPT الآن. يأتي الآن مع ميزة الرؤية GPT-4V، مما يسمح للمستخدمين بتحليل الصور المعطاة لهم. هذه هي الميزة الجديدة التي تم فتحها للمستخدمين.

يُعتبر إضافة تحليل الصور إلى نماذج اللغة الكبيرة مثل GPT-4 خطوة كبيرة إلى الأمام في أبحاث وتنمية الذكاء الاصطناعي. يفتح هذا النوع من نماذج اللغة المتعددة الوضع إمكانيات جديدة، حيث يأخذ نماذج اللغة إلى ما وراء النص لتقديم واجهات جديدة وحل مهام جديدة، مما يخلق تجارب جديدة للمستخدمين.

تم الانتهاء من تدريب GPT-4V في عام 2022، مع إطلاق الوصول المبكر في مارس 2023. يتم تشغيل الميزة البصرية في GPT-4V بواسطة تقنية GPT-4. بقي عملية التدريب كما هي. في البداية، تم تدريب النموذج على توقع الكلمة التالية في النص باستخدام مجموعة بيانات ضخمة من النص والصور من مصادر مختلفة بما في ذلك الإنترنت.

بعد ذلك، تم تعدينه بمزيد من البيانات، باستخدام طريقة تعلم التعزيز من التغذية المرتدة البشرية (RLHF)، لгенерация مخرجات تفضلها البشر.

ميكانيكا رؤية GPT-4

على الرغم من قدرات لغة الرؤية المذهلة لـ GPT-4، تظل الأساليب الأساسية على السطح.

للتحقيق في هذه الفرضية، تم تقديم نموذج رؤية-لغة جديد، MiniGPT-4، باستخدام نموذج لغة متقدم يسمى Vicuna. يستخدم هذا النموذج معالج رؤية مع مكونات مسبقة التدريب للرؤية، ويحاذي الميزات البصرية المرمزة مع نموذج لغة Vicuna من خلال طبقة 투영 واحدة. تكون هيكلة MiniGPT-4 بسيطة وفعالة، مع التركيز على محاذاة الميزات البصرية واللغة لتحسين القدرات الحوارية البصرية.

MiniGPT-4

تحتوي هيكلة MiniGPT-4 على معالج رؤية مع ViT و Q-Former، وطبقة 투영 خطية واحدة، ونموذج لغة Vicuna المتقدم.

كما نمت тенденция نماذج اللغة التوليدية ذات الصلة في مهام الرؤية-اللغة، مستفيدة من النقل العابر بين اللغة والبيئات المتعددة الوضع لتبادل المعرفة.

يحقق MiniGPT-4 ربط المجالات البصرية واللغة من خلال محاذاة المعلومات البصرية من معالج رؤية مسبق التدريب مع نموذج لغة متقدم. يستخدم النموذج Vicuna كمفسّر اللغة ويتبع نهج تدريب من مرحلتين. يتم تدريبه في البداية على مجموعة بيانات كبيرة من أزواج الصور والنص لاكتساب معرفة الرؤية-اللغة، يليها تعدين على مجموعة بيانات أصغر وأعلى جودة لتعزيز موثوقية وسهولة الإنتاج.

لتحسين طبيعية وسهولة اللغة المولدة في MiniGPT-4، طوّر الباحثون عملية محاذاة من مرحلتين، لمواجهة نقص قواعد البيانات الكافية لمحاذاة الرؤية-اللغة. قاموا بإنشاء مجموعة بيانات متخصصة لهذا الغرض.

في البداية، أنتج النموذج وصفًا مفصلاً للصور المدخلة، مما يحسن التفاصيل باستخدام سؤال حواري محاذي لتنسيق نموذج لغة Vicuna.

سؤال وصف الصورة الأولي:

###Human: <Img><ImageFeature></Img> وصف هذه الصورة بالتفصيل. قدم كل التفاصيل الممكنة. قل كل ما ترى. ###Assistant:

للمعالجة اللاحقة للبيانات، تم تصحيح أي عدم nhất quán أو أخطاء في الوصف المولدة باستخدام ChatGPT، يليها التحقق اليدوي لضمان الجودة العالية.

سؤال التعدين الثاني:

###Human: <Img><ImageFeature></Img><Instruction>###Assistant:

تفتح هذه الاستكشافات نافذة لفهم ميكانيكا الذكاء الاصطناعي المتعدد الوضع مثل GPT-4، مما يلقي الضوء على كيفية دمج الوضعية البصرية واللغة بشكل فعال لإنتاج مخرجات متسقة وغنية سياقيًا.

استكشاف رؤية GPT-4

تحديد أصل الصور مع ChatGPT

تُحسّن رؤية GPT-4 قدرة ChatGPT على تحليل الصور وتحديد أصلها الجغرافي. هذه الميزة تنتقل التفاعلات المستخدم إلى مزيج من النص والصورة، مما يصبح أداة مفيدة لأولئك الذين يريدون معرفة المزيد حول الأماكن المختلفة من خلال بيانات الصورة.

Chatgpt-vision-GPT-4

سؤال ChatGPT عن موقع صورة معلم

مفاهيم الرياضيات المعقدة

تتميز رؤية GPT-4 في استكشاف المفاهيم الرياضية المعقدة من خلال تحليل التعبيرات الرسومية أو المكتوبة باليد. تعمل هذه الميزة كأداة مفيدة للأفراد الذين يبحثون عن حل مشاكل رياضية معقدة، مما يجعل رؤية GPT-4 مساهمة ملحوظة في المجالات التعليمية والاكاديمية.

[caption id="attachment_191095" align="aligncenter" width="594"]Chatgpt-vision-GPT-4 سؤال ChatGPT عن فهم مفهوم رياضي معقد

تحويل المدخلات المكتوبة باليد إلى رموز LaTeX

تتمتع GPT-4V بقدرة ملحوظة على ترجمة المدخلات المكتوبة باليد إلى رموز LaTeX. تعتبر هذه الميزة نعمة للباحثين والأساتذة والطلاب الذين يحتاجون غالبًا إلى تحويل التعبيرات الرياضية المكتوبة باليد أو المعلومات الفنية الأخرى إلى تنسيق رقمي. يوسع تحويل المكتوب باليد إلى LaTeX أفق ترميز المستندات ويعزز عملية الكتابة الفنية.

[caption id="attachment_191173" align="aligncenter" width="546"]GPT-4V's ability to convert handwritten input into LaTeX codes قدرة GPT-4V على تحويل المدخلات المكتوبة باليد إلى رموز LaTeX

استخراج تفاصيل الجدول

تُظهر GPT-4V مهارة في استخراج التفاصيل من الجداول والاستجابة للأسئلة ذات الصلة، وهو مورد حاسم في تحليل البيانات. يمكن للمستخدمين استخدام GPT-4V لفرز الجداول وجمع Informationen الرئيسية والاستجابة للأسئلة، مما يجعله أداة قوية لمن析ي البيانات والمهنيين الآخرين.

[caption id="attachment_191125" align="aligncenter" width="437"]GPT-4V deciphering table details and responding to related queries GPT-4V يفهم تفاصيل الجدول والاستجابة للأسئلة ذات الصلة

فهم الإشارة البصرية

تضيف قدرة GPT-4V الفريدة على فهم الإشارة البصرية بعدًا جديدًا إلى التفاعل المستخدم. من خلال فهم الإشارات البصرية، يمكن لـ GPT-4V الاستجابة للأسئلة بفهم سياقي أعلى.

[caption id="attachment_191126" align="aligncenter" width="448"]GPT-4V-demonstrates-the-unique-capability-of-understanding-visual-pointing GPT-4V تُظهر القدرة الفريدة على فهم الإشارة البصرية

بناء مواقع ويب بسيطة باستخدام الرسم

مُلهمًا بهذا التغريد، حاولت إنشاء نموذج لموقع unite.ai.

[video width="1306" height="1082" mp4="https://www.unite.ai/wp-content/uploads/2023/10/uthomepage.mp4"][/video]

على الرغم من أن النتيجة لم تتطابق تمامًا مع رؤيتي الأولية، إليك النتيجة التي حققتها.

[caption id="attachment_191228" align="aligncenter" width="983"]ChatGPT Vision based output HTML Frontend واجهة المستخدم الأمامية ل HTML بناءً على رؤية ChatGPT

limitations & Flaws of GPT-4V(ision)

为了 تحليل GPT-4V، أجرى فريق Open AI تقييمات نوعية وكمية. شملت التقييمات النوعية الاختبارات الداخلية ومراجعات الخبراء الخارجية، بينما قاس التقييمات الكمية رفض النموذج ودقته في مختلف السيناريوهات مثل تحديد المحتوى الضار والتعرف على الديموغرافيا وقلق الخصوصية والتحديد الجغرافي وأمان السيبرانية والهجوم المتعدد الوضع.

然而، النموذج ليس مثاليًا.

تُبرز الورقة قيود GPT-4V، مثل الاستدلالات الخاطئة وعدم وجود نص أو شخصيات في الصور. قد يخترع أو يخترع حقائق. على وجه الخصوص، لا يصلح لتحديد المواد الخطرة في الصور، وغالبًا ما يُخلط بينها.

في التصوير الطبي، يمكن أن توفر GPT-4V استجابات غير متسقة وتنقصها الوعي بالممارسات القياسية، مما يؤدي إلى تشخيصات خاطئة محتملة.

[caption id="attachment_191179" align="aligncenter" width="605"]أداء غير موثوق به للأغراض الطبية. أداء غير موثوق به للأغراض الطبية (المصدر)

كما يفشل في فهم دقائق بعض رموز الكراهية ويمكن أن يولد محتوى غير مناسب بناءً على المدخلات البصرية. ينصح OpenAI بعدم استخدام GPT-4V للاستجابات الحاسمة، خاصة في السياقات الطبية أو الحساسة.

الختام

يأتي وصول GPT-4 Vision (GPT-4V) مع مجموعة من الإمكانيات الجديدة والتحديات الجديدة. قبل إطلاقه، تم بذل الكثير من الجهد لضمان أن المخاطر، خاصة عند التعامل مع صور الأشخاص، يتم فحصها وتقليلها. من المثير أن نرى كيف قفز GPT-4V إلى الأمام، مما يظهر الكثير من الوعد في مجالات صعبة مثل الطب والعلوم.

الآن، هناك بعض الأسئلة الكبيرة على الطاولة. على سبيل المثال، يجب أن يكون هذه النماذج قادرة على تحديد الأشخاص المشهورين من الصور؟ يجب أن يخمّن جنس الشخص أو عرقه أو مشاعره من صورة؟ ويجب أن يكون هناك تعديلات خاصة لمساعدة الأشخاص المعوقين بصريًا؟ تفتح هذه الأسئلة علبة من الدودة حول الخصوصية والعدالة وكيف يجب أن يلائم الذكاء الاصطناعي حياتنا، وهو أمر يجب أن يكون للجميع رأي فيه.

لقد قمت بإنفاق الخمس سنوات الماضية في غمرة العالم المثير للاهتمام من التعلم الآلي والتعلم العميق. وقد أدت شغفي وخبرتي إلى المساهمة في أكثر من 50 مشروعًا متنوعًا في هندسة البرمجيات، مع التركيز بشكل خاص على الذكاء الاصطناعي والتعلم الآلي. كما أدت فضولي المستمر إلى جذبي نحو معالجة اللغة الطبيعية، وهو مجال أنا متحمس لاستكشافه بشكل أكبر.