قادة الفكر

المهام المتوافقة مقابل التوافق البشري: لماذا يجب أن يكون معيار الذكاء الاصطناعي التالي هو نحن

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

كل بضعة أشهر، يظهر نموذج جديد ويعيد ترتيب قوائم صدارة الذكاء الاصطناعي. وفقًا لتقرير 2026 AI Index Report الصادر عن جامعة ستانفورد، ارتقت النماذج المتقدمة بحوالي 30 نقطة مئوية في عام واحد في اختبار “امتحان الإنسانية الأخير”، وهو معيار صُمم خصيصًا ليكون صعبًا على الذكاء الاصطناعي. القفزات التي كانت تستغرق سنوات الآن تحدث في غضون أشهر، وتعتبر الصناعة كل نتيجة جديدة عالية دليلًا على تحسن الذكاء الاصطناعي.

لا أنكر التقدم. هذه الأنظمة رائعة فيما صُممت من أجله. لكنني قضيت ما يقرب من عقدين من الزمن في علم النفس قبل الانتقال إلى الذكاء الاصطناعي، وأعود باستمرار إلى سؤال لا تجيب عنه أي من هذه المعايير. ما الذي تتحسن فيه النماذج بالضبط، ولمن؟ يمكن لنموذج أن يتصدر جميع القوائم القائمة على الدقة، ومع ذلك يترك المستخدم في حالة أسوأ من نواحٍ معينة. لا يوجد اختبار يقيس تأثير الذكاء الاصطناعي على المستخدمين، وهذا يستحق مزيدًا من الاهتمام.

نوعان مختلفان من التوافق

تتحدث صناعة الذكاء الاصطناعي باستمرار عن التوافق، لكن النقاش عادةً يدور حول ما إذا كان النموذج يتبع التعليمات بدقة أم ينتج محتوى ضار. هذا هو الذكاء الاصطناعي المتوافق مع المهمة. يتم تحسينه لإنجاز الطلب المقدم له بشكل صحيح وفعّال.

ومع ذلك، هناك طريقة أخرى للاقتراب من التوافق وحماية الأشخاص. يقيّم الذكاء الاصطناعي المتوافق مع الإنسان ما تفعله التفاعل مع الشخص على الجانب الآخر من الشاشة بمجرد انتهائه. هل أصبحوا أكثر قدرة على التعامل مع القرار الصعب التالي بمفردهم، أم أصبحوا أكثر اعتمادًا على النظام للقيام بذلك؟ بينما يقيس التوافق مع المهمة النتيجة، يقيس التوافق البشري الأثر اللاحق.

هذه الغايتان لا تتعارضان دائمًا. النموذج الذي يقدم إجابة سريعة ودقيقة على سؤال تقني يخدم كلاهما. ومع ذلك، عندما لا يكون للسؤال إجابة صحيحة واحدة، تصبح الاختلافات في التوافق واضحة.

ما لا تُظهره القوائم المتصدرة

تختبر المعايير الأكثر اقتباسًا في الصناعة أشياء مثل الرياضيات التنافسية ومهام الترميز على نطاق المستودعات. إنها مهارات قيمة، لكن كل سؤال له إجابة صحيحة، وتُبنى النماذج للعثور عليها.

هذا يعمل جيدًا للمشكلات الموضوعية، لكن الناس يستخدمون الذكاء الاصطناعي لأكثر من الرياضيات والبرمجة والبحث الأساسي. يطرحون أسئلة حول مسارهم المهني ويتعاملون مع محادثات صعبة مع شركائهم. لا يوجد اختبار يقيم ما إذا كان النموذج قد عالج تلك الأسئلة بشكل جيد، لأنه لا توجد حقيقة موضوعية للتحقق من الإجابة مقابلها. المعلومات ذات الصلة تكمن داخل الشخص السائل. بغض النظر عن مدى تفصيل الطلب، لا يستطيع النموذج الوصول إلى ذلك.

Responsible AI يملأ جزءًا من الفجوة التي تتركها هذه المعايير، لكن حتى ذلك العمل يهدف ببساطة إلى تقليل الضرر بدلاً من تحسين التفكير البشري. تدور إجراءات السلامة الحالية حول منع النموذج من المساعدة في شيء خطر. ولا تأخذ في الاعتبار ما إذا كانت آلاف المحادثات العادية التي تجتاز كل فحص سلامة تُدرب الأشخاص على تقليل ثقتهم في حكمهم الخاص.

كيف تخلق النماذج الاعتماد

كل نموذج اختبرته يميل إلى أن يكون شاملاً، سريعًا، وواثقًا. هذا ما يُكافأ عليه أثناء التدريب، وهو الحدس الصحيح للتعامل مع بناء برمجي معطوب أو موعد نهائي لتقديم مستند قانوني. عندما يعتمد القرار على قيم وتاريخ شخص ما، يمكن أن يبدأ نفس الحدس في العمل ضد المستخدم.

أظهرت الأبحاث بالفعل أن هذا أكثر من مجرد فرضية. أجرى كل من OpenAI ومختبر MIT Media Lab زوجًا من الدراسات حول الاستخدام العاطفي لـ ChatGPT ووجدوا أن الأشخاص الذين رأوا الذكاء الاصطناعي كصديق واستخدموه لفترات أطول كانوا أكثر عرضة للإبلاغ عن نتائج سلبية، بما في ذلك زيادة الشعور بالوحدة والاعتماد العاطفي، وهو نمط غطته أيضًا MIT Technology Review. وعلى حدة، وجدت دراسة عام 2025 نُشرت في مجلة Societies علاقة سلبية ذات دلالة إحصائية بين الاستخدام المتكرر لأدوات الذكاء الاصطناعي ودرجات التفكير النقدي. وقد تم توضيح ذلك بما يسميه الباحثون “التفريغ المعرفي”، وهو الميل إلى إسناد مهمة ذهنية إلى أداة بدلاً من معالجتها بنفسك.

لا يعني هذا أن على الناس تقليل استخدام الذكاء الاصطناعي. بل يجب أن ندرك أنه عندما يحل النظام كل نوع من الأسئلة بنفس الطريقة، يُفقد شيء ما على الجانب الذاتي من الحساب، وحالياً لا أحد يتتبع هذا الفقدان تقريبًا.

امنح الإجابات المباشرة حقها

أرغب في توضيح المواضع التي يكون فيها الذكاء الاصطناعي المتوافق مع المهمة مناسبًا، لأن هدف هذا المقال ليس الجدال من أجل نموذج يتحايل على كل شيء. إذا سأل أحدهم عن خطأ في الخادم أو موعد تقديم ضرائب، فإن إجابة سريعة ومباشرة وذات سلطة تخدمه جيدًا. سيكون من غير المفيد أن يرد الذكاء الاصطناعي بسؤال مفتوح. تظهر المشكلة عندما نطبق نفس الحدس على طلب يتعلق بوزن طلاق كما نفعل على طلب يتعلق بتصحيح شفرة برمجية.

ما الذي يجب أن نقيسه بدلاً من ذلك

التحكم. القدرة على التعرف على لحظة يكون فيها حل السؤال للمستخدم مكلفًا أكثر مما يفيده، والامتناع وفقًا لذلك.

الاستجواب المعياري. السؤال بدلاً من الإخبار، عندما يكون المشكلة ذات طابع ذاتي أو مرتبطة بهوية وقيم شخص ما بدلاً من حقيقة موجودة في قاعدة بيانات.

قراءة اللحظة. التمييز بين طلب يحتاج إلى إجابة مباشرة وشاملة وآخر يحتاج إلى مساحة ليعمل الشخص على حلّه بنفسه.

وجدت أبحاث ألبرت باندورا التي تعود إلى عقود مضت حول الكفاءة الذاتية أن الناس يبنون الثقة من خلال تجاربهم الخاصة في الإتقان، وليس بمراقبة شخص آخر أو شيء آخر يحل المشكلة لهم. هذا المبدأ يسبق الذكاء الاصطناعي بنصف قرن، ويجب دمجه في طريقة تصميمنا وتقييمنا للتقنية.

ما الذي ينبغي أن يعنيه التقدم بعد ذلك

لا يعني هذا أن علينا إبطاء التقدم التقني. أحتفل بتحسينات البرمجة والتفكير. لكن بطاقة النتائج التي تُبنى بالكامل على إكمال المهمة تخبرنا أن الذكاء الاصطناعي يصبح أكثر ذكاءً. ولا تخبرنا شيئًا عما إذا كان الأشخاص الذين يستخدمونه يتحسنون في التفكير بأنفسهم.

أود أن أرى هذا التغيير. كلما أصبحت هذه الأنظمة أكثر قدرة، يجب أن يصبح الأشخاص الذين يستخدمونها أكثر قدرة أيضًا. لقد أثبتنا أن الذكاء الاصطناعي يمكنه التفوق علينا في اختبار. يجب أن يقيم الاختبار التالي ما إذا كان بإمكانه مساعدتنا على التفكير بشكل أفضل بعد انتهاء المحادثة بفترة طويلة.

تشاي تشيك هو الرئيس التنفيذي لـ Gray Sky AI، الشركة التي تقف وراء Vesela، وهو مستشار محترف مرخص يمتلك أكثر من عقد من الخبرة في مجال الصحة السلوكية. أسس برنامج السعي إلى السعادة، وهو منظمة استشارية في تكساس تخدم الأطفال والعائلات في نظام الرعاية البديلة. يتركز عمله في Gray Sky AI على الذكاء الاصطناعي المتوافق مع الإنسان وكيف يمكن للتكنولوجيا تعزيز التفكير النقدي، والحكم البشري، والوكالة الشخصية. يجلب تشاي منظور الممارس إلى المناقشات حول AI alignment، AI safety، التفاعل بين الإنسان والذكاء الاصطناعي وتأثير AI على طريقة تفكير الناس واتخاذهم للقرارات.