زاوية Anderson
استخدام مسلسل “House” لتطوير قدرات التشخيص الاصطناعي

على الرغم من أن تشخيص الأمراض النادرة يعد تحديًا صعبًا للغاية بالنسبة للذكاء الاصطناعي (كما هو الحال مع البشر) ، أظهرت نماذج اللغة الشائعة ChatGPT و Gemini أداءً واعدًا عند تدريبها على حالات تشخيصية من مسلسل الدراما الطبي الشهير “House”.
يستخدم ما يقرب من نصف طلاب العلوم الصحية بانتظام مسلسلات طبية مثل House و Grey’s Anatomy و Scrubs. على الرغم من أن هذا النوع من المواد يمكن استخدامه فقط لأغراض تعليمية مع مرشحات و إطارات كثيرة ، بسبب خطر نشر معلومات خاطئة خطيرة ، فإن معيار البحث لمسلسلات الدراما التي تتمحور حول الحالات الطبية يعتبر عاليًا (على الرغم من أن الدقة تختلف بين الإنتاجات).
ليس من المفاجئ أن الأطباء غالبًا ما يصدر و يستشير و / أو يكتب مسلسلات تلفزيونية طبية. في مثل هذه الحالات ، يكون المعرفة الطبية المجالية مفيدة ليس فقط لنقل القضايا الطبية بدقة ، ولكن أيضًا لاقتراح أفكار جديدة ومثيرة للاهتمام للقصص.
من بين مسلسلات الدراما الطبية الأكثر بحثًا في العصر الذهبي الأخير للتلفزيون هو House (أو House MD) ، حيث تأخذ غرابة الشخصية الرئيسية وتقلبات كبيرة في طاقم الدعم دورًا ثانويًا مقارنة bằng “مرض الأسبوع”.
في الواقع ، من بين 177 حلقة تم بثها خلال مسيرته الذي استمر ثماني مواسم ، قدم House 176 دراسة حالة تشخيصية متقنة. على الرغم من انتهاء المسلسل في عام 2012 ، بحلول عام 2015 كان بالفعل يستخدم كأداة تعليمية ، مع دورة دراسية خاصة تقدم نتائج محسنة مقارنة بالدورات الدراسية العادية ، على الرغم من أن الحضور لم يكن يمنح أي رصيد للطلاب:

من دراسة عام 2015 ، أسباب متنوعة لماذا يريد الطلاب المشاركة في دورة تشخيصية تستفيد من المعلومات من مسلسل “House” التلفزيوني. تم جدولة الدورات في وقت متعمد للتحدي ، ولم تنقل أي رصيد دراسي ؛ على الرغم من هذه العوامل ، كانت المبادرة ناجحة. المصدر
House و الذكاء الاصطناعي
على الرغم من أن استخدام House ومسلسلات تلفزيونية أخرى متنوعة قد أثبتت في العديد من الدراسات كوسيلة مساعدة فعالة للتعلم ، بالنسبة للطلاب الطبيين ، لم يتم محاولة الكثير من هذا النهج حتى الآن في سياق التعلم الآلي.
الآن ، قدمت ورقة جديدة من جامعة ولاية بنسلفانيا مساهمة أولية في هذا الاتجاه ، من خلال إنشاء مجموعة بيانات تحتوي على جميع الدراسات الحالة القابلة للاستخدام البالغ عددها 176 من House ، مصممة في هيكل تشخيصي مدفوع بالسرد ، ثم تقييمها على نماذج اللغة الكبيرة الشائعة من OpenAI و Google.
على الرغم من صعوبة هذا التحدي (الذي يمثل واحدًا من أكثر المجالات صعوبة في العلوم البيولوجية) ، وجد الباحثون أن الإصدارات الأحدث من ChatGPT و Gemini أظهرت تحسنًا على الإصدارات القديمة ، مما يشير إلى أن اتجاه التطور في تطوير النماذج من المرجح أن يكون فعالًا في العمليات التشخيصية مع مرور الوقت.
تذكر الورقة ما يلي:
‘تظهر النتائج تباينًا كبيرًا في الأداء ، يتراوح بين 16.48٪ و 38.64٪ من الدقة ، مع تحقيق الإصدارات الأحدث من النماذج تحسنًا بنسبة 2.3 ضعف. في حين أن جميع النماذج تواجه تحديات كبيرة في تشخيص الأمراض النادرة ، فإن التحسن الملاحظ عبر الهياكل يشير إلى اتجاهات واعدة للتطوير المستقبلي. ‘
‘إن معيارنا التعليمي المعتمد يحدد معايير أداء أساسية للتفكير الطبي السردي ويقدم إطارًا تقييميًا متاحًا للجمهور لتقدم البحث في التشخيص بمساعدة الذكاء الاصطناعي.’
بالإضافة إلى إنشاء معايير الأداء ، يشير المؤلفون إلى أن مجموعة البيانات الجديدة – التي سيتم إتاحتها للمستخدمين – تحل مشكلة عدم وجود عملية سردية داخل مجموعات البيانات الطبية الحالية ، وتتوفر بسهولة ، على عكس ثقافة مجموعات البيانات الطبية التقليدية التي تتم حماية الوصول إليها.
البيانات
لتحديث مجموعة البيانات الخاصة بهم ، استخدم المؤلفون مواد متاحة للجمهور من موقع ويكيبيديا House الشهير. تم استخراج المحتوى السردي وتنقيته باستخدام إطار Beautiful Soup الشهير ، الذي يمكنه استخراج البيانات الهيكلية من مصدر صفحات الويب.
بعد حصاد السرد الأساسي بهذه الطريقة ، تم استخدام أربعة نماذج لغة كبيرة لتحويل الإخراج إلى تنسيق حالة معياري. النماذج المستخدمة كانت GPT-4o mini و GPT-5 Mini و Gemini 2.5 Flash و Gemini 2.5 Pro. أخيرًا ، تم تطبيق تصفية الجودة لضمان أن مجموعة البيانات تحتوي على تفاصيل سريرية مناسبة ، وتماشي مع الحالة الحالية للفن في التفكير الطبي.
يشير المؤلفون إلى أن ‘أمراض الأيتام’ (أي الأمراض النادرة) تمثيلها أقل في قواعد البيانات الطبية القياسية ؛ في بعض الحالات ، قد يمثل تغطيتها في عرض House نسبة غير عادية من التغطية الإجمالية.
يقر المؤلفون بأن فائدة مصدر بيانات من هذا النوع يجب أن تتم معالجتها بحذر نظرًا للترخيص الفني الذي قد يُمنح الأولوية في بعض الأحيان في تطوير الدراما الطبية:
‘في حين أن مجموعة بياناتنا تعكس قيود المحتوى الخيالي ، بما في ذلك المبالغة الدرامية والتركيز على الحالات المعقدة ، قد تفيد هذه الخصائص التقييم من خلال تقديم حالات حافة تحديات تختبر متانة النموذج.
‘توفر التحقق التعليمي من House M.D. بواسطة المهنيين الطبيين ثقة بأن السيناريوهات المستخرجة تحتوي على معلومات سريرية ذات معنى سريري مناسب للتقويم الذكاء الاصطناعي.’
![أمثلة من مجموعة البيانات التي تم إنشاؤها للمشروع. المصدر [ https://www.kaggle.com/datasets/arshgupta23/housemd-data-for-rare-disease-accuracy-using-llms?resource=download ]](https://www.unite.ai/wp-content/uploads/2025/11/dataset-examples.jpg)
أمثلة من مجموعة البيانات التي تم إنشاؤها للمشروع. المصدر
الاختبارات
为了 تقييم دقة النموذج في المهام التشخيصية السردية ، صمم المؤلفون خط أنابيب بسيطًا يجمع بين توليد التلميحات و استدلال النموذج و التقييم.
تم اختبار أربعة نماذج لغة كبيرة ، مع كل نموذج معين بدرجة حرارة صفر (لضمان مخرجات محددة بدلاً من مخرجات “إبداعية”) ، وطول أقصى رمز يبلغ 1500 – سماح مصمم لاستيعاب التفكير التشخيصي المعقد. لم يتم استخدام أي تلميحات نظام إضافية لتحديد الاستفسارات بشكل أكبر.
تم اتباع التلميحات نفسها لتنسيق تقديم الحالة الطبية المعتاد – النوع الذي يعتاد عليه المشاهدون من المسلسلات الطبية عند تقديم مريض / مرض جديد ، ويقدم الطبيب تلخيصًا للمريض لمصلحة الأطباء الآخرين الحاضرين (فعالًا ، على الرغم من ذلك ، لمصلحة المشاهدين).
قدم كل تلميح سرد سريري يتضمن تفاصيل ديموغرافية و جدول زمني للأعراض و التاريخ الطبي المهم و النتائج التشخيصية المبكرة. تم توجيه النموذج لتحديد تشخيص أولي واحد و تبرير استنتاجه بالاستدلال.
أنتج كل نموذج استجابة تشخيصية في ممرة واحدة ، دون أي تحسين تكراري ؛ وتم جمع الاستجابات في ظل ظروف متسقة عبر جميع الحالات البالغ عددها 176:
![مثال توضيحي يظهر تلميح سردي سريري و التشخيص الحقيقي المقابل ، كما تم استخدامه لاختبار Gemini 2.5 Pro. المصدر [ https://arxiv.org/pdf/2511.10912 ]](https://www.unite.ai/wp-content/uploads/2025/11/table-2-1.jpg)
مثال توضيحي يظهر تلميح سردي سريري و التشخيص الحقيقي المقابل ، كما تم استخدامه لاختبار Gemini 2.5 Pro. المصدر












