نماذج ومنصات الذكاء الاصطناعي
OpenEvidence تُطلق عائلة نماذج الذكاء الاصطناعي الطبية مع عرض داروين التجريبي

أصدرت شركة OpenEvidence عائلة جديدة من نماذج الذكاء الاصطناعي الطبية في 3 سبتمبر 2026، مما جعل ثلاثة نماذج إنتاجية متاحة مجانًا للأطباء المُعتمدين وفتحت نموذجًا رابعًا، تصفه بأنه الأكثر تقدمًا، للباحثين عبر طلبٍ فقط.
تم تسمية النماذج الإنتاجية الثلاثة بأسماء شخصيات من تاريخ الطب. يُعد نموذج Osler، الذي تصفه الشركة بأنه أسرع نموذج بحدود خمس ثوانٍ لكل إجابة، هو الخليفة للنموذج الذي كان يُشغّل إجابات OpenEvidence ويصبح هو الافتراضي للمنصة. يُصنّف نموذج Sackett كنموذج بحث أعمق يستغرق حوالي 30 ثانية لكل إجابة للأسئلة التي تعتمد على وزن الأدلة. أما نموذج Snow، فهو الخليفة لميزة OpenEvidence Deep Consult، وهو أعمق نموذج إنتاجي بحدود خمس دقائق لكل إجابة، حيث يجري تحقيقًا كاملًا في الأدبيات الطبية قبل إصدار تقرير.
يتم طرح النماذج على جميع مستخدمي OpenEvidence عبر الموقع openevidence.com وتطبيقات الشركة على iOS وAndroid، حيث يمكن للأطباء اختيار النموذج عبر محدد النماذج في الواجهة. صرّحت OpenEvidence أن كل نموذج في العائلة يلتزم بنفس معيار الدقة السريرية، والفرق بينهما يكمن في مدة تفكير النموذج وعمق بحثه.
الأسماء مستوحاة من ويليام أوسلر، الذي نقل تعليم الطب من القاعة إلى جانب السرير؛ وديفيد ساكيت، المعروف بأب الطب القائم على الأدلة؛ وجون سنو، الذي ربط تفشي الكوليرا في شارع برود عام 1854 بمضخة ماء واحدة وساهم في تأسيس علم الأوبئة الحديث.
داروين في نسخة البحث التجريبية
النموذج الرابع، داروين، في مرحلة عرض البحث التجريبي ولا يتم إصداره للجمهور. في الإعلان، تصف OpenEvidence داروين بأنه أكثر نموذج ذكاء اصطناعي طبي تقدمًا في العالم وتقول إنه أول نموذج ذكاء اصطناعي يحقق درجة كاملة في MedQA، الذي تُسميه الشركة المعيار المستقل الرائد للذكاء الاصطناعي الطبي. كما تُشير الشركة إلى أن داروين يُعد أحدث ما توصل إليه في MedXpertQA بنسبة 72.8٪، وHealthBench Professional بنسبة 82.7٪، وNOHARM بنسبة 87.2٪، متفوقًا على النماذج التالية التي تُسمى Claude Fable 5 وGemini 3.7.
الوصول يتم عبر طلبٍ فقط. صرّحت OpenEvidence أن منطقها يتعلق بمخاطر الاستخدام المزدوج: نموذج قادر على التفكير في طليعة الفيروسات، المناعة، والوراثة البشرية قد يُسرّع، في الأيدي الخاطئة، أعمالًا تخضع لرقابة صارمة مثل البحوث المتعلقة بالأسلحة البيولوجية وتعديل الخط الوراثي خارج الإشراف العلمي التقليدي. يغطي الوصول الحالي شركاء مؤسسيين مثل المنظمة الوطنية للاضطرابات النادرة، التي تُقدّم لداروين أصعب الحالات، والمتعاونين الباحثين، والباحثين الأكاديميين المعتمدين في الذكاء الاصطناعي الذين يقيمون دقة وسلامة الذكاء الاصطناعي في الطب السريري. وأشارت الشركة إلى أن قدرات داروين ستنتقل إلى أوسلر، وساكيت، وسنو مع التحقق من سلامتها مع هؤلاء الشركاء.
منهجية التقييم
في مقال تقني مرفق، وفّرت OpenEvidence تفاصيل إعداد التقييم. بالنسبة لـ MedQA، بدأت الشركة من إعادة تعيين الأطباء لمجموعة الاختبار المكوّنة من 1,273 سؤالًا بأربع خيارات، وطبّقت معايير استبعاد للمعلومات المفقودة، الغموض، وأخطاء التصنيف، ثم أجرت مراجعة ثانية في أغسطس 2026 من قبل ثلاثة أطباء من OpenEvidence غطوا كل سؤال أجاب أي نموذج مُقَيَّم عليه بشكل غير صحيح. أسفر ذلك عن مجموعة تقييم نهائية مكوّنة من 660 سؤالًا أجاب داروين عليها دون خطأ. تُصدر الشركة تعليقاتها واستجابات داروين الكاملة لجميع المعايير الأربعة.
في MedXpertQA، تم تقييم داروين على مجموعة النص الكاملة المكوّنة من 2,450 سؤالًا، مستثنياً الجزء متعدد الوسائط. بالنسبة لـ HealthBench Professional، استخدمت الشركة مجموعة الاختبار المتاحة علنًا مع استبعاد الحالات المتعددة الجولات، مما ترك 410 من أصل 525 مهمة، وقامت بتقييم الردود باستخدام تكوين LLM-as-a-judge الذي نشرته Anthropic، باستخدام Claude Opus 4.8 بحد أقصى للميزانية الفكرية يبلغ 32,000 رمز. تم تقييم NOHARM، وهو معيار يقيس تواتر وشدة التوصيات الضارة في حالات الاستشارة الحقيقية، باستخدام حزمته المفتوحة المصدر الرسمية على مجموعة الـ30 حالة المفتوحة.
تم تشغيل الخطوط الأساسية كنماذج claude-fable-5 مع التفكير التكيّفي، gpt-5.6-sol بالجهد الافتراضي للتفكير، وgemini-3.7-flash بالجهد الافتراضي للتفكير، باستخدام إعدادات API الافتراضية لكل مزود دون أدوات أو موجهات نظام مخصصة. تم حساب متوسط درجات HealthBench Professional على الأقل عبر خمس تجارب مستقلة لكل نموذج، بينما تم حساب باقي المجموعات عبر مرور واحد، مع الإبلاغ عن المتوسطات طوال العملية.
وفقًا للمقال، سجل داروين في MedXpertQA أعلى بـ 7.7 نقطة مقارنةً بأقوى خط أساس، وسجل في HealthBench Professional أعلى بـ 12.1 نقطة مقارنةً بالنموذج التالي، ووصل وزن الدقة المتدرج F1 في NOHARM إلى 0.872 مقابل 0.740 لأقرب خط أساس. وأقرت الشركة أن الدقة غير الموزونة لداروين في NOHARM أقل من عدة خطوط أساس، موضحةً أن المعيار يحسب كل توصية غير موجودة في rubric كإيجابٍ زائف، وأن داروين مُضبط لتزويد الأطباء بمجموعة كاملة من الخيارات ذات الصلة. وأعلنت أن الدقة المتدرجة لداروين بلغت 0.9.
التوافر والخطوات التالية
نماذج Osler وSackett وSnow متاحة للاستخدام غير المحدود لجميع الأطباء المُعتمدين دون أي تكلفة. يتوفر داروين للباحثين عبر عملية تقديم طلب على موقع الشركة.
قالت OpenEvidence إنها ستستمر في تحسين وتوسيع وزيادة الوصول إلى عائلة النماذج مع مرور الوقت، بما في ذلك نماذج مخصصة للممارسات التخصصية بدءًا من علم الأورام، والأشعة، والوراثة السريرية.












