एआई मॉडल और प्लेटफ़ॉर्म

OpenEvidence ने डार्विन प्रीव्यू के साथ मेडिकल AI मॉडल परिवार लॉन्च किया

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

OpenEvidence ने 3 सितंबर, 2026 को एक नया मेडिकल AI खोज मॉडल परिवार जारी किया, जिसमें तीन उत्पादन मॉडल सत्यापित चिकित्सकों के लिए मुफ्त उपलब्ध कराए गए और चौथा, जिसे वह अपने सबसे उन्नत मॉडल के रूप में वर्णित करता है, केवल आवेदन के माध्यम से शोधकर्ताओं के लिए खोला गया।

तीन उत्पादन मॉडलों के नाम चिकित्सा इतिहास के प्रमुख व्यक्तियों पर रखे गए हैं। Osler, जिसे कंपनी अपने सबसे तेज़ मॉडल के रूप में लगभग पाँच सेकंड प्रति उत्तर के साथ वर्णित करती है, वह उस मॉडल का उत्तराधिकारी है जो पहले OpenEvidence उत्तरों को शक्ति प्रदान करता था और प्लेटफ़ॉर्म का डिफ़ॉल्ट बन जाता है। Sackett को एक गहरा खोज मॉडल के रूप में स्थित किया गया है जो साक्ष्य के वजन पर निर्भर प्रश्नों के लिए लगभग 30 सेकंड प्रति उत्तर लेता है। Snow, जो OpenEvidence Deep Consult फीचर का उत्तराधिकारी है, लगभग पाँच मिनट प्रति उत्तर के साथ सबसे गहरा उत्पादन मॉडल है, जो रिपोर्ट उत्पन्न करने से पहले चिकित्सा साहित्य की पूर्ण जाँच करता है।

ये मॉडल openevidence.com पर सभी OpenEvidence उपयोगकर्ताओं और कंपनी के iOS तथा Android ऐप्स पर क्रमशः रोल आउट किए जा रहे हैं, जहाँ चिकित्सक इंटरफ़ेस में मॉडल चयनकर्ता के माध्यम से इन्हें चुन सकते हैं। OpenEvidence ने कहा कि परिवार के प्रत्येक मॉडल को समान क्लिनिकल सटीकता मानक पर रखा गया है, और उनके बीच अंतर केवल मॉडल के सोचने के समय और खोज की गहराई में है।

इन नामों के पीछे के व्यक्तित्व हैं William Osler, जिन्होंने चिकित्सा शिक्षा को व्याख्यान कक्ष से रोगी के बिस्तर तक ले जाया; David Sackett, जिन्हें साक्ष्य-आधारित चिकित्सा के पिता के रूप में याद किया जाता है; और John Snow, जिन्होंने 1854 के ब्रॉड स्ट्रीट कॉलरा प्रकोप को एक ही जल पंप तक सीमित किया और आधुनिक महामारी विज्ञान की नींव रखी।

डार्विन अनुसंधान प्रीव्यू में

चौथा मॉडल, Darwin, अनुसंधान प्रीव्यू में है और सामान्य रूप से जारी नहीं किया गया है। घोषणा में, OpenEvidence ने Darwin को दुनिया का सबसे उन्नत मेडिकल AI मॉडल बताया और कहा कि यह MedQA पर पूर्ण अंक प्राप्त करने वाला पहला AI मॉडल है, जिसे कंपनी मेडिकल AI का प्रमुख पूर्णतः स्वतंत्र बेंचमार्क मानती है। कंपनी ने यह भी बताया कि Darwin MedXpertQA पर 72.8 प्रतिशत, HealthBench Professional पर 82.7 प्रतिशत, और NOHARM पर 87.2 प्रतिशत के साथ अत्याधुनिक है, जो अगले सर्वश्रेष्ठ मॉडलों, अर्थात Claude Fable 5 और Gemini 3.7, से आगे है।

पहुँच केवल आवेदन के माध्यम से है। OpenEvidence ने कहा कि इसका तर्क द्वि-उपयोग जोखिम: एक मॉडल जो विषाणु विज्ञान, इम्यूनोलॉजी और मानव आनुवंशिकी के अग्रभाग में तर्क कर सकता है, यदि गलत हाथों में पड़ जाए, तो बायोवेपन-संबंधी शोध और मुख्यधारा वैज्ञानिक निगरानी के बाहर जीनोमिक संपादन जैसे कार्यों को तेज़ कर सकता है। वर्तमान पहुँच में National Organization for Rare Disorders जैसे संस्थागत साझेदार शामिल हैं, जो Darwin को उसके सबसे कठिन मामलों से परिचित कराते हैं, शोध सहयोगी, और अकादमिक संस्थानों में मान्य AI शोधकर्ता जो क्लिनिकल मेडिसिन में AI की सटीकता और सुरक्षा का बेंचमार्क बनाते हैं। कंपनी ने कहा कि Darwin की क्षमताएँ Osler, Sackett, और Snow में प्रवाहित होंगी क्योंकि इन साझेदारों के साथ इसकी सुरक्षा उपायों को मान्य किया जाएगा।

बेंचमार्क कार्यप्रणाली

सहयोगी तकनीकी पोस्ट में, OpenEvidence ने मूल्यांकन सेटअप का विवरण दिया। MedQA के लिए, कंपनी ने बेंचमार्क के 1,273-प्रश्न चार-विकल्प परीक्षण विभाजन की चिकित्सक पुनः-एनोटेशन से शुरू किया और अनुपलब्ध जानकारी, अस्पष्टता, और लेबल त्रुटियों के लिए बहिष्करण मानदंड लागू किए, उसके बाद अगस्त 2026 में तीन OpenEvidence चिकित्सकों द्वारा एक द्वितीय समीक्षा पास किया गया, जिन्होंने प्रत्येक प्रश्न को कवर किया जो किसी भी मूल्यांकित मॉडल ने गलत उत्तर दिया था। इससे अंतिम मूल्यांकन सेट 660 प्रश्नों का बना, जिसे Darwin ने बिना त्रुटि के उत्तर दिया। कंपनी अपने एनोटेशन और सभी चार बेंचमार्कों के लिए Darwin की पूर्ण प्रतिक्रियाएँ जारी कर रही है।

MedXpertQA पर, Darwin को पूर्ण 2,450-प्रश्न टेक्स्ट विभाजन पर मूल्यांकित किया गया, मल्टीमॉडल उपसमुच्चय को छोड़कर। HealthBench Professional के लिए, कंपनी ने सार्वजनिक रूप से उपलब्ध परीक्षण सेट का उपयोग किया, जिसमें बहु-टर्न मामलों को बाहर रखा गया, जिससे 525 कार्यों में से 410 शेष रहे, और प्रतिक्रियाओं को Anthropic द्वारा प्रकाशित LLM-as-a-judge कॉन्फ़िगरेशन के साथ ग्रेड किया, जिसमें Claude Opus 4.8 को 32,000-टोकन अधिकतम सोच बजट के साथ उपयोग किया गया। NOHARM, जो वास्तविक परामर्श मामलों में हानिकारक सिफ़ारिशों की आवृत्ति और गंभीरता को स्कोर करता है, को 30-केस खुले उपसमुच्चय पर इसके आधिकारिक ओपन-सोर्स पैकेज के साथ ग्रेड किया गया।

बेसलाइन को claude-fable-5 के साथ अनुकूली सोच, डिफ़ॉल्ट तर्क प्रयास के साथ gpt-5.6-sol, और डिफ़ॉल्ट तर्क प्रयास के साथ gemini-3.7-flash के रूप में चलाया गया, प्रत्येक प्रदाता के API डिफ़ॉल्ट का उपयोग करके, बिना टूल या अनुकूलित सिस्टम प्रॉम्प्ट के। HealthBench Professional स्कोर को प्रत्येक मॉडल के लिए कम से कम पाँच स्वतंत्र परीक्षणों के औसत के रूप में गणना किया गया, जबकि अन्य डेटासेट को एक ही पास में स्कोर किया गया, और पूरे लेख में औसत स्कोर रिपोर्ट किए गए।

पोस्ट के अनुसार, Darwin का MedXpertQA स्कोर सबसे मजबूत बेसलाइन से 7.7 अंक अधिक है, उसका HealthBench Professional स्कोर अगले सर्वश्रेष्ठ मॉडल से 12.1 अंक अधिक है, और उसका NOHARM गंभीरता-भारित F1 0.872 तक पहुंचा, जबकि सबसे निकटतम बेसलाइन 0.740 था। कंपनी ने स्वीकार किया कि NOHARM पर Darwin की बिना भारित प्रिसीजन कई बेसलाइन से कम है, यह समझाते हुए कि यह मीट्रिक रूब्रिक में अनुपस्थित प्रत्येक सिफ़ारिश को फॉल्स पॉज़िटिव मानता है और Darwin को चिकित्सकों को सभी प्रासंगिक विकल्प देने के लिए ट्यून किया गया है। उसने Darwin की गंभीरता-भारित प्रिसीजन को 0.9 बताया।

उपलब्धता और अगले कदम

Osler, Sackett, और Snow सभी सत्यापित चिकित्सकों के लिए असीमित उपयोग के साथ निःशुल्क उपलब्ध हैं। Darwin कंपनी की साइट पर आवेदन प्रक्रिया के माध्यम से शोधकर्ताओं के लिए उपलब्ध है।

OpenEvidence ने कहा कि वह समय के साथ मॉडल परिवार को सुधारना, विस्तार करना और पहुंच बढ़ाना जारी रखेगा, जिसमें ऑन्कोलॉजी, रेडियोलॉजी और क्लिनिकल जीनिटिक्स से शुरू होने वाली विशेष प्रैक्टिस के लिए निर्मित मॉडल शामिल हैं।

आरिया ब्लूम एक एआई-जनरेटेड पत्रकार हैं जो यह देखती हैं कि कृत्रिम बुद्धिमत्ता जैव प्रौद्योगिकी और जीनोमिक अनुसंधान को कैसे बदल रही है। उनके लेखन में सटीकता और जीवन विज्ञान के भविष्य के बारे में गहरी जिज्ञासा का मिश्रण है।
सिंथेटिक जीव विज्ञान से लेकर व्यक्तिगत चिकित्सा तक, आरिया यह विश्लेषण करती हैं कि मशीन लर्निंग मानव स्वास्थ्य नवाचार को कैसे तेज कर रही है।
आरिया ब्लूम द्वारा लिखे गए लेख एआई-जनरेटेड हैं और सटीकता और अनुपालन के लिए यूनाइट.एआई की संपादकीय टीम द्वारा समीक्षा की जाती हैं।