Μοντέλα και πλατφόρμες AI
Η OpenEvidence λανσάρει οικογένεια ιατρικών μοντέλων AI με προεπισκόπηση του Darwin

Η OpenEvidence κυκλοφόρησε μια νέα οικογένεια ιατρικών μοντέλων AI αναζήτησης στις 3 Σεπτεμβρίου 2026, καθιστώντας τρία μοντέλα παραγωγής διαθέσιμα δωρεάν σε επαληθευμένους κλινικούς ιατρούς και ανοίγοντας ένα τέταρτο, το οποίο περιγράφει ως το πιο προηγμένο, σε ερευνητές μόνο κατόπιν αίτησης.
Τα τρία μοντέλα παραγωγής ονομάζονται προς τιμήν προσωπικοτήτων της ιστορίας της ιατρικής. Το Osler, το οποίο η εταιρεία περιγράφει ως το πιο γρήγορο μοντέλο της, με περίπου πέντε δευτερόλεπτα ανά απάντηση, είναι ο διάδοχος του μοντέλου που παλαιότερα τροφοδότησε τις απαντήσεις του OpenEvidence και γίνεται η προεπιλογή της πλατφόρμας. Το Sackett τοποθετείται ως μοντέλο πιο βαθιάς αναζήτησης που απαιτεί περίπου 30 δευτερόλεπτα ανά απάντηση για ερωτήσεις που εξαρτώνται από το βάρος των αποδείξεων. Το Snow, ο διάδοχος της λειτουργίας OpenEvidence Deep Consult, είναι το πιο βαθύ μοντέλο παραγωγής με περίπου πέντε λεπτά ανά απάντηση, εκτελώντας πλήρη διερεύνηση της ιατρικής βιβλιογραφίας πριν δημιουργήσει μια αναφορά.
Τα μοντέλα κυκλοφορούν σε όλους τους χρήστες του OpenEvidence στο openevidence.com και στις εφαρμογές της εταιρείας για iOS και Android, με τους κλινικούς ιατρούς να μπορούν να επιλέγουν μεταξύ τους μέσω ενός επιλογέα μοντέλων στη διεπαφή. Η OpenEvidence δήλωσε ότι κάθε μοντέλο στην οικογένεια τηρεί το ίδιο πρότυπο κλινικής ακρίβειας, με τη διαφορά μεταξύ τους να είναι το χρονικό διάστημα σκέψης του μοντέλου και το βάθος της αναζήτησης.
Τα ομώνυμα είναι ο William Osler, που μετέφερε τη διδασκαλία της ιατρικής από την αμφιθέατρο στο κρεβάτι του ασθενούς· ο David Sackett, που θεωρείται ο πατέρας της evidence‑based medicine· και ο John Snow, που ανίχνευσε την επιδημία χολέρας του 1854 στη Broad Street σε μία μοναδική αντλία νερού και συνέβαλε στην ίδρυση της σύγχρονης επιδημιολογίας.
Darwin σε Προεπισκόπηση Έρευνας
Το τέταρτο μοντέλο, Darwin, βρίσκεται σε προεπισκόπηση έρευνας και δεν κυκλοφορεί γενικά. Στην ανακοίνωση, η OpenEvidence περιγράφει το Darwin ως το πιο προηγμένο ιατρικό μοντέλο AI παγκοσμίως και δηλώνει ότι είναι το πρώτο μοντέλο AI που πέτυχε τέλειο σκορ στο MedQA, το οποίο η εταιρεία χαρακτηρίζει ως το κορυφαίο πλήρως ανεξάρτητο benchmark της ιατρικής AI. Η εταιρεία επίσης αναφέρει ότι το Darwin είναι στην αιχμή της τεχνολογίας στο MedXpertQA με 72,8 %, στο HealthBench Professional με 82,7 % και στο NOHARM με 87,2 %, μπροστά από τα επόμενα καλύτερα μοντέλα, που ονομάζει Claude Fable 5 και Gemini 3.7.
Η πρόσβαση είναι μόνο κατόπιν αίτησης. Η OpenEvidence δήλωσε ότι η λογική του σχετίζεται με τον κίνδυνο διπλής χρήσης: dual-use risk. Ένα μοντέλο που μπορεί να λογίζεται στα όρια της ιολογίας, της ανοσολογίας και της γενετικής του ανθρώπου, θα μπορούσε, στα λάθος χέρια, να επιταχύνει εργασίες που ρυθμίζονται αυστηρά, όπως η έρευνα σχετική με βιολογικά όπλα και η επεξεργασία της γενετικής γραμμής εκτός του κύριου επιστημονικού ελέγχου. Η τρέχουσα πρόσβαση καλύπτει θεσμικούς εταίρους όπως η Εθνική Οργάνωση για Σπάνιες Παθήσεις, η οποία φέρνει στο Darwin τις πιο δύσκολες περιπτώσεις, ερευνητικούς συνεργάτες και πιστοποιημένους ερευνητές AI σε ακαδημαϊκά ιδρύματα που αξιολογούν την ακρίβεια και την ασφάλεια της AI στην κλινική ιατρική. Η εταιρεία δήλωσε ότι οι δυνατότητες του Darwin θα ενσωματωθούν στα Osler, Sackett και Snow καθώς οι μηχανισμοί ασφαλείας του επικυρώνονται με αυτούς τους εταίρους.
Μεθοδολογία Benchmark
Σε μια συνοδευτική τεχνική ανάρτηση, η OpenEvidence περιέγραψε τη ρύθμιση της αξιολόγησης. Για το MedQA, η εταιρεία ξεκίνησε από επανεπεξεργασίες ιατρών του benchmark με 1.273 ερωτήσεις πολλαπλής επιλογής και εφάρμοσε κριτήρια εξαίρεσης για ελλιπείς πληροφορίες, ασάφεια και σφάλματα ετικετών, ακολουθούμενα από δεύτερο γύρο ελέγχου τον Αύγουστο 2026 από τρεις ιατρούς του OpenEvidence που κάλυψαν κάθε ερώτηση που απάντησε λανθασμένα οποιοδήποτε αξιολογημένο μοντέλο. Αυτό παρήγαγε ένα τελικό σύνολο αξιολόγησης 660 ερωτήσεων, στις οποίες το Darwin απάντησε χωρίς σφάλμα. Η εταιρεία δημοσιεύει τις σημειώσεις της και τις πλήρεις απαντήσεις του Darwin για όλα τα τέσσερα benchmarks.
Στο MedXpertQA, το Darwin αξιολογήθηκε στο πλήρες σύνολο 2.450 ερωτήσεων Text, εξαιρώντας το πολυμορφικό υποσύνολο. Για το HealthBench Professional, η εταιρεία χρησιμοποίησε το δημόσια διαθέσιμο σύνολο δοκιμών με εξαίρεση τις περιπτώσεις πολλαπλών γύρων, αφήνοντας 410 από τις 525 εργασίες, και αξιολόγησε τις απαντήσεις με τη ρύθμιση LLM‑as‑a‑judge που δημοσίευσε η Anthropic, χρησιμοποιώντας το Claude Opus 4.8 με μέγιστο προϋπολογισμό σκέψης 32.000 tokens. Το NOHARM, ένα benchmark που μετρά τη συχνότητα και τη σοβαρότητα βλαβερών συστάσεων σε πραγματικές περιπτώσεις συμβουλευτικής, αξιολογήθηκε με το επίσημο ανοιχτού κώδικα πακέτο του σε υποσύνολο 30 ανοιχτών περιπτώσεων.
Οι βάσεις εκτελέστηκαν ως claude-fable-5 με προσαρμοστική σκέψη, gpt-5.6-sol με προεπιλεγμένη προσπάθεια λογικής και gemini-3.7-flash με προεπιλεγμένη προσπάθεια λογικής, χρησιμοποιώντας τις προεπιλογές API κάθε παρόχου χωρίς εργαλεία ή προσαρμοσμένα prompts συστήματος. Οι βαθμολογίες του HealthBench Professional μέσουσαν τουλάχιστον πέντε ανεξάρτητες δοκιμές ανά μοντέλο, ενώ τα άλλα σύνολα δεδομένων αξιολογήθηκαν με μία μόνο διεξαγωγή, με τις μέσες βαθμολογίες να αναφέρονται καθ’ όλη τη διάρκεια.
Σύμφωνα με την ανάρτηση, το σκορ του Darwin στο MedXpertQA είναι 7,7 μονάδες πάνω από τη δυνατότερη βάση, το σκορ του στο HealthBench Professional 12,1 μονάδες πάνω από το επόμενο καλύτερο μοντέλο, και το βαρυποσομένο F1 του NOHARM έφτασε στο 0,872 έναντι 0,740 για τη πιο κοντινή βάση. Η εταιρεία παραδέχτηκε ότι η μη βαρυποσομένη ακρίβεια του Darwin στο NOHARM είναι χαμηλότερη από αρκετές βάσεις, εξηγώντας ότι το μέτρο μετρά κάθε σύσταση που λείπει από το κριτήριο ως ψευδώς θετική και ότι το Darwin ρυθμίζεται ώστε να παρέχει στους ιατρούς το πλήρες σύνολο των σχετικών επιλογών. Αναφέρθηκε ότι η βαρυποσομένη ακρίβεια του Darwin είναι 0,9.
Διαθεσιμότητα και Επόμενα Βήματα
Τα Osler, Sackett και Snow είναι διαθέσιμα με απεριόριστη χρήση σε όλους τους επαληθευμένους κλινικούς ιατρούς δωρεάν. Το Darwin είναι διαθέσιμο σε ερευνητές μέσω διαδικασίας αίτησης στην ιστοσελίδα της εταιρείας.
Η OpenEvidence δήλωσε ότι θα συνεχίσει να βελτιώνει, να επεκτείνει και να αυξάνει την πρόσβαση στην οικογένεια μοντέλων με την πάροδο του χρόνου, συμπεριλαμβανομένων μοντέλων που θα δημιουργηθούν για εξειδικευμένη πρακτική, ξεκινώντας με ογκολογία, ακτινολογία και κλινική γενετική.












