AI-modeller og platforme
OpenEvidence lancerer medicinsk AI-modelfamilie med Darwin Preview

OpenEvidence udgav en ny familie af medicinske AI‑søgemodeller den 3. september 2026, gjorde tre produktionsmodeller tilgængelige gratis for verificerede klinikere og åbnede en fjerde, som den beskriver som den mest avancerede, for forskere kun via ansøgning.
Denne tre produktionsmodeller er opkaldt efter personer i medicinhistorien. Osler, som virksomheden beskriver som den hurtigste model med cirka fem sekunder pr. svar, er efterfølgeren til den model, der tidligere drev OpenEvidence‑svar og bliver platformens standard. Sackett er placeret som en dybere søgemodel, der tager omkring 30 sekunder pr. svar for spørgsmål, der afhænger af evidencens vægt. Snow, efterfølgeren til OpenEvidence Deep Consult‑funktionen, er den dybeste produktionsmodel med cirka fem minutter pr. svar og udfører en fuld undersøgelse af medicinsk litteratur, inden den producerer en rapport.
Modellerne rulles ud til alle OpenEvidence‑brugere på openevidence.com samt virksomhedens iOS‑ og Android‑apps, hvor klinikere kan vælge mellem dem via en modelvælger i grænsefladen. OpenEvidence sagde, at hver model i familien overholder den samme standard for klinisk nøjagtighed, og forskellen mellem dem er, hvor længe en model tænker, og hvor dybt den søger.
Navnelegenderne er William Osler, der flyttede medicinsk undervisning fra forelæsningssalen til patientens seng; David Sackett, husket som faderen til evidensbaseret medicin; og John Snow, som sporede koleraudbruddet på Broad Street i 1854 til en enkelt vandpumpe og var med til at grundlægge moderne epidemiologi.
Darwin i forskningspreview
Den fjerde model, Darwin, er i forskningspreview og udgives ikke generelt. I meddelelsen beskriver OpenEvidence Darwin som den mest avancerede medicinske AI‑model i verden og siger, at den er den første AI‑model, der opnår en perfekt score på MedQA, som virksomheden kalder den førende fuldt uafhængige benchmark for medicinsk AI. Virksomheden rapporterer også, at Darwin er state of the art på MedXpertQA med 72,8 %, HealthBench Professional med 82,7 % og NOHARM med 87,2 %, foran de næstbedste modeller, som den navngiver Claude Fable 5 og Gemini 3.7.
Adgang er kun via ansøgning. OpenEvidence sagde, at dens begrundelse relaterer sig til dual‑use‑risiko: en model, der kan resonere i grænselandet for virologi, immunologi og menneskelig genetik, kunne i de forkerte hænder fremskynde arbejde, der er stramt reguleret, såsom forskning relateret til biologiske våben og redigering af kimlinjen uden for den almindelige videnskabelige tilsyn. Den nuværende adgang dækker institutionelle partnere såsom National Organization for Rare Disorders, som bringer Darwins sværeste sager, forskningssamarbejdspartnere og akkrediterede AI‑forskere ved akademiske institutioner, der benchmarker nøjagtigheden og sikkerheden af AI i klinisk medicin. Virksomheden sagde, at Darwins kapaciteter vil flyde ind i Osler, Sackett og Snow, efterhånden som sikkerhedsforanstaltningerne valideres med disse partnere.
Benchmark‑metodologi
I en ledsagende teknisk post detaljerede OpenEvidence evalueringsopsætningen. For MedQA startede virksomheden med læge‑re‑annoteringer af benchmarkens 1.273‑spørgsmåls fire‑valgs test‑split og anvendte eksklusionskriterier for manglende information, tvetydighed og mærkningsfejl, efterfulgt af en anden gennemgang i august 2026 af tre OpenEvidence‑læger, der dækkede hvert spørgsmål, som en evalueret model besvarede forkert. Det resulterede i et endeligt evalueringssæt på 660 spørgsmål, som Darwin besvarede uden fejl. Virksomheden frigiver sine annoteringer og Darwins komplette svar for alle fire benchmarks.
På MedXpertQA blev Darwin evalueret på den fulde 2.450‑spørgsmåls Text‑split, ekskluderende den multimodale delmængde. For HealthBench Professional brugte virksomheden det offentligt tilgængelige test‑sæt med multi‑turn‑sager ekskluderet, hvilket efterlod 410 af de 525 opgaver, og bedømte svarene med LLM‑as‑a‑judge‑konfigurationen udgivet af Anthropic, ved brug af Claude Opus 4.8 med et maksimum på 32.000‑token tænke‑budget. NOHARM, en benchmark der måler hyppighed og alvorlighed af skadelige anbefalinger i reelle konsultationssager, blev bedømt med sin officielle open‑source‑pakke på den 30‑sags åbne delmængde.
Baseline‑modellerne blev kørt som claude-fable-5 med adaptiv tænkning, gpt-5.6-sol med standard resonneringsindsats og gemini-3.7-flash med standard resonneringsindsats, ved brug af hver leverandørs API‑standarder uden værktøjer eller tilpassede system‑prompter. HealthBench Professional‑score blev gennemsnitligt over mindst fem uafhængige forsøg pr. model, mens andre datasæt blev scoret over et enkelt gennemløb, med gennemsnitlige scores rapporteret gennem hele testen.
Ifølge posten ligger Darwins MedXpertQA‑score 7,7 point over den stærkeste baseline, dens HealthBench Professional‑score 12,1 point over den næstbedste model, og dens NOHARM‑sværheds‑vægtede F1 nåede 0,872 mod 0,740 for den nærmeste baseline. Virksomheden anerkendte, at Darwins uvægtede præcision på NOHARM er lavere end flere baselines, og forklarede, at metrikken tæller hver anbefaling, der mangler i rubrikken, som en falsk positiv, og at Darwin er indstillet til at give læger det fulde sæt af relevante muligheder. Den rapporterede Darwins sværheds‑vægtede præcision som 0,9.
Tilgængelighed og næste skridt
Osler, Sackett og Snow er tilgængelige med ubegrænset brug for alle verificerede klinikere uden omkostning. Darwin er tilgængelig for forskere via en ansøgningsproces på virksomhedens hjemmeside.
OpenEvidence sagde, at de vil fortsætte med at forbedre, udvide og øge adgangen til modelfamilien over tid, herunder modeller bygget til specialpraksis, begyndende med onkologi, radiologi og klinisk genetik.












