AI-modellen en platforms
OpenEvidence introduceert medische AI-modelfamilie met Darwin‑preview

OpenEvidence heeft op 3 september 2026 een nieuwe familie van medische AI‑zoekmodellen uitgebracht, waarbij drie productie‑modellen gratis beschikbaar worden gesteld aan geverifieerde clinici en een vierde, dat zij beschrijven als hun meest geavanceerde, uitsluitend via een aanvraagprocedure aan onderzoekers wordt geopend.
De drie productie‑modellen zijn genoemd naar figuren uit de medische geschiedenis. Osler, dat het bedrijf beschrijft als hun snelste model met ongeveer vijf seconden per antwoord, is de opvolger van het model dat eerder OpenEvidence‑antwoorden aandreef en wordt de standaard van het platform. Sackett is gepositioneerd als een dieper zoekmodel dat ongeveer 30 seconden per antwoord nodig heeft voor vragen waarbij het gewicht van het bewijs centraal staat. Snow, de opvolger van de OpenEvidence Deep Consult‑functie, is het meest diepgaande productie‑model met ongeveer vijf minuten per antwoord, waarbij een volledige onderzoek van medische literatuur wordt uitgevoerd voordat een rapport wordt opgesteld.
De modellen worden uitgerold naar alle OpenEvidence‑gebruikers op openevidence.com en in de iOS‑ en Android‑apps van het bedrijf, waarbij clinici via een modelkeuzeknop in de interface tussen hen kunnen kiezen. OpenEvidence meldt dat elk model in de familie voldoet aan dezelfde klinische nauwkeurigheid, waarbij het verschil tussen de modellen ligt in de tijd die een model nodig heeft om na te denken en de diepgang van de zoekopdracht.
De naamgevers zijn William Osler, die het medisch onderwijs van de collegezaal naar het bed verplaatste; David Sackett, herinnerd als de vader van evidence‑based medicine; en John Snow, die de cholera‑uitbraak van 1854 in Broad Street terugleidde tot een enkele waterpomp en bijdroeg aan de oprichting van de moderne epidemiologie.
Darwin in onderzoekspreview
Het vierde model, Darwin, bevindt zich in een onderzoekspreview en wordt niet algemeen vrijgegeven. In de aankondiging beschrijft OpenEvidence Darwin als het meest geavanceerde medische AI‑model ter wereld en stelt dat het het eerste AI‑model is dat een perfecte score behaalt op MedQA, dat het bedrijf het toonaangevende volledig onafhankelijke benchmark voor medische AI noemt. Het bedrijf meldt bovendien dat Darwin state‑of‑the‑art presteert op MedXpertQA met 72,8 %, op HealthBench Professional met 82,7 % en op NOHARM met 87,2 %, en dat het daarmee beter scoort dan de op één na beste modellen, die zij benoemen als Claude Fable 5 en Gemini 3.7.
Toegang is uitsluitend via een aanvraag. OpenEvidence verklaart dat de redenering verband houdt met dual‑use‑risico: een model dat kan redeneren op het grensgebied van virologie, immunologie en menselijke genetica, zou in de verkeerde handen het werk kunnen versnellen dat streng gereguleerd is, zoals onderzoek naar biowapens en kiembewerkingen buiten de reguliere wetenschappelijke controle. Huidige toegang omvat institutionele partners zoals de National Organization for Rare Disorders, die Darwin de meest complexe gevallen biedt, onderzoeks‑samenwerkingspartners en geaccrediteerde AI‑onderzoekers aan academische instellingen die de nauwkeurigheid en veiligheid van AI in klinische geneeskunde benchmarken. Het bedrijf zei dat de mogelijkheden van Darwin zullen doorstromen naar Osler, Sackett en Snow zodra de waarborgen met deze partners zijn gevalideerd.
Benchmark‑methodologie
In een bijbehorende technische publicatie heeft OpenEvidence de evaluatiesetup toegelicht. Voor MedQA begon het bedrijf met her‑annotaties door artsen van de benchmark‑test met 1.273 vragen en vier keuzemogelijkheden, en paste uitsluitingscriteria toe voor ontbrekende informatie, onduidelijkheid en label‑fouten, gevolgd door een tweede beoordelingsronde in augustus 2026 door drie OpenEvidence‑artsen die elke vraag behandelden die door een geëvalueerd model onjuist werd beantwoord. Dit leverde een definitieve evaluatieset van 660 vragen op, die Darwin foutloos beantwoordde. Het bedrijf maakt zijn annotaties en de volledige antwoorden van Darwin voor alle vier de benchmarks openbaar.
Voor MedXpertQA werd Darwin geëvalueerd op de volledige tekst‑split van 2.450 vragen, waarbij de multimodale subset werd uitgesloten. Voor HealthBench Professional gebruikte het bedrijf de publiek beschikbare testset waarbij multi‑turn‑cases werden weggelaten, waardoor 410 van de 525 taken overbleven, en beoordeelde de antwoorden met de LLM‑as‑a‑judge‑configuratie gepubliceerd door Anthropic, waarbij Claude Opus 4.8 werd ingezet met een maximale denkbudget van 32.000 tokens. NOHARM, een benchmark die de frequentie en ernst van schadelijke aanbevelingen in echte consultatiescores meet, werd beoordeeld met het officiële open‑source‑pakket op de 30‑case open subset.
Baseline‑modellen werden uitgevoerd als claude‑fable‑5 met adaptief denken, gpt‑5.6‑sol met standaard redeneerinspanning, en gemini‑3.7‑flash met standaard redeneerinspanning, waarbij de API‑standaarden van elke provider werden gebruikt zonder hulpmiddelen of aangepaste systeem‑prompts. HealthBench Professional‑scores werden gemiddeld over ten minste vijf onafhankelijke proefruns per model, terwijl andere datasets werden beoordeeld in één enkele run, met gemiddelde scores die gedurende het hele rapport worden vermeld.
Volgens de publicatie ligt Darwin’s MedXpertQA‑score 7,7 punten boven de sterkste baseline, de HealthBench Professional‑score 12,1 punten boven het op één na beste model, en behaalde de op ernst‑gewogen F1‑score van NOHARM een waarde van 0,872 tegenover 0,740 voor de dichtstbijzijnde baseline. Het bedrijf erkent dat Darwin’s ongewogen precisie op NOHARM lager is dan bij verschillende baselines, en legt uit dat de metriek elke aanbeveling die niet in de rubric staat als een vals‑positief telt, en dat Darwin zo is afgesteld dat artsen de volledige set relevante opties krijgen. Het rapporteerde een ernst‑gewogen precisie van 0,9.
Beschikbaarheid en volgende stappen
Osler, Sackett en Snow zijn onbeperkt beschikbaar voor alle geverifieerde clinici zonder kosten. Darwin is beschikbaar voor onderzoekers via een aanvraagprocedure op de website van het bedrijf.
OpenEvidence meldt dat zij de modelfamilie in de loop van de tijd blijven verbeteren, uitbreiden en de toegang vergroten, onder meer met modellen die zijn ontwikkeld voor specialistische praktijken, te beginnen met oncologie, radiologie en klinische genetica.












