AI-modeller og plattformer
OpenEvidence lanserer medisinsk AI-modellfamilie med Darwin-forhåndsvisning

OpenEvidence lanserte en ny familie av medisinske AI‑søkmodeller 3. september 2026, og gjorde tre produksjonsmodeller tilgjengelige gratis for verifiserte klinikere, samt åpnet en fjerde, som de beskriver som den mest avanserte, for forskere kun via søknad.
De tre produksjonsmodellene er oppkalt etter personer i medisinhistorien. Osler, som selskapet beskriver som den raskeste modellen med omtrent fem sekunder per svar, er etterfølgeren til modellen som tidligere drev OpenEvidence‑svar og blir plattformens standard. Sackett er posisjonert som en dypere søkemodell som tar omtrent 30 sekunder per svar for spørsmål som avhenger av bevisenes vekt. Snow, etterfølgeren til OpenEvidence Deep Consult‑funksjonen, er den dypeste produksjonsmodellen med omtrent fem minutter per svar, og gjennomfører en full undersøkelse av medisinsk litteratur før den produserer en rapport.
Modellene rulles ut til alle OpenEvidence‑brukere på openevidence.com og selskapets iOS‑ og Android‑apper, hvor klinikere kan velge mellom dem via en modellvelger i grensesnittet. OpenEvidence oppgir at hver modell i familien holder samme standard for klinisk nøyaktighet, og forskjellen mellom dem er hvor lenge en modell tenker og hvor dypt den søker.
Navnene er William Osler, som flyttet medisinsk undervisning fra forelesningssalen til pasientsengen; David Sackett, husket som faren til evidensbasert medisin; og John Snow, som sporet kolerautbruddet i Broad Street i 1854 til en enkelt vannpumpe og bidro til å grunnlegge moderne epidemiologi.
Darwin i forskningsforhåndsvisning
Den fjerde modellen, Darwin, er i forskningsforhåndsvisning og blir ikke lansert generelt. I kunngjøringen beskriver OpenEvidence Darwin som den mest avanserte medisinske AI‑modellen i verden og sier den er den første AI‑modellen som oppnår en perfekt poengsum på MedQA, som selskapet omtaler som den ledende fullt uavhengige referansen for medisinsk AI. Selskapet rapporterer også at Darwin er i forkant på MedXpertQA med 72,8 % , HealthBench Professional med 82,7 % og NOHARM med 87,2 %, foran de nest beste modellene, som de navngir Claude Fable 5 og Gemini 3.7.
Tilgang er kun via søknad. OpenEvidence oppgir at begrunnelsen knytter seg til dual-use risk: en modell som kan resonere i grensen av virologi, immunologi og menneskelig genetikk, kan i feil hender akselerere arbeid som er strengt regulert, som forskning relatert til biologiske våpen og endring av germlinjen utenfor hovedstrømmen av vitenskapelig tilsyn. Nåværende tilgang omfatter institusjonelle partnere som National Organization for Rare Disorders, som gir Darwin sine vanskeligste tilfeller, forskningssamarbeidspartnere og akkrediterte AI‑forskere ved akademiske institusjoner som benchmarker nøyaktigheten og sikkerheten til AI i klinisk medisin. Selskapet sa at Darwins evner vil bli overført til Osler, Sackett og Snow etter hvert som sikkerhetstiltakene valideres med disse partnerne.
Benchmark‑metodikk
I et tilhørende teknisk innlegg detaljert OpenEvidence evalueringsoppsettet. For MedQA startet selskapet med lege‑reannotasjoner av benchmarkens 1 273‑spørsmåls test med fire svaralternativer, og anvendte eksklusjonskriterier for manglende informasjon, tvetydighet og merkelappfeil, etterfulgt av en andre gjennomgang i august 2026 av tre OpenEvidence‑leger som dekket hvert spørsmål som noen evaluert modell svarte feil på. Dette ga et endelig evalueringssett på 660 spørsmål, som Darwin besvarte uten feil. Selskapet publiserer sine annotasjoner og Darwins komplette svar for alle fire benchmarkene.
På MedXpertQA ble Darwin evaluert på hele 2 450‑spørsmåls Text‑splittet, med unntak av den multimodale delmengden. For HealthBench Professional brukte selskapet det offentlig tilgjengelige testsettet med flertrinnssaker ekskludert, og beholdt 410 av de 525 oppgavene, og vurderte svarene med LLM‑as‑a‑judge‑konfigurasjonen publisert av Anthropic, ved bruk av Claude Opus 4.8 med et maksimum på 32 000‑token tenkebudsjett. NOHARM, et benchmark som måler hyppigheten og alvorlighetsgraden av skadelige anbefalinger i ekte konsultasjonssaker, ble vurdert med sin offisielle åpen‑kilde‑pakke på den åpne delmengden på 30 saker.
Referansebasene ble kjørt som claude-fable-5 med adaptiv tenkning, gpt-5.6-sol med standard resonneringsinnsats, og gemini-3.7-flash med standard resonneringsinnsats, ved bruk av hver leverandørs API‑standarder uten verktøy eller tilpassede system‑prompt. HealthBench Professional‑poeng ble gjennomsnittet over minst fem uavhengige forsøk per modell, mens andre datasett ble vurdert i én gjennomgang, med gjennomsnittlige poeng rapportert gjennom hele teksten.
Ifølge innlegget ligger Darwins MedXpertQA‑poeng 7,7 poeng over den sterkeste referansen, HealthBench Professional‑poeng 12,1 poeng over den nest beste modellen, og NOHARM‑sårbarhetsvektede F1‑score nådde 0,872 mot 0,740 for den nærmeste referansen. Selskapet innrømmer at Darwins uvektede presisjon på NOHARM er lavere enn flere referanser, og forklarer at metrikken teller hver anbefaling som mangler i rubrikken som et falskt positivt svar, og at Darwin er justert for å gi leger hele settet av relevante alternativer. De rapporterte Darwins sårbarhetsvektede presisjon som 0,9.
Tilgjengelighet og neste steg
Osler, Sackett og Snow er tilgjengelige med ubegrenset bruk for alle verifiserte klinikere uten kostnad. Darwin er tilgjengelig for forskere via en søknadsprosess på selskapets nettsted.
OpenEvidence oppgir at de vil fortsette å forbedre, utvide og øke tilgangen til modellfamilien over tid, inkludert modeller utviklet for spesialpraksis med start i onkologi, radiologi og klinisk genetikk.












