AI-modeller och plattformar
OpenEvidence lanserar medicinsk AI-modellfamilj med Darwin‑förhandsgranskning

OpenEvidence släppte en ny familj av medicinska AI‑sökmodeller den 3 september 2026, vilket gör tre produktionsmodeller tillgängliga gratis för verifierade kliniker och öppnar en fjärde, som de beskriver som deras mest avancerade, för forskare enbart via ansökan.
De tre produktionsmodellerna är uppkallade efter personer i medicinhistorien. Osler, som företaget beskriver som deras snabbaste modell med ungefär fem sekunder per svar, är eftertraktaren till den modell som tidigare drev OpenEvidence‑svaren och blir plattformens standard. Sackett positioneras som en djupare sökmodell som tar cirka 30 sekunder per svar för frågor där bevisens vikt är avgörande. Snow, eftertraktaren till OpenEvidence Deep Consult‑funktionen, är den djupaste produktionsmodellen med ungefär fem minuter per svar och genomför en fullständig undersökning av medicinsk litteratur innan den producerar en rapport.
Modellerna rullas ut till alla OpenEvidence‑användare på openevidence.com samt företagets iOS‑ och Android‑appar, där kliniker kan välja mellan dem via en modellväljare i gränssnittet. OpenEvidence uppgav att varje modell i familjen hålls till samma standard för klinisk noggrannhet, och skillnaden mellan dem är hur länge modellen tänker och hur djupt den söker.
Namnen kommer från William Osler, som flyttade medicinsk undervisning från föreläsningssalen till patientens sida; David Sackett, ihågkommen som fadern till evidensbaserad medicin; och John Snow, som spårade kolerautbrottet på Broad Street 1854 till en enda vattenpump och medverkade till att grunda modern epidemiologi.
Darwin i forskningsförhandsgranskning
Den fjärde modellen, Darwin, är i forskningsförhandsgranskning och släpps inte allmänt. I annonsen beskriver OpenEvidence Darwin som den mest avancerade medicinska AI‑modellen i världen och säger att den är den första AI‑modellen som uppnår ett perfekt resultat på MedQA, som företaget kallar det ledande helt oberoende benchmarket för medicinsk AI. Företaget rapporterar också att Darwin är state‑of‑the‑art på MedXpertQA med 72,8 procent, HealthBench Professional med 82,7 procent och NOHARM med 87,2 procent, framför de näst bästa modellerna som de benämner Claude Fable 5 och Gemini 3.7.
Tillgång ges endast via ansökan. OpenEvidence sade att dess resonemang relaterar till dual‑use‑risk: en modell som kan resonera i framkanten av virologi, immunologi och mänsklig genetik kan i fel händer påskynda arbete som är strikt reglerat, såsom forskning relevant för biovapen och germlineredigering utanför den vanliga vetenskapliga tillsynen. Nuvarande tillgång omfattar institutionella partners som National Organization for Rare Disorders, som ger Darwin dess svåraste fall, forskningssamarbetspartner och ackrediterade AI‑forskare vid akademiska institutioner som benchmarkar AI:s noggrannhet och säkerhet i klinisk medicin. Företaget sade att Darwins kapabiliteter kommer att integreras i Osler, Sackett och Snow när dess skyddsmekanismer valideras med dessa partners.
Benchmark‑metodik
I ett kompletterande tekniskt inlägg detaljerade OpenEvidence utvärderingsuppsättningen. För MedQA började företaget med läkares omannoteringar av benchmarkens testuppdelning med 1 273 frågor och fyra svarsalternativ och tillämpade exklusionskriterier för saknad information, tvetydighet och felaktiga etiketter, följt av ett andra granskningspass i augusti 2026 av tre OpenEvidence‑läkare som täckte varje fråga som någon utvärderad modell besvarade felaktigt. Detta resulterade i en slutgiltig utvärderingsuppsättning på 660 frågor, som Darwin besvarade utan fel. Företaget släpper sina annoteringar och Darwins kompletta svar för alla fyra benchmarkar.
På MedXpertQA utvärderades Darwin på hela Text‑uppdelningen med 2 450 frågor, med undantag för den multimodala delmängden. För HealthBench Professional använde företaget den offentligt tillgängliga testuppsättningen med flerstegsfall exkluderade, vilket lämnade 410 av de 525 uppgifterna, och bedömde svaren med LLM‑as‑a‑judge‑konfigurationen publicerad av Anthropic, med Claude Opus 4.8 och en maximal tanke‑budget på 32 000 token. NOHARM, ett benchmark som räknar frekvensen och allvaret i skadliga rekommendationer i verkliga konsultationsfall, bedömdes med dess officiella open‑source‑paket på den öppna delmängden med 30 fall.
Baslinjer kördes som claude-fable-5 med adaptivt tänkande, gpt-5.6-sol med standard resonemangsinsats och gemini-3.7-flash med standard resonemangsinsats, med varje leverantörs API‑standardinställningar utan verktyg eller anpassade systempromptar. HealthBench Professional‑resultat genomsnittades över minst fem oberoende försök per modell, medan andra datamängder bedömdes i ett enda pass, med medelvärden rapporterade genomgående.
Enligt inlägget ligger Darwins MedXpertQA‑poäng 7,7 poäng över den starkaste baslinjen, dess HealthBench Professional‑poäng 12,1 poäng över näst bästa modell, och dess NOHARM‑severity‑weighted F1 nådde 0,872 jämfört med 0,740 för den närmaste baslinjen. Företaget erkände att Darwins oviktade precision på NOHARM är lägre än flera baslinjer, och förklarade att metrikken räknar varje rekommendation som saknas i rubriken som ett falskt positivt samt att Darwin är finjusterad för att ge läkare hela uppsättningen av relevanta alternativ. De rapporterade Darwins severity‑weighted precision som 0,9.
Tillgänglighet och nästa steg
Osler, Sackett och Snow är tillgängliga med obegränsad användning för alla verifierade kliniker utan kostnad. Darwin är tillgänglig för forskare via en ansökningsprocess på företagets webbplats.
OpenEvidence sade att de kommer att fortsätta förbättra, expandera och öka tillgången till modellfamiljen över tid, inklusive modeller som byggs för specialiserad praxis med start i onkologi, radiologi och klinisk genetik.












