Modely a platformy AI

OpenEvidence představuje rodinu lékařských AI modelů s náhledem Darwin

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

OpenEvidence vydala novou rodinu lékařských AI vyhledávacích modelů dne 3. září 2026, přičemž tři výrobní modely jsou k dispozici zdarma ověřeným lékařům a čtvrtý, který popisuje jako svůj nejpokročilejší, je zpřístupněn výzkumníkům pouze na základě žádosti.

Tři výrobní modely nesou jména osobností z historie medicíny. Osler, který společnost popisuje jako svůj nejrychlejší model s přibližně pěti sekundami na odpověď, je nástupcem modelu, který dříve poháněl odpovědi OpenEvidence, a stává se výchozím modelem platformy. Sackett je koncipován jako model pro hlubší vyhledávání, který na otázky, kde rozhoduje váha důkazů, potřebuje přibližně 30 sekund na odpověď. Snow, nástupce funkce OpenEvidence Deep Consult, je nejhlubším výrobním modelem s přibližně pěti minutami na odpověď, provádějícím kompletní průzkum lékařské literatury před vytvořením zprávy.

Modely jsou nasazovány všem uživatelům OpenEvidence na openevidence.com a v aplikacích společnosti pro iOS a Android, přičemž lékaři si je mohou vybrat pomocí výběru modelu v rozhraní. OpenEvidence uvedla, že každý model v rodině splňuje stejný standard klinické přesnosti, a rozdíl mezi nimi spočívá v délce úvahy modelu a hloubce jeho vyhledávání.

Jména nesou po Williamu Oslerovi, který přesunul výuku medicíny z přednáškové síně k lůžku pacienta; Davidu Sackettovi, který je považován za otce evidence‑based medicíny; a Johnu Snowovi, jenž vystopoval cholérní výbuch v Broad Street v roce 1854 k jediné vodní pumpě a pomohl založit moderní epidemiologii.

Darwin v výzkumném náhledu

Čtvrtý model, Darwin, je ve výzkumném náhledu a není obecně vydáván. V oznámení OpenEvidence popisuje Darwin jako nejpokročilejší lékařský AI model na světě a uvádí, že je prvním AI modelem, který dosáhl dokonalého skóre v MedQA, což společnost označuje za přední zcela nezávislý benchmark lékařské AI. Společnost také uvádí, že Darwin je špičkový v MedXpertQA s 72,8 % , v HealthBench Professional s 82,7 % a v NOHARM s 87,2 %, před ostatními nejlepšími modely, které jmenuje Claude Fable 5 a Gemini 3.7.

Přístup je pouze na základě žádosti. OpenEvidence řekla, že její úvahy se týkají dual-use risk: model, který dokáže uvažovat na hranicích virologie, imunologie a lidské genetiky, by v nesprávných rukou mohl urychlit činnosti pod přísnou regulací, jako je výzkum související s biologickými zbraněmi a editace germinální linie mimo hlavní vědecký dohled. Současný přístup zahrnuje institucionální partnery, jako je Národní organizace pro vzácná onemocnění, která Darwinu přináší nejnáročnější případy, výzkumné spolupracovníky a akreditované AI výzkumníky na akademických institucích, kteří benchmarkují přesnost a bezpečnost AI v klinické medicíně. Společnost uvedla, že schopnosti Darwinu budou přeneseny do modelů Osler, Sackett a Snow, jakmile budou tyto ochranné mechanismy ověřeny s těmito partnery.

Metodologie benchmarku

V doprovodném technickém příspěvku OpenEvidence podrobně popsal nastavení hodnocení. Pro MedQA společnost vycházela z lékařských přeznačkování benchmarku s 1 273 otázkami a čtyřmi možnostmi a použila vylučovací kritéria pro chybějící informace, nejednoznačnost a chyby štítků, následováno druhým revizním kolem v srpnu 2026 třemi lékaři OpenEvidence, kteří přezkoumali každou otázku, na kterou kterýkoli hodnocený model odpověděl nesprávně. To vytvořilo konečnou hodnotící sadu 660 otázek, na které Darwin odpověděl bez chyby. Společnost zveřejňuje své anotace a kompletní odpovědi Darwinu pro všechny čtyři benchmarky.

U MedXpertQA byl Darwin hodnocen na celém rozdělení Text s 2 450 otázkami, s vyloučením multimodální podmnožiny. Pro HealthBench Professional společnost použila veřejně dostupnou testovací sadu s vyloučenými víceotáčkovými případy, což zanechalo 410 ze 525 úkolů, a hodnotila odpovědi pomocí konfigurace LLM‑as‑a‑judge publikované společností Anthropic, využívající Claude Opus 4.8 s maximálním rozpočtem úvahy 32 000 tokenů. NOHARM, benchmark hodnotící četnost a závažnost škodlivých doporučení ve skutečných konzultačních případech, byl hodnocen pomocí oficiálního open‑source balíčku na otevřené podmnožině 30 případů.

Základní modely byly spuštěny jako claude-fable-5 s adaptivním úsilím o úvahu, gpt-5.6-sol s výchozím úsilím o úvahu a gemini-3.7-flash s výchozím úsilím o úvahu, přičemž byly použity výchozí nastavení API každého poskytovatele bez nástrojů či upravených systémových promptů. Skóre HealthBench Professional byla průměrována z alespoň pěti nezávislých pokusů na model, zatímco ostatní datové sady byly hodnoceny jedním průchodem, přičemž průměrná skóre jsou uvedena v celém textu.

Podle příspěvku je skóre Darwinu v MedXpertQA o 7,7 bodu vyšší než nejvyšší základní model, jeho skóre v HealthBench Professional je o 12,1 bodu nad dalším nejlepším modelem a jeho vážené F1 skóre v NOHARM dosáhlo 0,872 oproti 0,740 u nejbližšího základního modelu. Společnost přiznala, že nevyvážená přesnost Darwinu v NOHARM je nižší než u několika základních modelů, a vysvětlila, že metrika počítá každé doporučení chybějící v rubrice jako falešně pozitivní a že Darwin je nastaven tak, aby poskytl lékařům úplnou sadu relevantních možností. Uvedla, že vážená přesnost podle závažnosti je 0,9.

Dostupnost a další kroky

Modely Osler, Sackett a Snow jsou k dispozici všem ověřeným lékařům s neomezeným používáním zdarma. Darwin je k dispozici výzkumníkům prostřednictvím žádosti na webu společnosti.

OpenEvidence uvedla, že bude nadále vylepšovat, rozšiřovat a zvyšovat přístup k rodině modelů, včetně modelů určených pro specializovanou praxi, počínaje onkologií, radiologií a klinickou genetikou.

Aria Bloom je AI-generovaný novinář, který zkoumá, jak umělá inteligence transformuje biotechnologii a genetický výzkum. Jeho psaní spojuje přesnost s hlubokou zvědavostí o budoucnosti věd o životě. Od syntetické biologie po personalizovanou medicínu Aria analyzuje, jak strojové učení urychluje inovace ve zdravotnictví.