Modele i platformy AI
OpenEvidence wprowadza rodzinę medycznych modeli AI z podglądem Darwin

OpenEvidence wypuściło nową rodzinę medycznych modeli AI do wyszukiwania 3 września 2026 roku, udostępniając trzy modele produkcyjne bezpłatnie zweryfikowanym lekarzom oraz otwierając czwarty, który opisuje jako najbardziej zaawansowany, wyłącznie dla badaczy po złożeniu wniosku.
Trzy modele produkcyjne noszą imiona postaci z historii medycyny. Osler, który firma opisuje jako swój najszybszy model, potrzebujący około pięciu sekund na odpowiedź, jest następcą modelu, który wcześniej zasilał odpowiedzi OpenEvidence i staje się domyślnym modelem platformy. Sackett jest pozycjonowany jako głębszy model wyszukiwania, który potrzebuje około 30 sekund na odpowiedź na pytania zależne od wagi dowodów. Snow, następcą funkcji OpenEvidence Deep Consult, jest najgłębszym modelem produkcyjnym, potrzebującym około pięciu minut na odpowiedź, przeprowadzając pełne badanie literatury medycznej przed wygenerowaniem raportu.
Modele są udostępniane wszystkim użytkownikom OpenEvidence na stronie openevidence.com oraz w aplikacjach firmy na iOS i Android, a lekarze mogą wybierać spośród nich przy pomocy selektora modelu w interfejsie. OpenEvidence podkreśla, że każdy model w rodzinie spełnia ten sam standard dokładności klinicznej, a różnice między nimi polegają jedynie na czasie przemyślenia i głębokości przeszukiwania.
Osobowości, które dały nazwę modelom, to William Osler, który przeniósł nauczanie medyczne z sal wykładowych do przyłóżek; David Sackett, uznawany za ojca medycyny opartej na dowodach; oraz John Snow, który powiązał epidemię cholery z 1854 roku przy Broad Street z jedną pompą wodną i pomógł założyć nowoczesną epidemiologię.
Darwin w wersji badawczej
Czwarty model, Darwin, znajduje się w wersji badawczej i nie jest udostępniany szerokiej publiczności. W ogłoszeniu OpenEvidence opisuje Darwina jako najzaawansowany medyczny model AI na świecie i podaje, że jest to pierwszy model AI, który uzyskał perfekcyjny wynik w teście MedQA, który firma określa jako wiodący w pełni niezależny benchmark medycznej AI. Firma podaje także, że Darwin jest najnowocześniejszy w teście MedXpertQA (72,8 %), HealthBench Professional (82,7 %) oraz NOHARM (87,2 %), wyprzedzając kolejne najlepsze modele, które wymienia jako Claude Fable 5 i Gemini 3.7.
Dostęp jest możliwy wyłącznie po złożeniu wniosku. OpenEvidence zaznacza, że jego rozważania dotyczą ryzyka podwójnego zastosowania: model, który potrafi rozumować na granicy wirusologii, immunologii i genetyki człowieka, mógłby w nieodpowiednich rękach przyspieszyć prace ściśle regulowane, takie jak badania nad bronią biologiczną czy edycja linii rozrodczej poza głównym nadzorem naukowym. Aktualny dostęp obejmuje partnerów instytucjonalnych, takich jak National Organization for Rare Disorders, który dostarcza Darwina najtrudniejsze przypadki, współpracowników badawczych oraz akredytowanych badaczy AI w instytucjach akademickich, oceniających dokładność i bezpieczeństwo AI w medycynie klinicznej. Firma podkreśla, że możliwości Darwina będą przenoszone do modeli Osler, Sackett i Snow w miarę weryfikacji zabezpieczeń z tymi partnerami.
Metodologia benchmarku
W powiązanym poście technicznym OpenEvidence szczegółowo opisało ustawienia oceny. Dla MedQA firma rozpoczęła od ponownej adnotacji lekarzy benchmarkowego testu składającego się z 1 273 pytań z czterema opcjami odpowiedzi, stosując kryteria wykluczenia dla brakujących informacji, niejasności i błędów etykiet, a następnie przeprowadzając drugą rundę przeglądu w sierpniu 2026 roku przez trzech lekarzy OpenEvidence, obejmujących każde pytanie, na które którykolwiek oceniany model odpowiedział niepoprawnie. W efekcie powstał ostateczny zestaw oceny składający się z 660 pytań, które Darwin odpowiedział bezbłędnie. Firma udostępnia swoje adnotacje oraz pełne odpowiedzi Darwina dla wszystkich czterech benchmarków.
W przypadku MedXpertQA Darwin został oceniony na pełnym podziale Text obejmującym 2 450 pytań, z wyłączeniem podzbioru multimodalnego. Dla HealthBench Professional firma użyła publicznie dostępnego zestawu testowego z wykluczeniem przypadków wieloturnowych, pozostawiając 410 z 525 zadań, a odpowiedzi oceniano przy użyciu konfiguracji LLM‑as‑a‑judge opublikowanej przez Anthropic, wykorzystując Claude Opus 4.8 z maksymalnym budżetem myślenia 32 000 tokenów. NOHARM, benchmark oceniający częstotliwość i nasilenie szkodliwych rekomendacji w rzeczywistych przypadkach konsultacji, został oceniony przy użyciu oficjalnego pakietu open‑source na otwartym podzbiorze 30 przypadków.
Podstawy (baseline) uruchomiono jako claude-fable-5 z adaptacyjnym myśleniem, gpt-5.6-sol przy domyślnym nakładzie rozumowania oraz gemini-3.7-flash przy domyślnym nakładzie rozumowania, korzystając z domyślnych ustawień API każdego dostawcy, bez narzędzi ani spersonalizowanych promptów systemowych. Wyniki HealthBench Professional uśredniono na co najmniej pięciu niezależnych próbach na model, natomiast pozostałe zestawy danych oceniano jednorazowo, podając średnie wyniki w całym opracowaniu.
Zgodnie z postem, wynik Darwina w MedXpertQA przewyższa najsilniejszy baseline o 7,7 punktu, wynik w HealthBench Professional o 12,1 punktu względem kolejnego najlepszego modelu, a ważona wg nasilenia miara F1 w NOHARM osiągnęła 0,872 w porównaniu do 0,740 najbliższego baseline. Firma przyznała, że nieważona precyzja Darwina w NOHARM jest niższa niż w kilku baseline’ach, tłumacząc to tym, że metryka liczy każdą rekomendację nieobecną w rubryce jako fałszywy alarm i że Darwin jest dostrojony, aby dostarczyć lekarzom pełny zestaw istotnych opcji. Firma podała, że ważona wg nasilenia precyzja Darwina wynosi 0,9.
Dostępność i kolejne kroki
Osler, Sackett i Snow są dostępne z nieograniczonym użyciem dla wszystkich zweryfikowanych lekarzy bez żadnych kosztów. Darwin jest dostępny dla badaczy po przejściu procesu aplikacyjnego na stronie firmy.
OpenEvidence zadeklarowało, że będzie kontynuować udoskonalanie, rozszerzanie i zwiększanie dostępu do rodziny modeli w czasie, w tym tworzenie modeli przeznaczonych do praktyk specjalistycznych, zaczynając od onkologii, radiologii i genetyki klinicznej.












