Modele și platforme AI

OpenEvidence lansează familia de modele AI medicale cu previzualizarea Darwin

mm
Adaugă Unite.AI la sursele tale preferate pe Google

OpenEvidence a lansat o nouă familie de modele AI medicale pe 3 septembrie 2026, punând la dispoziție gratuit trei modele de producție pentru clinicienii verificaţi şi deschizând un al patrulea, pe care îl descrie ca fiind cel mai avansat, pentru cercetători doar prin aplicaţie.

Cele trei modele de producție poartă numele unor figuri din istoria medicinei. Osler, pe care compania îl descrie ca fiind cel mai rapid model, cu aproximativ cinci secunde per răspuns, este succesorul modelului care anterior alimenta răspunsurile OpenEvidence şi devine implicit pe platformă. Sackett este poziţionat ca un model de căutare mai profund, care necesită aproximativ 30 de secunde per răspuns pentru întrebări ce depind de greutatea dovezilor. Snow, succesorul funcţionalităţii OpenEvidence Deep Consult, este cel mai profund model de producţie, cu aproximativ cinci minute per răspuns, realizând o investigaţie completă a literaturii medicale înainte de a produce un raport.

Modelele sunt implementate pentru toţi utilizatorii OpenEvidence pe openevidence.com şi în aplicaţiile iOS şi Android ale companiei, clinicienii putând selecta dintre ele printr-un selector de modele în interfaţă. OpenEvidence a declarat că fiecare model din familie respectă acelaşi standard de acurateţe clinică, diferenţa dintre ele constând în timpul de gândire al modelului şi adâncimea căutării.

Numele modelelor provin de la William Osler, care a mutat predarea medicală de la sala de curs la patul pacientului; David Sackett, recunoscut ca părintele medicinei bazate pe dovezi; şi John Snow, care a identificat focarul de holeră de pe Broad Street din 1854 la o singură pompă de apă şi a contribuit la fondarea epidemiologiei moderne.

Darwin în previzualizare de cercetare

Al patrulea model, Darwin, se află în previzualizare de cercetare şi nu este lansat în mod general. În anunţul, OpenEvidence descrie Darwin ca fiind cel mai avansat model AI medical din lume şi afirmă că este primul model AI care a obţinut un scor perfect la MedQA, pe care compania îl numeşte principalul benchmark complet independent al AI‑ului medical. Compania raportează, de asemenea, că Darwin este de ultimă generaţie la MedXpertQA cu 72,8 %, la HealthBench Professional cu 82,7 % şi la NOHARM cu 87,2 %, depăşind următoarele modele cele mai bune, pe care le numeşte Claude Fable 5 şi Gemini 3.7.

Accesul se realizează numai prin aplicaţie. OpenEvidence a precizat că raţionamentul său se referă la riscul de utilizare duală: un model care poate raţiona la frontiera virologiei, imunologiei şi geneticii umane ar putea, în mâini greşite, accelera lucrări strict reglementate, cum ar fi cercetarea relevantă pentru arme biologice şi editarea germinativă în afara supravegherii ştiinţifice mainstream. Accesul curent acoperă parteneri instituţionali precum National Organization for Rare Disorders, care aduce lui Darwin cele mai dificile cazuri, colaboratori de cercetare şi cercetători AI acreditaţi din instituţii academice care evaluează acurateţea şi siguranţa AI în medicina clinică. Compania a declarat că capabilităţile lui Darwin vor fi integrate în Osler, Sackett şi Snow pe măsură ce măsurile de siguranţă sunt validate cu aceşti parteneri.

Metodologia de benchmark

În un articol tehnic însoţitor, OpenEvidence a detaliat configurarea evaluării. Pentru MedQA, compania a pornit de la re‑annotările medicilor asupra testului de patru opţiuni cu 1.273 de întrebări şi a aplicat criterii de excludere pentru informaţii lipsă, ambiguitate şi erori de etichetare, urmate de o a doua rundă de revizuire în august 2026 de către trei medici OpenEvidence care au revizuit fiecare întrebare la care orice model evaluat a răspuns incorect. Acest proces a generat un set final de evaluare de 660 de întrebări, la care Darwin a răspuns fără eroare. Compania pune la dispoziţie anotările sale şi răspunsurile complete ale lui Darwin pentru toate cele patru benchmark‑uri.

La MedXpertQA, Darwin a fost evaluat pe setul complet de 2.450 de întrebări din diviziunea Text, excluzând submulţimea multimodală. Pentru HealthBench Professional, compania a folosit setul de testare public disponibil, excluzând cazurile cu multiple interacţiuni, rămânând 410 din cele 525 de sarcini, şi a evaluat răspunsurile cu configuraţia LLM‑ca‑judecător publicată de Anthropic, utilizând Claude Opus 4.8 cu un buget maxim de gândire de 32.000 de tokeni. NOHARM, un benchmark care evaluează frecvenţa şi severitatea recomandărilor dăunătoare în cazuri de consultaţie reale, a fost evaluat cu pachetul său oficial open‑source pe submulţimea deschisă de 30 de cazuri.

Bazele de referinţă au fost rulate ca claude-fable-5 cu gândire adaptivă, gpt-5.6-sol la efortul de raţionament implicit şi gemini-3.7-flash la efortul de raţionament implicit, utilizând setările implicite ale API‑urilor fiecărui furnizor, fără instrumente sau prompturi de sistem personalizate. Scorurile HealthBench Professional au fost mediate peste cel puţin cinci încercări independente pe model, în timp ce celelalte seturi de date au fost evaluate printr‑o singură trecere, cu scorurile medii raportate pe parcurs.

Conform articolului, scorul lui Darwin la MedXpertQA este cu 7,7 puncte peste cel mai puternic benchmark de referinţă, scorul său la HealthBench Professional este cu 12,1 puncte peste următorul model cel mai bun, iar F1‑ul său ponderat pe severitate la NOHARM a atins 0,872 faţă de 0,740 pentru cel mai apropiat benchmark. Compania a recunoscut că precizia neponderată a lui Darwin pe NOHARM este mai mică decât la mai multe benchmark‑uri, explicând că metrica numără fiecare recomandare absentă din rubrică ca fals pozitiv şi că Darwin este reglat să ofere medicilor setul complet de opţiuni relevante. A raportat precizia ponderată pe severitate a lui Darwin ca 0,9.

Disponibilitate și paşii următori

Osler, Sackett şi Snow sunt disponibile cu utilizare nelimitată pentru toţi clinicienii verificaţi, fără costuri. Darwin este disponibil pentru cercetători printr‑un proces de aplicaţie pe site‑ul companiei.

OpenEvidence a declarat că va continua să îmbunătăţească, să extindă şi să crească accesul la familia de modele în timp, inclusiv modele construite pentru practici de specialitate începând cu oncologia, radiologia şi genetica clinică.

Aria Bloom este un jurnalist generat de inteligență artificială care explorează modul în care inteligența artificială transformă biotehnologia și cercetarea genomică. Scrierile sale combină precizia cu o curiozitate profundă despre viitorul științelor vieții. De la biologia sintetică la medicina personalizată, Aria analizează modul în care învățarea automată accelerează inovația în sănătatea umană. Articolele scrise de Aria Bloom sunt generate de inteligență artificială și verificate de echipa editorială Unite.AI pentru acuratețe și conformitate.