AI-mallit ja alustat

OpenEvidence julkaisee lääketieteellisen tekoälymalliperheen Darwin-esikatselun

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

OpenEvidence julkaisi uuden lääketieteellisten tekoälyhakumallien perheen 3. syyskuuta 2026, tehden kolme tuotantomallia saataville ilmaiseksi vahvistetuille kliinisille käyttäjille ja avaten neljännen, jonka se kuvaa edistyneimmäkseen, tutkijoille vain hakemuksen perusteella.

Kolme tuotantomallia on nimetty lääketieteen historian henkilöiden mukaan. Osler, jonka yritys kuvaa nopeimmaksi mallikseen noin viiden sekunnin vastausajalla, on edellisen OpenEvidence‑vastausmallin seuraaja ja siitä tulee alustan oletusmalli. Sackett on syvempi hakumalli, jonka vastausaika on noin 30 sekuntia kysymyksille, joiden ratkaisu riippuu todisteiden painosta. Snow, OpenEvidence Deep Consult -ominaisuuden seuraaja, on syvin tuotantomalli, jonka vastausaika on noin viisi minuuttia; se suorittaa täydellisen lääketieteellisen kirjallisuuden tutkimuksen ennen raportin tuottamista.

Mallit otetaan käyttöön kaikille OpenEvidence‑käyttäjille openevidence.com -sivustolla sekä yrityksen iOS‑ ja Android‑sovelluksissa, ja kliiniset käyttäjät voivat valita niitä käyttöliittymän mallivalitsimen kautta. OpenEvidence kertoi, että jokainen perheen malli noudattaa samaa kliinisen tarkkuuden tasoa, ja niiden välinen ero on mallin ajankäyttö ja hakun syvyys.

Nimihenkilöt ovat William Osler, joka siirsi lääketieteellisen opetuksen luentosalista potilasvuoteelle; David Sackett, jota muistetaan todisteisiin perustuvan lääketieteen isänä; ja John Snow, joka jäljitti vuoden 1854 Broad Streetin koleraepidemian yhteen vesipumppuun ja auttoi perustamaan modernin epidemiologian.

Darwin tutkimusesikatselussa

Neljäs malli, Darwin, on tutkimusesikatselussa eikä sitä julkaista yleisesti. Ilmoituksessa OpenEvidence kuvaa Darwinia maailman edistyneimmäksi lääketieteelliseksi tekoälymalliksi ja toteaa sen olevan ensimmäinen tekoälymalli, joka saavutti täydet pisteet MedQA:ssa, jonka yritys määrittelee johtavaksi täysin riippumattomaksi lääketieteellisen tekoälyn vertailuarvoksi. Yritys raportoi myös, että Darwin on huipputasolla MedXpertQA:ssa 72,8 prosentilla, HealthBench Professionalissa 82,7 prosentilla ja NOHARMissa 87,2 prosentilla, ylittäen seuraavaksi parhaiten sijoittuvat mallit, jotka nimetään Claude Fable 5:ksi ja Gemini 3.7:ksi.

Pääsy on mahdollista vain hakemuksen kautta. OpenEvidence kertoi, että sen perustelu liittyy kaksinkertaiseen käyttöriskiin: malli, joka pystyy päättelyyn virologian, immunologian ja ihmisen genetiikan rajoilla, voisi väärissä käsissä nopeuttaa tiukasti säänneltyä toimintaa, kuten biologisten aseiden tutkimusta ja kantasolujen muokkausta ilman valtavirran tieteellistä valvontaa. Nykyinen pääsy kattaa institutionaaliset kumppanit, kuten National Organization for Rare Disorders, joka tuo Darwiniin sen vaikeimmat tapaukset, tutkimusyhteistyökumppanit sekä akateemisissa laitoksissa toimivat akkreditoidut tekoälytutkijat, jotka vertailevat tekoälyn tarkkuutta ja turvallisuutta kliinisessä lääketieteessä. Yritys sanoi, että Darwiniin liittyvät ominaisuudet siirtyvät Osleriin, Sackettiin ja Snow’hun, kun sen turvatoimet vahvistetaan näiden kumppaneiden kanssa.

Vertailumenetelmä

Liitännäisessä teknisessä julkaisussa OpenEvidence kuvaili arviointiasetelman. MedQA:n osalta yritys aloitti lääkärien uudelleentunnistuksista, jotka koskivat vertailun 1 273 kysymyksen nelivalintakokeen ja sovelsi poissulkemiskriteerejä puuttuvan tiedon, epäselvyyden ja merkintävirheiden osalta, jonka jälkeen tehtiin toinen tarkistuspassi elokuussa 2026 kolmen OpenEvidence‑lääkärin toimesta, jotka kattoivat jokaisen kysymyksen, jonka mikä tahansa arvioitu malli vastasi virheellisesti. Tämä tuotti lopullisen arviointijoukon, jossa oli 660 kysymystä, joihin Darwin vastasi virheettömästi. Yritys julkaisee annotaationsa ja Darwini täydelliset vastaukset kaikille neljälle vertailuarvolle.

MedXpertQA:ssa Darwin arvioitiin koko 2 450 kysymyksen Text‑osassa, poissulkien multimodaalisen alajoukon. HealthBench Professional -osalta yritys käytti julkisesti saatavilla olevaa testijoukkoa, josta monivaiheiset tapaukset on poistettu, jättäen 410 tehtävää 525:stä, ja arvioi vastaukset Anthropicin julkaisemalla LLM‑as‑a‑judge‑konfiguraatiolla käyttäen Claude Opus 4.8:aa, jonka maksimipohjainen ajatusbudjetti on 32 000 tokenia. NOHARM, vertailu, joka mittaa haitallisten suositusten esiintymistiheyttä ja vakavuutta todellisissa konsultointitapauksissa, arvioitiin sen virallisella avoimen lähdekoodin paketilla 30‑tapaus‑avoinnassa alajoukossa.

Vertailuperusteet ajettiin mallien claude-fable-5 (adaptiivinen ajattelu), gpt-5.6-sol (oletus päättelyponnistus) ja gemini-3.7-flash (oletus päättelyponnistus) avulla, käyttäen kunkin tarjoajan API‑oletuksia ilman työkaluja tai räätälöityjä järjestelmäkehotteita. HealthBench Professional -pisteet keskiarvoiltiin vähintään viidellä itsenäisellä kokeella per malli, kun taas muut aineistot pisteytettiin yhdellä läpikäynnillä, ja keskiarvopisteet raportoitiin koko ajan.

Julkaisun mukaan Darwini MedXpertQA‑pisteet ovat 7,7 pistettä vahvemman vertailuperusteen yläpuolella, sen HealthBench Professional -pisteet 12,1 pistettä seuraavaksi parhaan mallin yläpuolella, ja sen NOHARM‑vakavuuspainotettu F1‑arvo oli 0,872 verrattuna 0,740:een lähimmän vertailuperusteen osalta. Yritys myönsi, että Darwini painottamaton tarkkuus NOHARMissa on alhaisempi kuin useilla vertailuperusteilla, selittäen että mittari laskee jokaisen puuttuvan suosituksen rubriikista vääräksi positiiviseksi ja että Darwin on viritetty antamaan lääkäreille täydellinen joukko asiaankuuluvia vaihtoehtoja. Se raportoi Darwini vakavuuspainotetun tarkkuuden olevan 0,9.

Saatavuus ja seuraavat askeleet

Osler, Sackett ja Snow ovat saatavilla rajoittamattomalla käytöllä kaikille vahvistetuille kliinisille käyttäjille ilmaiseksi. Darwin on saatavilla tutkijoille yrityksen sivuston hakuprosessin kautta.

OpenEvidence ilmoitti jatkavansa perhemallien parantamista, laajentamista ja käyttömahdollisuuksien lisäämistä ajan myötä, mukaan lukien erikoisalojen, kuten onkologia, radiologia ja kliininen genetiikka, tarpeisiin rakennettavat mallit.

Aria Bloom on tekoälygeneroiva journalisti, joka tutkii, miten tekoäly muuttaa biotekniikkaa ja genomiikkaa. Hänen kirjoittelussaan yhdistyvät tarkkuus ja syvä uteliaisuus elämän tieteiden tulevaisuudesta.
Hän analysoi, miten koneoppiminen kiihdyttää ihmisen terveyden innovaatioita synthetic biologiasta henkilökohtaiseen lääkehoitoon.
Artikkelit, joita Aria Bloom on kirjoittanut, ovat tekoälygeneroituja ja Unite.AI:n toimittajatiimi tarkistaa ne tarkkuuden ja mukaisuuden varmistamiseksi.