AI-mallit ja alustat

Terveydenhuollon vallankumous: Tutkimalla Large Language Modelien vaikutusta ja tulevaisuutta lääketieteessä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Large Language Modelien (LLM) integrointi ja soveltaminen lääketieteessä ja terveydenhuollossa on ollut merkittävän kiinnostuksen ja kehityksen aihe.

Kuten mainittiin Terveydenhuollon tietohallinto- ja järjestelmäkonferenssissa ja muissa merkittävissä tapahtumissa, yritykset kuten Google (GOOGL ) johtavat tutkimusta LLM:n mahdollisuuksista terveydenhuollossa. Heidän aloitteensa, kuten Med-PaLM 2, korostavat terveydenhuollon ratkaisujen kehitystä, erityisesti diagnostiikassa, potilashuollossa ja hallinnollisessa tehokkuudessa.

Google:n Med-PaLM 2 on uraauurtava LLM terveydenhuollon alalla, joka on osoittanut vaikuttavia kykyjä, erityisesti saavuttamalla “asiantuntija”-tason Yhdysvaltain lääkärin lupausten tyyppisissä kysymyksissä. Tämä malli ja muut samanlaiset lupaavat vallankumouksellisen muutoksen terveydenhuollon ammattilaisten tiedon käyttöön ja hyödyntämiseen, mahdollisesti parantamalla diagnostiikkaa ja potilashuoltoa.

Kuitenkin näiden edistysten rinnalla on herännyt huolenaiheita näiden teknologioiden käytännöllisyydestä ja turvallisuudesta terveydenhuollon käytännössä. Esimerkiksi riippuvuus laajoista internet-lähteistä mallien koulutuksessa voi olla hyödyllistä joissakin yhteyksissä, mutta ei aina sovelleta lääketieteellisiin tarkoituksiin. Nigam Shah, PhD, MBBS, Stanfordin terveydenhuollon tietohallinnon johtaja, korostaa, että avainkysymykset liittyvät näiden mallien suorituskykyyn todellisissa lääketieteellisissä ympäristöissä ja niiden vaikutukseen potilashuoltoon ja terveydenhuollon tehokkuuteen.

Tohtori Shahin näkökulma korostaa tarvetta räätälöidylle lähestymistavalle LLM:n käytölle lääketieteessä. Sen sijaan, että yleiskäyttöisiä malleja koulutetaan laajoihin internet-lähteisiin, hän ehdottaa tarkemmin kohdennettua strategiaa, jossa mallit koulutetaan tiettyihin, relevantteihin lääketieteellisiin tietoihin. Tämä lähestymistapa muistuttaa lääketieteellisen harjoittelijan koulutusta – heille annetaan tiettyjä tehtäviä, heidän suorituskykyään valvotaan ja heille annetaan vähitellen enemmän itsenäisyyttä, kun he osoittavat kykynsä.

Tämän linjan mukaisesti EPFL-tutkijoiden kehittämä Meditron edustaa mielenkiintoista edistystä alalla. Meditron, avoimen lähdekoodin LLM, joka on erityisesti suunniteltu lääketieteellisiin sovelluksiin, edustaa merkittävää askelta eteenpäin. Koulutettuna valikoituihin lääketieteellisiin tietoihin luotettavista lähteistä kuten PubMedista ja kliinisistä ohjeista, Meditron tarjoaa tarkemmin kohdennetun ja mahdollisesti luotettavamman työkalun lääkäreille. Sen avoimen lähdekoodin luonne edistää avoimuutta ja yhteistyötä ja sallii jatkuvan parantamisen ja testaamisen laajemman tutkimusyhteisön toimesta.

MEDITRON-70B-achieves-an-accuracy-of-70.2-on-USMLE-style-questions-in-the-MedQA-4-options-dataset

MEDITRON-70B-achieves-an-accuracy-of-70.2-on-USMLE-style-questions-in-the-MedQA-4-options-dataset

Työkalujen kuten Meditronin, Med-PaLM 2:n ja muiden kehittäminen heijastaa kasvavaa tunnistamista terveydenhuollon erityistarpeista, kun on kyse AI-sovelluksista. Korostaminen näiden mallien koulutuksesta relevanttiin, laadukkaaseen lääketieteelliseen tietoon ja turvallisuuteen ja luotettavuuteen kliinisissä ympäristöissä on erittäin tärkeää.

Lisäksi monipuolisten tietojoukkojen, kuten humanitaaristen ympäristöjen kuten Kansainvälisen Punaisen Ristin tietojen, käyttäminen osoittaa herkkyyttä globaalin terveydenhuollon moninaisiin tarpeisiin ja haasteisiin. Tämä lähestymistapa on linjassa useiden AI-tutkimuskeskuksien laajemman tehtävän kanssa, joiden tavoitteena on luoda AI-työkaluja, jotka eivät ole vain teknologisesti edistyneitä, vaan myös sosiaalisesti vastuullisia ja hyödyllisiä.

Viimeaikaisessa Nature-lehdessä julkaistussa tutkimuksessa “Large language models encode clinical knowledge” tarkastellaan, miten suuria kielen malleja voidaan käyttää tehokkaasti kliinisissä ympäristöissä. Tutkimus esittää uraauurtavia näkemyksiä ja menetelmiä, jotka valottavat LLM:n kykyjä ja rajoituksia lääketieteellisessä alalla.

Lääketieteellinen ala on monimutkainen, ja siinä on laaja valikoima oireita, sairauksia ja hoitotoimenpiteitä, jotka kehittyvät jatkuvasti. LLM:n on kyettävä ymmärtämään tämä monimutkaisuus ja pysymään ajan tasalla viimeisimmän lääketieteellisen tiedon ja ohjeiden kanssa.

Tutkimuksen ydin keskittyy uuteen, kokoamaamme lääketieteelliseen kysymys-vastaus-benchmarkiin nimeltä MultiMedQA. Tämä benchmark yhdistää kuusi olemassa olevaa lääketieteellistä kysymys-vastaus-tietojoukkoa uuden HealthSearchQA-tietojoukon, joka koostuu lääketieteellisistä kysymyksistä, jotka ovat usein etsittyjä verkossa. Tämä kattava lähestymistapa pyrkii arvioimaan LLM:n useiden ulottuvuuksien, mukaan lukien faktualisuus, ymmärrys, päättely, mahdollinen haitta ja harha, ja siten osoittamaan aiempien automaattisten arvioiden rajoituksia, jotka perustuivat rajoitettuihin benchmark-ohjelmiin.

MultiMedQA, a benchmark for answering medical questions spanning medical exam

MultiMedQA, a benchmark for answering medical questions spanning medical exam

Tutkimuksen keskeinen osa on Pathways Language Modelin (PaLM) arviointi, 540-miljardin parametrin LLM, ja sen ohjeistuksen mukainen variantti, Flan-PaLM, MultiMedQA-benchmarkissa. Merkittävästi Flan-PaLM saavuttaa huipputason tarkin MultiMedQA:n monivalintadataseteissa, mukaan lukien 67,6 prosentin tarkin MedQA:ssa, joka koostuu Yhdysvaltain lääkärin lupausten tyyppisistä kysymyksistä. Tämä suorituskyky merkitsee merkittävää parannusta aiempiin malleihin verrattuna, ylittäen aiemman huipputason yli 17 prosentilla.

MedQA

MedQA-tietojoukko sisältää kysymyksiä, jotka on muotoiltu Yhdysvaltain lääkärin lupausten tyyppisiksi, ja niissä on neljä tai viisi vastausvaihtoehtoa. Se sisältää kehitysaineiston, jossa on 11 450 kysymystä, ja testijoukon, jossa on 1 273 kysymystä.

Format: question and answer (Q + A), multiple choice, open domain.

Esimerkkikysymys: 65-vuotias mies, jolla on verenpainetauti, tulee lääkärin luo terveydenhuollon ylläpitämistarkastukseen. Hänellä on parhaillaan atenololia, lisinopriilia ja atorvastatia. Hänen syketaajuutensa on 86 minuutin kohti, hengitystiheys on 18 minuutin kohti, ja verenpaine on 145/95 mmHg. Sydämen tutkiminen paljastaa loppudiastolisen murinan. Mikä seuraavista on todennäköisin syy tälle fyysiseen tutkimukseen?

Vastaukset (oikea vastaus lihavoituna): (A) Vasemman ventrikelin vasteen lasku, (B) Mitralkappaleen myksomatoottinen degeneraatio (C) Perikardiumin tulehdus (D) Aortan laajentuma (E) Mitralkappaleen lehtien paksuntuminen.

Tutkimus tunnistaa myös kriittiset aukot mallin suorituskyvyssä, erityisesti kuluttajien lääketieteellisten kysymysten vastaamisessa. Tätä varten tutkijat esittävät menetelmän, jota kutsutaan ohjeistus-ohjelmointitunnisteeksi. Tämä tekniikka kohdistaa LLM:t tehokkaasti uusiin aloihin muutamilla esimerkeillä, mikä johtaa Med-PaLM-mallin luomiseen. Med-PaLM-malli, vaikka se suorittaa lupaavasti ja osoittaa parannusta ymmärryksessä, tiedon muistamisessa ja päättelyssä, ei kuitenkaan ole yhtä hyvä kuin lääkärit.

Tutkimuksen merkittävä piirre on yksityiskohtainen ihmisen arviointirunko. Tämä arviointirunko arvioi mallien vastauksia tieteellisen konsensuksen mukaan ja mahdollisten haitallisten seurausten mukaan. Esimerkiksi vain 61,9 prosenttia Flan-PaLM:n pitkistä vastauksista oli yhtäpitävää tieteellisen konsensuksen kanssa, mutta tämä luku nousi 92,6 prosenttiin Med-PaLM:ssa, joka on vertailukelpoinen lääkärien antamiin vastauksiin. Samoin Med-PaLM:n vastausten mahdollinen haitallinen vaikutus oli merkittävästi vähäisempi verrattuna Flan-PaLM:iin.

Med-PaLM:n vastausten ihmisen arviointi korosti sen osaamista useilla alueilla, jotka ovat läheisessä yhteydessä lääkärien antamiin vastauksiin. Tämä korostaa Med-PaLM:n potentiaalia tukevana työkaluna kliinisissä ympäristöissä.

Tutkimus, josta on keskusteltu yllä, tutkii syvällisemmin suurten kielen mallien parantamista lääketieteellisiin sovelluksiin. Tutkimuksen havainnot ja menetelmät voidaan yleistää parantamaan LLM:n kykyjä eri aloilla. Tutustumme nyt näihin avainasioihin:

Ohjelmointitunniste parantaa suorituskykyä

  • Yleinen soveltaminen: Ohjelmointitunniste, joka sisältää LLM:n hienosäätöä tiettyjen ohjeiden tai oppaiden mukaan, on osoittanut parantavan merkittävästi suorituskykyä eri aloilla. Tätä tekniikkaa voidaan soveltaa muihin aloihin, kuten oikeudelliseen, taloudelliseen tai koulutukselliseen, parantamaan LLM:n tulosten tarkin ja relevantin.

Mallin kokoon suuretus

  • Laajemmat vaikutukset: Havainto, että mallin kokoon suuretus parantaa suorituskykyä, ei rajoitu lääketieteelliseen kysymys-vastausmalliin. Suuremmat mallit, joissa on enemmän parametreja, pystyvät prosessoimaan ja generoimaan monimutkaisempia ja hienostuneempia vastauksia. Tämä suuretus voi olla hyödyllistä aloilla, kuten asiakaspalvelussa, luovan kirjoittamisen ja teknisen tuen alalla, joissa nuanssillinen ymmärrys ja vastausten generointi ovat tärkeitä.

Ajatuksen ketju (COT) -ohjelmointi

  • Eri alojen soveltaminen: Ajatuksen ketju -ohjelmointia, vaikka se ei aina paranna suorituskykyä lääketieteellisissä tietojoukoissa, voidaan hyödyntää muilla aloilla, joissa monimutkainen ongelmanratkaisu vaaditaan. Esimerkiksi teknisessä vianmäärityksessä tai monimutkaisissa päätöksenteossa ajatuksen ketju -ohjelmointi voi ohjata LLM:iä prosessoimaan tietoa askel kerrallaan, johtaen tarkempiin ja perustellumpiin tuloksiin.

Itsenäisyys parantaa tarkin

  • Laajemmat soveltamiset: Itsenäisyyden tekniikka, jossa useita tuloksia generoidaan ja valitaan eniten yhdenmukainen vastaus, voidaan parantaa suorituskykyä eri aloilla. Rahoituksen ja oikeudellisen alan kaltaisilla aloilla, joilla tarkkuus on olennainen, tätä menetelmää voidaan käyttää tulosten cross-verifiointiin suuremman luotettavuuden saavuttamiseksi.

Epilemä ja valikoiva ennustaminen

  • Eri alojen relevanttiys: Epätarkkuuden ilmoittaminen on tärkeää aloilla, joilla virheellinen tieto voi johtaa vakaviin seuraamuksiin, kuten terveydenhuollossa ja oikeudessa. LLM:n kyky ilmoittaa epätarkkuus ja valikoivasti jättää ennustaminen, kun luottamus on alhainen, voidaan olla tärkeä työkalu näillä aloilla estämään virheellisen tiedon leviäminen.

Näiden mallien käytännön soveltaminen ulottuu laajasti kysymysten vastaamisen ulkopuolelle. Niitä voidaan käyttää potilashuollossa, diagnostiikassa ja jopa lääketieteen opiskelijoiden koulutuksessa. Niiden käyttöön on kuitenkin otettava huomioon asianmukainen valvonta, jotta voidaan välttää riippuvuus AI:sta ilman asianmukaista ihmisten valvontaa.

Terveydenhuollon tietämyksen kehittyessä myös LLM:t on sopeutettava ja opittava. Tämä edellyttää jatkuvan oppimisen ja päivittämisen mekanismeja, jotta mallit säilyttävät merkityksensä ja tarkin ajan mittaan.

Olen viettänyt viimeiset viisi vuotta uppoutumalla kiinnostavaan koneoppimisen ja syvän oppimisen maailmaan. Minun intohimoni ja asiantuntemukseni ovat johtaneet minun osallistumiseen yli 50:een monipuoliseen ohjelmistosuunnitteluhankkeeseen, joissa on erityisesti painottunut AI/ML. Minun jatkuva uteliaisuuteni on myös ohjannut minun luontaisen kielen prosessoinnin pariin, jota haluan tutkia tarkemmin.