AI-modeller og plattformer
Revolusjonering av helsevesenet: Utforsking av innvirkning og fremtid for store språkmodeller i medisin
Integrasjon og anvendelse av store språkmodeller (LLM) i medisin og helsevesen har vært et tema av betydelig interesse og utvikling.
Som notert i Healthcare Information Management and Systems Society global konferanse og andre bemerkelsesverdige hendelser, er selskaper som Google (GOOGL ) i fronten for å utforske potensialet for generativ AI innen helsevesenet. Deres initiativer, som Med-PaLM 2, høydepunkter den evoluerende landskapet av AI-drevne helse løsninger, særlig i områder som diagnostikk, pasientpleie og administrativ effisiens.
Googles Med-PaLM 2, en pioner LLM i helse domenet, har demonstrert imponerende evner, særlig ved å oppnå en “ekspert” nivå i U.S. Medical Licensing Examination-style spørsmål. Denne modellen, og andre lignende, lover å revolusjonere måten helsepersonell får tilgang til og bruker informasjon, potensielt forbedrer diagnostisk nøyaktighet og pasientpleie effisiens.
Likevel, sammen med disse fremgangene, har bekymringer om praktisitet og sikkerhet til disse teknologiene i kliniske settinger blitt reist. For eksempel, avhengighet av omfattende internett datakilder for modell trening, mens nyttig i noen sammenhenger, kan ikke alltid være passende eller pålitelig for medisinske formål. Som Nigam Shah, PhD, MBBS, Chief Data Scientist for Stanford Health Care, påpeker, er de kritiske spørsmålene å spørre om ytelsen til disse modellene i virkelige medisinske settinger og deres faktiske innvirkning på pasientpleie og helse effisiens.
Dr. Shahs perspektiv understreker behovet for en mer tilpasset tilnærming til å bruke LLM i medisin. Istedenfor generelle modeller trent på bredt internett data, foreslår han en mer fokusert strategi hvor modeller er trent på spesifikke, relevante medisinske data. Denne tilnærmingen ligner å trene en medisinsk intern – gi dem spesifikke oppgaver, overvåke deres ytelse og gradvis tillate mer autonomi når de demonstrerer kompetanse.
I linje med dette, presenterer utviklingen av Meditron av EPFL forskere en interessant fremgang i feltet. Meditron, en åpen kildekode LLM spesifikt tilpasset for medisinske anvendelser, representerer et betydelig skritt fremover. Trenet på kurerte medisinske data fra pålitelige kilder som PubMed og kliniske retningslinjer, tilbyr Meditron en mer fokusert og potensielt mer pålitelig verktøy for helsepersonell. Dens åpen kildekode natur fremmer ikke bare transparens og samarbeid, men også kontinuerlig forbedring og stresstesting av den videre forsknings samfunnet.
Utviklingen av verktøy som Meditron, Med-PaLM 2 og andre reflekterer en økende erkjennelse av de unike kravene til helse sektoren når det gjelder AI anvendelser. Betoningen på å trene disse modellene på relevante, høykvalitets medisinske data, og sikre deres sikkerhet og pålitelighet i kliniske settinger, er svært kritisk.
Foruten dette, viser inklusjonen av diverse datasett, som fra humanitære sammenhenger som Den internasjonale Røde Kors komité, en sensitivitet til de varierte behovene og utfordringene i global helse. Denne tilnærmingen er i linje med den bredere misjonen til mange AI forskningssentere, som har som mål å skape AI verktøy som ikke bare er teknologisk avanserte, men også samfunnsansvarlige og nyttige.
Artikkelen “Large language models encode clinical knowledge” nylig publisert i Nature, utforsker hvordan store språkmodeller (LLM) kan bli effektivt anvendt i kliniske settinger. Forskningen presenterer banebrytende innsikter og metoder, og kaster lys over evnene og begrensningene til LLM i det medisinske domenet.
Det medisinske domenet er karakterisert av sin kompleksitet, med en stor mengde symptomer, sykdommer og behandlinger som stadig utvikler seg. LLM må ikke bare forstå denne kompleksiteten, men også holde pace med den siste medisinske kunnskapen og retningslinjene.
Kjernen i denne forskningen dreier seg om en ny kurert benchmark kalt MultiMedQA. Denne benchmarken kombinerer seks eksisterende medisinske spørsmål-svar datasett med et nytt datasett, HealthSearchQA, som består av medisinske spørsmål som ofte søkes på nettet. Denne omfattende tilnærmingen har som mål å evaluere LLM over flere dimensjoner, inkludert faktualitet, forståelse, resonnering, mulig skade og bias, og dermed adresse begrensningene til tidligere automatiserte evalueringer som ble basert på begrensede benchmark.
Nøkkel til studien er evalueringen av Pathways Language Model (PaLM), en 540-milliard parameter LLM, og dens instruksjon-trente variant, Flan-PaLM, på MultiMedQA. Merkbart, Flan-PaLM oppnår state-of-the-art nøyaktighet på alle flervalgsdatasettene innen MultiMedQA, inkludert en 67,6% nøyaktighet på MedQA, som består av US Medical Licensing Exam-style spørsmål. Denne ytelsen markerer en betydelig forbedring over tidligere modeller, og overgår den tidligere state-of-the-art med over 17%.
MedQA
Format: spørsmål og svar (Q + A), flervalg, åpen domene.
Eksempel spørsmål: En 65-årig mann med hypertensjon kommer til legen for en rutinemessig helse undersøkelse. Nåværende medisiner inkluderer atenolol, lisinopril og atorvastatin. Hans puls er 86 min−1, respirasjoner er 18 min−1, og blodtrykk er 145/95 mmHg. Kardiovaskulær undersøkelse avdekker end diastolisk murmur. Hva er den mest sannsynlige årsaken til denne fysiske undersøkelsen?
Svar (korrekt svar i fet skrift): (A) Redusert kompliance av venstre ventrikkelen, (B) Myxomatøs degenerasjon av mitralventilen (C) Inflamasjon av perikardiet (D) Dilatasjon av aortaroten (E) Tykning av mitralventilens blad.
Studien identifiserer også kritiske hull i modellens ytelse, særlig i å svare på forbruker medisinske spørsmål. For å adresse disse problemene, presenterer forskerne en metode kalt instruksjon prompt tuning. Denne teknikken effektivt justerer LLM til nye domener ved å bruke noen få eksempler, og resulterer i skapingen av Med-PaLM. Med-PaLM modellen, selv om den utfører oppmuntrende og viser forbedring i forståelse, kunnskaps gjenskaping og resonnering, mangler likevel sammenlignet med kliniske ekspertise.
En merkbart aspekt av denne forskningen er den detaljerte menneskelig evaluering rammen. Denne rammen vurderer modellens svar for enighet med vitenskapelig konsensus og potensielle skadelige resultater. For eksempel, mens bare 61,9% av Flan-PaLMs lange svar stemmer overens med vitenskapelig konsensus, steg denne figuren til 92,6% for Med-PaLM, sammenlignbar med kliniske genererte svar. Liksom var potensialet for skadelige resultater betydelig redusert i Med-PaLMs svar sammenlignet med Flan-PaLM.
Menneskelig evaluering av Med-PaLMs svar understreket dens kompetanse i flere områder, og stemmer overens med kliniske genererte svar. Dette understreker Med-PaLMs potensiale som et støttende verktøy i kliniske settinger.
Forskningen diskutert ovenfor dykker ned i kompleksiteten til å forbedre store språkmodeller (LLM) for medisinske anvendelser. Teknikkene og observasjonene fra denne studien kan generaliseres til å forbedre LLM evner over flere domener. La oss utforske disse nøkkel aspektene:
Instruksjonstuning forbedrer ytelse
- Generalisert anvendelse: Instruksjonstuning, som innebærer finjustering av LLM med spesifikke instruksjoner eller retningslinjer, har vist seg å signifikant forbedre ytelse over flere domener. Denne teknikken kan bli anvendt i andre felt som juridisk, finansiell eller utdannings domener for å forbedre nøyaktigheten og relevansen av LLM utdata.
Skalering av modell størrelse
- Bredere implikasjoner: Observasjonen at skalering av modell størrelse forbedrer ytelse, er ikke begrenset til medisinske spørsmål-svar. Større modeller, med flere parametre, har kapasiteten til å prosessere og generere mer nyanserte og komplekse svar. Denne skaleringen kan være nyttig i domener som kundeservice, kreativ skriving og teknisk support, hvor nyansert forståelse og svar generering er kritisk.
Kjede av tanke (COT) prompting
- Anvendelse i diverse domener: Anvendelsen av COT prompting, selv om den ikke alltid forbedrer ytelse i medisinske datasett, kan være verdifull i andre domener hvor kompleks problem løsning er nødvendig. For eksempel, i teknisk feilsøking eller komplekse beslutnings scenarier, kan COT prompting guide LLM til å prosessere informasjon trinnvis, og føre til mer nøyaktige og begrunnete utdata.
Selv-konsistens for forbedret nøyaktighet
- Bredere anvendelser: Teknikken selv-konsistens, hvor flere utdata genereres og det mest konsistente svaret velges, kan signifikant forbedre ytelse i flere domener. I domener som finansiell eller juridisk hvor nøyaktighet er av største betydning, kan denne metoden bli anvendt for å kryss-verifisere de genererte utdata for høyere pålitelighet.
Usikkerhet og selektiv prediksjon
- Anvendelse over flere domener: Kommunikasjon av usikkerhets estimeringer er kritisk i domener hvor feilinformasjon kan ha alvorlige konsekvenser, som helse og jus. Anvendelse av LLMs evne til å uttrykke usikkerhet og selektivt avvise prediksjoner når konfidensen er lav, kan være et kritisk verktøy i disse domenene for å forhindre spredning av feil informasjon.
Den virkelige anvendelsen av disse modellene strekker seg langt utenfor å svare på spørsmål. De kan bli anvendt i pasient utdanning, å assistere i diagnostiske prosesser og sogar i å trene medisinske studenter. Likevel, deres utrulling må bli styrt for å unngå avhengighet av AI uten tilstrekkelig menneskelig tilsyn.
Så lenge medisinsk kunnskap utvikler seg, må LLM også tilpasse seg og lære. Dette krever mekanismer for kontinuerlig læring og oppdatering, og sikrer at modellene forblir relevante og nøyaktige over tid.














