AI-modeller og platforme
Revolutionerende sundhedspleje: En udforskning af Large Language Models’ impact og fremtid i medicin
Integreringen og anvendelsen af store sprogmodeller (LLM’er) i medicin og sundhedspleje har været et emne af betydelig interesse og udvikling.
Som nævnt på Healthcare Information Management and Systems Society’s globale konference og andre bemærkelsesværdige begivenheder, er virksomheder som Google (GOOGL ) i spidsen for at udforske potentialet for generativ AI inden for sundhedspleje. Deres initiativer, såsom Med-PaLM 2, fremhæver den udviklende landskab af AI-drevne sundheds løsninger, især inden for områder som diagnostik, patientpleje og administrativ effektivitet.
Google’s Med-PaLM 2, en pionerende LLM inden for sundhedsområdet, har demonstreret imponerende evner, navnlig ved at opnå et “ekspert”-niveau på US Medical Licensing Examination-lignende spørgsmål. Denne model og andre lignende lover at revolutionere måden, sundhedsprofessionelle får adgang til og anvender information, potentielt forbedrer diagnostisk nøjagtighed og patientpleje-effektivitet.
Men sammen med disse fremskridt er der også blevet rejst bekymringer om praktikabiliteten og sikkerheden af disse teknologier i kliniske sammenhænge. For eksempel kan afhængigheden af omfattende internetdatakilder til modeltræning, mens det kan være nyttigt i visse sammenhænge, ikke altid være passende eller pålideligt til medicinske formål. Som Nigam Shah, PhD, MBBS, Chief Data Scientist for Stanford Health Care, påpeger, er de afgørende spørgsmål at stille omkring modellernes præstation i rigtige medicinske sammenhænge og deres virkelige indvirkning på patientpleje og sundhedspleje-effektivitet.
Dr. Shahs perspektiv understreger behovet for en mere tilpasset tilgang til at anvende LLM’er i medicin. I stedet for generelle modeller, der er trænet på bredt internetdata, foreslår han en mere fokuseret strategi, hvor modellerne er trænet på specifik, relevant medicinsk data. Denne tilgang ligner træning af en medicinsk praktikant – ved at give dem specifikke opgaver, overvåge deres præstation og gradvist give dem mere selvstændighed, når de demonstrerer kompetence.
I overensstemmelse hermed præsenterer udviklingen af Meditron af EPFL-forskere en interessant fremgang i feltet. Meditron, en open-source LLM specifikt tilpasset til medicinske anvendelser, repræsenterer et betydeligt skridt fremad. Trænet på kurateret medicinsk data fra troværdige kilder som PubMed og kliniske retningslinjer, tilbyder Meditron en mere fokuseret og potentielt mere pålidelig værktøj for sundhedsprofessionelle. Dens open-source-natur fremmer ikke kun gennemsigtighed og samarbejde, men tillader også for kontinuerlig forbedring og stresstestning af den bredere forskningskommmunitet.
Udviklingen af værktøjer som Meditron, Med-PaLM 2 og andre afspejler en voksende erkendelse af de unikke krav, som sundhedssektoren stiller til AI-anvendelser. Betoningen af at træne disse modeller på relevant, højkvalitets medicinsk data og sikre deres sikkerhed og pålidelighed i kliniske sammenhænge, er meget afgørende.
Desuden demonstrerer inklusionen af diverse datasæt, såsom dem fra humanitære sammenhænge som Den Internationale Røde Kors-komité, en følsomhed over for de varierede behov og udfordringer i global sundhedspleje. Denne tilgang er i overensstemmelse med den bredere mission for mange AI-forskningscentre, der sigter mod at skabe AI-værktøjer, der ikke kun er teknologisk avancerede, men også socialt ansvarlige og nyttige.
Artiklen “Large language models encode clinical knowledge“, der nylig er offentliggjort i Nature, udforsker, hvordan store sprogmodeller (LLM’er) kan anvendes effektivt i kliniske sammenhænge. Forskningen præsenterer banebrydende indsigt og metoder, der kaster lys over LLM’ernes evner og begrænsninger inden for det medicinske område.
Det medicinske område kendetegnes af sin kompleksitet, med en bred vifte af symptomer, sygdomme og behandlinger, der konstant udvikler sig. LLM’er må ikke kun forstå denne kompleksitet, men også følge med den seneste medicinske viden og retningslinjer.
Kernen i denne forskning drejer sig om en nyt kurateret benchmark kaldet MultiMedQA. Denne benchmark kombinerer seks eksisterende medicinske spørgsmål-svar-datasæt med et nyt datasæt, HealthSearchQA, der består af medicinske spørgsmål, der ofte søges online. Denne omfattende tilgang sigter mod at evaluere LLM’er på tværs af forskellige dimensioner, herunder faktualitet, forståelse, resonnering, mulig skade og bias, og derved adressere begrænsningerne i tidligere automatiserede evalueringer, der afhængigt af begrænsede benchmarks.
Nøgle til studiet er evalueringen af Pathways Language Model (PaLM), en 540-milliard parameter LLM, og dens instruktions-justerede variant, Flan-PaLM, på MultiMedQA. Forbløffende opnår Flan-PaLM state-of-the-art-nøjagtighed på alle multiple-choice-datasæt inden for MultiMedQA, herunder en 67,6% nøjagtighed på MedQA, der består af US Medical Licensing Exam-lignende spørgsmål. Denne præstation markerer en betydelig forbedring i forhold til tidligere modeller, overgående den tidligere state of the art med mere end 17%.
MedQA
Format: spørgsmål og svar (Q + A), multiple choice, åben domæne.
Eksempelspørgsmål: En 65-årig mand med hypertension kommer til lægen for en rutinemæssig sundhedsundersøgelse. Nuverende medicin inkluderer atenolol, lisinopril og atorvastatin. Hans puls er 86 min−1, åndedræt er 18 min−1, og blodtryk er 145/95 mmHg. Hjertefunktionsundersøgelse afslører en diastolisk murmur. Hvad er den mest sandsynlige årsag til denne fysisk undersøgelse?
Svar (korrekt svar i fed): (A) Nedsat compliance af venstre ventrikel, (B) Myxomatøs degeneration af mitralvalven (C) Inflammation af pericardiet (D) Dilatation af aortaroden (E) Tykning af mitralvalvens blade.
Studiet identificerer også kritiske huller i modellens præstation, især i svarene på forbrugermedicinske spørgsmål. For at adressere disse problemer introducerer forskerne en metode kaldet instruktionsprompt-justering. Denne teknik justerer LLM’er effektivt til nye domæner ved hjælp af få eksempler, hvilket resulterer i skabelsen af Med-PaLM. Med-PaLM-modellen, selvom den opviser lovende resultater og viser forbedring i forståelse, viden og resonnering, mangler dog stadig i forhold til kliniske standarder.
En bemærkelsesværdig aspekt af denne forskning er den detaljerede menneskelige evalueringsskema. Dette skema vurderer modellernes svar for overensstemmelse med videnskabelig konsensus og potentiel skadelig udgang. For eksempel var kun 61,9% af Flan-PaLM’s lange svar i overensstemmelse med videnskabelig konsensus, mens denne cifre steg til 92,6% for Med-PaLM, svarende til kliniske standarder. Ligeledes var potentialet for skadelig udgang betydeligt reduceret i Med-PaLM’s svar i forhold til Flan-PaLM.
Menneskelig evaluering af Med-PaLM’s svar fremhævede dens kompetence i flere områder, svarende nært til kliniske standarder. Dette understreger Med-PaLM’s potentiale som et værktøj til støtte i kliniske sammenhænge.
Forskningen, der er diskuteret ovenfor, dykker ned i detaljerne omkring forbedring af Large Language Models (LLM’er) til medicinske anvendelser. Teknikkerne og observationerne fra denne studie kan generaliseres til at forbedre LLM-kapaciteter på tværs af forskellige domæner. Lad os udforske disse nøgleaspekter:
Instruktionsjustering forbedrer præstation
- Generel anvendelse: Instruktionsjustering, der indebærer finjustering af LLM’er med specifikke instruktioner eller retningslinjer, har vist sig at kunne forbedre præstationen betydeligt på tværs af forskellige domæner. Denne teknik kan anvendes i andre felter, såsom juridisk, finansiel eller uddannelsesmæssig, for at forbedre nøjagtigheden og relevansen af LLM-udgang.
Skalering af modellens størrelse
- Broader implikationer: Observationen om, at skalering af modellens størrelse forbedrer præstationen, er ikke begrænset til medicinsk spørgsmål-svar. Større modeller med flere parametre har kapaciteten til at bearbejde og generere mere nuancerede og komplekse svar. Denne skalering kan være nyttig i domæner som kundeservice, kreativ skrivning og teknisk support, hvor nuanceret forståelse og svarsgenerering er afgørende.
Kæde af tanker (COT) promptning
- Anvendelse i diverse domæner: Anvendelsen af COT-promptning, selvom den ikke altid forbedrer præstationen i medicinske datasæt, kan være værdifuld i andre domæner, hvor kompleks problem-løsning er påkrævet. For eksempel i teknisk fejlfinding eller komplekse beslutningssituationer kan COT-promptning guide LLM’er til at bearbejde information trin for trin, hvilket fører til mere præcise og begrundede udgang.
Selv-konsistens for forbedret nøjagtighed
- Broader anvendelse: Teknikken selv-konsistens, hvor flere udgang er genereret og det mest konsistente svar er valgt, kan forbedre præstationen betydeligt i forskellige felter. I domæner som finans eller juridisk, hvor nøjagtighed er afgørende, kan denne metode anvendes til at krydskontrollere de genererede udgang for højere pålidelighed.
Usikkerhed og selektiv prædiktionsudgang
- Anvendelse på tværs af domæner: Kommunikation af usikkerhedsestimater er afgørende i felter, hvor misinformations kan have alvorlige konsekvenser, som sundhedspleje og juridisk. Ved at anvende LLM’ers evne til at udtrykke usikkerhed og selektivt afvise prædiktionsudgang, når tilliden er lav, kan være et afgørende værktøj i disse domæner for at forhindre spredning af ukorrekte oplysninger.
Den reale anvendelse af disse modeller strækker sig ud over at svare på spørgsmål. De kan anvendes til patientundervisning, assistance i diagnostiske processer og endda i træning af medicinske studerende. Men deres implementering skal være omhyggeligt styret for at undgå afhængighed af AI uden ordentlig menneskelig overvågning.
Som medicinsk viden udvikler sig, må LLM’er også tilpasse sig og lære. Dette kræver mekanismer for kontinuerligt læring og opdatering, hvilket sikrer, at modellerne forbliver relevante og nøjagtige over tid.














