AI-modeller och plattformar
Revolutionerar hälsovården: Utforskar påverkan och framtid för stora språkmodeller inom medicin
Integrering och tillämpning av stora språkmodeller (LLM) inom medicin och hälsovård har varit ett ämne av betydande intresse och utveckling.
Som noterats i Healthcare Information Management and Systems Society global konferens och andra noterbara evenemang, företag som Google (GOOGL ) leder vägen i att utforska potentialen för generativ AI inom hälsovården. Deras initiativ, som Med-PaLM 2, belyser den utvecklande landskapsbilden av AI-drivna hälsovårdslösningar, särskilt inom områden som diagnostik, patientvård och administrativ effektivitet.
Googles Med-PaLM 2, en banbrytande LLM inom hälsovårdsområdet, har visat imponerande förmågor, särskilt genom att uppnå en “expertnivå” på frågor i stil med US Medical Licensing Examination. Denna modell, och andra liknande, lovar att revolutionera sättet hälsovårdspersonal får tillgång till och använder information, potentiellt förbättrande diagnostisk noggrannhet och patientvårdseffektivitet.
Men tillsammans med dessa framsteg, har farhågor om praktiskheten och säkerheten för dessa teknologier i kliniska miljöer väckts. Till exempel, beroendet av omfattande internetdatakällor för modellträning, medan det kan vara fördelaktigt i vissa sammanhang, kan inte alltid vara lämpligt eller tillförlitligt för medicinska ändamål. Som Nigam Shah, PhD, MBBS, Chief Data Scientist för Stanford Health Care, påpekar, är de avgörande frågorna att ställa om prestationen av dessa modeller i verkliga medicinska miljöer och deras faktiska inverkan på patientvård och hälsovårdseffektivitet.
Dr. Shahs perspektiv understryker behovet av en mer anpassad strategi för att använda LLM inom medicin. Istället för allmänna modeller tränade på breda internetdata, föreslår han en mer fokuserad strategi där modeller tränas på specifika, relevanta medicinska data. Denna strategi liknar utbildning av en medicinsk praktikant – ge dem specifika uppgifter, övervaka deras prestation och långsamt tillåta mer autonomi när de visar kompetens.
I linje med detta presenterar utvecklingen av Meditron av EPFL-forskare en intressant framsteg inom området. Meditron, en öppen källkods-LLM specifikt utformad för medicinska tillämpningar, representerar ett betydande steg framåt. Tränad på kuraterad medicinsk data från trovärdiga källor som PubMed och kliniska riktlinjer, erbjuder Meditron ett mer fokuserat och potentiellt mer tillförlitligt verktyg för hälsovårdspersonal. Dess öppna källkods-natur främjar inte bara transparens och samarbete, utan möjliggör också kontinuerlig förbättring och stress-testning av den bredare forskarsamhället.
Utvecklingen av verktyg som Meditron, Med-PaLM 2 och andra speglar en växande erkänsla av de unika kraven inom hälsovårdssektorn när det gäller AI-tillämpningar. Betonandet av att träna dessa modeller på relevanta, högkvalitativa medicinska data och säkerställa deras säkerhet och tillförlitlighet i kliniska miljöer är mycket viktigt.
Dessutom visar inkluderingen av diversifierade dataset, som de från humanitära sammanhang som Internationella Röda Korset, en känslighet för de varierande behoven och utmaningarna inom global hälsovård. Denna strategi överensstämmer med den bredare missionen för många AI-forskningscenter, som syftar till att skapa AI-verktyg som inte bara är tekniskt avancerade, utan också socialt ansvariga och fördelaktiga.
Den nyligen publicerade artikeln “Large language models encode clinical knowledge” i Nature, utforskar hur stora språkmodeller (LLM) kan användas effektivt i kliniska miljöer. Forskningen presenterar banbrytande insikter och metoder, som kastar ljus över förmågor och begränsningar av LLM inom det medicinska området.
Det medicinska området kännetecknas av sin komplexitet, med en stor mängd symtom, sjukdomar och behandlingar som ständigt utvecklas. LLM måste inte bara förstå denna komplexitet, utan också hålla jämna steg med den senaste medicinska kunskapen och riktlinjerna.
Kärnan i denna forskning kretsar kring en ny kuraterad benchmark kallad MultiMedQA. Denna benchmark kombinerar sex befintliga medicinska frågesvarsdataset med ett nytt dataset, HealthSearchQA, som består av medicinska frågor som ofta söks online. Detta omfattande tillvägagångssätt syftar till att utvärdera LLM över olika dimensioner, inklusive fakticitet, förståelse, resonemang, möjlig skada och bias, och därmed adresserar begränsningarna i tidigare automatiserade utvärderingar som förlitade sig på begränsade benchmark.
Nyckeln till studien är utvärderingen av Pathways Language Model (PaLM), en 540-miljarders parameter LLM, och dess instruktions-tunade variant, Flan-PaLM, på MultiMedQA. Förbluffande nog uppnår Flan-PaLM state-of-the-art noggrannhet på alla multiple-choice dataset inom MultiMedQA, inklusive en 67,6% noggrannhet på MedQA, som består av US Medical Licensing Exam-stil frågor. Denna prestation markerar en betydande förbättring jämfört med tidigare modeller, överträffande den tidigare state-of-the-art med mer än 17%.
MedQA
Format: fråga och svar (Q + A), multiple choice, öppet område.
Exempelfråga: En 65-årig man med hypertension kommer till läkaren för en rutinmässig hälsokontroll. Nuvarande mediciner inkluderar atenolol, lisinopril och atorvastatin. Hans puls är 86 min−1, andning är 18 min−1 och blodtryck är 145/95 mmHg. Kardiovaskulär undersökning visar en diastolisk murmel. Vilken av följande är den mest sannolika orsaken till denna fysiska undersökning?
Svar (korrekt svar i fetstil): (A) Minskad kompliance av vänster ventrikel, (B) Myxomatös degenerering av mitralventilen (C) Inflammation av perikardiet (D) Dilatation av aortroten (E) Förtjockning av mitralventilens blad.
Studien identifierar också kritiska luckor i modellens prestation, särskilt när det gäller att besvara konsumenternas medicinska frågor. För att adressera dessa problem introducerar forskarna en metod kallad instruktionsprompt-tuning. Denna teknik effektivt anpassar LLM till nya domäner med hjälp av några exempel, vilket resulterar i skapandet av Med-PaLM. Med-PaLM-modellen, trots att den presterar uppmuntrande och visar förbättring i förståelse, kunskapsåterkallande och resonemang, faller fortfarande kort jämfört med kliniker.
En anmärkningsvärd aspekt av denna forskning är den detaljerade mänskliga utvärderingsramen. Denna ram utvärderar modellernas svar för överensstämmelse med vetenskaplig konsensus och potentiella skadliga resultat. Till exempel, medan endast 61,9% av Flan-PaLM:s långformsvar överensstämde med vetenskaplig konsensus, steg denna siffra till 92,6% för Med-PaLM, jämförbar med kliniker-genererade svar. Likaså minskades potentialen för skadliga resultat avsevärt i Med-PaLM:s svar jämfört med Flan-PaLM.
Den mänskliga utvärderingen av Med-PaLM:s svar belyste dess kompetens inom flera områden, i nära överensstämmelse med kliniker-genererade svar. Detta understryker Med-PaLM:s potential som ett stödverktyg i kliniska miljöer.
Forskningen som diskuteras ovan gräver djupt i förbättringen av stora språkmodeller (LLM) för medicinska tillämpningar. Teknikerna och observationerna från denna studie kan generaliseras för att förbättra LLM-förmågor över olika domäner. Låt oss utforska dessa nyckelaspekter:
Instruktionsjustering förbättrar prestanda
- Generell tillämpning: Instruktionsjustering, som innebär finjustering av LLM med specifika instruktioner eller riktlinjer, har visat sig förbättra prestanda avsevärt över olika domäner. Denna teknik kan tillämpas på andra områden som juridik, finansiella eller utbildningsdomäner för att förbättra noggrannheten och relevansen av LLM-utdata.
Skalning av modellstorlek
- Större implikationer: Observationen att skalning av modellstorlek förbättrar prestanda är inte begränsad till medicinska frågesvar. Större modeller, med fler parametrar, har kapacitet att bearbeta och generera mer nyanserade och komplexa svar. Denna skalning kan vara fördelaktig i domäner som kundtjänst, kreativt skrivande och tekniskt stöd, där nyanserad förståelse och svarsgenerering är avgörande.
Kedja av tankar (COT) framkallande
- Varierande domäntillämpningar: Användningen av COT-framkallande, även om den inte alltid förbättrar prestanda i medicinska dataset, kan vara värdefull i andra domäner där komplex problemlösning krävs. Till exempel i teknisk felsökning eller komplex beslutsfattning, kan COT-framkallande vägleda LLM att bearbeta information steg för steg, vilket leder till mer precisa och resonliga utdata.
Självkonsekvens för förbättrad noggrannhet
- Större tillämpningar: Tekniken för självkonsekvens, där flera utdata genereras och det mest konsekventa svaret väljs, kan förbättra prestanda avsevärt i olika fält. I domäner som finansiella eller juridiska, där noggrannhet är av yttersta vikt, kan denna metod användas för att korsverifiera de genererade utdata för högre tillförlitlighet.
Ovisshet och selektiv förutsägelse
- Korsdomäntillämpning: Kommunikation av osäkerhetsuppskattningar är avgörande i fält där felinformation kan ha allvarliga konsekvenser, som hälsovård och juridik. Användning av LLM:s förmåga att uttrycka osäkerhet och selektivt avstå från förutsägelser när förtroendet är lågt, kan vara ett avgörande verktyg i dessa domäner för att förhindra spridning av felaktig information.
Den verkliga tillämpningen av dessa modeller sträcker sig bortom att besvara frågor. De kan användas för patientutbildning, assistera i diagnostiska processer och till och med i utbildning av medicinska studenter. Men deras distribution måste hanteras noggrant för att undvika beroende av AI utan ordentlig mänsklig övervakning.
Såsom medicinsk kunskap utvecklas, måste LLM också anpassa sig och lära. Detta kräver mekanismer för kontinuerligt lärande och uppdatering, för att säkerställa att modellerna förblir relevanta och precisa över tid.














