AI-modellen en platforms

Revolutie in de gezondheidszorg: het onderzoeken van de impact en de toekomst van Large Language Models in de geneeskunde

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

De integratie en toepassing van large language models (LLM’s) in de geneeskunde en de gezondheidszorg is een onderwerp van significant belang en ontwikkeling.

Zoals vermeld in de Healthcare Information Management and Systems Society wereldconferentie en andere opvallende evenementen, zijn bedrijven zoals Google (GOOGL ) leidende krachten in het onderzoeken van het potentieel van generatieve AI in de gezondheidszorg. Hun initiatieven, zoals Med-PaLM 2, benadrukken de evoluerende landschap van AI-gedreven gezondheidsoplossingen, met name op gebieden zoals diagnostiek, patiëntenzorg en administratieve efficiëntie.

Google’s Med-PaLM 2, een baanbrekend LLM in de gezondheidssector, heeft indrukwekkende capaciteiten getoond, met name door een “expert”-niveau te bereiken in vragen in de stijl van het Amerikaanse medisch licentie-examen. Dit model, en anderen zoals het, beloven de manier waarop gezondheidsprofessionals toegang hebben tot en gebruikmaken van informatie te revolutioneren, waardoor mogelijk de diagnostische nauwkeurigheid en de efficiëntie van de patiëntenzorg worden verbeterd.

Er zijn echter, naast deze vooruitgang, bezorgdheden geuit over de praktische toepasbaarheid en veiligheid van deze technologieën in klinische omgevingen. Zo kan de afhankelijkheid van uitgebreide internetgegevens voor modeltraining, hoewel gunstig in sommige contexten, niet altijd geschikt of betrouwbaar zijn voor medische doeleinden. Zo wijst Nigam Shah, PhD, MBBS, Chief Data Scientist voor Stanford Health Care, erop dat de cruciale vragen die gesteld moeten worden, gaan over de prestaties van deze modellen in echte medische omgevingen en hun werkelijke impact op de patiëntenzorg en de efficiëntie van de gezondheidszorg.

Dr. Shah’s perspectief benadrukt de noodzaak van een meer gerichte aanpak voor het gebruik van LLM’s in de geneeskunde. In plaats van algemene modellen getraind op brede internetgegevens, stelt hij een meer gefocuste strategie voor waarbij modellen getraind worden op specifieke, relevante medische gegevens. Deze aanpak lijkt op het trainen van een medische stagiair – door hen specifieke taken te geven, hun prestaties te controleren en hen langzaam meer autonomie te geven naarmate ze competentie tonen.

In overeenstemming hiermee presenteert de ontwikkeling van Meditron door EPFL-onderzoekers een interessante vooruitgang in het veld. Meditron, een open-source LLM specifiek ontwikkeld voor medische toepassingen, vertegenwoordigt een significante stap voorwaarts. Getraind op gecureerde medische gegevens van betrouwbare bronnen zoals PubMed en klinische richtlijnen, biedt Meditron een meer gefocuste en mogelijk betrouwbaardere tool voor medische professionals. De open-source aard van Meditron bevordert niet alleen transparantie en samenwerking, maar staat ook toe dat de bredere onderzoekscommunity het model continu verbetert en test.

MEDITRON-70B-achieves-an-accuracy-of-70.2-on-USMLE-style-questions-in-the-MedQA-4-options-dataset

MEDITRON-70B-achieves-an-accuracy-of-70.2-on-USMLE-style-questions-in-the-MedQA-4-options-dataset

De ontwikkeling van tools zoals Meditron, Med-PaLM 2 en anderen weerspiegelt een groeiend besef van de unieke eisen van de gezondheidssector bij het gebruik van AI-toepassingen. De nadruk op het trainen van deze modellen op relevante, hoogwaardige medische gegevens en het waarborgen van hun veiligheid en betrouwbaarheid in klinische omgevingen is zeer cruciaal.

Bovendien toont de opname van diverse datasets, zoals die uit humanitaire contexten zoals het Internationale Rode Kruis, een gevoeligheid voor de uiteenlopende behoeften en uitdagingen in de mondiale gezondheidszorg. Deze aanpak staat in overeenstemming met de bredere missie van veel AI-onderzoekscentra, die ernaar streven AI-tools te creëren die niet alleen technisch geavanceerd zijn, maar ook sociaal verantwoordelijk en nuttig.

Het artikel getiteld “Large language models encode clinical knowledge” dat onlangs in Nature werd gepubliceerd, onderzoekt hoe large language models (LLM’s) effectief kunnen worden gebruikt in klinische omgevingen. Het onderzoek presenteert baanbrekende inzichten en methoden, en werpt licht op de capaciteiten en beperkingen van LLM’s in de medische sector.

De medische sector wordt gekenmerkt door zijn complexiteit, met een breed scala aan symptomen, ziektes en behandelingen die constant evolueren. LLM’s moeten niet alleen deze complexiteit begrijpen, maar ook bijblijven met de laatste medische kennis en richtlijnen.

Het kernonderzoek draait om een nieuw gecreëerd benchmark genaamd MultiMedQA. Deze benchmark combineert zes bestaande medische vraag-antwoord-datasets met een nieuwe dataset, HealthSearchQA, die bestaat uit medische vragen die vaak online worden gezocht. Deze uitgebreide aanpak heeft als doel LLM’s te evalueren over verschillende dimensies, waaronder feitelijkheid, begrip, redenering, mogelijke schade en vooroordeel, en zo de beperkingen van eerdere geautomatiseerde evaluaties aan te pakken die afhankelijk waren van beperkte benchmarks.

MultiMedQA, a benchmark for answering medical questions spanning medical exam

MultiMedQA, a benchmark for answering medical questions spanning medical exam

Belangrijk voor het onderzoek is de evaluatie van het Pathways Language Model (PaLM), een 540-miljard parameter LLM, en zijn instructie-gefinetune variant, Flan-PaLM, op de MultiMedQA. Opmerkelijk is dat Flan-PaLM een state-of-the-art nauwkeurigheid bereikt op alle multiple-choice datasets binnen MultiMedQA, waaronder een nauwkeurigheid van 67,6% op MedQA, dat bestaat uit vragen in de stijl van het Amerikaanse medisch licentie-examen. Deze prestatie markeert een significante verbetering ten opzichte van eerdere modellen, waarbij het vorige state-of-the-art met meer dan 17% wordt overtroffen.

MedQA

De MedQA-dataset3 bevat vragen in de stijl van het Amerikaanse medisch licentie-examen, elk met vier of vijf antwoordopties. Het bevat een ontwikkelingsset met 11.450 vragen en een testset met 1.273 vragen.

Formaat: vraag en antwoord (Q + A), multiple choice, open domein.

Voorbeeldvraag: Een 65-jarige man met hypertensie komt voor een routineonderzoek bij de arts. De huidige medicatie omvat atenolol, lisinopril en atorvastatine. Zijn pols is 86 min-1, ademhalingen zijn 18 min-1 en bloeddruk is 145/95 mmHg. Het cardiale onderzoek onthult een einddiastolisch murmel. Wat is de meest waarschijnlijke oorzaak van deze fysieke onderzoeksbevinding?

Antwoorden (correct antwoord in vet): (A) Verminderde compliantie van de linkerhartkamer, (B) Myxomateuze degeneratie van de mitraliskleppen (C) Ontsteking van het pericard (D) Dilatatie van de aortawortel (E) Verdikking van de mitraliskleppen.

Het onderzoek identificeert ook kritieke hiaten in de prestaties van het model, met name bij het beantwoorden van consumentenmedische vragen. Om deze problemen aan te pakken, introduceren de onderzoekers een methode genaamd instructieprompt-tuning. Deze techniek aligneert LLM’s efficiënt met nieuwe domeinen met behulp van enkele voorbeelden, wat leidt tot de creatie van Med-PaLM. Het Med-PaLM-model, hoewel het bemoedigende resultaten laat zien en een verbetering toont in begrip, kennisherinnering en redenering, blijft nog steeds achter bij clinici.

Een opvallend aspect van dit onderzoek is het gedetailleerde kader voor humane evaluatie. Dit kader beoordeelt de antwoorden van de modellen op overeenstemming met de wetenschappelijke consensus en potentieel schadelijke uitkomsten. Terwijl slechts 61,9% van de lange antwoorden van Flan-PaLM overeenkwam met de wetenschappelijke consensus, steeg dit cijfer tot 92,6% voor Med-PaLM, vergelijkbaar met antwoorden gegenereerd door clinici. Bovendien werd het potentieel voor schadelijke uitkomsten aanzienlijk verlaagd in de antwoorden van Med-PaLM in vergelijking met Flan-PaLM.

De humane evaluatie van de antwoorden van Med-PaLM benadrukte zijn vaardigheid in verschillende gebieden, waaronder overeenstemming met clinici gegenereerde antwoorden. Dit onderstreept het potentieel van Med-PaLM als een ondersteunend instrument in klinische omgevingen.

Het onderzoek dat hierboven wordt besproken, duikt in de nuances van het verbeteren van Large Language Models (LLM’s) voor medische toepassingen. De technieken en observaties uit deze studie kunnen worden gegeneraliseerd om de capaciteiten van LLM’s te verbeteren in verschillende domeinen. Laten we deze belangrijke aspecten verkennen:

Instructieafstemming verbetert prestaties

  • Algemene toepassing: Instructieafstemming, die het fijn afstemmen van LLM’s met specifieke instructies of richtlijnen inhoudt, heeft aangetoond significante prestatieverbeteringen te kunnen bereiken in verschillende domeinen. Deze techniek kan worden toegepast in andere gebieden zoals juridisch, financieel of educatief om de nauwkeurigheid en relevantie van LLM-uitvoer te verbeteren.

Schaal van modelgrootte

  • Brede implicaties: De observatie dat het schalen van de modelgrootte de prestaties verbetert, is niet beperkt tot medische vraagbeantwoording. Grotere modellen, met meer parameters, hebben de capaciteit om meer nuances en complexe antwoorden te verwerken en te genereren. Dit schalen kan gunstig zijn in domeinen zoals klantenservice, creatief schrijven en technische ondersteuning, waar nuances begrip en antwoordgeneratie cruciaal zijn.

Chain of Thought (COT) Prompting

  • Gebruik in diverse domeinen: Het gebruik van COT-prompting, hoewel niet altijd prestatieverbetering in medische datasets, kan waardevol zijn in andere domeinen waar complex probleemoplossing vereist is. In technische storingen of complexe beslissingsscenario’s kan COT-prompting LLM’s helpen informatie stap voor stap te verwerken, leidend tot meer accurate en gerede uitvoer.

Zelfconsistentie voor verbeterde nauwkeurigheid

  • Brede toepassingen: De techniek van zelfconsistentie, waarbij meerdere uitvoeren gegenereerd worden en het meest consistente antwoord geselecteerd wordt, kan de prestaties aanzienlijk verbeteren in verschillende domeinen. In domeinen zoals financiën of juridisch, waar nauwkeurigheid van het grootste belang is, kan deze methode worden gebruikt om gegenereerde uitvoer te cross-verifiëren voor een hogere betrouwbaarheid.

Onzekerheid en selectieve voorspelling

  • Relevantie over domeinen heen: Het communiceren van onzekerheidschattingen is cruciaal in domeinen waar misinformatie ernstige gevolgen kan hebben, zoals de gezondheidszorg en de rechtspraak. Het gebruik van de mogelijkheid van LLM’s om onzekerheid uit te drukken en selectief te definiëren wanneer het vertrouwen laag is, kan een cruciaal instrument zijn in deze domeinen om de verspreiding van onnauwkeurige informatie te voorkomen.

De reële toepassing van deze modellen gaat verder dan het beantwoorden van vragen. Ze kunnen worden gebruikt voor patiënteneducatie, bijstand bij diagnostische processen en zelfs bij de opleiding van medische studenten. Echter, hun inzet moet zorgvuldig worden beheerd om te voorkomen dat er te veel wordt vertrouwd op AI zonder adequate menselijke toezicht.

Naarmate de medische kennis evolueert, moeten LLM’s ook aanpassen en leren. Dit vereist mechanismen voor continue leren en updaten, om ervoor te zorgen dat de modellen relevant en nauwkeurig blijven in de loop van de tijd.

Ik heb de afgelopen vijf jaar doorgebracht met het onderdompelen van mezelf in de fascinerende wereld van Machine Learning en Deep Learning. Mijn passie en expertise hebben me geleid om bij te dragen aan meer dan 50 diverse software-engineeringprojecten, met een bijzondere focus op AI/ML. Mijn voortdurende nieuwsgierigheid heeft me ook aangetrokken tot Natural Language Processing, een vakgebied dat ik graag verder wil verkennen.