Gezondheidszorg
Google’s AMIE haalbaarheidsstudie voor primaire zorg gepubliceerd in The Lancet

Een prospectieve klinische studie, geleid door onderzoekers van Google en Beth Israel Deaconess Medical Center, die Google’s AMIE conversatie‑diagnostische AI evalueerde in een echte spoed‑primaire‑zorgkliniek, werd gepubliceerd in The Lancet op 8 oktober 2026, volgens Google’s aankondiging. In de studie raadpleegden 98 patiënten de AMIE‑chatbot vóór hun spoedzorgbezoek, terwijl toezichthoudende artsen de interacties in realtime monitorden, en geen van de gesprekken hoefde te worden onderbroken volgens vooraf gedefinieerde veiligheidscriteria.
Google omschreef het artikel als haar allereerste publicatie in het hoofdblad The Lancet. Het bedrijf stelde dat grotere klinische onderzoeken nodig zijn om patiëntgerichte AI op schaal te beoordelen, en zei dat de bevindingen wijzen op potentieel voor AI om de relatie tussen patiënt en arts te verbeteren en de druk op zorgmedewerkers te verlichten.
Studieontwerp en veiligheidsbewaking
Het systeem, formeel genaamd de Articulate Medical Intelligence Explorer (AMIE), is een medische AI‑chatbot die patiënten vanuit huis gebruikten na het plannen van een spoed‑primaire‑zorgafspraak met een BIDMC‑arts. Volgens Google Research-teamverslag voltooiden 100 volwassen patiënten een pre‑bezoekinteractie met AMIE, en 98 hielden hun geplande afspraak bij. De deelnemers, die waren ingepland voor nieuwe, niet‑noodzakelijke, episodische klachten, communiceerden met het systeem via een beveiligde tekst‑chatinterface tot vijf dagen vóór het bezoek. Het systeem stelde vragen over symptomen, verzamelde medische voorgeschiedenissen, presenteerde mogelijke diagnoses die patiënten met hun arts konden bespreken, en genereerde een samenvatting die de zorgverlener vooraf kon bekijken. De prospectieve, single‑arm, single‑center studie was vooraf geregistreerd op ClinicalTrials.gov en uitgevoerd onder door een ethische commissie goedgekeurde protocollen, waarbij patiënten verzekerd werden dat hun deelnamebeslissing geen invloed zou hebben op hun zorg.
De deelnemers waren jonger dan de algemene spoedzorgpopulatie van de kliniek: van de 1.452 totale spoedzorgbezoeken tijdens de studieperiode betrof meer dan de helft patiënten ouder dan 60 jaar, terwijl de trends in vrouwelijke en witte deelnemers overeenkwamen met de populatie van de kliniek, aldus het Google Research‑verslag.
BIDMC meldde dat de studie liep van april tot november 2025 en 114 patiënten inschreef, en dat elk gesprek in realtime werd gemonitord door een internist met board‑certificering via een live‑videogesprek met schermdeling. Toezichthouders waren getraind om in te grijpen op basis van vier vooraf gespecificeerde criteria: direct gevaar voor zichzelf of anderen, aanzienlijke emotionele stress gerelateerd aan de AI‑interactie, door de toezichthouder geïdentificeerd potentieel klinisch risico, of een expliciet verzoek van de patiënt om de sessie te beëindigen. Over alle 98 voltooide ontmoetingen heen was geen enkel gesprek een veiligheidsstop nodig; toezichthoudende artsen identificeerden één hallucinatie en boden in vijf gevallen extra klinische verduidelijking, volgens BIDMC’s 9 oktober 2026 persbericht. “Deze studie helpt de basiskenmerken van dergelijke real‑world gesprekken vast te stellen,” zei co‑eerste auteur Peter Brodeur, een klinisch fellow in cardiovasculaire geneeskunde bij BIDMC, in het persbericht. BIDMC stelt dat zij gelooft dat de studie de eerste prospectieve real‑world studie is van een patiëntgerichte conversationele AI‑systeem in de primaire zorg.
Resultaten diagnostisch redeneren
De differentiële diagnose van AMIE omvatte de definitieve diagnose, vastgesteld via chartreview acht weken na elk gesprek, binnen de top zeven mogelijkheden in 90 % van de gevallen, met een top‑drie nauwkeurigheid van 75 %, en het identificeerde de definitieve diagnose als de enige meest waarschijnlijke mogelijkheid in 56 % van de gevallen, meldde het onderzoeksteam. De nauwkeurigheid bleef hoog voor de subset van 46 patiënten waarvan de definitieve diagnose werd bevestigd door een diagnostische test, zoals een laboratorium‑, microbiologisch‑, pathologisch‑ of beeldvormingsresultaat.
In een verblinde en gerandomiseerde vergelijking beoordeelden panels van drie klinische evaluatoren per geval de differentiële diagnoses en behandelplannen van AMIE en van primaire‑zorgverleners, waarbij ze een vergelijkbare algehele kwaliteit vonden voor differentiële diagnoses (p = 0,6) en voor de geschiktheid (p = 0,1) en veiligheid (p = 1,0) van behandelplannen, volgens preprintrecord van de studie. De artsen presteerden beter dan AMIE op het gebied van praktisch nut (p = 0,003) en kosteneffectiviteit (p = 0,004) van behandelplannen. Google Research schreef dat het verschil te wijten is aan het ontbreken van toegang van AMIE tot het elektronisch patiëntendossier, het onvermogen om een lichamelijk onderzoek uit te voeren, en het ontbreken van multimodale input zoals de algehele fysieke verschijning van de patiënt.
Patiënt‑ en zorgverlenerervaring
Patiënten vulden de General Attitudes towards AI Scale in vóór de chat, na de chat en na het consult met de zorgverlener; de houding verschoof significant positiever na interactie met AMIE (p < 0.001) en bleef verhoogd na het consult, meldden de onderzoekers. BIDMC meldde dat patiënten het systeem hoog scoorden op luisteren, informatie uitleggen en hen op hun gemak stellen, terwijl er zorgen bleven bestaan over het vertrouwen in de vertrouwelijkheid van de met het systeem gedeelde informatie en over het vertrouwen in de eerlijkheid en betrouwbaarheid van de chatbot. Adam Rodman, Director of AI Programs at BIDMC’s Carl J. Shapiro Institute for Research and Education, zei dat toekomstig onderzoek moet onderzoeken welke interactie‑kenmerken het vertrouwen van patiënten kunnen opbouwen en hoe AI‑interacties de relatie tussen patiënt en arts kunnen versterken.
Eerstelijnszorgverleners bekeken een door AI gegenereerd transcript of samenvatting voordat ze patiënten zagen in 44 gevallen; artsen meldden dat dit hen hielp zich in 75 % van de gevallen op het consult voor te bereiden en mogelijk hun klinische aanpak beïnvloedde in 57 %, meldde BIDMC. In één geval beschreef een zorgverlener de interactie als enigszins schadelijk, met de zorg dat een patiënt angst had kunnen ervaren nadat AMIE lymfoom had genoemd als een van de mogelijke diagnoses. In kwalitatieve interviews gerapporteerd door Google Research zeiden artsen dat AMIE de dynamiek van het consult verschuift van eenvoudige gegevensverzameling naar gegevensverificatie, waardoor meer collaboratieve gesprekken en gedeelde besluitvorming mogelijk werden.
Beperkingen, financiering en eerdere openbaarmaking
Het onderzoeksteam beschrijft het werk als een single‑center haalbaarheidsstudie zonder gecontroleerde vergelijkingen, die geen kwantitatieve effectiviteitsclaims ondersteunt ten opzichte van een standaard workflow, en somt verdere beperkingen op, waaronder de uitsluitend tekstgebaseerde interface en onverkende effecten van gezondheidsvaardigheid, technologische vaardigheid en vertrouwdheid met chatbots. Rodman en collega’s benadrukten dat de studie was opgezet om de haalbaarheid te evalueren in plaats van te bepalen of AI de gezondheidsresultaten verbetert.
BIDMC gaf aan dat de studie werd gefinancierd door Alphabet en dat Rodman gedurende een deel van de studie als bezoekend onderzoeker bij Google werkte. Brodeur en Jacob M. Koshy zijn de co‑eerste auteurs van het artikel, Rodman staat als laatste onder de auteurs, en Marc L. Cohen is co‑senior auteur.
De resultaten van de studie werden voor het eerst openbaar gemaakt in maart 2026: de preprint werd op 9 maart 2026 ingediend bij arXiv, en het Google Research‑team publiceerde op 11 maart 2026 een gedetailleerd verslag, dat op 8 oktober 2026 werd geüpdatet om de publicatie in The Lancet te vermelden. Het onderzoeksteam zei dat het van plan is de bruikbaarheid en impact van dergelijke systemen te blijven beoordelen in toekomstige grotere studies met gecontroleerde vergelijkingen.












