Gezondheidszorg

Crowdsourced AI-uitdaging om mammogramanalyse te verbeteren eindigt

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Mammogrammen zijn belangrijk voor de gezondheid van vrouwen en om vroege indicaties van borstkanker te detecteren. Echter, mammogrammen vereisen menselijke specialisten om ze te interpreteren, en zelfs hoogopgeleide specialisten maken fouten. Het wordt geschat dat het valse positieve tarief van mammogrammen ongeveer 10% is in de VS. Om systemen te creëren die nauwkeurigere lezingen van mammogrammen geven, heeft de Digital Mammography (DM) Dream Challenge onlangs een crowdsourced onderneming gelanceerd om nieuwe mammogramleesalgoritmen te ontwikkelen

Volgens PhysicsWorld zijn computervisietechnieken en diepe leer-algoritmen de afgelopen jaren geavanceerder geworden, en onderzoekers en ingenieurs richten zich nu op het gebruik van AI om mammogrammen te interpreteren, met als doel de nauwkeurigheid te verhogen. De Digital Mammography (DM) Dream Challenge lanceerde een wedstrijd om het gebruik van AI-algoritmen te onderzoeken bij het herkennen van mogelijke tekenen van borstkanker.

De DM Dream Challenge is de grootste studie van diepe leer-algoritmen met betrekking tot mammograminterpretatie tot nu toe. Justin Guinney, de president van de DREAM-uitdagingen, legde uit dat de reden voor de uitdagingen was dat het een gestructureerde beoordeling van tientallen diepe leermodellen op twee verschillende databases mogelijk maakte. Deelnemers aan de uitdaging moesten algoritmen ontwerpen die getraind konden worden op mammogramgegevens en een waarschijnlijkheidsscore konden uitvoeren die aangaf of een patiënt binnen een jaar zou worden gediagnosticeerd met borstkanker. Er was ook een tweede uitdagingvoorwaarde. In de tweede taak mochten de algoritmen getraind worden op aanvullende informatie, zoals demografische risicodata, klinische gegevens en afbeeldingen verzameld tijdens eerdere screenings.

Er werden twee datasets gebruikt om de modellen te trainen. De eerste dataset was de Kaiser Permanente Washington (KPW)-dataset, samengesteld door onderzoekers uit de VS. Ondertussen werd een tweede dataset samengesteld door Zweedse onderzoekers aan het Karolinska Instituut (KI).

Meer dan 1100 deelnemers sloten zich aan bij de uitdaging, verdeeld over 126 verschillende teams en bestaande uit mensen van over de hele wereld. Tijdens het eerste deel van de uitdaging werden de modellen getraind met behulp van de KPW-dataset, die afbeeldingen van meer dan 140.000 screeningsonderzoeken bevatte. Toen de resultaten van de tweede uitdaging werden vergeleken, bleek dat toegang tot meer functies, zoals klinische gegevens, de discriminatiekracht van de algoritmen niet significant verbeterde. De DM Dream-team stelde echter voor dat toekomstige algoritme-ontwikkeling de analyse van eerdere afbeeldingen van patiënten moet omvatten, omdat de deelnemers de gegevens mogelijk niet volledig hebben benut.

Volgens Health IT Analytics wil het DR Dream-team de top acht presterende teams samen laten werken om een ensembleclassificatiemodel te ontwerpen, om te zien of dit model individuele modellen zou kunnen overtreffen. De uitdagingcoördinatoren gebruikten vervolgens een gewogen aggregatie van de voorspellingen van de verschillende algoritmen, waardoor het Challenge Ensemble Model (CEM) ontstond. De probabilistische voorspellingen van het CEM-model werden vergeleken met interpretaties van radiologen, zoals beoordeeld met behulp van specificiteit. De radiologen behaalden 90,5% specificiteit, terwijl het CEM-model slechts 76,1% specificiteit behaalde. Hoewel de resultaten teleurstellend lijken, verbeterde de specificiteit tot 92% toen de schattingen van het CEM-model en de interpretatie van radiologen werden geaggregeerd in een ander model (CEM+R).

Vergelijkbare resultaten werden behaald op de KI-testdataset, die uitsluitend werd gebruikt om de modellen te valideren en afbeeldingen van meer dan 166.000 onderzoeken bevatte. Het CEM-model was iets minder goed dan radiologen (92,5% specificiteit in vergelijking met 96,7% specificiteit), maar CEM+R behaalde betere resultaten (98,5% specificiteit).

Hoewel geen van de individuele modellen de prestaties van menselijke specialisten kon overtreffen, zag het CEM+R-model een lichte voorsprong ten opzichte van de interpretatie van radiologen alleen. Het is mogelijk dat het combineren van menselijke intuïtie met een AI-assistent de nauwkeurigheid kan verbeteren.

Blogger en programmeur met specialisaties in Machine Learning en Deep Learning onderwerpen. Daniel hoopt anderen te helpen de kracht van AI te gebruiken voor het sociale goede.