Salud
Desafío de inteligencia artificial crowdsourced para mejorar el análisis de mamografías llega a su fin

Las mamografías son importantes para la salud de las mujeres y para detectar indicadores tempranos de cáncer de mama. Sin embargo, las mamografías requieren la interpretación de especialistas humanos, y incluso los especialistas altamente capacitados cometen errores. Se estima que la tasa de falsos positivos de las mamografías es de aproximadamente el 10% en Estados Unidos. Con el fin de crear sistemas que proporcionen lecturas más precisas de las mamografías, el Desafío de Mamografía Digital (DM) Dream Challenge ha creado recientemente un esfuerzo crowdsourced para desarrollar nuevos algoritmos de lectura de mamografías
Según informa PhysicsWorld, las técnicas de visión por computadora y los algoritmos de aprendizaje profundo se han vuelto más sofisticados en los últimos años, los investigadores y los ingenieros se están volcando hacia el uso de la inteligencia artificial para interpretar las mamografías, con el objetivo de aumentar la precisión. El Desafío de Mamografía Digital (DM) Dream Challenge lanzó una competencia para investigar el uso de algoritmos de inteligencia artificial para reconocer posibles signos de cáncer de mama.
El desafío DM Dream es el estudio más grande realizado hasta la fecha sobre algoritmos de aprendizaje profundo en la interpretación de mamografías. Justin Guinney, el presidente de los desafíos DREAM, explicó que la razón de los desafíos es que permiten una evaluación estructurada de decenas de modelos de aprendizaje profundo en dos bases de datos diferentes. Los participantes en el desafío debían diseñar algoritmos que pudieran ser entrenados con datos de mamografías y producir una puntuación de probabilidad de que un paciente fuera diagnosticado con cáncer de mama dentro de un año. También había una condición de desafío secundaria. En la segunda tarea, los algoritmos podían ser entrenados con información adicional como datos de riesgo demográfico, datos clínicos e imágenes recopiladas de exámenes de detección previos.
Se utilizaron dos conjuntos de datos para entrenar los modelos. El primer conjunto de datos fue el conjunto de datos Kaiser Permanente Washington (KPW), recopilado por investigadores de Estados Unidos. Mientras que un segundo conjunto de datos fue recopilado por investigadores suecos del Instituto Karolinska (KI).
Más de 1100 participantes se unieron al desafío, divididos en 126 equipos diferentes y compuestos por personas de todo el mundo. Durante la primera parte del desafío, los modelos se entrenaron utilizando el conjunto de datos KPW, que incluía imágenes de más de 140.000 exámenes de detección. Al comparar los resultados con los de la segunda parte del desafío, se encontró que el acceso a más características como los datos clínicos no mejoró significativamente el poder discriminatorio de los algoritmos. Sin embargo, el equipo DM Dream sugirió que el desarrollo futuro de algoritmos debería incluir el análisis de imágenes previas de los pacientes, planteando que los participantes pueden no haber utilizado completamente los datos.
Según Health IT Analytics, el equipo DM Dream quiere que los ocho equipos mejor clasificados colaboren y diseñen un modelo de clasificación ensemble, para ver si este modelo podría potencialmente superar a los modelos individuales. Los coordinadores del desafío utilizaron entonces una agregación ponderada de las predicciones de los diversos algoritmos, creando el Modelo de Conjunto del Desafío (CEM). Las predicciones probabilísticas del modelo CEM se compararon con las interpretaciones de los radiólogos, evaluadas utilizando la especificidad. Los radiólogos lograron una especificidad del 90,5%, mientras que el modelo CEM logró solo una especificidad del 76,1%. Aunque los resultados parecen decepcionantes, cuando las suposiciones del modelo CEM y la interpretación de los radiólogos se agregaron en otro modelo (CEM+R), la especificidad mejoró al 92%.
Se lograron resultados comparables en el conjunto de datos de prueba KI, utilizado exclusivamente para validar los modelos, que contenía imágenes de más de 166.000 exámenes, con el modelo CEM siendo ligeramente inferior a los radiólogos (especificidad del 92,5% en comparación con una especificidad del 96,7%), pero CEM+R logró mejores resultados (especificidad del 98,5%).
Aunque ninguno de los modelos individuales pudo superar a los especialistas humanos, el modelo CEM+R vio una ligera ventaja en comparación con la interpretación de los radiólogos solos. Es posible que la combinación de la intuición humana con un asistente de inteligencia artificial pueda mejorar la precisión.












