Ángulo de Anderson

Las dificultades de la IA para distinguir entre izquierda y derecha en las imágenes médicas

mm
Añade Unite.AI a tus fuentes preferidas en Google
A robot doctor confused by an x-ray of a hand – ChatGPT-40 and Firefly (Oct 2024).

Un nuevo estudio encuentra que los modelos de imagen de IA como ChatGPT pueden malinterpretar la anatomía invertida o rotada, lo que aumenta el riesgo de errores peligrosos en el diagnóstico, con pruebas que indican que a menudo fallan en la razón espacial básica en las imágenes médicas – adivinando dónde deberían estar los órganos, en lugar de realmente mirar la imagen. Quizás de interés más amplio, la investigación demuestra que estos modelos pueden no estar leyendo tus PDF subidos o mirando tus imágenes en absoluto.

 

Cualquiera que haya subido datos regularmente, como contenido de PDF, a un modelo de lenguaje líder como ChatGPT, sabrá que los LLM no siempre necesariamente leen o examinan lo que se les presenta; más bien, a menudo hacen suposiciones sobre el material, basadas en lo que se escribió sobre él en la solicitud cuando se subió.

Puede ser un desafío incluso hacer que un modelo de lenguaje admita que no examinó realmente el contenido que se le presentó, sino que basó su respuesta en conocimientos previos, metadatos o suposiciones generales. Fuente: https://chatgpt.com

Puede ser difícil persuadir a un modelo de lenguaje para que admita que su respuesta se basó en conocimientos previos, metadatos o suposiciones generales, en lugar de en el contenido que se le dio. Fuente: https://chatgpt.com

Una posible razón para esto es aumentar la velocidad de la respuesta considerando el material subido como ‘redundante’ y confiando en la solicitud de texto para utilizar el conocimiento previo del sistema – evitando la subida por completo y, en el proceso, minimizando el tráfico de la red.

Otra razón es la conservación de recursos (aunque los proveedores parecen poco dispuestos a divulgar esto, si es cierto), donde los metadatos existentes que el LLM extrajo de intercambios anteriores en la conversación se utilizan como base para respuestas adicionales, incluso cuando estos intercambios y metadatos no contienen suficiente información para servir a este propósito.

¿Izquierda, derecha?

Independientemente de la razón por la que la generación actual de LLM tenga una atención y capacidad de enfoque variable, hay situaciones y contextos en los que adivinar es extremadamente peligroso. Uno de ellos es cuando se le pide a la IA que proporcione servicios médicos como la detección o estimación de riesgo de material radiológico.

Esta semana, investigadores de Alemania y EE. UU. publicaron un nuevo estudio de investigación que examina la eficacia de cuatro modelos de visión-lenguaje líderes, incluido ChatGPT-4o, cuando se les pide que identifiquen la ubicación de los órganos en las imágenes médicas.

Sorprendentemente, a pesar de representar el estado del arte en este respecto, los modelos base logran una tasa de éxito no mayor que la casualidad la mayor parte del tiempo – aparentemente porque no pueden separar adecuadamente su conocimiento entrenado de la anatomía humana y realmente mirar las imágenes que se les presentan, en lugar de recurrir a un conocimiento previo entrenado fácil desde sus datos de entrenamiento.

Los investigadores encontraron que los LLM probados funcionaron significativamente mejor cuando las secciones a considerar estaban denotadas por otros indicadores (como puntos y secuencias alfanuméricas) y con nombre – y mejor de todo cuando no se mencionaba la anatomía o los órganos en la consulta en absoluto:

Niveles de éxito variables, que aumentan a medida que la capacidad del modelo para recurrir a los datos entrenados se reduce, y se le obliga a concentrarse en los datos que tiene ante sí. Fuente: https://wolfda95.github.io/your_other_left/

Niveles de éxito variables, que aumentan a medida que la capacidad del modelo para recurrir a los datos entrenados se reduce, y se le obliga a concentrarse en los datos que tiene ante sí. Fuente: https://wolfda95.github.io/your_other_left/

El documento observa*:

‘Los VLM de vanguardia ya poseen un fuerte conocimiento anatómico previo incorporado en sus componentes de lenguaje. En otras palabras, “saben” dónde se encuentran normalmente las estructuras anatómicas en la anatomía humana estándar.

‘Hipotetizamos que los VLM a menudo basan sus respuestas en este conocimiento previo en lugar de analizar el contenido real de la imagen. Por ejemplo, cuando se les pregunta si el hígado está a la derecha del estómago, un modelo podría responder afirmativamente sin inspeccionar la imagen, confiando únicamente en la norma aprendida de que el hígado generalmente se encuentra a la derecha del estómago.

‘Este comportamiento podría llevar a diagnósticos críticos en casos en los que las posiciones reales se desvían de los patrones anatómicos típicos, como en situs inversus, alteraciones postquirúrgicas o desplazamiento de tumores.’

Para mitigar el problema en futuros esfuerzos, los autores han desarrollado un conjunto de datos diseñado para abordar este problema.

Los hallazgos del documento pueden sorprender a muchos lectores que han seguido el desarrollo de la IA médica, ya que la radiografía fue señalada muy temprano como uno de los trabajos más en riesgo de ser automatizado a través del aprendizaje automático.

El nuevo trabajo se llama ¡Tu otra izquierda! Los modelos de visión-lenguaje no pueden identificar posiciones relativas en imágenes médicas, y proviene de siete investigadores de dos facultades de la Universidad de Ulm y Axiom Bio en EE. UU.

Método y datos

Los investigadores se propusieron responder a cuatro cuestiones: si los modelos de visión-lenguaje de vanguardia pueden determinar correctamente las posiciones relativas en las imágenes de radiología; si el uso de marcadores visuales mejora su rendimiento en esta tarea; si confían más en el conocimiento anatómico previo que en el contenido real de la imagen; y cómo manejan las tareas de posición relativa cuando se les priva de cualquier contexto médico.

Con este fin, curaron el conjunto de datos Posicionamiento relativo de imágenes médicas (MIRP).

Aunque la mayoría de las pruebas de preguntas visuales existentes para rebanadas de CT o MRI incluyen tareas de anatomía y localización, estas colecciones más antiguas pasan por alto el desafío central de determinar posiciones relativas, lo que deja muchas tareas resolubles utilizando solo el conocimiento médico previo.

MIRP está diseñado para abordar esto mediante la prueba de preguntas de posición relativa entre estructuras anatómicas, evaluando el impacto de los marcadores visuales y aplicando rotaciones y giros aleatorios para bloquear la confianza en las normas aprendidas. El conjunto de datos se centra en rebanadas de CT abdominales, debido a su complejidad y prevalencia en la radiología.

MIRP contiene un número igual de y no respuestas, con las estructuras anatómicas en cada pregunta opcionalmente marcadas para mayor claridad.

Se probaron tres tipos de marcadores visuales: números negros en una caja blanca; letras negras en una caja blanca; y un punto rojo y un punto azul:

Los varios marcadores visuales utilizados en MIRP. Fuente: https://arxiv.org/pdf/2508.00549

Los varios marcadores visuales utilizados en MIRP. Fuente: https://arxiv.org/pdf/2508.00549

La colección se extrajo de los conjuntos de datos existentes Más allá de la bóveda craneal (BTCV) y Segmentación de múltiples órganos abdominales (AMOS).

Rebanadas anotadas del conjunto de datos AMOS. Fuente: https://arxiv.org/pdf/2206.08023

Rebanadas anotadas del conjunto de datos AMOS. Fuente: https://arxiv.org/pdf/2206.08023

Se utilizó el proyecto TotalSegmentator para extraer imágenes anatómicas planas de datos volumétricos:

Algunas de las 104 estructuras anatómicas disponibles en TotalSegmentator. Fuente: https://arxiv.org/pdf/2208.05868

Algunas de las 104 estructuras anatómicas disponibles en TotalSegmentator. Fuente: https://arxiv.org/pdf/2208.05868

Las rebanadas de imagen axiales se obtuvieron con el marco SimpleITK.

Las ubicaciones de las imágenes ‘desafío’ tenían que estar al menos a 50 píxeles de distancia y tener un tamaño al menos el doble que el de los marcadores, para generar pares de preguntas y respuestas.

Pruebas

Los cuatro modelos de visión-lenguaje probados fueron GPT-4o; Llama3.2; Pixtral; y JanusPro de DeepSeek.

Los investigadores probaron cada una de sus cuatro preguntas de investigación por turno, con la primera (Q1) siendo ‘¿Pueden los VLM actuales de vanguardia determinar con precisión las posiciones relativas en las imágenes radiológicas? Para esta pregunta, los investigadores probaron los modelos en rebanadas de CT simples, rotadas o invertidas, utilizando un formato de pregunta estándar, como ¿Está el riñón izquierdo debajo del estómago?.

Los resultados (que se muestran a continuación) mostraron precisiones cercanas al 50 por ciento en todos los modelos, lo que indica un rendimiento al nivel de la casualidad y una incapacidad para juzgar con confiabilidad las posiciones relativas sin marcadores visuales:

Precisión promedio para todos los experimentos utilizando la evaluación basada en la imagen en el benchmark MIRP (RQ1–RQ3) y el conjunto de datos de ablación (AS).

Precisión promedio para todos los experimentos utilizando la evaluación basada en la imagen en el benchmark MIRP (RQ1–RQ3) y el conjunto de datos de ablación (AS).

Para probar si los marcadores visuales pueden ayudar a los modelos de visión-lenguaje a determinar las posiciones relativas en las imágenes radiológicas, el estudio repitió los experimentos utilizando rebanadas de CT anotadas con letras, números o puntos rojos y azules; y aquí, el formato de la pregunta se ajustó para hacer referencia a estos marcadores – por ejemplo, ¿Está el riñón izquierdo (A) debajo del estómago (B)? o ¿Está el riñón izquierdo (rojo) debajo del estómago (azul)?.

Los resultados mostraron pequeñas ganancias de precisión para GPT-4o y Pixtral cuando se utilizaron marcadores de letras o números, mientras que JanusPro y Llama3.2 vieron poco o ningún beneficio, lo que sugiere que los marcadores solos pueden no ser suficientes para mejorar significativamente el rendimiento.

Precisión para todos los experimentos utilizando la evaluación basada en la imagen. Para RQ2, RQ3 y AS, los resultados se muestran con el tipo de marcador que mejor se desempeña para cada modelo: letras para GPT-4o, y puntos rojo-azul para Pixtral, JanusPro y Llama3.4.

Precisión para todos los experimentos utilizando la evaluación basada en la imagen. Para RQ2, RQ3 y AS, los resultados se muestran con el tipo de marcador que mejor se desempeña para cada modelo: letras para GPT-4o, y puntos rojo-azul para Pixtral, JanusPro y Llama3.4.

Para abordar la tercera pregunta, ¿Priorizan los VLM el conocimiento anatómico previo sobre la entrada visual al determinar las posiciones relativas en las imágenes radiológicas?, los autores examinaron si los modelos de visión-lenguaje confían más en el conocimiento anatómico previo que en la evidencia visual al determinar las posiciones relativas en las imágenes radiológicas.

Cuando se probaron en rebanadas de CT rotadas o invertidas, GPT-4o y Pixtral a menudo produjeron respuestas consistentes con las posiciones anatómicas estándar, en lugar de reflejar lo que se mostraba en la imagen, con GPT-4o logrando más del 75 por ciento de precisión en la evaluación basada en la anatomía, pero solo un rendimiento al nivel de la casualidad en la evaluación basada en la imagen.

Al eliminar los términos anatómicos de las solicitudes y utilizar solo marcadores visuales, se obligó a los modelos a depender del contenido de la imagen, lo que llevó a mejoras significativas, con GPT-4o superando el 85 por ciento de precisión con marcadores de letras, y Pixtral superando el 75 por ciento con puntos.

Una comparación de los cuatro modelos de visión-lenguaje para determinar las posiciones relativas de las estructuras anatómicas en las imágenes médicas – un requisito clave para el uso clínico. El rendimiento está al nivel de la casualidad con imágenes simples (RQ1) y muestra solo ganancias menores con marcadores visuales (RQ2). Cuando se eliminan los nombres anatómicos y los modelos deben confiar enteramente en los marcadores, GPT-4o y Pixtral logran mejoras significativas de precisión (RQ3). Los resultados se muestran con el tipo de marcador que mejor se desempeña para cada modelo.

Una comparación de los cuatro modelos de visión-lenguaje para determinar las posiciones relativas de las estructuras anatómicas en las imágenes médicas – un requisito clave para el uso clínico. El rendimiento está al nivel de la casualidad con imágenes simples (RQ1) y muestra solo ganancias menores con marcadores visuales (RQ2). Cuando se eliminan los nombres anatómicos y los modelos deben confiar enteramente en los marcadores, GPT-4o y Pixtral logran mejoras significativas de precisión (RQ3). Los resultados se muestran con el tipo de marcador que mejor se desempeña para cada modelo.

Esto sugiere que, si bien ambos pueden realizar la tarea utilizando datos de la imagen, tienden a recurrir a los conocimientos anatómicos previos cuando se les dan nombres anatómicos – un patrón que no se observa claramente en JanusPro o Llama3.2.

Aunque no cubrimos habitualmente los estudios de ablación, los autores abordaron la cuarta y última pregunta de investigación de esta manera. Por lo tanto, para probar la capacidad de posición relativa sin ningún contexto médico, el estudio utilizó imágenes blancas simples con marcadores colocados aleatoriamente y formuló preguntas simples como ¿Está el número 1 por encima del número 2?. Pixtral mostró mejores resultados con marcadores de puntos, mientras que los otros modelos funcionaron de manera similar a sus puntajes de RQ3.

JanusPro, y particularmente Llama3.2, lucharon incluso en este entorno simplificado, lo que indica debilidades subyacentes en la posición relativa que no se limitan a las imágenes médicas.

Los autores observan que GPT-4o se desempeñó mejor con marcadores de letras, mientras que Pixtral, JanusPro y Llama3.2 lograron mejores resultados con puntos rojo-azul. GPT-4o fue el modelo que mejor se desempeñó en general, con Pixtral como el modelo de código abierto líder.

Conclusión

En una nota personal, este documento me llamó la atención no tanto por su importancia médica, sino porque destaca una de las limitaciones más infrarreportadas y fundamentales de la actual ola de LLM de vanguardia – que, si la tarea puede evitarse, y a menos que se presente el material con cuidado, no leerán los textos que se suben o examinarán las imágenes que se les presentan.

Además, el estudio indica que si su solicitud de texto explica de alguna manera el material secundario que se sube, la IA tenderá a tratarlo como un ejemplo ‘teleológico’ y supondrá/asegurará muchas cosas sobre él basándose en el conocimiento previo, en lugar de estudiar y considerar lo que se subió.

En efecto, en este estado de cosas, los VLM tendrán grandes dificultades para identificar material ‘anormal’ – una de las habilidades más esenciales en la medicina diagnóstica. Si bien es posible invertir la lógica y tener un sistema que busque outliers en lugar de resultados dentro de la distribución, el modelo necesitaría una curación excepcional para evitar abrumar la señal con ejemplos irrelevantes o espurios.

 

* Las citas en línea se omiten, ya que no hay una forma elegante de incluirlos como hipervínculos. Por favor, consulte el documento de origen.

Publicado por primera vez el lunes 4 de agosto de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai