Ángulo de Anderson

Utilizando el programa de televisión ‘House’ para desarrollar las capacidades de diagnóstico de la IA

mm
Añade Unite.AI a tus fuentes preferidas en Google
A screen capture from the NBC TV show 'House, S04E02., 'The Right Stuff'

Aunque el diagnóstico de enfermedades raras es un desafío particularmente difícil para la IA (al igual que para los humanos), los modelos de lenguaje populares ChatGPT y Gemini muestran un rendimiento prometedor cuando se entrenan con casos de diagnóstico de la popular serie médica ‘House’.

 

Casi la mitad de todos los estudiantes de ciencias de la salud ven regularmente dramas médicos como House, Grey’s Anatomy y Scrubs. Aunque este tipo de material solo se puede utilizar para fines didácticos con un gran filtro y enmarcado, debido al riesgo de difundir información errónea peligrosa, el estándar de investigación para dramas que presentan condiciones médicas tiende a ser bastante alto (aunque la precisión varía entre producciones).

No es de extrañar que los médicos a menudo originen, asesoran o escriben guiones para dramas médicos de televisión. En tales casos, el conocimiento médico extenso es ventajoso no solo para transmitir con precisión problemas médicos, sino también para idear sugerencias para nuevas y interesantes tramas.

Una de las series médicas más estudiadas de la reciente ‘edad de oro’ de la televisión es House (también conocida como House MD), donde las excentricidades del personaje principal y las grandes fluctuaciones en el elenco de apoyo, aunque entretenidas, ocuparon un segundo lugar con respecto a la ‘enfermedad de la semana’.

De hecho, de los 177 episodios emitidos a lo largo de sus ocho temporadas, House proporcionó 176 estudios de casos de diagnóstico minuciosos. Aunque el programa terminó en 2012, para 2015 ya se estaba utilizando como herramienta de enseñanza, con un seminario especial de ‘Dr. House’ que ofreció mejores resultados en comparación con los seminarios estándar, incluso aunque asistir no ofrecía créditos estudiantiles:

De un estudio de 2015, diversas razones por las que los estudiantes de medicina querían asistir a un seminario de diagnóstico que utilizaba información de la serie de televisión 'House'. Fuente [ https://journals.plos.org/plosone/article/file?id=10.1371/journal.pone.0193972&type=printable ]

De un estudio de 2015, diversas razones por las que los estudiantes de medicina querían asistir a un seminario de diagnóstico que utilizaba información de la serie de televisión ‘House’. Los seminarios se programaron en un momento intencionalmente desafiante y no conveyeron créditos de estudio; a pesar de estos factores, la iniciativa fue un éxito. Fuente

House y la IA

Aunque el uso de House y otros diversos programas de televisión ha sido probado en múltiples estudios como un complemento efectivo para el aprendizaje, para los estudiantes de medicina, poco de este enfoque se ha intentado hasta ahora en un contexto de aprendizaje automático.

Ahora, un nuevo artículo de la Universidad Estatal de Pensilvania ha hecho un intento inicial en esta dirección, desarrollando un conjunto de datos que presenta los 176 estudios de casos de House utilizables, formulados en una estructura de diagnóstico narrativa, posteriormente evaluada en LLM populares de OpenAI y Google.

A pesar de la dificultad de este desafío (que caracteriza a uno de los campos más difíciles de las ciencias biológicas), los investigadores encontraron que las versiones más recientes de ChatGPT y Gemini mostraron una mejora con respecto a las versiones anteriores, lo que indica que la tendencia evolutiva del desarrollo del modelo probablemente se incline efectivamente hacia los procesos de diagnóstico con el tiempo.

El artículo establece:

‘Los resultados muestran una variación significativa en el rendimiento, que va desde el 16,48% hasta el 38,64% de precisión, con las generaciones de modelos más recientes demostrando una mejora de 2,3 veces. Si bien todos los modelos enfrentan desafíos sustanciales con el diagnóstico de enfermedades raras, la mejora observada en las arquitecturas sugiere direcciones prometedoras para el desarrollo futuro.’

‘Nuestro marco de referencia validado educativamente establece métricas de rendimiento básicas para la razón médica narrativa y proporciona un marco de evaluación público y accesible para avanzar en la investigación del diagnóstico asistido por IA.’

Además de establecer métricas de rendimiento básicas con las que se pueden evaluar los esfuerzos futuros, los autores señalan que el nuevo conjunto de datos – que están haciendo públicamente disponible – resuelve la falta de proceso narrativo dentro de los conjuntos de datos médicos existentes, y está fácilmente disponible, en contraste con la cultura de conjuntos de datos médicos estándar que están restringidos.

El nuevo trabajo se titula Evaluación de grandes modelos de lenguaje en el diagnóstico de enfermedades raras: un estudio de caso que utiliza House M.D., y proviene de cuatro investigadores de Penn State*.

Datos

Para poblar su conjunto de datos, los autores utilizaron material público disponible del sitio de fanes de House Wiki establecido. El contenido narrativo se extrajo y se destiló utilizando el popular marco de trabajo Beautiful Soup, que puede extraer datos estructurales del código fuente HTML de las páginas web.

Después de que se cosecharon las narrativas básicas de esta manera, se utilizaron cuatro LLM para transformar la salida en un formato de caso estandarizado. Los modelos utilizados fueron GPT-4o mini; GPT-5 Mini; Gemini 2.5 Flash; y Gemini 2.5 Pro. Finalmente, se aplicó un filtro de calidad para asegurarse de que el conjunto de datos tuviera detalles clínicos adecuados y estuviera alineado con el estado actual del arte en la razón médica.

Los autores observan que ‘enfermedades huérfanas’ (también conocidas como enfermedades raras) están subrepresentadas en las bases de datos médicas estándar; en ciertos casos, su cobertura en el programa House puede representar un porcentaje inusual de su cobertura total existente.

Los autores conceden que la utilidad de una fuente de datos de este tipo tiene que ser templada con precaución con respecto a la licencia artística que puede priorizarse en la creación de dramas médicos:

‘Aunque nuestro conjunto de datos refleja las limitaciones del contenido ficticio, incluyendo la exageración dramática y el enfoque en casos complejos, estas características pueden beneficiar la evaluación al proporcionar casos de borde desafiantes que prueban la robustez del modelo.’

‘La validación educativa de House M.D. por parte de profesionales médicos proporciona confianza de que los escenarios extraídos contienen información clínicamente significativa adecuada para la evaluación de la IA.’

Ejemplos del conjunto de datos generado para el proyecto. Fuente [ https://www.kaggle.com/datasets/arshgupta23/housemd-data-for-rare-disease-accuracy-using-llms?resource=download ]

Ejemplos del conjunto de datos generado para el proyecto. Fuente

Pruebas

Para evaluar la precisión del modelo en tareas de diagnóstico narrativo, los autores diseñaron una tubería simple que combina la generación de solicitudes, la inferencia del modelo y la puntuación.

Se probaron los cuatro LLM anteriores, con cada modelo configurado con temperatura establecida en cero (garantizando una salida determinista en lugar de ‘creativa’), y con una longitud máxima de token de 1.500 – una concesión diseñada para acomodar la razón médica compleja. No se utilizaron solicitudes de sistema adicionales para enmarcar las consultas más.

Las solicitudes en sí mismas se adhirieron a un formato de presentación de caso médico estructurado estándar – el tipo que los espectadores estarán más familiarizados con los dramas médicos cuando se introduce un nuevo paciente/enfermedad y un médico resume una visión general para el beneficio de los demás médicos presentes (efectivamente, aunque, para el beneficio de los espectadores).

Cada solicitud presentó una narrativa clínica que comprendía detalles demográficos; una línea de tiempo de síntomas; historial médico relevante; y hallazgos diagnósticos tempranos. El modelo se instruyó para identificar un solo diagnóstico principal y justificar su conclusión con razón.

Cada modelo generó su respuesta diagnóstica en un solo paso, sin refinamiento iterativo; y las respuestas se recopilaron bajo condiciones consistentes en todos los 176 casos:

Un ejemplo ilustrativo, que muestra una solicitud clínica narrativa y su diagnóstico de verdad fundamental correspondiente, como se utilizó para probar Gemini 2.5 Pro. Fuente [ https://arxiv.org/pdf/2511.10912 ]

Un ejemplo ilustrativo que muestra una solicitud clínica narrativa y su diagnóstico de verdad fundamental correspondiente, como se utilizó para probar Gemini 2.5 Pro. Fuente

Para las métricas, las predicciones se evaluaron utilizando un procedimiento de coincidencia de cadena ‘difusa’ diseñado para tener en cuenta la ambigüedad en la terminología médica. El enfoque utilizó la biblioteca SequenceMatcher de Python, con un umbral de similitud de 0,8, comenzando con la coincidencia de subcadena exacta y retrocediendo a la comparación de tokens cuando es necesario. La precisión se calculó como la proporción de casos clasificados correctamente bajo estas condiciones:

El flujo de trabajo de 'coincidencia difusa' utilizado por los investigadores.

El flujo de trabajo de ‘coincidencia difusa’ utilizado por los investigadores.

Los autores señalan que la coincidencia difusa podría significar que los diagnósticos semánticamente idénticos que utilizan una terminología diferente podrían perderse, pero presentan su enfoque como el más reproducible que podría satisfacer todas las limitaciones del proyecto.

Resultados

La precisión diagnóstica varió ampliamente entre los modelos, con Gemini 2.5 Pro que realizó lo mejor con un 38,64%, seguido de GPT-5 Mini con un 36,93%, Gemini 2.5 Flash con un 32,95% y GPT-4o Mini con un 16,48%. A pesar de estas diferencias, todos los modelos lucharon con las demandas de la razón diagnóstica para enfermedades raras:

Resultados de la precisión diagnóstica en los cuatro modelos probados.

Resultados de la precisión diagnóstica en los cuatro modelos probados.

Los autores también señalan que el rendimiento varió a lo largo de las temporadas del programa:

Precisión variable a lo largo de las diversas temporadas de House, pero sin una curva o razón obvia.

Precisión variable a lo largo de las diversas temporadas de House, pero sin una curva o razón obvia.

El artículo establece:

‘La Temporada 1 logró la mayor precisión con un 56,52%, mientras que la Temporada 5 mostró la más baja con un 20,83%. Esta variación sugiere que la complejidad diagnóstica varía a lo largo de la serie, con temporadas posteriores que potencialmente presentan casos de enfermedades raras más desafiantes. ‘

‘Sin embargo, el rendimiento relativamente fuerte en la Temporada 8 (52,38%) indica que la progresión temporal sola no explica completamente las diferencias de precisión; en lugar de eso, la complejidad diagnóstica del caso parece ser el principal impulsor.’

Los modelos realizaron de manera más confiable cuando diagnosticaban condiciones comunes con síntomas reconocibles, como la meningitis, el infarto de miocardio y la embolia pulmonar – pero lucharon consistentemente con enfermedades raras como la neurocisticercosis y la enfermedad de Erdheim-Chester, así como con trastornos autoinmunes complejos como el lupus eritematoso sistémico y la sarcoidosis. El rendimiento también disminuyó en los casos toxicológicos que requerían vincular la historia de exposición a los signos clínicos.

Los autores sugieren que la variación en la precisión entre los modelos señala a diferencias significativas en la arquitectura y la estrategia de entrenamiento, con el rendimiento más fuerte de GPT-5 Mini y Gemini 2.5 Pro que indica que las generaciones más recientes de LLM se benefician de capacidades de razonamiento mejoradas – aunque sus resultados aún revelan limitaciones claras en el manejo de tareas de diagnóstico complejas.

Los resultados, sostienen, proporcionan métricas básicas para el diagnóstico de enfermedades raras basado en narrativa, lo que indica firmemente que los modelos de lenguaje actuales están comenzando a mostrar capacidades de razonamiento médico útiles.

El salto en el rendimiento de GPT-4o Mini con un 16,48% a Gemini 2.5 Pro con un 38,64%, concluye el artículo, señala un progreso constante hacia herramientas de apoyo clínico aplicables.

Aunque los investigadores conceden que los niveles de precisión siguen siendo modestos, la referencia se centra exclusivamente en casos complejos que desafían incluso a los médicos capacitados, y la capacidad de identificar correctamente el diagnóstico en casi el 40% de estos ejemplos difíciles señala una capacidad de razonamiento real, sentando las bases para mejoras futuras a través de un ajuste fino dirigido, la integración de conocimientos médicos estructurados o estrategias de razonamiento híbridas.

Conclusión

Hay algunos peligros obvios en la reutilización de narrativas de programas de televisión en conjuntos de datos médicos del mundo real – incluso en casos, como House, donde el material de origen tiene un alto nivel de contribuciones y supervisión médica calificada.

Es interesante señalar que un episodio típico de House actúa efectivamente como una máquina de resumen para una serie de entradas médicas que pueden no estar directamente accesibles en Internet para el público en general, o para fuentes de datos que presentan la información de una manera más fragmentada y no lineal.

Tener a un médico que escriba el guión de un episodio, como sucedió con frecuencia con House, podría ser utilizado por los investigadores como una especie de ‘aprobación’ del contenido; pero esto ignora el hecho de que las consideraciones artísticas pueden haber influido en la presentación de la enfermedad en el episodio.

Esto deja los datos en la condición de muchas otras fuentes de datos potencialmente útiles para el entrenamiento: en necesidad de una capa fresca de supervisión humana calificada y costosa.

 

* Por favor, tenga en cuenta que este artículo corto no sigue la plantilla habitual, y he adaptado la cobertura para acomodarlo.

Publicado por primera vez el lunes 17 de noviembre de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai