Modelos y plataformas de IA
Revolucionando la Atención Médica: Explorando el Impacto y el Futuro de los Grandes Modelos de Lenguaje en la Medicina
La integración y aplicación de grandes modelos de lenguaje (LLM) en la medicina y la atención médica ha sido un tema de gran interés y desarrollo.
Como se señaló en la Conferencia Global de la Sociedad de Gestión de la Información de la Salud y otros eventos notables, empresas como Google (GOOGL ) están liderando el camino en la exploración del potencial de la inteligencia artificial generativa en la atención médica. Sus iniciativas, como Med-PaLM 2, destacan el panorama en constante evolución de las soluciones de atención médica impulsadas por la IA, particularmente en áreas como la diagnóstica, la atención al paciente y la eficiencia administrativa.
Med-PaLM 2 de Google, un modelo de lenguaje pionero en el dominio de la salud, ha demostrado capacidades impresionantes, logrando un nivel “experto” en preguntas de estilo de examen de licencia médica de EE. UU. Este modelo, y otros como él, prometen revolucionar la forma en que los profesionales de la salud acceden y utilizan la información, lo que podría mejorar la precisión diagnóstica y la eficiencia en la atención al paciente.
No obstante, junto con estos avances, se han planteado preocupaciones sobre la practicidad y la seguridad de estas tecnologías en entornos clínicos. Por ejemplo, la dependencia de fuentes de datos de Internet para el entrenamiento de los modelos, aunque beneficioso en algunos contextos, no siempre es apropiada o confiable para fines médicos. Como Nigam Shah, PhD, MBBS, Científico de Datos Jefe para Stanford Health Care, señala, las preguntas cruciales son sobre el desempeño de estos modelos en entornos médicos reales y su impacto real en la atención al paciente y la eficiencia en la atención médica.
La perspectiva del Dr. Shah subraya la necesidad de un enfoque más personalizado para utilizar los LLM en la medicina. En lugar de modelos de propósito general entrenados en datos de Internet amplios, sugiere una estrategia más enfocada donde los modelos se entrenan en datos médicos específicos y relevantes. Este enfoque se asemeja al entrenamiento de un internado médico: proporcionarles tareas específicas, supervisar su desempeño y permitir gradualmente más autonomía a medida que demuestran competencia.
En línea con esto, el desarrollo de Meditron por investigadores de EPFL presenta una interesante avanzada en el campo. Meditron, un LLM de código abierto específicamente diseñado para aplicaciones médicas, representa un paso significativo hacia adelante. Entrenado en datos médicos curados de fuentes confiables como PubMed y directrices clínicas, Meditron ofrece una herramienta más enfocada y potencialmente más confiable para los profesionales médicos. Su naturaleza de código abierto no solo promueve la transparencia y la colaboración, sino que también permite la mejora continua y las pruebas de estrés por parte de la comunidad de investigación más amplia.
El desarrollo de herramientas como Meditron, Med-PaLM 2 y otras refleja un creciente reconocimiento de los requisitos únicos del sector de la salud en cuanto a aplicaciones de IA. El énfasis en entrenar a estos modelos en datos médicos relevantes y de alta calidad, y garantizar su seguridad y confiabilidad en entornos clínicos, es muy crucial.
Además, la inclusión de conjuntos de datos diversos, como los de contextos humanitarios como el Comité Internacional de la Cruz Roja, demuestra una sensibilidad a las diversas necesidades y desafíos en la atención médica global. Este enfoque se alinea con la misión más amplia de muchos centros de investigación de IA, que apuntan a crear herramientas de IA que no solo sean tecnológicamente avanzadas, sino también socialmente responsables y beneficiosas.
El artículo titulado “Los grandes modelos de lenguaje codifican el conocimiento clínico” publicado recientemente en Nature, explora cómo los grandes modelos de lenguaje (LLM) pueden ser utilizados de manera efectiva en entornos clínicos. La investigación presenta ideas y metodologías innovadoras, arrojando luz sobre las capacidades y limitaciones de los LLM en el dominio médico.
El dominio médico se caracteriza por su complejidad, con una amplia gama de síntomas, enfermedades y tratamientos que están en constante evolución. Los LLM no solo deben entender esta complejidad, sino también mantenerse al día con los últimos conocimientos y directrices médicas.
El núcleo de esta investigación gira en torno a una nueva referencia llamada MultiMedQA. Esta referencia combina seis conjuntos de datos de respuesta a preguntas médicas existentes con un nuevo conjunto de datos, HealthSearchQA, que comprende preguntas médicas frecuentemente buscadas en línea. Este enfoque integral apunta a evaluar a los LLM en varias dimensiones, incluyendo factualidad, comprensión, razonamiento, posible daño y sesgo, abordando así las limitaciones de las evaluaciones automatizadas anteriores que dependían de referencias limitadas.
Clave para el estudio es la evaluación del Modelo de Lenguaje Pathways (PaLM), un LLM de 540 mil millones de parámetros, y su variante con instrucciones, Flan-PaLM, en MultiMedQA. Flan-PaLM logra una precisión de estado del arte en todos los conjuntos de datos de opciones múltiples dentro de MultiMedQA, incluyendo una precisión del 67.6% en MedQA, que comprende preguntas de estilo de examen de licencia médica de EE. UU. Este desempeño marca una mejora significativa sobre modelos anteriores, superando el estado del arte anterior en más de un 17%.
MedQA
Formato: pregunta y respuesta (Q + A), opción múltiple, dominio abierto.
Pregunta de ejemplo: Un hombre de 65 años con hipertensión acude al médico para un examen de mantenimiento de salud de rutina. Los medicamentos actuales incluyen atenolol, lisinopril y atorvastatina. Su pulso es de 86 min-1, respiraciones son de 18 min-1 y la presión arterial es de 145/95 mmHg. El examen cardíaco revela un murmullo diastólico. ¿Cuál de las siguientes es la causa más probable de este examen físico?
Respuestas (la respuesta correcta en negrita): (A) Disminución de la complianza del ventrículo izquierdo, (B) Degeneración mixomatosa de la válvula mitral (C) Inflamación del pericardio (D) Dilatación de la raíz aórtica (E) Engrosamiento de las valvas de la válvula mitral.
El estudio también identifica brechas críticas en el desempeño del modelo, especialmente al responder preguntas médicas de consumidores. Para abordar estos problemas, los investigadores introducen un método conocido como ajuste de instrucciones. Esta técnica alinea eficientemente a los LLM con nuevos dominios utilizando pocos ejemplos, lo que resulta en la creación de Med-PaLM. El modelo Med-PaLM, aunque muestra un desempeño alentador y mejora en la comprensión, la recuperación de conocimiento y el razonamiento, todavía no alcanza el nivel de los clínicos.
Un aspecto notable de esta investigación es el marco de evaluación humana detallado. Este marco evalúa las respuestas de los modelos para su acuerdo con el consenso científico y los resultados potencialmente dañinos. Por ejemplo, mientras que solo el 61.9% de las respuestas de Flan-PaLM en forma larga se alineaban con el consenso científico, esta cifra aumentó al 92.6% para Med-PaLM, comparable a las respuestas generadas por clínicos. De manera similar, el potencial de resultados dañinos se redujo significativamente en las respuestas de Med-PaLM en comparación con Flan-PaLM.
La evaluación humana de las respuestas de Med-PaLM destacó su competencia en varias áreas, alineándose estrechamente con las respuestas generadas por clínicos. Esto subraya el potencial de Med-PaLM como una herramienta de apoyo en entornos clínicos.
La investigación discutida anteriormente se adentra en las complejidades de mejorar los Grandes Modelos de Lenguaje (LLM) para aplicaciones médicas. Las técnicas y observaciones de este estudio pueden generalizarse para mejorar las capacidades de los LLM en diversos dominios. Exploraremos estos aspectos clave:
Ajuste de instrucciones mejora el desempeño
- Aplicación generalizada: El ajuste de instrucciones, que implica ajustar los LLM con instrucciones o directrices específicas, ha demostrado mejorar significativamente el desempeño en varios dominios. Esta técnica podría aplicarse a otros campos, como el legal, financiero o educativo, para mejorar la precisión y la relevancia de las salidas de los LLM.
Escalado del tamaño del modelo
- Implicaciones más amplias: La observación de que el escalado del tamaño del modelo mejora el desempeño no se limita a la respuesta a preguntas médicas. Los modelos más grandes, con más parámetros, tienen la capacidad de procesar y generar respuestas más matizadas y complejas. Este escalado puede ser beneficioso en dominios como el servicio al cliente, la escritura creativa y el soporte técnico, donde la comprensión y la generación de respuestas matizadas son cruciales.
Invocación de la cadena de pensamiento (COT)
- Utilización en dominios diversos: El uso de la invocación de la cadena de pensamiento (COT), aunque no siempre mejora el desempeño en conjuntos de datos médicos, puede ser valioso en otros dominios donde se requiere resolución de problemas complejos. Por ejemplo, en escenarios de resolución de problemas técnicos o toma de decisiones complejas, la invocación de la cadena de pensamiento puede guiar a los LLM para procesar la información paso a paso, lo que conduce a salidas más precisas y razonadas.
Coincidencia propia para una mayor precisión
- Aplicaciones más amplias: La técnica de coincidencia propia, donde se generan varias salidas y se selecciona la respuesta más consistente, puede mejorar significativamente el desempeño en varios campos. En dominios como las finanzas o el derecho, donde la precisión es fundamental, este método puede utilizarse para verificar las salidas generadas para una mayor confiabilidad.
Incertidumbre y predicción selectiva
- Relevancia entre dominios: Comunicar las estimaciones de incertidumbre es crucial en campos donde la información errónea puede tener consecuencias graves, como la atención médica y el derecho. Utilizar la capacidad de los LLM para expresar incertidumbre y deferir selectivamente las predicciones cuando la confianza es baja puede ser una herramienta crucial en estos dominios para prevenir la diseminación de información inexacta.
La aplicación real de estos modelos se extiende más allá de responder preguntas. Pueden utilizarse para la educación del paciente, asistir en los procesos de diagnóstico e incluso en la formación de estudiantes de medicina. Sin embargo, su despliegue debe gestionarse cuidadosamente para evitar la dependencia de la IA sin la debida supervisión humana.
A medida que evoluciona el conocimiento médico, los LLM también deben adaptarse y aprender. Esto requiere mecanismos para el aprendizaje y la actualización continuos, garantizando que los modelos permanezcan relevantes y precisos con el tiempo.














