Fundamentos de la IA
Por qué su RAG biomédico oculta contradicciones de usted

El RAG biomédico estándar resuelve la evidencia en conflicto silenciosamente en aproximadamente tres de cada cuatro consultas. La solución es estructural, no informativa — y la mayoría de la complejidad que los equipos agregan upstream no ayuda.
Pregúntele a un asistente clínico con recuperación aumentada una pregunta simple — ¿ayuda la melatonina con el jet lag? — y la literatura que recupera no estará de acuerdo con sí misma.
La revisión de Cochrane concluyó que la melatonina es notablemente efectiva, con ocho de diez ensayos incluidos que mostraron una reducción del jet lag en vuelos que cruzan cinco o más zonas horarias. Un ensayo aleatorizado y doble ciego de 257 médicos noruegos en la Revista Americana de Psiquiatría encontró ningún beneficio de ninguno de los tres regímenes de melatonina.
Ambos documentos son reales. Ambos son metodológicamente serios. Cualquier clínico que decida qué recomendar necesita saber que no están de acuerdo.
En pruebas controladas, la síntesis generalmente no lo dijo. Produjo un párrafo fluido y correctamente citado que se inclinó por un lado y nunca señaló que existía otro lado.
Eso es ceguera de contradicción. En un benchmark de contradicción emparejada biomédica, ocurrió en 72.6 por ciento de las consultas (95% CI 0.697–0.755). El resultado se leyó normalmente. Las citas se resolvieron correctamente. Las comprobaciones de calidad estándar pasaron. La discrepancia simplemente desapareció.
El modo de fallo que parece éxito
Mientras que no hay convergencia directa en la evidencia relacionada con la biomedicina, los estudios muestran resultados en conflicto entre el uso de estudios observacionales versus ensayos controlados aleatorios (ECA) y también métodos variables utilizados para diferentes poblaciones de pacientes; sin embargo, un estudio también puede incluir tanto una metodología fuerte como débil, lo que parecería tener el mismo peso.
Este no es un caso único. El análisis de Ioannidis de la investigación clínica más citada encontró que el 16 por ciento de los estudios más citados fueron contradichos directamente, y que los estudios observacionales fueron mucho más propensos que los ensayos aleatorios a ser contradichos o a tener sus efectos revisados hacia abajo — cinco de seis, contra nueve de treinta y nueve. Por lo tanto, el problema no es solo la discrepancia entre los estudios, sino más bien una parte estructural de la literatura en sí.
Por lo tanto, como una función crítica de cualquier sistema de generación con recuperación aumentada biomédica, generar evidencia sobre las discrepancias entre los estudios debe ser un objetivo principal. Sin embargo, la mayoría de los sistemas no logran cumplir con esta tarea. Al utilizar el benchmark HealthContradict de 920 ejemplos emparejados de contradicción, se demostró que un RAG estándar falló al generar las discrepancias en aproximadamente el 73 por ciento de los pares probados. El problema no es la recuperación. El sistema recupera ambos lados. Luego resuelve el conflicto silenciosamente, a favor de uno de ellos.
Un examen manual de 50 casos de fallo estratificados produjo un patrón que he denominado aplacimiento epistemológico. Ambos documentos son citados individualmente por el modelo, y su representación del conflicto se describe en términos de gradientes de confianza (“evidencia anecdótica… estudios científicos indican…”) como si no existiera conflicto. Menos del 5 por ciento de estos casos de fallo utilizaron las palabras “contradicción”, “conflicto” o “discrepancia” en absoluto. El resultado generado tuvo una tasa de precisión de cita de 0,99. Ese es precisamente el punto: la precisión de la cita no implica conciencia de contradicción. Un sistema puede atribuir cada oración perfectamente y aún así decirle a un clínico algo que la base de evidencia no admite.
Tres características de la “síntesis” de RAG crean un entorno clínico peligroso.
Invertir la propuesta de valor. El propósito de RAG es mostrar evidencia relevante para los clínicos. Por lo tanto, al eliminar el aspecto de esa evidencia que es más importante para que los clínicos la revisen, en realidad logra lo contrario.
Crear invisibilidad. Dado que no hay margen, ni truncamiento, ni artefacto de formato; una síntesis “aplaciada” y una síntesis fiel parecen indistinguibles en la pantalla.
Compensar silenciosamente a escala. Nada en un conjunto de evaluación estándar lo señala, por lo que un sistema puede ejecutarse en producción durante meses mientras cada consulta en conflicto se resuelve silenciosamente en una dirección.
La información no es la palanca
Una solución obvia a este problema sería informar al modelo. Claramente, si el modo de fallo era que el modelo no identificaba que dos documentos estaban en conflicto, podrías simplemente agregar una etiqueta de postura “SOPORTE” o “CONTRADICCIÓN” a cada uno de los documentos recuperados. Esto debería mejorar obviamente el rendimiento del modelo. No lo hizo.
En un experimento en el que agregamos etiquetas de postura (al anotar) para dar explícitamente al modelo la información de que dos documentos estaban en conflicto, encontramos que la anotación explícita de postura movió la ceguera de contradicción del 93,8 por ciento en el brazo de control no anotado al 91,4 por ciento — una diferencia con intervalos de confianza superpuestos y sin importancia práctica. Aunque el modelo recibió la información de que dos documentos estaban en conflicto, su respuesta predeterminada permaneció sin cambios.
Entender el mecanismo es útil aquí. La información agregada pasivamente a una llamada no cambia la distribución de respuesta predeterminada del modelo. Para preguntas biomédicas llenas de contradicciones, esa distribución favorece fuertemente una posición consolidada. Las etiquetas de postura se convierten en tokens extra — a menudo reciclados en títulos de sección — mientras que la prosa vuelve a su tipo.
La estructura es la palanca
Lo que funcionó fue estructural, en lugar de ser informativo; en lugar de proporcionar al modelo toda la información factual o correcta sobre los documentos, la estructura requirió que la síntesis se construyera en términos de posibles discrepancias (Acuerdo, Discrepancia, Calidad de la evidencia, Conclusión). La llamada con estructura proporciona al modelo no más información que la del control no anotado. La única diferencia es lo que el modelo tiene que hacer.
Hubo reducciones de aproximadamente diecinueve veces — del 93,8 por ciento al 4,9 por ciento — en la ceguera de contradicción sin ningún reintento, sin ninguna modificación de la tubería, sin ninguna latencia aumentada y sin ningún aumento en los costos por consulta.
Esto no es razonamiento mejorado. Esto es simplemente asignación forzada. Una vez que el modelo debe proporcionar una sección de discrepancia, vuelve a los documentos que inicialmente recuperó en busca de algo para incluir en esta sección.

Ceguera de contradicción bajo tres condiciones de síntesis en ablación controlada. Agregar información de postura movió la tasa en 2,4 puntos; cambiar la estructura de salida requerida la movió en 86,5.
La llamada estructurada es menos sobre mejorar la capacidad del modelo para razonar y más sobre proporcionar una gobernanza ligera sobre cómo la generación del comportamiento del modelo asigna el espacio de salida. Obliga al modelo a gastar cierta cantidad de su espacio de salida en la discrepancia (la diferencia entre la información disponible y la información que necesita aparecer para cumplir con los requisitos).
Esto cambia una suposición arquitectónica común. La mayoría de las mejoras propuestas para RAG agregan información al contexto: más documentos, puntuaciones de recuperación, etiquetas de postura, metadatos de evidencia de grado. A menos que la llamada de síntesis tenga requisitos específicos para que esa información dé forma a la estructura de salida, la mayoría no cambiará el comportamiento del modelo. Cambiar la entrada desplaza la masa en los márgenes; cambiar la estructura de salida requerida cambia las distribuciones directamente
Por qué los ayudantes esperados no ayudan
Dos elementos comúnmente considerados esenciales para un RAG biomédico consciente de contradicciones proporcionaron muy poco cuando se probaron con ablación controlada.
1) Descomposición PICO. PICO (Población, Intervención, Comparación, Resultado) es una forma organizada de descomponer preguntas clínicas en partes componentes para su uso en medicina basada en evidencia. La hipótesis fue que descomponer las afirmaciones en campos PICO limitaría la deriva del alcance y mejoraría la detección de contradicciones en evidencia heterogénea. La eliminación de este nivel resultó en una salida casi indistinguible de la generada por el sistema completo. Aunque PICO puede ser útil para organizar sus pensamientos durante la toma de decisiones clínicas; como una inferencia en el momento del análisis para respaldar la detección de contradicciones, no tiene contribución medible.
2) Clasificación explícita de postura. En contraste con la eliminación de PICO, la clasificación explícita de postura funcionó mal pero de manera diferente. En corpus académicos limpios, produjo pequeñas ganancias en algunas métricas. Sin embargo, al analizar texto web ruidoso — que es típicamente cómo los aplicaciones de salud de cara al consumidor tendrán acceso a la información — el clasificador devolvió NOT_ENOUGH_INFO para la mayoría de los documentos, principalmente porque los autores de contenido de salud de cara al consumidor no declaran normalmente su posición utilizando lenguaje declarativo esperado por el clasificador. En consecuencia, esas etiquetas como no informativas se propagaron en el contexto de síntesis como ruido. La eliminación de la etapa para corpus ruidosos mejoró ligeramente la detección de contradicciones.
El verdadero cuello de botella es la calidad de la señal de aguas arriba
La conclusión más importante de este estudio es que la capacidad de reconocer contradicciones en las fuentes está limitada por la precisión de la información (datos) sobre estas fuentes, más que por cómo se construyeron o estructuraron.
La utilización de la calidad de la evidencia — la proporción de casos en los que la síntesis prefiere citar la fuente de mayor calidad cuando ambas están disponibles — fue 0,83 en resúmenes científicos limpios y cayó por debajo de 0,15 en recuperación web ruidosa. La fidelidad de la cita semántica siguió el mismo patrón, desde 0,66 en resúmenes hasta 0,45 en contenido de salud del consumidor.

Identical pipelines, different corpora. Contradiction handling is capped by the explicitness of the signals in the source documents.
Hay una razón estructural para esto. Los documentos recuperados en el mundo real a menudo carecen de las señales que cualquier clasificador o mecanismo de ponderación depende: metadatos de tipo de publicación, declaraciones de postura explícitas, descripciones de metodología. Los resúmenes de artículos de revisión por pares hacen afirmaciones declarativamente con respecto a poblaciones, metodologías y resultados específicos. Las mismas afirmaciones se hacen dentro de un lenguaje anecdótico, persuasivo y matizado en artículos de salud del consumidor. Por lo tanto, sistemas idénticos producen un comportamiento muy diferente aguas abajo basado en lo que reciben como entrada.
Esto también está respaldado por la mayor evaluación de expertos de RAG médica publicada, en la que dieciocho expertos médicos contribuyeron con 80,502 anotaciones en 800 salidas del modelo. Solo el 22 por ciento de los pasajes recuperados en el top 16 fueron relevantes. El RAG estándar degradó la factualidad y la completitud con respecto a los puntos de referencia no RAG. La recuperación y la selección de evidencia, no la generación, fueron los puntos de fallo dominantes — un eco de lo que el trabajo de benchmark sobre RAG médica ha estado informando durante dos años.
Aunque hay una implicación relativamente limitada de este hallazgo en términos de aplicación, se puede decir concluyentemente que la capacidad de su sistema para manejar contradicciones cuando recupera de resúmenes de PubMed no se puede transferir a un sitio web de cara al consumidor, independientemente de lo avanzado que sea el resto de su sistema.
El punto ciego de la evaluación
Medir el manejo de contradicciones es más difícil de lo que parece, y incluso un enfoque estándar para medir el manejo de contradicciones tiene su propio conjunto de problemas.
La puntuación del juez LLM representa la forma más común en que se puntúa la salida de RAG de abierto para el manejo de conflictos y también se desvía de las comprobaciones de reconocimiento estructural en términos de cómo se desarrollan. Las estrategias de llamada que organizan la síntesis en campos PICO reciben puntuaciones altas de los jueces mientras fallan las pruebas de reconocimiento explícito directamente. Esto es esperado: los jueces LLM han sido documentados como favorables a respuestas más largas y elaboradas y también verán una salvedad enterrada en la sección de resultado como exhaustividad cuando nada en el nivel de prosa hace referencia al conflicto.
La estrategia de recuperación introduce una segunda trampa. La recuperación aleatoria produce una tasa de ceguera de contradicción de cero — una síntesis no puede fallar al reconocer una contradicción que su conjunto recuperado no contiene. La recuperación de relevancia marginal máxima, por otro lado, redujo la fidelidad de la cita semántica a 0,11. Cada uno parece aceptable bajo una sola métrica de manejo de contradicciones, pero ambos fallan bajo la evaluación emparejada.
Así que empareje las métricas. Ejecute tres comprobaciones en cada síntesis: una comprobación estructural determinista para lenguaje expresado que reconoce un conflicto; un juez LLM para profundidad y equilibrio; y una comprobación de cita semántica que confirma que el contenido citado coincide con su fuente. Cada uno identifica lo que los demás no. Ninguno puede ser confiable por sí solo como una referencia para el manejo de contradicciones.
Cuatro acciones para este trimestre
- Pruebe su línea de base. Cada sistema de RAG biomédico, clínico, regulatorio en producción debe probarse para la ceguera de contradicción antes de una implementación posterior. Para realizar la prueba, necesita un conjunto de prueba emparejado con contradicción y una comprobación por consulta que la salida señalice una discrepancia sustantiva. Un valor de referencia del 72,6 por ciento no es un error de redondeo.
- Implemente llamadas de síntesis estructuradas. Las cuatro secciones obligatorias — acuerdo, discrepancia, calidad de la evidencia, conclusión — obligan a la salida a asignar ancho de banda a las discrepancias. No se requiere nueva infraestructura; no se requiere capacitación; no se requiere costo por consulta; un cambio produjo una reducción de diecinueve veces.
- No use la recuperación MMR para consultas sensibles a contradicciones. Aunque MMR utiliza documentos diversificados para la cobertura temática, no se optimiza para la cobertura de postura — lo cual es incorrecto cuando el objetivo es recuperar ambos lados de una discrepancia. Por lo tanto, la recuperación bm25 más la recuperación de incrustación debe usarse como un valor predeterminado más seguro. Sin embargo, la diversificación consciente de la postura sería la dirección hacia la que apunta este trabajo.
- Empareje sus métricas de evaluación. Retire la puntuación única del juez LLM. Combínela con una comprobación estructural para contenido sustantivo bajo encabezados de reconocimiento y una comprobación de cita semántica que verifica que la evidencia citada admita la afirmación declarada.
El punto más amplio
El instinto dominante en el desarrollo de RAG es aditivo: mejores recuperadores, mejores reordenadores, metadatos más ricos, ventanas de contexto más largas. La conversación de la industria sobre por qué las tuberías de RAG todavía fallan en producción ha seguido en gran medida la misma forma. Para el manejo de contradicciones, el movimiento efectivo fue sustractivo — restringir lo que el sistema está permitido producir en lugar de expandir lo que se le da.
Una llamada de síntesis de cuatro partes superó a una tubería de cinco etapas. Lo hizo cambiando lo que el modelo tenía que producir, no lo que el modelo podía ver.
Eso no hace que la arquitectura sea irrelevante. La recuperación establece un techo, la recuperación aleatoria hace que la síntesis sea insignificante y la mala calidad de la evidencia limita todo aguas abajo. Esto es por qué la pregunta de si los sistemas de RAG resuelven el problema de la confiabilidad sigue resurgiendo. Sin embargo, lo que determina si la evidencia en conflicto se representa como en conflicto resulta estar más adelante en la tubería y es más barato de cambiar que muchos de los otros componentes, lo que significa que los cambios necesarios para mejorar la confiabilidad pueden ocurrir antes.
El trabajo costoso — mejores conjuntos de datos de contradicción, señales de entrenamiento de discrepancia explícita, recuperación consciente de postura, benchmarks nativos de contradicción — todavía necesita hacerse y tomará considerablemente más tiempo.
Por lo tanto, si desea saber si su sistema presenta evidencia contradictoria como contradictoria, debe hacerse la pregunta incómoda y encontrar la respuesta esta semana: ¿Su sistema le dice al usuario cuándo su evidencia contradice?












