Líderes de opinión

La verdadera razón por la que su tubería RAG sigue alucinando

mm
Añade Unite.AI a tus fuentes preferidas en Google

Conoce el ritual. La tubería alucinó frente a un cliente, así que cambió el modelo de incrustación. Luego actualizó el LLM. Luego agregó una llamada de sistema que dice, en mayúsculas cada vez más desesperadas, SOLO USAR EL CONTEXTO PROPORCIONADO. Y esta mañana citó confiadamente un documento de política que no existe.

Estás en buena compañía. Cuando los investigadores de RegLab y HAI de Stanford auditaron las herramientas de investigación jurídica de IA vendidas por LexisNexis y Thomson Reuters (TRI ), productos comercializados como “libres de alucinaciones” gracias a la generación aumentada de recuperación, encontraron tasas de alucinación entre el 17% y el 34% en consultas legales preregistradas. RAG genuinamente ayudó: el GPT-4 sin procesar alucinó mucho más. Pero la brecha entre “reducido” y “eliminado” es donde viven los sistemas de producción, y esa brecha tiene una estructura.

La alucinación en una tubería RAG rara vez es un solo fallo. Son tres, conspirando: la recuperación falla silenciosamente, el modelo fue entrenado para responder de todos modos, y nada en la tubería mide el espacio entre esos dos hechos. Cambiar modelos no aborda ninguno de ellos.

Conspirador uno: la recuperación falla más a menudo de lo que crees

La evidencia más fresca aquí es también la más incómoda. En noviembre de 2025, un equipo que incluía a 18 expertos médicos produjo 80,502 anotaciones en 800 salidas de RAG en consultas de pacientes y estilo USMLE reales. El RAG estándar no solo no entregó; degradó la factualidad hasta un 6% y la completitud hasta un 5% en comparación con los mismos modelos que ejecutaban sin recuperación. La causa raíz se sentó aguas arriba del LLM por completo: solo el 22% de los pasajes recuperados en el top-16 eran relevantes para la consulta.

Antes de que desestimes eso como un problema de dominio difícil, Anthropic midió el fallo de recuperación en corpora limpios y curados mientras desarrollaba su técnica de recuperación contextual y encontró que la búsqueda de incrustación estándar falló en superficie el trozo necesario en los resultados principales 20 el 5.7% del tiempo. Una consulta de cada dieciocho, en datos bien cuidados, sin nada exótico sucediendo.

Esto es por qué la taxonomía de ingeniería canónica de fallos de RAG, Barnett et al.’s siete puntos de fallo, importa tanto: tres de los siete (contenido perdido, documentos de clasificación superior perdidos y fallos de consolidación de contexto) ocurren antes de que el modelo de lenguaje genere un solo token. Unite.AI ha publicado un paseo exhaustivo de esa taxonomía y los marcos de evaluación que se asignan a ella, así que no lo reconstruiré aquí. El punto que este artículo agrega es sobre incentivos: la similitud de incrustación es un proxy para la relevancia, no una garantía de ella, y el trabajo teórico reciente de Google DeepMind indica que las incrustaciones de vector único tienen límites matemáticos difíciles en qué combinaciones de documentos relevantes pueden representar en absoluto. Un recuperador que devuelve fragmentos plausibles pero incorrectos está haciendo exactamente lo que la similitud de coseno hace.

Conspirador dos: el modelo fue entrenado para adivinar

Ahora entregue ese contexto defectuoso a un modelo de lenguaje y pregunte qué enseñó su entrenamiento a hacer con las brechas.

OpenAI respondió directamente en su papel de septiembre de 2025 Por qué los modelos de lenguaje alucinan: el entrenamiento y la evaluación estándar recompensan adivinar sobre reconocer la incertidumbre. Las pruebas de precisión binaria, la abstención puntuación cero, y así, como los estudiantes que enfrentan un examen de opción múltiple, los modelos aprenden que una suposición confiada supera un espacio en blanco. El propio comparación del papel lo hace concreto: en SimpleQA, un modelo de razonamiento se abstuvo el 1% del tiempo y estuvo equivocado el 75% del tiempo, mientras que un hermano afinado de manera diferente se abstuvo el 52% del tiempo y redujo su tasa de error al 26%.

Las pruebas específicas de RAG muestran qué hace ese incentivo dentro de una tubería. El benchmark RGB probó si los modelos se negaban a responder cuando se les entregaban solo documentos irrelevantes. La mejor tasa de rechazo negativo en todos los modelos probados fue del 45%, lo que significa que incluso el mejor modelo, dado nada más que contexto de basura, respondió de todos modos más de la mitad del tiempo. ClashEval encontró el fallo de espejo: cuando el contenido recuperado contradecía el conocimiento que el modelo ya tenía correcto, los modelos abandonaron su propia respuesta correcta en favor del contexto incorrecto más del 60% del tiempo. La fidelidad falla en ambas direcciones, y FaithEval de Salesforce agrega el coro inquietante de que los modelos más grandes no son fiablemente más fieles.

El equipo de interpretación de Anthropic incluso ha rastreado el mecanismo. En su análisis, la negativa es el circuito predeterminado del modelo; una característica de “entidad conocida” suprime esa negativa cuando el modelo reconoce algo. La alucinación sucede cuando la característica falla, cuando el modelo reconoce la forma de su pregunta, carece de la sustancia y confabula fluidamente en la brecha.

Y si estás esperando que la frontera simplemente superará esto: el leaderboard de alucinación de Vectara mide algo mucho más fácil que RAG, resumiendo un solo documento colocado directamente frente al modelo, y a partir de su actualización de mayo de 2026, GPT-4o todavía fabricó en el 9.6% de los resúmenes y Claude Opus 4 en el 12%. Incluso con la recuperación resuelta perfectamente, la generación se filtra.

La solución instintiva empeora las cosas

Enfrentado con todo esto, la mayoría de los equipos se lanzan hacia el volumen. Recuperar más fragmentos. Comprar la ventana de contexto más grande. Meter todo lo que podría ayudar y dejar que el modelo lo resuelva.

La evidencia corre en la dirección opuesta. El estudio de rotación de contexto de Chroma probó 18 modelos, incluyendo GPT-4.1, Claude 4 y Gemini 2.5, y encontró que el rendimiento se volvía “cada vez más poco confiable a medida que crece la longitud de entrada”, con un solo documento de distracción que reducía significativamente la precisión y cuatro distractores que la reducían sustancialmente. La investigación anterior Perdido en el medio encontró la famosa curva en U: la información enterrada en el contexto medio se ignora incluso por los modelos de contexto largo. Y la auditoría médica de arriba es lo que esas dinámicas parecen de principio a fin, un sistema que recupera dieciséis pasajes de los cuales doce o más son irrelevantes, y luego entrega el montón a un modelo entrenado para nunca decir “no sé”.

Más recuperación sin más precisión solo fabrica distractores. La precisión supera a la recuperación en la generación basada, y no es cercano.

Conspirador tres: nadie está midiendo la brecha

Barnett et al. puso la verdad operativa en una línea: “la validación de un sistema RAG solo es factible durante la operación”. No puedes firmar una tubería RAG en la etapa, porque sus modos de fallo son una propiedad conjunta de su corpus, sus consultas y sus usuarios, ninguno de los cuales se mantiene quieto.

Sin embargo, la mayoría de las tuberías de producción siguen la calidad de la respuesta de extremo a extremo como máximo, lo que confunde a los dos conspiradores anteriores en un solo número inexplicable. La descomposición estándar, a veces llamada triada RAG, separa la relevancia del contexto (¿encontró la recuperación el material correcto?), la fundamentación (¿se adhiere la respuesta a ese material?), y la relevancia de la respuesta (¿aborda la pregunta?). Marcos como RAGAS y TruLens implementan esto. Seré honesto de que no existe una encuesta rigurosa que cuantifique cuántos equipos de producción ejecutan estos; lo que existe es el registro del practicante, y describe principalmente la evaluación por vibraciones. Si su equipo no tiene un panel de instrumentos que distinga los fallos de recuperación de los fallos de fidelidad, cada alucinación seguirá pareciendo un problema del modelo, y seguirá comprando soluciones con forma de modelo.

Qué funciona realmente, en orden

Mida la recuperación por separado de la generación. La solución poco glamorosa que todos saltan, y en mi opinión el artículo de mayor influencia en esta lista, porque convierte un argumento sobre qué modelo comprar en un diagnóstico. Si la relevancia del contexto es mala, ningún generador puede salvarlo. Si la fundamentación es mala con un buen contexto, ningún recuperador puede.

Construya la pila de precisión. Los números publicados de Anthropic son la demostración más clara de soluciones de recuperación apiladas en cualquier lugar: las incrustaciones de fragmentos contextuales redujeron el fallo de recuperación en los resultados principales 20 del 5.7% al 3.7%, agregar BM25 híbrido de búsqueda (coincidencia de palabras clave clásica junto con la búsqueda de vector) lo llevó al 2.9%, y agregar un reranqueador, un modelo de segunda etapa que re-puntuó los fragmentos candidatos para la relevancia real, alcanzó el 1.9%, una reducción total del 67%. Unite.AI ha cubierto por qué la recuperación de dos etapas golpea por encima de su peso en detalle.

Recompense la abstención. La prescripción de OpenAI es penalizar los errores confiados más que la incertidumbre expresada, y puede implementar la versión local hoy: solicite y evalúe respuestas “no sé”, y agregue una verificación de fundamentación, un modelo de implicación (NLI) que verifica cada afirmación generada que está respaldada por el texto recuperado antes de que la respuesta se envíe. El trabajo RAGTruth mostró que un pequeño detector afinado puede coincidir con el GPT-4 basado en la llamada para atrapar afirmaciones no respaldadas.

Reescriba las consultas y filtre la evidencia. En la auditoría médica, la reformulación de la consulta más la filtración de la evidencia recuperó hasta 12 puntos de factualidad. Barato, aburrido, efectivo.

Considere la recuperación agente como último. La recuperación de múltiples pasos que razona sobre qué recuperar a continuación (principiante aquí) genuinamente ayuda a las consultas de múltiples saltos difíciles, pero agrega latencia, costo y nuevos modos de fallo. Es una piedra angular, no una base.

El modelo fue la parte menos rota

Mire hacia atrás al ritual desde la apertura. Cada paso de él, el intercambio de incrustación, la actualización del modelo, la llamada de sistema que grita, trataron la alucinación como un defecto en el generador. La evidencia dice que el generador estaba haciendo lo que su entrenamiento recompensa, con los materiales que su recuperador le entregó, no observado por ninguna métrica que pudiera haber dicho cuál de esos estaba fallando.

Su tubería RAG no está rota. Es obediente. Hace exactamente lo que sus incentivos recompensan, y hasta que mida la recuperación y la generación por separado y haga “no sé” una categoría de puntuación en lugar de un fallo, esos incentivos dicen: adivina.

Gary es un escritor experto con más de 10 años de experiencia en desarrollo de software, desarrollo web y estrategia de contenido. Se especializa en crear contenido de alta calidad y atractivo que impulsa las conversiones y construye lealtad a la marca. Tiene una pasión por crear historias que cautivan e informan a las audiencias, y siempre está buscando nuevas formas de involucrar a los usuarios.