Ángulo de Anderson

Nueva investigación encuentra dieciséis problemas importantes con los sistemas RAG, incluyendo la perplejidad

mm
Añade Unite.AI a tus fuentes preferidas en Google
Image generated by ChatGPT-4o, with prompt ' Create a highly photorealistic panoramic image of a robot frantically searching the internet on a laptop. Do not stylize this image so that it looks like a false or AI-created image'

Un estudio reciente de Estados Unidos ha encontrado que el rendimiento en el mundo real de los sistemas de investigación de generación aumentada (RAG) populares, como Perplexity y Bing Copilot, se queda muy corto tanto de la publicidad como de la adopción popular que ha generado titulares en los últimos 12 meses.

El proyecto, que involucró una participación extensa en una encuesta con 21 voces expertas, encontró no menos de 16 áreas en las que los sistemas RAG estudiados (You Chat, Bing Copilot y Perplexity) produjeron causa de preocupación:

1: Falta de detalle objetivo en las respuestas generadas, con resúmenes genéricos y poca profundidad contextual o matiz.

2. Refuerzo de la percepción del sesgo del usuario, donde un motor RAG a menudo no presenta una gama de puntos de vista, sino que infiere y refuerza el sesgo del usuario, basado en la forma en que el usuario formula una pregunta.

3. Lenguaje excesivamente confiado, particularmente en respuestas subjetivas que no pueden establecerse empíricamente, lo que puede llevar a los usuarios a confiar en la respuesta más de lo que merece.

4: Lenguaje simplista y falta de pensamiento crítico y creatividad, donde las respuestas efectivamente patronizan al usuario con información “simplificada” y “acorde”, en lugar de una cogitación y análisis pensados.

5: Malatribución y mala cita de fuentes, donde el motor de respuestas utiliza fuentes citadas que no respaldan su respuesta/s, fomentando la ilusión de credibilidad.

6: Selección de información de contexto inferido, donde el agente RAG parece buscar respuestas que respalden su contenido generado y su estimación de lo que el usuario quiere escuchar, en lugar de basar sus respuestas en un análisis objetivo de fuentes confiables (posiblemente indicando un conflicto entre los datos “preestablecidos” del LLM y los datos que obtiene en tiempo real de Internet en respuesta a una consulta).

7: Omisión de citas que respaldan declaraciones, donde el material de fuente para las respuestas está ausente.

8: No proporciona un esquema lógico para sus respuestas, donde los usuarios no pueden cuestionar por qué el sistema prioriza ciertas fuentes sobre otras.

9: Número limitado de fuentes, donde la mayoría de los sistemas RAG típicamente proporcionan alrededor de tres fuentes de apoyo para una declaración, incluso cuando una mayor diversidad de fuentes sería aplicable.

10: Fuentes huérfanas, donde los datos de todas o algunas de las citas de apoyo del sistema no están incluidos en la respuesta.

11: Uso de fuentes no confiables, donde el sistema parece haber preferido una fuente que es popular (es decir, en términos de SEO) en lugar de factualmente correcta.

12: Fuentes redundantes, donde el sistema presenta múltiples citas en las que los artículos de fuente son esencialmente los mismos en contenido.

13: Fuentes no filtradas, donde el sistema ofrece al usuario ninguna forma de evaluar o filtrar las citas ofrecidas, obligando a los usuarios a confiar en los criterios de selección.

14: Falta de interactividad o explorabilidad, donde varios de los participantes en el estudio de usuarios se sintieron frustrados porque los sistemas RAG no hicieron preguntas clarificadoras, sino que asumieron la intención del usuario desde la primera consulta.

15: Necesidad de verificación externa, donde los usuarios se sienten compelidos a realizar una verificación independiente de la respuesta/s suministrada, lo que elimina en gran medida la supuesta comodidad de RAG como “reemplazo de búsqueda”.

16: Uso de métodos de citación académica, como [1] o [34]; esto es una práctica estándar en círculos académicos, pero puede ser poco intuitivo para muchos usuarios.

Para el trabajo, los investigadores reunieron a 21 expertos en inteligencia artificial, salud y medicina, ciencias aplicadas y educación y ciencias sociales, todos ellos investigadores postdoctorales o candidatos a doctorado. Los participantes interactuaron con los sistemas RAG estudiados mientras hablaban sus procesos de pensamiento en voz alta, para aclarar (para los investigadores) su propio esquema racional.

El papel cita ampliamente las dudas y preocupaciones de los participantes sobre el rendimiento de los tres sistemas estudiados.

La metodología del estudio de usuarios se sistematizó luego en un estudio automatizado de los sistemas RAG, utilizando suites de control de navegador:

‘Una evaluación automatizada a gran escala de sistemas como You.com, Perplexity.ai y BingChat mostró que ninguno cumplió con un rendimiento aceptable en la mayoría de las métricas, incluidos aspectos críticos relacionados con el manejo de alucinaciones, declaraciones no respaldadas y precisión de citación.’

Los autores argumentan a lo largo (y asiduamente, en el papel comprehensivo de 27 páginas) que tanto los nuevos como los usuarios experimentados deben ejercer precaución al utilizar la clase de sistemas RAG estudiados. También proponen un nuevo sistema de métricas, basado en las deficiencias encontradas en el estudio, que podría formar la base de una mayor supervisión técnica en el futuro.

Sin embargo, el creciente uso público de los sistemas RAG lleva a los autores a abogar también por una legislación y una política gubernamental más estrictas y aplicables en cuanto a las interfaces de búsqueda de IA asistidas por agentes.

El estudio proviene de cinco investigadores de la Universidad Estatal de Pensilvania y Salesforce, y se titula Motores de búsqueda en una era de IA: La falsa promesa de respuestas verificables y con fuentes citadas. El trabajo cubre los sistemas RAG hasta el estado del arte en agosto de 2024

El comercio de RAG

Los autores prefacian su trabajo reiterando cuatro deficiencias conocidas de los Modelos de Lenguaje Grande (LLM) donde se utilizan dentro de los motores de respuestas.

Primero, están propensos a alucinar información, y carecen de la capacidad de detectar inconsistencias factuales. Segundo, tienen dificultades para evaluar la precisión de una citación en el contexto de una respuesta generada. Tercero, tienden a favorecer los datos de sus propios pesos preentrenados, y pueden resistir los datos de la documentación recuperada externamente, incluso si esos datos son más recientes o más precisos.

Finalmente, los sistemas RAG tienden hacia un comportamiento de agradar a la gente, comportamiento sicofante, a menudo a expensas de la precisión de la información en sus respuestas.

Todas estas tendencias se confirmaron en ambos aspectos del estudio, entre muchas observaciones novedosas sobre los peligros de RAG.

El papel considera el producto RAG SearchGPT de OpenAI (lanzado a los suscriptores la semana pasada, después de que se presentó el nuevo papel), como probablemente para alentar la adopción del usuario de los sistemas de búsqueda basados en RAG, a pesar de las deficiencias fundamentales que los resultados de la encuesta sugieren*:

‘El lanzamiento de OpenAI’s ‘SearchGPT’, comercializado como un ‘asesino de Google search’, exacerbó aún más las preocupaciones. A medida que crece la dependencia de estas herramientas, también lo hace la urgencia de comprender su impacto. Lindemann introduce el concepto de Conocimiento Sellado, que critica cómo estos sistemas limitan el acceso a respuestas diversas al condensar las consultas de búsqueda en respuestas autorizadas singulares, descontextualizando efectivamente la información y reduciendo perspectivas de usuario.

‘Esta “sellado” de conocimiento perpetúa sesgos de selección y restringe puntos de vista marginados.’

El estudio

Los autores primero probaron su procedimiento de estudio en tres de los 24 participantes seleccionados, todos invitados por medios como LinkedIn o correo electrónico.

La primera etapa, para los 21 restantes, involucró Recuperación de información de expertos, donde los participantes promediaron alrededor de seis consultas de búsqueda durante una sesión de 40 minutos. Esta sección se centró en la recolección y verificación de preguntas y respuestas basadas en hechos, con soluciones empíricas potenciales.

La segunda fase se ocupó de Recuperación de información de debate, que trató con asuntos subjetivos, incluyendo ecología, vegetarianismo y política.

Respuestas de estudio generadas de Perplexity (izquierda) y You Chat (derecha). Fuente: https://arxiv.org/pdf/2410.22349

Respuestas de estudio generadas de Perplexity (izquierda) y You Chat (derecha). Fuente: https://arxiv.org/pdf/2410.22349

Dado que todos los sistemas permitían al menos algún nivel de interactividad con las citas proporcionadas como apoyo para las respuestas generadas, se animó a los sujetos del estudio a interactuar con la interfaz tanto como fuera posible.

En ambos casos, se pidió a los participantes que formularan sus consultas tanto a través de un sistema RAG como de un motor de búsqueda convencional (en este caso, Google).

Los tres motores de respuestas – You Chat, Bing Copilot y Perplexity – se eligieron porque son accesibles públicamente.

La mayoría de los participantes ya eran usuarios de sistemas RAG, a frecuencias variables.

Debido a limitaciones de espacio, no podemos desglosar cada una de las dieciséis deficiencias clave encontradas en el estudio, pero presentamos una selección de algunos de los ejemplos más interesantes y esclarecedores.

Falta de detalle objetivo

El papel señala que los usuarios encontraron que las respuestas de los sistemas a menudo carecían de detalle objetivo, tanto en las respuestas factuales como en las subjetivas. Uno comentó:

‘Estaba solo tratando de responder sin darme realmente una respuesta sólida o una respuesta más pensada, que puedo obtener con múltiples búsquedas de Google.’

Otro observó:
‘Es demasiado corto y solo resume todo mucho. [El modelo] necesita darme más datos para la afirmación, pero está muy resumido.’

Falta de punto de vista holístico

Los autores expresan preocupación por esta falta de matiz y especificidad, y afirman que los motores de respuestas a menudo no presentaron múltiples perspectivas sobre ningún argumento, tendiendo a estar de acuerdo con un sesgo percibido inferido de la forma en que el usuario formuló la pregunta.

Un participante dijo:

‘Quiero saber más sobre el lado opuesto del argumento… esto es con una pizca de sal porque no sabemos el otro lado y la evidencia y los hechos.’

Otro comentó:
‘No me da ambos lados del argumento; no está discutiendo conmigo. En lugar de eso, [el modelo] me está diciendo: “tienes razón… y aquí están las razones por las que”.’

Lenguaje confiado

Los autores observan que los tres sistemas probados exhibieron el uso de lenguaje excesivamente confiado, incluso para respuestas que cubren asuntos subjetivos. Sostienen que este tono tenderá a inspirar una confianza injustificada en la respuesta.

Un participante anotó:

‘Escribe con tanta confianza, me siento convencido sin siquiera mirar la fuente. Pero cuando miro la fuente, es mala y eso me hace cuestionarla de nuevo.’

Otro comentó:
‘Si alguien no conoce exactamente la respuesta correcta, confiará en esto incluso cuando está mal.’

Citaciones incorrectas

Otro problema frecuente fue la mala atribución de fuentes citadas como autoridad para las respuestas de los sistemas RAG, con uno de los sujetos del estudio que afirmó:

‘[Esta] afirmación no parece estar en la fuente. Quiero decir que la afirmación es verdadera; es válida… pero no sé de dónde está obteniendo esta información.’

Los autores del nuevo papel comentan:

‘Los participantes sintieron que los sistemas estaban utilizando citaciones para legitimar su respuesta, creando una ilusión de credibilidad. Esta fachada solo se reveló a unos pocos usuarios que procedieron a examinar las fuentes.’

Selección de información para adaptarse a la consulta

Volviendo a la idea de un comportamiento de agradar a la gente, sycophantic, en las respuestas RAG, el estudio encontró que muchas respuestas resaltaron un punto de vista particular en lugar de resumir de manera integral el tema, como observó un participante:

‘Siento que [el sistema] es manipulador. Solo toma algunas informaciones y me hace sentir que solo veo un lado de las cosas.’

Otro opinó:

‘[La fuente] tiene tanto pros como contras, y ha elegido recoger solo los argumentos requeridos de este enlace sin la imagen completa.’

Para más ejemplos detallados (y múltiples citas críticas de los participantes en la encuesta), nos referimos al lector al papel de fuente.

RAG automatizado

En la segunda fase del estudio más amplio, los investigadores utilizaron scripting basado en navegador para solicitar sistemáticamente consultas a los tres motores RAG estudiados. Luego utilizaron un sistema LLM (GPT-4o) para analizar las respuestas de los sistemas.

Las declaraciones se analizaron para relevancia de la consulta y Declaraciones a favor y en contra (es decir, si la respuesta es a favor, en contra o neutral, en relación con el sesgo implícito de la consulta.

Una Puntuación de confianza de la respuesta también se evaluó en esta fase automatizada, basada en el método de prueba psicométrica de escala de Likert. Aquí, el juez LLM se complementó con dos anotadores humanos.

Una tercera operación involucró el uso de scraping web para obtener el contenido de texto completo de las páginas web citadas, a través de la herramienta Jina.ai Reader. Sin embargo, como se señala en otra parte del papel, la mayoría de las herramientas de scraping web no pueden acceder a sitios con pago más que la mayoría de las personas (aunque los autores observan que Perplexity.ai ha sido conocido por evadir esta barrera).

Consideraciones adicionales fueron si las respuestas citaban una fuente (computada como una ‘matriz de citación’), así como una ‘matriz de apoyo factual’ – una métrica verificada con la ayuda de cuatro anotadores humanos.

Así, se obtuvieron 8 métricas generales: respuesta sesgada; respuesta excesivamente confiada; declaración relevante; fuentes no citadas; declaraciones no respaldadas; necesidad de fuente; precisión de citación; y exhaustividad de citación.

El material contra el que se probaron estas métricas consistió en 303 preguntas curadas de la fase del estudio de usuarios, lo que resultó en 909 respuestas en los tres sistemas RAG probados.

Evaluación cuantitativa a través de los tres sistemas RAG probados, basada en ocho métricas.

Evaluación cuantitativa a través de los tres sistemas RAG probados, basada en ocho métricas.

En cuanto a los resultados, el papel establece:

‘Al examinar las tres métricas relacionadas con el texto de la respuesta, encontramos que todos los motores de respuestas evaluados generan con frecuencia (50-80%) respuestas sesgadas, favoreciendo el acuerdo con una formulación cargada de una pregunta de debate sobre presentar múltiples perspectivas en la respuesta, con Perplexity que se desempeña peor que los otros dos motores.

‘Este hallazgo se ajusta a [los hallazgos] de nuestros resultados cualitativos. Sorprendentemente, aunque Perplexity es más probable que genere una respuesta sesgada, también genera las respuestas más largas (18,8 declaraciones por respuesta en promedio), lo que indica que la falta de diversidad de respuesta no se debe a la brevedad de la respuesta.

‘En otras palabras, aumentar la longitud de la respuesta no mejora necesariamente la diversidad de la respuesta.’

Los autores también observan que Perplexity es más probable que utilice lenguaje confiado (90% de las respuestas), y que, en contraste, los otros dos sistemas tienden a utilizar un lenguaje más cauteloso y menos confiado cuando se trata de contenido subjetivo.

You Chat fue el único marco RAG que logró cero fuentes no citadas para una respuesta, con Perplexity en 8% y Bing Chat en 36%.

Todos los modelos mostraron una ‘proporción significativa’ de declaraciones no respaldadas, y el papel declara:

‘El marco RAG se anuncia para resolver el comportamiento alucinado de los LLM al hacer que un LLM genere una respuesta basada en documentos de fuente, sin embargo, los resultados muestran que los motores de respuestas RAG todavía generan respuestas que contienen una gran proporción de declaraciones no respaldadas por las fuentes que proporcionan.

Además, todos los sistemas probados tuvieron dificultades para respaldar sus declaraciones con citaciones:

‘You.Com y [Bing Chat] se desempeñan ligeramente mejor que Perplexity, con aproximadamente dos tercios de las citaciones que apuntan a una fuente que respalda la declaración citada, y Perplexity se desempeña peor con más de la mitad de sus citaciones siendo inexactas.

‘Este resultado es sorprendente: la citación no es solo inexacta para las declaraciones que no están respaldadas por ninguna fuente, sino que encontramos que incluso cuando existe una fuente que respalda una declaración, todos los motores todavía citan con frecuencia una fuente incorrecta diferente, perdiendo la oportunidad de proporcionar información de origen correcta al usuario.

En otras palabras, el comportamiento alucinado no se exhibe solo en declaraciones no respaldadas, sino también en citaciones inexactas que impiden que los usuarios verifiquen la validez de la información.

Los autores concluyen:

‘Ninguno de los motores de respuestas logra un buen rendimiento en la mayoría de las métricas, lo que destaca la gran habitación para la mejora en los motores de respuestas.’

 

 

* Mi conversión de las citaciones en línea de los autores a enlaces. Donde fue necesario, elegí la primera de múltiples citaciones para el enlace, debido a consideraciones prácticas de formato.

Énfasis de los autores, no mío.

Publicado por primera vez el lunes 4 de noviembre de 2024

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai