Ángulo de Anderson
Los peligros de utilizar citas para autenticar contenido de NLG

Opinión Los modelos de Generación de Lenguaje Natural (NLG) como GPT-3 son propensos a ‘halucinar’ material que presentan en el contexto de información factual. En una era que se preocupa extraordinariamente por el crecimiento de las noticias falsas basadas en texto, estos ‘vuelos de fantasía’ representan un obstáculo existencial para el desarrollo de sistemas de escritura y resumen automatizados, y para el futuro de la periodismo impulsado por IA, entre otros subsectores de Procesamiento de Lenguaje Natural (NLP).
El problema central es que los modelos de lenguaje de estilo GPT derivan características y clases clave de corpus de texto de entrenamiento muy grandes y aprenden a utilizar estas características como bloques de construcción del lenguaje de manera hábil y auténtica, independientemente de la precisión del contenido generado o incluso de su aceptabilidad.
Por lo tanto, los sistemas de NLG confían actualmente en la verificación humana de hechos en uno de dos enfoques: que los modelos se utilizan como generadores de texto de semilla que se pasan inmediatamente a los usuarios humanos, ya sea para verificación o algún otro tipo de edición o adaptación; o que los humanos se utilizan como filtros costosos para mejorar la calidad de los conjuntos de datos destinados a informar modelos menos abstractos y ‘creativos’ (que en sí mismos son inevitablemente difíciles de confiar en términos de precisión factual y que requerirán capas adicionales de supervisión humana).
Noticias antiguas y hechos falsos
Los modelos de Generación de Lenguaje Natural (NLG) pueden producir salida convincente y plausible porque han aprendido la arquitectura semántica, en lugar de asimilar más abstractamente la historia real, la ciencia, la economía o cualquier otro tema sobre el que puedan opinar, que están efectivamente entrelazados como ‘pasajeros’ en los datos de origen.
La precisión factual de la información que generan los modelos de NLG supone que la entrada en la que se entrenan es en sí misma confiable y actualizada, lo que presenta una carga extraordinaria en términos de preprocesamiento y verificación humana adicional – un obstáculo costoso que el sector de investigación de NLP está abordando actualmente desde muchos frentes.
Los sistemas a escala GPT-3 requieren una cantidad extraordinaria de tiempo y dinero para entrenar, y una vez entrenados, son difíciles de actualizar a lo que podría considerarse el ‘nivel del núcleo’. Aunque las modificaciones locales de sesión y de usuario pueden aumentar la utilidad y la precisión de los modelos implementados, estos beneficios útiles son difíciles, a veces imposibles de pasar al modelo central sin necesidad de un entrenamiento completo o parcial.
Por esta razón, es difícil crear modelos de lenguaje entrenados que puedan utilizar la información más reciente.

Entrenado incluso antes del advenimiento de COVID, text-davinci-002 – la iteración de GPT-3 considerada ‘más capaz’ por su creador OpenAI – puede procesar 4000 tokens por solicitud, pero no sabe nada sobre COVID-19 o la invasión ucraniana de 2022 (estos prompts y respuestas son del 5 de abril de 2022). Curiosamente, ‘desconocido’ es en realidad una respuesta aceptable en ambos casos de fallo, pero los prompts adicionales establecen fácilmente que GPT-3 es ignorante de estos eventos. Fuente: https://beta.openai.com/playground
Un modelo entrenado solo puede acceder a ‘verdades’ que internalizó en el momento del entrenamiento, y es difícil obtener una cita precisa y pertinente por defecto, cuando se intenta que el modelo verifique sus afirmaciones. El verdadero peligro de obtener citas del GPT-3 predeterminado (por ejemplo) es que a veces produce citas correctas, lo que lleva a una confianza falsa en este aspecto de sus capacidades:

Arriba, tres citas precisas obtenidas por GPT-3 de la era 2021. Centro, GPT-3 no puede citar una de las citas más famosas de Einstein ("Dios no juega a los dados con el universo"), a pesar de una solicitud no críptica. Abajo, GPT-3 asigna una cita escandalosa y ficticia a Albert Einstein, aparentemente un desbordamiento de preguntas anteriores sobre Winston Churchill en la misma sesión. Fuente: El artículo del autor de 2021 en https://www.width.ai/post/business-applications-for-gpt-3
GopherCite
Con la esperanza de abordar esta deficiencia general en los modelos de NLG, DeepMind de Google propuso recientemente GopherCite, un modelo de 280 mil millones de parámetros que puede citar evidencia específica y precisa en apoyo de sus respuestas generadas a las solicitudes.



Tres ejemplos de GopherCite respaldando sus afirmaciones con citas reales. Fuente: https://arxiv.org/pdf/2203.11147.pdf
GopherCite aprovecha el aprendizaje de refuerzo a partir de preferencias humanas (RLHP) para entrenar modelos de consulta capaces de citar citas reales como evidencia de apoyo. Las citas se extraen en vivo de múltiples fuentes de documentos obtenidas de motores de búsqueda o de un documento específico proporcionado por el usuario.
El rendimiento de GopherCite se midió a través de la evaluación humana de las respuestas del modelo, que se encontraron de ‘alta calidad’ el 80% de las veces en el conjunto de datos NaturalQuestions de Google, y el 67% de las veces en el conjunto de datos ELI5.
Citando falsedades
Sin embargo, cuando se probó contra la referencia de TruthfulQA de la Universidad de Oxford, las respuestas de GopherCite rara vez se calificaron como veraces, en comparación con las respuestas ‘correctas’ curadas por humanos.
Los autores sugieren que esto se debe a que el concepto de ‘respuestas respaldadas’ no define de manera objetiva la verdad en sí misma, ya que la utilidad de las citas de fuente puede verse comprometida por otros factores, como la posibilidad de que el autor de la cita esté ‘halucinando’ (es decir, escribiendo sobre mundos ficticios, produciendo contenido publicitario o fantaseando material inauténtico de otras maneras.



Casos de GopherCite donde la plausibilidad no necesariamente se equipara con ‘verdad’.
En efecto, se hace necesario distinguir entre ‘respaldado’ y ‘verdadero’ en tales casos. La cultura humana está actualmente muy por delante del aprendizaje automático en términos del uso de metodologías y marcos diseñados para obtener definiciones objetivas de la verdad, y allí, el estado nativo de ‘verdad importante’ parece ser contención y negación marginal.
El problema es recursivo en las arquitecturas de NLG que buscan crear mecanismos ‘corroborantes’ definitivos: el consenso humano se utiliza como referencia de verdad a través de modelos de tipo AMT donde los evaluadores humanos (y los humanos que median disputas entre ellos) son parciales y sesgados en sí mismos.
Por ejemplo, los experimentos iniciales de GopherCite utilizan un modelo de ‘super calificador’ para elegir los mejores sujetos humanos para evaluar la salida del modelo, seleccionando solo a los calificadores que obtuvieron al menos el 85% en comparación con un conjunto de aseguramiento de la calidad. Finalmente, se seleccionaron 113 supercalificadores para la tarea.

Captura de pantalla de la aplicación de comparación utilizada para ayudar a evaluar la salida de GopherCite.
Argumentablemente, esta es una imagen perfecta de una persecución fractal imposible de ganar: el conjunto de aseguramiento de la calidad utilizado para calificar a los calificadores es en sí mismo otra métrica ‘definida por humanos’ de la verdad, al igual que el conjunto de TruthfulQA de Oxford contra el que GopherCite ha sido encontrado carente.
En términos de contenido ‘respaldado’ y ‘autenticado’, todo lo que los sistemas de NLG pueden esperar sintetizar a partir del entrenamiento en datos humanos es la disparidad y diversidad humana, en sí misma un problema mal planteado y no resuelto. Tenemos una tendencia innata a citar fuentes que respaldan nuestros puntos de vista y a hablar con autoridad y convicción en casos en los que nuestra información de fuente puede estar desactualizada, completamente inexacta o representada de manera deliberadamente engañosa de otras maneras; y una disposición a difundir estos puntos de vista directamente en la naturaleza, a una escala y eficacia sin precedentes en la historia humana, directamente en el camino de los marcos de extracción de conocimiento que alimentan los nuevos marcos de NLG.
Por lo tanto, el peligro involucrado en el desarrollo de sistemas de NLG con citas respaldadas parece estar vinculado a la naturaleza impredecible del material de fuente. Cualquier mecanismo (como la cita directa y las citas) que aumente la confianza del usuario en la salida de NLG es, en el estado actual del arte, agregar peligrosamente a la autenticidad, pero no a la veracidad de la salida.
Tales técnicas probablemente serán útiles cuando el NLP finalmente recrea los ‘caleidoscopios’ de escritura de ficción de 1984 de Orwell; pero representan una persecución peligrosa para el análisis de documentos objetivos, el periodismo centrado en IA y otras posibles aplicaciones ‘no ficticias’ de la generación de texto y resumen de máquina.
Publicado por primera vez el 5 de abril de 2022. Actualizado a las 15:29 EET para corregir el término.












