Ángulo de Anderson

Hacer que el PNL desafíe las preguntas mal informadas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Algunas preguntas son inrespondibles porque contienen información incorrecta, presuposiciones que la persona que escucha la pregunta debe filtrar y rechazar. Esto supone, por supuesto, que el oyente tiene suficiente información correcta para desafiar la pregunta, en lugar de utilizar la pregunta en sí como fuente de información (errónea).

Es un desafío para los sistemas de Procesamiento de Lenguaje Natural (PNL) como GPT-3, que tienen una tendencia a “alucinar” información para mantener el diálogo.

Actualmente, preguntarle a GPT-3 “¿Cuándo inventó Marie Curie el uranio?” probablemente obtendrá la respuesta “Marie Curie inventó el uranio en 1898”.

Fuente: https://beta.openai.com/playground (Da Vinci instruct beta).

Fuente: https://beta.openai.com/playground (Da Vinci instruct beta).

En realidad, el uranio fue descubierto en 1789 por el químico alemán Martin Heinrich Klaproth, mientras que la revelación de los Curie en 1898 fue la aislación del radio.

El problema de los sistemas de PNL que ignoran las presuposiciones incorrectas ha sido objeto de atención en una serie de publicaciones este año, incluida la forma en que los resultados de búsqueda asistidos por IA de Google ignoran la información incorrecta en la pregunta “¿Cuándo puso Neil Armstrong el pie en Marte?” – un error que todavía se muestra en el momento de escribir este artículo, y que también se aplica a Toy Story‘s Buzz Lightyear, que aparentemente aterrizó en la Luna el 21 de julio de 1969.

Tom Hanks, otro Toy Story alumnus, también es acreditado por Google por haber aterrizado en la Luna en 1970, a pesar de que su personaje Apollo 13, el astronauta Jim Lovell, es más famoso por no haber logrado esto.

Abordar los problemas de presuposición en los intercambios de PNL

Ahora, Google Research, junto con investigadores de la Universidad Johns Hopkins y la Universidad Brown, está investigando nuevos métodos de aprendizaje automático para que los sistemas de PNL puedan eventualmente desafiar preguntas factualmente incorrectas de la misma manera que es esencial para los maestros humanos durante las conversaciones con los alumnos.

El reciente artículo ¿Qué lingüista inventó la bombilla? Verificación de presuposición para la respuesta a preguntas describe un esfuerzo concertado para desarrollar un sistema novel para identificar presuposiciones y considerar su veracidad antes de continuar el intercambio.

El nuevo algoritmo efectivamente preprocesa las preguntas antes de regresar a la conversación, descomponiendo la “autenticación” de la pregunta en un proceso de tres partes.

No computa! A la izquierda, el 'bloqueo' que ocurre incluso cuando un sistema de PNL avanzado ha podido identificar que la pregunta no tiene sentido. A la derecha, una descomposición de un algoritmo propuesto que intenta rectificar el error de origen. Fuente: https://arxiv.org/pdf/2101.00391.pdf

No computa! A la izquierda, el ‘bloqueo’ que ocurre incluso cuando un sistema de PNL avanzado ha podido identificar que la pregunta no tiene sentido. A la derecha, una descomposición de un algoritmo propuesto que intenta rectificar el error de origen. Fuente: https://arxiv.org/pdf/2101.00391.pdf

Aunque parece una rutina de verificación simple que debería haber sido incorporada en los sistemas de conocimiento desde el principio, la mayoría de las rutinas de entrenamiento de PNL aprenden información con un nivel excesivo de confianza en los datos de origen, incluyendo el discurso (como las noticias falsas) que pueden haber sido publicadas en canales previamente “confiables”.

Por lo tanto, un problema clave es identificar por consenso una fuente confiable de hechos en un clima en el que la proliferación de información incorrecta a través de las redes sociales otorgaría, por defecto, autoridad bajo la lógica de la generalización del aprendizaje automático. Esto ha tendido a utilizar la cantidad o la repetición de los datos como proxy para la precisión, al menos hasta que los fenómenos de las noticias falsas se convirtieron en un área crítica de interés en el campo en los últimos años.

Determinar el mejor enfoque para las preguntas inrespondibles

Para determinar un enfoque adecuado para resolver una pregunta que contiene información incorrecta, los investigadores pasaron 100 de esas preguntas por cuatro diferentes modelos de preguntas y respuestas, y pidieron a sujetos humanos que eligieran la mejor o menos problemática solución que los modelos generaron.

Los cuatro resultados arquitectónicos posibles para la “mala” pregunta fueron: ‘Inrespondible’ – donde un sistema de preguntas y respuestas de libro cerrado efectivamente cierra la investigación sin más elaboración; ‘Explicación basada en el fracaso de la presuposición’ – donde el sistema no verifica la suposición incorrecta, efectivamente una respuesta “inrespondible”, con una explicación agregada; ‘Explicación extractiva’ – donde el sistema recupera una cita de Wikipedia relacionada con el tema y la agrega a la prefatoria “Esta pregunta es inrespondible porque…”; y ‘Reescritura de dominio abierto’ – donde un sistema competitivo busca fuentes adicionales en Wikipedia.

Este ejemplo de cuatro posibles respuestas a una pregunta aparentemente 'inrespondible' ilustra la complejidad de intentar una solución competitiva de dominio basada en la pregunta.

Este ejemplo de cuatro posibles respuestas a una pregunta aparentemente ‘inrespondible’ ilustra la complejidad de intentar una solución competitiva de dominio basada en la pregunta.

A lo largo de las pruebas, los cinco participantes (reclutados en una plataforma de crowdsourcing interna de Google) prefirieron las respuestas basadas en la presuposición, lo que llevó a los investigadores a desarrollar un nuevo marco para descomponer y verificar preguntas.

En el nuevo sistema, los desencadenantes lingüísticos se obtienen de la pregunta por un generador basado en reglas que descompone la oración en declaraciones de hecho putativas. Si se derivan múltiples suposiciones de la pregunta, cada una se investiga y contribuirá a la respuesta final si abordan las presuposiciones erróneas de la pregunta original.

Conjuntos de datos

Las presuposiciones generadas en la etapa inicial se modificaron manualmente para crear un conjunto de datos de verificación con presuposiciones “oro”. Cualquier presuposición que surgiera del ramificado de la investigación, pero que no estuviera presente en las preguntas originales, se eliminó.

Dos de los autores del artículo annotaron manualmente 462 presuposiciones en términos de sí/no verificabilidad, basándose en una página de Wikipedia relevante asociada con cada pregunta. Los casos de desacuerdo se resolvieron en una discusión posterior antes de ser comprometidos con el conjunto de datos.

Los investigadores utilizaron zero-shot NLI, una tarea de clasificación de premisa/hipótesis que requirió la descomposición de artículos de Wikipedia relacionados con las preguntas. Dado que este proceso genera muchos más pares que la pregunta puede implicar o que el modelo admite, los resultados filtrados se agregaron y etiquetaron.

Resultados y formulación de respuestas

Los resultados más efectivos se obtuvieron con la solución más laboriosa: un híbrido de reglas y NLI afinado con oraciones y presuposiciones de Wiki.

El rendimiento de los modelos de verificación, donde 'Oraciones de Wiki' utiliza oraciones obtenidas de artículos de Wikipedia relacionados con las preguntas, y 'Presuposiciones de Wiki' son presuposiciones generadas a partir de esas oraciones.

El rendimiento de los modelos de verificación, donde ‘Oraciones de Wiki’ utiliza oraciones obtenidas de artículos de Wikipedia relacionados con las preguntas, y ‘Presuposiciones de Wiki’ son presuposiciones generadas a partir de esas oraciones.

Utilizando esta formulación, los investigadores desarrollaron un sistema de plantillas donde un hecho negador de Wikipedia se agrega a “Esta pregunta es inrespondible porque…” y frases similares. Aunque no es una solución ideal, los autores sugieren que las respuestas basadas en la no verificabilidad probablemente reducirán la incidencia de falsos negativos.

El sistema se implementó finalmente en un modelo de construcción de transformador extendido (ETC).

Implicaciones

Dependiendo de su rendimiento final en el mundo real, se podría argumentar que este enfoque puede llevar a la simple sustitución de “no verificable” por “inrespondible”, en casos en los que el sistema de investigación de apoyo no puede evaluar una corrección útil para una presuposición errónea de la pregunta. Efectivamente, parece estar sentando las bases para sistemas de verificación futuros y mejores.

Los investigadores ya admiten que el costo de las solicitudes de API basadas en tokens es un factor limitante al formular las respuestas más largas que este sistema generará, y se asume que el sobrecoste adicional de la investigación “en vivo” en una pregunta probablemente agregará latencia incluso a sistemas de gran escala como GPT-3, ya que la respuesta de dichos sistemas ha dependido hasta ahora de la incorporación generalizada del conocimiento en el momento del entrenamiento, en lugar de rutinas de verificación extensas basadas en la red.

Además, los investigadores señalan que el sistema actual tiene limitaciones relacionadas con el análisis de aspectos semánticos del texto:

Por ejemplo, ¿quién cree que pip que es la madre de Estella tiene una posesión incrustada en un verbo no factivo creer, pero nuestro generador generaría ‘Estella’ tiene ‘madre’.

Sin embargo, el equipo prevé nuevos y más flexibles sistemas de respuesta a preguntas que se desarrollarán a partir de esta investigación:

En el futuro, planeamos construir sobre este trabajo proponiendo sistemas de preguntas y respuestas que sean más robustos y cooperativos. Por ejemplo, diferentes tipos de fallos de presuposición podrían abordarse con estrategias de respuesta más fluidas, por ejemplo, la violación de las presuposiciones de unicidad podría manejarse mejor proporcionando todas las posibles respuestas, en lugar de declarar que la presuposición de unicidad fue violada.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai