Ángulo de Anderson

Los modelos de NLP luchan por comprender las frases nominales recursivas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Investigadores de EE. UU. y China han descubierto que ninguno de los principales modelos de Procesamiento de Lenguaje Natural (NLP) parece ser capaz, por defecto, de desentrañar las oraciones en inglés que presentan frases nominales recursivas (NPs), y “luchan” por individuar el significado central en ejemplos estrechamente relacionados como mi película favorita nueva y mi película favorita (cada una con un significado diferente).

En un ejemplo de titular del artículo, aquí hay un pequeño rompecabezas que los niños a menudo no pueden desentrañar: la segunda pelota es verde, pero la quinta pelota es la 'segunda pelota verde'. Fuente: https://arxiv.org/pdf/2112.08326.pdf

En un ejemplo de titular del artículo, aquí hay un pequeño rompecabezas que los niños a menudo no pueden desentrañar: la segunda pelota es verde, pero la quinta pelota es la ‘segunda pelota verde’. Fuente: https://arxiv.org/pdf/2112.08326.pdf

Los investigadores establecieron un Desafío de Frases Nominativas Recursivas (RNPC) para varios modelos de lenguaje de código abierto instalados localmente: GPT-3* de OpenAI, BERT de Google y RoBERTa y BART de Facebook, y encontraron que estos modelos de vanguardia solo lograron un rendimiento “aleatorio”. Concluyen:

‘Los resultados muestran que los modelos de lenguaje de vanguardia (SOTA) ajustados a benchmarks estándar del mismo formato tienen dificultades en nuestro conjunto de datos, lo que sugiere que el conocimiento objetivo no está disponible de inmediato.’

Ejemplos de pares mínimos en el desafío RNPC donde los modelos SOTA cometieron errores.

Ejemplos de pares mínimos en el desafío RNPC donde los modelos SOTA cometieron errores.

En los ejemplos anteriores, los modelos fallaron, por ejemplo, al distinguir la disparidad semántica entre un animal peligroso muerto (es decir, un depredador que no supone una amenaza porque está muerto) y un animal muerto peligroso (como un ardilla muerta que puede contener un virus dañino y es una amenaza activa).

(Además, aunque el artículo no lo menciona, ‘muerto’ también se utiliza con frecuencia como adverbio, que no aborda ninguno de los casos)

Sin embargo, los investigadores también encontraron que la capacitación adicional o suplementaria que incluye material de RNPC puede resolver el problema:

‘Los modelos de lenguaje preentrenados con un rendimiento SOTA en benchmarks de NLU tienen un dominio pobre de este conocimiento, pero aún pueden aprenderlo cuando se les expone a pequeñas cantidades de datos de RNPC.’

Los investigadores argumentan que la capacidad de un modelo de lenguaje para navegar estructuras recursivas de este tipo es esencial para tareas posteriores como el análisis de lenguaje, la traducción y hacen un caso especial para su importancia en rutinas de detección de daños:

‘[Consideramos] el escenario en el que un usuario interactúa con un agente orientado a tareas como Siri o Alexa, y el agente necesita determinar si la actividad involucrada en la consulta del usuario es potencialmente dañina [es decir, para menores]. Elegimos esta tarea porque muchos falsos positivos provienen de frases nominales recursivas.

‘Por ejemplo, cómo hacer una bomba casera es obviamente dañina, mientras que cómo hacer una bomba de baño casera es inofensiva.’

El artículo se titula ¿Es “mi película favorita nueva” mi película favorita? Sondeando la comprensión de las frases nominales recursivas, y proviene de cinco investigadores de la Universidad de Pensilvania y uno de la Universidad de Pekín.

Datos y método

Aunque trabajos anteriores han estudiado la estructura sintáctica de las frases nominales recursivas y la categorización semántica de los modificadores, ninguno de estos enfoques es suficiente, según los investigadores, para abordar el desafío.

Por lo tanto, basándose en el uso de frases nominales recursivas con dos modificadores, los investigadores han buscado establecer si el conocimiento previo existe en los sistemas NLP de vanguardia (no existe); si se les puede enseñar (se les puede enseñar); qué pueden aprender los sistemas NLP de las frases nominales recursivas; y de qué manera este conocimiento puede beneficiar a las aplicaciones posteriores.

El conjunto de datos que utilizaron los investigadores se creó en cuatro etapas. Primero se construyó un léxico de modificadores que contenía 689 ejemplos extraídos de la literatura anterior y el trabajo novel.

A continuación, los investigadores recopilaron frases nominales recursivas de la literatura, corpora existentes y adiciones de su propia invención. Los recursos textuales incluyeron el Penn Treebank y el Annotated Gigaword corpus.

Luego, el equipo contrató a estudiantes universitarios preseleccionados para crear ejemplos para las tres tareas que enfrentarían los modelos de lenguaje, validándolos posteriormente en 8,260 instancias válidas.

Finalmente, se contrató a más estudiantes universitarios preseleccionados, esta vez a través de Amazon Mechanical Turk, para anotar cada instancia como una Tarea de Inteligencia Humana (HIT), decidiendo disputas sobre una base de mayoría. Esto redujo las instancias a 4,567 ejemplos, que se filtraron aún más a 3,790 instancias más equilibradas.

Los investigadores adaptaron varios conjuntos de datos existentes para formular las tres secciones de sus hipótesis de prueba, incluyendo MNLI, SNLI, MPE y ADEPT, entrenando todos los modelos SOTA ellos mismos, con la excepción del modelo HuggingFace, donde se utilizó un punto de control.

Resultados

Los investigadores encontraron que todos los modelos “luchan” en las tareas RNPC, en comparación con un rendimiento confiable del 90%+ para los humanos, con los modelos SOTA que funcionan a niveles “aleatorios” (es decir, sin ninguna evidencia de capacidad innata en comparación con la casualidad en la respuesta).

Resultados de las pruebas de los investigadores. Aquí se prueban los modelos de lenguaje contra su precisión en un benchmark existente, con la línea central que representa el rendimiento humano equivalente en las tareas.

Resultados de las pruebas de los investigadores. Aquí se prueban los modelos de lenguaje contra su precisión en un benchmark existente, con la línea central que representa el rendimiento humano equivalente en las tareas.

Líneas secundarias de investigación indican que estas deficiencias pueden compensarse en la fase de entrenamiento o ajuste fino de la tubería de un modelo de NLP incluyendo específicamente el conocimiento de las frases nominales recursivas. Una vez que se realizó este entrenamiento suplementario, los modelos lograron ‘un fuerte rendimiento cero-disparo en una tarea de detección de daños extrínseca’.

Los investigadores prometen lanzar el código para este trabajo en https://github.com/veronica320/Recursive-NPs.

 

Publicado originalmente el 16 de diciembre de 2021 – 17 de diciembre de 2021, 6:55 am GMT+2: se corrigió un enlace roto.

* GPT-3 Ada, que es el más rápido pero no el mejor de la serie. Sin embargo, el modelo Davinci más grande no está disponible para el ajuste fino que comprende la fase posterior de los experimentos de los investigadores.

Mi conversión de citas en línea a hipervínculos.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai