Ángulo de Anderson

Modelos de escritura generativa basados en inteligencia artificial a menudo “copian y pegan” datos de origen

mm
Añade Unite.AI a tus fuentes preferidas en Google

El dramaturgo y empresario estadounidense Wilson Mizner es citado famosamente diciendo: “Cuando robas de un autor, es plagio; si robas de muchos, es investigación”.

De manera similar, la suposición alrededor de la nueva generación de sistemas de escritura creativa basados en inteligencia artificial es que las grandes cantidades de datos alimentados a ellos en la etapa de entrenamiento han resultado en una genuina abstracción de conceptos e ideas de alto nivel; que estos sistemas tienen a su disposición la sabiduría destilada de miles de autores contribuyentes, de la cual la inteligencia artificial puede formular escritura innovadora y original; y que aquellos que utilizan dichos sistemas pueden estar seguros de que no están involucrados involuntariamente en plagio por poderes.

Es una presunción que es desafiada por un nuevo documento de un consorcio de investigación (que incluye las divisiones de investigación de inteligencia artificial de Facebook y Microsoft ), que ha encontrado que los modelos de lenguaje generativo de aprendizaje automático como la serie GPT “a veces copian incluso pasajes muy largos” en su supuesta producción original, sin atribución.

En algunos casos, los autores observan que GPT-2 duplicará más de 1.000 palabras del conjunto de entrenamiento en su producción.

El documento se titula ¿Cuánto copian los modelos de lenguaje de sus datos de entrenamiento? Evaluando la novedad lingüística en la generación de texto utilizando RAVEN, y es una colaboración entre la Universidad Johns Hopkins, Microsoft Research, la Universidad de Nueva York y Facebook AI Research.

RAVEN

El estudio utiliza un nuevo enfoque llamado RAVEN (RAtingVErbalNovelty), un acrónimo que ha sido entretenidamente torturado para reflejar al villano aviar de un poema clásico:

‘Este acrónimo se refiere a “El cuervo” de Edgar Allan Poe, en el que el narrador se encuentra con un misterioso cuervo que repite “Nunca más”. El narrador no puede decir si el cuervo simplemente está repitiendo algo que escuchó a un ser humano, o si está construyendo sus propias expresiones (quizás combinando nunca y más)—la misma ambigüedad básica que nuestro documento aborda.’

Los hallazgos del nuevo documento llegan en el contexto de un crecimiento importante para los sistemas de escritura de contenido de inteligencia artificial que buscan reemplazar tareas de edición “simples”, e incluso para escribir contenido de longitud completa. Uno de dichos sistemas recibió $21 millones en financiamiento de serie A a principios de esta semana.

Los investigadores observan que ‘GPT-2 a veces duplica pasajes de entrenamiento que son más de 1.000 palabras de largo. (su énfasis), y que los sistemas de lenguaje generativo propagan errores lingüísticos en los datos de origen.

Los modelos de lenguaje estudiados bajo RAVEN fueron la serie de versiones de GPT hasta GPT-2 (los autores no tenían acceso en ese momento a GPT-3), un Transformer, Transformer-XL y un LSTM.

Novedad

El documento observa que GPT-2 acuña inflexiones al estilo de Bush 2, como ‘suizificado’, y derivaciones como ‘IKEA-ness’, creando tales palabras novatas (que no aparecen en el conjunto de entrenamiento de GPT-2) sobre principios lingüísticos derivados de espacios de alta dimensión establecidos durante el entrenamiento.

Los resultados también muestran que ‘el 74% de las oraciones generadas por Transformer-XL tienen una estructura sintáctica que ninguna oración de entrenamiento tiene’, lo que indica, como observan los autores, ‘los modelos de lenguaje neural no simplemente memorizan; en cambio, utilizan procesos productivos que les permiten combinar partes familiares de maneras novatas.’

Así que, técnicamente, la generalización y la abstracción deben producir texto innovador y novato.

La duplicación de datos puede ser el problema

El documento teoriza que las citas largas y verbales producidas por los sistemas de generación de lenguaje natural (NLG) podrían volverse “cocidos” en el modelo de inteligencia artificial porque el texto de origen original se repite múltiples veces en conjuntos de datos que no han sido adecuadamente deduplicados.

Aunque otro proyecto de investigación ha encontrado que la duplicación completa de texto puede ocurrir incluso si el texto de origen solo aparece una vez en el conjunto de datos, los autores observan que el proyecto tiene arquitecturas conceptuales diferentes de la corrida común de sistemas de generación de contenido de inteligencia artificial.

Los autores también observan que cambiar el componente de decodificación en los sistemas de generación de lenguaje podría aumentar la novedad, pero encontraron en las pruebas que esto ocurre a expensas de la calidad de la producción.

Se presentan problemas adicionales a medida que los conjuntos de datos que alimentan los algoritmos de generación de contenido crecen cada vez más. Además de agravar los problemas relacionados con la asequibilidad y la viabilidad de la preprocesamiento de datos, así como la garantía de calidad y la deduplicación de los datos, muchos errores básicos permanecen en los datos de origen, que luego se propagan en la producción de contenido por la inteligencia artificial.

Los autores observan*:

‘Los recientes aumentos en el tamaño de los conjuntos de entrenamiento hacen que sea especialmente crítico verificar la novedad porque la magnitud de estos conjuntos de entrenamiento puede romper nuestras intuiciones sobre lo que se puede esperar que ocurra naturalmente. Por ejemplo, algunos trabajos notables en adquisición del lenguaje dependen de la suposición de que las formas regulares del tiempo pasado de verbos irregulares (por ejemplo, becomed, teached) no aparecen en la experiencia de un aprendiz, así que si un aprendiz produce tales palabras, deben ser novatas para el aprendiz.

‘Sin embargo, resulta que, para todos los 92 verbos irregulares básicos en inglés, la forma regular incorrecta aparece en el conjunto de entrenamiento de GPT-2.’

Se necesita más curación de datos

El documento sostiene que se debe prestar más atención a la novedad en la formulación de los sistemas de lenguaje generativo, con un énfasis particular en asegurarse de que la parte “retenida” del conjunto de datos (la parte del conjunto de datos que se establece aparte para probar cómo bien el algoritmo final ha evaluado el cuerpo principal de datos entrenados) sea adecuada para la tarea.

‘En el aprendizaje automático, es fundamental evaluar los modelos en un conjunto de prueba retenido. Debido a la naturaleza abierta de la generación de texto, el texto generado por un modelo puede ser copiado del conjunto de entrenamiento, en cuyo caso no está retenido, así que utilizar esos datos para evaluar el modelo (por ejemplo, para coherencia o gramaticalidad) no es válido.’

Los autores también sostienen que se necesita más cuidado en la producción de modelos de lenguaje debido al efecto Eliza, un síndrome identificado en 1966 que identificó “la susceptibilidad de las personas a leer mucho más comprensión de la que se justifica en cadenas de símbolos, especialmente palabras, unidas por computadoras”.

 

* Mi conversión de citas en línea a hipervínculos

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai