Ángulo de Anderson

Creación de Turcos Mecánicos Artificiales con Modelos de Lenguaje Preentrenados

mm
Añade Unite.AI a tus fuentes preferidas en Google

Una gran parte del desarrollo de sistemas de aprendizaje automático depende de la etiquetación de datos, donde cientos, incluso miles de preguntas (como ¿Es esta una imagen de un gato? y ¿Es este texto ofensivo?) deben ser resueltas para desarrollar conjuntos de datos autorizados en los que se entrenarán los sistemas de inteligencia artificial.

Aunque todos contribuimos a este proceso en algún momento, la mayoría de estas tareas de etiquetado son realizadas a cambio de dinero por trabajadores humanos en marcos como Amazon Mechanical Turk, donde los anotadores completan tareas de clasificación menores en una economía de trabajo por piezas.

El desarrollo de modelos sería más barato si los modelos de lenguaje preentrenados (PLM) pudieran realizar algunas de las tareas de inteligencia humana (HIT) más básicas que actualmente se están subcontratando en AMT y plataformas similares.

Investigación reciente de Alemania y Huawei propone esto, en el documento LMTurk: Aprendices de pocos disparos como trabajadores de subcontratación.

Modelos de Lenguaje que Realizan Aprendizaje de Pocos Disparos

Los autores sugieren que los estratos más simples de tareas dirigidas a (trabajadores humanos) Turk son análogos al aprendizaje de pocos disparos, donde un marco automatizado debe decidir una mini-tarea en función de un pequeño número de ejemplos dados.

Por lo tanto, proponen que los sistemas de inteligencia artificial pueden aprender de manera efectiva a partir de PLM existentes que fueron entrenados originalmente por trabajadores de la multitud – que el conocimiento fundamental impartido por las personas a las máquinas se ha realizado efectivamente ya, y que donde dicho conocimiento es relativamente inmutable o empírico de alguna manera, los marcos de modelos de lenguaje automatizados pueden potencialmente realizar estas tareas por sí mismos.

‘Nuestra idea básica es que, para una tarea de NLP T, tratamos a los aprendices de pocos disparos como trabajadores no expertos, que se asemejan a los trabajadores de subcontratación que anotan recursos para la tecnología del lenguaje humano. Estamos inspirados por el hecho de que podemos considerar a un trabajador de subcontratación como un tipo de aprendiz de pocos disparos.’

Las implicaciones incluyen la posibilidad de que muchos de los hechos verdaderos en los que dependen los sistemas de inteligencia artificial del futuro hayan sido derivados de humanos hace bastante tiempo, y que posteriormente se considerarán como información prevalidada y explotable que ya no requiere intervención humana.

Trabajos para Modelos de Lenguaje de Rango Medio, Semiperformantes

Además de la motivación para reducir el costo de los humanos en el bucle, los investigadores sugieren que el uso de PLM de ‘rango medio’ como verdaderos Turcos Mecánicos proporciona un trabajo útil para estos sistemas ‘también corren’, que están siendo cada vez más eclipsados por modelos de lenguaje de gran escala y costosos como GPT-3, que son demasiado caros y sobrecargados para tales tareas.

‘Nuestro objetivo en este documento es diseñar métodos que hagan un uso más efectivo de los aprendices de pocos disparos actuales. Esto es crucial porque se están entrenando un número creciente de aprendices de pocos disparos gigantescos; cómo utilizarlos de manera efectiva es así una pregunta importante. En particular, queremos una alternativa a los modelos grandes difíciles de implementar.

‘Al mismo tiempo, queremos aprovechar al máximo las fortalezas de los PLM: Su versatilidad garantiza una amplia aplicabilidad en tareas; su gran cantidad de conocimiento sobre el lenguaje y el mundo (aprendido en el preentrenamiento) se manifiesta en la eficiencia de datos de los aprendices de pocos disparos, reduciendo el trabajo y el tiempo de consumo en la anotación de datos.’

Hasta la fecha, los autores argumentan que los aprendices de pocos disparos en NLP han sido tratados como etapas intermedias descartables en el camino hacia sistemas de lenguaje natural de alto nivel que son mucho más intensivos en recursos, y que dicho trabajo se ha realizado de manera abstracta y sin considerar la posible utilidad de estos sistemas.

Método

Los autores ofrecen LMTurk (Modelo de Lenguaje como turco mecánico), en un flujo de trabajo donde la entrada de este HIT automatizado proporciona etiquetas para un modelo de NLP de nivel medio.

Un modelo de concepto básico para LMTurk. Fuente: https://arxiv.org/pdf/2112.07522.pdf

Un modelo de concepto básico para LMTurk. Fuente: https://arxiv.org/pdf/2112.07522.pdf

Esta primera iteración depende de datos ‘oro’ etiquetados por humanos, donde los turcos de carne han anotado etiquetas para un número limitado de tareas, y las etiquetas han sido puntuadas bien, ya sea a través de la supervisión humana directa o a través de votación por consenso. La implicación para este esquema es que las bifurcaciones o desarrollos a partir de este punto de partida basado en humanos pueden no necesitar entrada humana adicional en el camino.

Aunque los autores sugieren experimentos adicionales con modelos híbridos posteriores (donde la entrada humana estaría presente, pero grandemente reducida), no enfrentaron a los modelos LMTurk contra resultados equivalentes de trabajadores de HIT generados por humanos, considerando que los datos etiquetados con oro son en sí mismos ‘entrada humana’.

El PLM diseñado para realizar operaciones de Turk se adaptó para la tarea mediante P-Tuning, un método publicado por investigadores de China en 2021, que propuso incrustaciones de prompt continuas entrenables para mejorar el rendimiento de los modelos de estilo GPT-3 en tareas de comprensión del lenguaje natural (NLU).

P-Tuning intenta profundizar el poder predictivo de un modelo de estilo GPT, y su apariencia de comprensión conceptual del lenguaje, incorporando pseudo-prompt incrustados. En este caso, la consulta de inicio es 'La capital de Gran Bretaña es un [x]'

P-Tuning intenta profundizar el poder predictivo de un modelo de estilo GPT, y su apariencia de comprensión conceptual del lenguaje, incorporando pseudo-prompt incrustados. En este caso, la consulta de inicio es ‘La capital de Gran Bretaña es un [x]'”. Fuente: https://arxiv.org/pdf/2103.10385.pdf

Datos y Arquitectura

LMTurk se evaluó en cinco conjuntos de datos: dos del Árbol de Sentimiento de Stanford; el Corpus de Noticias de AG; Reconocimiento de Implicación Textual (RTE); y Corpus de Aceptabilidad Lingüística (CoLA).

Para su modelo más grande, LMTurk utiliza los PLM públicamente disponibles ALBERT-XXLarge-v2 (AXLV2) como el modelo de origen para la conversión en un Turk automatizado. El modelo cuenta con 223 millones de parámetros (en comparación con los 175 mil millones de parámetros en GPT-3). AXLV2, observan los autores, ha demostrado ser capaz de superar a modelos de mayor escala como 334M BERT-Large.

Para un modelo más ágil, ligero y desplegable en el borde, el proyecto utiliza TinyBERT-General-4L-312D (TBG), que cuenta con 14,5 millones de parámetros con un rendimiento comparable al de BERT-base (que tiene 110 millones de parámetros).

El entrenamiento con prompt se llevó a cabo en PyTorch y HuggingFace para AXLV2 durante 100 pasos de lote a un tamaño de lote de 13, con una tasa de aprendizaje de 5e-4, utilizando decaimiento lineal. Cada experimento se originó con tres semillas aleatorias diferentes.

Resultados

El proyecto LMTurk ejecuta modelos diversos contra tantos subsectores específicos de NLP que los resultados complejos de los experimentos de los investigadores no son fáciles de reducir a evidencia empírica de que LMTurk ofrece en sí mismo un enfoque viable para la reutilización de escenarios de aprendizaje de pocos disparos de HIT de origen humano histórico.

Sin embargo, con fines de evaluación, los autores comparan su método con dos trabajos anteriores: Explotar preguntas de cloze para la clasificación de texto de pocos disparos y la inferencia del lenguaje natural de los investigadores alemanes Timo Schick y Hinrich Schutze; y los resultados de Prompt-Based Auto, presentados en Hacer que los modelos de lenguaje preentrenados sean mejores aprendices de pocos disparos de Gao, Chen y Fisch (respectivamente de Princeton y MIT).

Resultados de los experimentos LMTurk, con los investigadores informando un rendimiento 'comparable'

Resultados de los experimentos LMTurk, con los investigadores informando un rendimiento ‘comparable'”.

En resumen, LMTurk ofrece una línea de investigación relativamente prometedora para los investigadores que buscan incorporar y consagrar datos etiquetados con oro de origen humano en modelos de lenguaje de complejidad media que evolucionan, donde los sistemas automatizados se hacen pasar por entrada humana.

Al igual que la cantidad relativamente pequeña de trabajos previos en este campo, el concepto central se basa en la inmutabilidad de los datos humanos originales, y la presunción de que los factores temporales – que pueden representar obstáculos significativos para el desarrollo de NLP – no requerirán intervención humana adicional a medida que evoluciona la línea de descendencia de solo máquina.

 

Publicado originalmente el 30 de diciembre de 2022

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai