Ángulo de Anderson

Creación de un modelo de lenguaje de estilo GPT para una sola pregunta

mm
Añade Unite.AI a tus fuentes preferidas en Google

Investigadores de China han desarrollado un método económico para crear sistemas de Procesamiento de Lenguaje Natural (NLP) de estilo GPT-3 mientras evitan el costo cada vez más prohibitivo de tiempo y dinero involucrado en la capacitación de grandes conjuntos de datos, una tendencia en crecimiento que de otra manera amenaza con relegar eventualmente este sector de la IA a jugadores de FAANG y grandes inversores.

El marco propuesto se llama Modelado de Lenguaje Orientado a Tareas (TLM). En lugar de capacitar un modelo enorme y complejo en un vasto corpus de miles de millones de palabras y miles de etiquetas y clases, TLM capacita un modelo mucho más pequeño que incorpora una consulta directamente dentro del modelo.

A la izquierda, un enfoque de hipercala típico para modelos de lenguaje de gran volumen; a la derecha, el método de línea delgada de TLM para explorar un gran corpus de lenguaje por tema o por pregunta. Fuente: https://arxiv.org/pdf/2111.04130.pdf

A la izquierda, un enfoque de hipercala típico para modelos de lenguaje de gran volumen; a la derecha, el método de línea delgada de TLM para explorar un gran corpus de lenguaje por tema o por pregunta. Fuente: https://arxiv.org/pdf/2111.04130.pdf

En efecto, se produce un algoritmo o modelo de NLP único para responder a una sola pregunta, en lugar de crear un modelo de lenguaje general enorme y engorroso que pueda responder a una variedad más amplia de preguntas.

Al probar TLM, los investigadores encontraron que el nuevo enfoque logra resultados que son similares o mejores que los Modelos de Lenguaje Preentrenados como RoBERTa-Large, y sistemas de NLP de hipercala como GPT-3 de OpenAI, el Modelo de Conmutador de Parámetros de Trillón de Google Model, HyperClover de Corea Model, Jurassic 1 de AI21 Labs Model, y Megatron-Turing NLG 530B de Microsoft Model.

En pruebas de TLM en ocho conjuntos de datos de clasificación en cuatro dominios, los autores también encontraron que el sistema reduce las operaciones de punto flotante por segundo (FLOPs) necesarias para la capacitación en dos órdenes de magnitud. Los investigadores esperan que TLM pueda ‘democratizar’ un sector que se está volviendo cada vez más elitista, con modelos de NLP tan grandes que no se pueden instalar localmente de manera realista, y en su lugar se encuentran detrás de las API costosas y de acceso limitado de OpenAI y, ahora, Microsoft Azure.

Los autores afirman que reducir el tiempo de capacitación en dos órdenes de magnitud reduce el costo de capacitación en más de 1,000 GPU durante un día a solo 8 GPU durante 48 horas.

El nuevo informe se titula NLP desde cero sin preentrenamiento a gran escala: Un marco simple y eficiente, y proviene de tres investigadores de la Universidad Tsinghua en Pekín, y un investigador de la empresa de desarrollo de IA china Recurrent AI, Inc.

Respuestas inasequibles

El costo de capacitar modelos de lenguaje efectivos y de propósito general es cada vez más caracterizado como un posible ‘límite térmico’ para la medida en que el NLP performante y preciso puede realmente difundirse en la cultura.

Estadísticas sobre el crecimiento de facetas en arquitecturas de modelos de NLP, de un informe de 2020 de A121 Labs. Fuente: https://arxiv.org/pdf/2004.08900.pdf

Estadísticas sobre el crecimiento de facetas en arquitecturas de modelos de NLP, de un informe de 2020 de A121 Labs. Fuente: https://arxiv.org/pdf/2004.08900.pdf

En 2019, un investigador calculó que cuesta $61,440 USD capacitar el modelo XLNet (informado en ese momento como el que supera a BERT en tareas de NLP) durante 2,5 días en 512 núcleos en 64 dispositivos, mientras que GPT-3 se estima que costó $12 millones para capacitar, 200 veces el costo de capacitar a su predecesor, GPT-2 (aunque recientes reestimaciones afirman que podría haberse capacitado ahora por $4,600,000 en las GPU de nube de menor precio).

Subconjuntos de datos basados en necesidades de consulta

En su lugar, la nueva arquitectura propuesta busca derivar clasificaciones, etiquetas y generalización precisas utilizando una consulta como una especie de filtro para definir un subconjunto de información de una base de datos de lenguaje grande que se capacitará, junto con la consulta, para proporcionar respuestas sobre un tema limitado.

Los autores afirman:

‘TLM está motivado por dos ideas clave. Primero, los humanos dominan una tarea utilizando solo una pequeña parte del conocimiento del mundo (por ejemplo, los estudiantes solo necesitan revisar unos pocos capítulos, entre todos los libros del mundo, para prepararse para un examen).

‘Hipotetizamos que hay mucha redundancia en el gran corpus para una tarea específica. En segundo lugar, la capacitación en datos etiquetados supervisados es mucho más eficiente en términos de datos para el rendimiento posterior que la optimización del objetivo de modelado de lenguaje en datos no etiquetados. Basado en estas motivaciones, TLM utiliza los datos de la tarea como consultas para recuperar un subconjunto diminuto del corpus general. Esto se sigue con la optimización conjunta de un objetivo de tarea supervisada y un objetivo de modelado de lenguaje utilizando tanto los datos recuperados como los datos de la tarea.’

Además de hacer que la capacitación de modelos de NLP efectivos sea asequible, los autores ven una serie de ventajas al utilizar modelos de NLP orientados a tareas. Por un lado, los investigadores pueden disfrutar de una mayor flexibilidad, con estrategias personalizadas para la longitud de la secuencia, la tokenización, la afinación de hiperparámetros y las representaciones de datos.

Los investigadores también prevén el desarrollo de sistemas híbridos futuros que intercambian la capacitación limitada de un PLM (que de otra manera no se anticipa en la implementación actual) por una mayor versatilidad y generalización contra los tiempos de capacitación. Consideran el sistema como un paso adelante para el avance de los métodos de generalización de cero disparos en el dominio.

Pruebas y resultados

TLM se probó en desafíos de clasificación en ocho tareas en cuatro dominios: ciencia biomédica, noticias, reseñas y ciencia informática. Las tareas se dividieron en categorías de recursos altos y bajos. Las tareas de recursos altos incluyeron más de 5,000 datos de tarea, como AGNews y RCT, entre otros; las tareas de recursos bajos incluyeron ChemProt y ACL-ARC, así como el conjunto de datos de detección de noticias hiperpartidistas HyperPartisan.

Los investigadores desarrollaron dos conjuntos de capacitación titulados Corpus-BERT y Corpus-RoBERTa, el último diez veces el tamaño del primero. Los experimentos compararon los Modelos de Lenguaje Preentrenados generales BERT (de Google) y RoBERTA (de Facebook ) con la nueva arquitectura.

El artículo observa que aunque TLM es un método general, y debería ser más limitado en alcance y aplicabilidad que los modelos de estado del arte más amplios y de mayor volumen, es capaz de realizar tareas cerca de la afinación de dominio.

Resultados de la comparación del rendimiento de TLM contra los conjuntos basados en BERT y RoBERTa. Los resultados enumeran una puntuación F1 promedio en tres escalas de capacitación diferentes, y enumeran el número de parámetros, el cómputo de capacitación total (FLOPs) y el tamaño del corpus de capacitación.

Resultados de la comparación del rendimiento de TLM contra los conjuntos basados en BERT y RoBERTa. Los resultados enumeran una puntuación F1 promedio en tres escalas de capacitación diferentes, y enumeran el número de parámetros, el cómputo de capacitación total (FLOPs) y el tamaño del corpus de capacitación.

Los autores concluyen que TLM es capaz de lograr resultados que son comparables o mejores que los PLM, con una reducción sustancial en las FLOPs necesarias, y requiriendo solo 1/16 del corpus de capacitación. En escalas medias y grandes, TLM aparentemente puede mejorar el rendimiento en 0,59 y 0,24 puntos en promedio, mientras reduce el tamaño de los datos de capacitación en dos órdenes de magnitud.

‘Estos resultados confirman que TLM es muy preciso y mucho más eficiente que los PLM. Además, TLM obtiene más ventajas en eficiencia a una escala más grande. Esto indica que los PLM de mayor escala pueden haber sido capacitados para almacenar conocimiento general que no es útil para una tarea específica.’

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai