Modelos y plataformas de IA
data2vec: Un hito en el aprendizaje auto-supervisado

Los modelos de aprendizaje automático han dependido en gran medida de los datos etiquetados para su entrenamiento, y tradicionalmente, el entrenamiento de modelos con datos etiquetados produce resultados precisos. Sin embargo, el principal inconveniente del uso de datos etiquetados es el alto costo de anotación que aumenta con el tamaño de los datos de entrenamiento. Los altos costos de anotación son un gran obstáculo para los desarrolladores, especialmente cuando trabajan en un proyecto grande con cantidades sustanciales de datos de entrenamiento.
Para abordar el problema de anotación, los desarrolladores crearon el concepto de SSL o Aprendizaje Auto-Supervisado. El Aprendizaje Auto-Supervisado es un proceso de aprendizaje automático en el que el modelo se entrena a sí mismo para aprender una parte de la entrada a partir de otra parte de la entrada. Un modelo de Aprendizaje Auto-Supervisado tiene como objetivo explotar la relación entre los datos en lugar de utilizar señales de supervisión de datos etiquetados.
Además del Aprendizaje Auto-Supervisado, existen varios otros métodos y modelos para entrenar modelos de aprendizaje automático sin el uso de datos etiquetados. Sin embargo, la mayoría de estos métodos tienen dos problemas importantes
- A menudo están especializados en una sola modalidad, como una imagen o un texto.
- Requieren una gran cantidad de poder computacional.
Estas limitaciones son un problema importante por el que la mente humana promedio puede aprender de un solo tipo de datos mucho más efectivamente en comparación con un modelo de IA que depende de modelos y datos de entrenamiento separados para distinguir entre una imagen, un texto y un discurso.
Para abordar el problema de la modalidad única, Meta AI lanzó el data2vec, el primer algoritmo de alto rendimiento auto-supervisado de su tipo para aprender patrones de información a partir de tres modalidades diferentes: imagen, texto y discurso. Con la implementación del algoritmo data2vec, la comprensión del texto se puede aplicar a un problema de segmentación de imágenes o se puede implementar en una tarea de reconocimiento de discurso.
En este artículo, hablaremos sobre el modelo data2vec en profundidad. Discutiremos la visión general del método, el trabajo relacionado, la arquitectura y los resultados del modelo de manera más detallada para que tenga una comprensión clara del algoritmo data2vec.
Introducción a Data2vec: La idea central
Aunque el concepto fundamental del Aprendizaje Auto-Supervisado se aplica a través de modalidades, los objetivos y algoritmos reales difieren entre sí porque fueron diseñados con respecto a una sola modalidad. Diseñar un modelo para una sola modalidad es la razón por la que el mismo algoritmo de aprendizaje auto-supervisado no puede funcionar de manera efectiva en diferentes tipos de datos de entrenamiento.
Para superar el desafío presentado por los modelos y algoritmos de modalidad única, Meta AI lanzó el data2vec, un algoritmo que utiliza la misma metodología de aprendizaje para la visión por computadora, el NLP o el discurso.
La idea central detrás del algoritmo data2vec es utilizar la vista enmascarada de la entrada para predecir representaciones latentes de los datos de entrada completos en un conjunto de auto-destilación con la ayuda de la arquitectura estándar de Transformador. Así, en lugar de objetos de modalidad específicos como imágenes, texto o voz que son locales por naturaleza, el algoritmo data2vec predice representaciones latentes con información de los datos de entrenamiento o entrada completos.

¿Por qué la industria de la IA necesita el algoritmo Data2Vec?
Los modelos de Aprendizaje Auto-Supervisado construyen representaciones de los datos de entrenamiento utilizando etiquetas anotadas por humanos, y es una de las razones principales detrás del avance de la tecnología de NLP y la visión por computadora. Estas representaciones de aprendizaje auto-supervisado son la razón por la que las tareas como el reconocimiento de discurso y el aprendizaje automático despliegan el aprendizaje no supervisado en sus modelos.
Hasta ahora, estos algoritmos de aprendizaje auto-supervisado se centran en modalidades individuales, lo que resulta en sesgos de aprendizaje y diseños específicos en los modelos. La modalidad individual de los algoritmos de aprendizaje auto-supervisado crea desafíos en diferentes aplicaciones de IA, incluida la visión por computadora y el NLP.
Por ejemplo, existen vocabularios de unidades de discurso en el procesamiento del discurso que pueden definir una tarea de aprendizaje auto-supervisado en NLP. De manera similar, en la visión por computadora, los desarrolladores pueden regresar la entrada, aprender tokens visuales discretos o aprender representaciones invariantes a la ampliación de datos. Aunque estos sesgos de aprendizaje son útiles, es difícil confirmar si estos sesgos se generalizarán a otras modalidades.
El algoritmo data2vec es un hito importante en la industria del aprendizaje auto-supervisado, ya que tiene como objetivo mejorar múltiples modalidades en lugar de solo una. Además, el algoritmo data2vec no depende de la reconstrucción de la entrada o del aprendizaje contrastivo.
Así que la razón por la que el mundo necesita data2vec es porque el algoritmo data2vec tiene el potencial de acelerar el progreso en la IA y contribuir al desarrollo de modelos de IA que puedan aprender sobre diferentes aspectos de su entorno de manera fluida. Los científicos esperan que el algoritmo data2vec permita desarrollar modelos de IA y ML más adaptables que puedan realizar tareas avanzadas más allá de lo que pueden hacer los modelos de IA actuales.
¿Qué es el algoritmo Data2Vec?
El data2vec es un marco unificado que tiene como objetivo implementar el aprendizaje auto-supervisado en diferentes modalidades de datos, incluidas imágenes, discurso y texto.
El algoritmo data2vec tiene como objetivo desarrollar modelos de ML que puedan aprender los patrones generales en el entorno de manera más efectiva manteniendo el objetivo de aprendizaje uniforme en diferentes modalidades. El modelo data2vec unifica el algoritmo de aprendizaje, pero aún aprende las representaciones para cada modalidad de manera individual.
Con la introducción del algoritmo data2vec, Meta AI espera que haga que el aprendizaje multimodal sea efectivo y mucho más simple.
¿Cómo funciona el algoritmo Data2Vec?
El algoritmo data2vec combina el aprendizaje de representaciones latentes con predicción enmascarada, aunque utiliza múltiples capas de red como objetivos para generalizar las representaciones latentes. El modelo entrena una red Transformador estándar que se utiliza en el modo maestro o modo estudiante.
En el modo maestro, el modelo construye las representaciones de los datos de entrada que sirven como objetivos en la tarea de aprendizaje. En el modo estudiante, el modelo codifica una versión enmascarada de los datos de entrada que se utiliza para hacer predicciones sobre las representaciones de los datos completos.

La imagen anterior representa cómo el modelo data2vec utiliza el mismo proceso de aprendizaje para diferentes modalidades. En el primer paso, el modelo produce representaciones de los datos de entrada (modo maestro). El modelo luego regresa estas representaciones en función de una versión enmascarada de los datos de entrada.
Además, como el algoritmo data2vec utiliza representaciones latentes de los datos de entrada, se puede considerar como una versión simplificada de los diseños específicos de modalidad, como crear objetivos adecuados normalizando la entrada o aprendiendo un conjunto fijo de tokens visuales. Pero el punto de diferenciación crucial entre el data2vec y otros algoritmos es que el data2vec utiliza la auto-atención para hacer que la representación del objetivo sea contextualizada y continua. Por otro lado, otros modelos de aprendizaje auto-supervisado utilizan un conjunto fijo de objetivos basados en un contexto local.
Data2vec: Método del modelo
El modelo data2vec se entrena prediciendo las representaciones del modelo de los datos de entrada dados una vista parcial de la entrada. Como se puede ver en la figura dada, la cara del perro está enmascarada, una sección particular de la nota de voz está enmascarada y la palabra “con” está enmascarada en el texto.

El modelo primero codifica una versión enmascarada del ejemplo de entrenamiento (modo estudiante), y luego codifica la versión no enmascarada de la entrada para construir objetivos de entrenamiento con el mismo modelo, pero solo cuando se parametriza como el promedio móvil exponencial de los pesos del modelo(modo maestro). Además, las representaciones de los objetivos codifican la información presente en el ejemplo de entrenamiento, y en el modo estudiante, la tarea de aprendizaje se utiliza para predecir estas representaciones cuando se da una vista parcial de la entrada.
Arquitectura del modelo
El modelo data2vec utiliza una arquitectura de Transformador estándar con codificación específica de modalidad de los datos de entrada. Para tareas relacionadas con la visión por computadora, el modelo utiliza la estrategia de ViT para codificar una imagen como una secuencia de parches donde cada imagen abarca 16×16 píxeles, y se alimenta como una transformación lineal.
Además, para el reconocimiento de discurso, el modelo codifica los datos utilizando una red neuronal convolucional de capas múltiples que mapea las ondas de 16 kHz en representaciones de 50 Hz. Para procesar los datos de texto, el modelo preprocesa los datos para extraer unidades subpalabra, y luego los incorpora en el espacio de distribución a través de vectores de incorporación.
Enmascaramiento
Una vez que el modelo incorpora los datos de entrada como una secuencia de tokens, el modelo enmascara partes de estas unidades reemplazándolas con un token de incorporación, y luego alimenta la secuencia a la red de Transformador. Para la visión por computadora, el modelo practica una estrategia de enmascaramiento de bloques.
Las representaciones latentes del discurso se utilizan para enmascarar extensiones de datos de discurso, y para tareas relacionadas con el lenguaje, los tokens se enmascaran.
Objetivos de entrenamiento
El modelo data2vec tiene como objetivo predecir las representaciones del modelo de la muestra de entrenamiento no enmascarada en función de una codificación de la muestra enmascarada que se alimentó originalmente al modelo. El modelo predice las representaciones solo para los pasos de tiempo enmascarados.
El modelo predice representaciones contextualizadas que no solo codifican el paso de tiempo particular, sino que también codifican otra información de la muestra porque utiliza la auto-atención en la red de Transformador. Las representaciones contextualizadas y el uso de la red de Transformador son lo que distingue al modelo data2vec de los modelos existentes BERT, wav2vec, BEiT, SimMIM, MAE y MaskFeat que predicen objetivos sin información contextual.
Aquí está cómo el modelo data2vec parametriza el modo maestro para predecir las representaciones de la red que luego sirven como objetivos.
Parametrización del maestro
El modelo data2vec parametriza la codificación de la muestra de entrenamiento no enmascarada con el uso de PMA o Promedio Móvil Exponencial de los parámetros del modelo(θ) donde los pesos del modelo en el modo objetivo(△) son los siguientes
∆ ← τ∆ + (1 − τ ) θ
Además, el modelo programa τ que aumenta linealmente el parámetro desde τ0 a τe (valor objetivo) durante las primeras τn actualizaciones. Después de estas actualizaciones, el modelo mantiene el valor constante hasta que se completa el entrenamiento. El uso de la estrategia de PMA actualiza al maestro con mucha más frecuencia al comienzo cuando el entrenamiento comienza cuando el modelo es aleatorio. A medida que el entrenamiento procede y se han aprendido buenos parámetros, el maestro se actualiza con menos frecuencia.
Los resultados muestran que el modelo es más eficiente y preciso cuando comparte los parámetros del codificador de características y el codificador de posición entre el modo estudiante y el modo maestro.
Objetivos
La construcción de los objetivos de entrenamiento depende de la salida de los bloques superiores K de la red del maestro para los pasos de tiempo enmascarados en el modo estudiante. La salida del bloque l en cualquier paso de tiempo t se denota como alt. El modelo luego aplica la normalización a cada bloque para obtener alt antes de promediar los bloques superiores K.

para obtener el objetivo de entrenamiento yt para el paso de tiempo t para una red con L bloques en total.
Crea objetivos de entrenamiento que el modelo regresa cuando está en modo estudiante. En los experimentos iniciales, el modelo data2vec funcionó bien al predecir cada bloque por separado con una proyección dedicada, y fue mucho más eficiente al mismo tiempo.
Además, normalizar los objetivos también permite que el modelo data2vec no colapse en representaciones constantes para los pasos de tiempo, y evita que las capas con una gran normalización dominen las características en el conjunto de datos de objetivos. Para el reconocimiento de discurso, el modelo utiliza la normalización de instancia sobre la muestra de entrada actual sin parámetros aprendidos.
Además, los investigadores encontraron que cuando trabajan con la visión por computadora y el NLP, la normalización sin parámetros es suficiente. El problema también se puede resolver con regularización de varianza-invarianza-covarianza, pero la estrategia mencionada anteriormente funciona suficientemente bien y no requiere parámetros adicionales.
Objetivo
Para objetivos de entrenamiento contextualizados yt, el modelo utiliza una pérdida L1 suave para regresar los objetivos como se menciona a continuación

Aquí, β controla la transición de una pérdida cuadrada a una pérdida L1, y depende en gran medida del tamaño de la brecha entre la predicción del modelo ft(x) en el paso de tiempo t. La ventaja de esta pérdida es que es comparativamente menos sensible a los valores atípicos, con la necesidad de ajustar la configuración de β.
Configuración experimental
El modelo data2vec se experimenta con dos tamaños de modelo: data2vec Grande y data2vec Base. Para la estabilidad numérica, las actualizaciones de PMA se realizan en fp32, y los modelos contienen L = 12 o L = 24 bloques de Transformador con dimensiones ocultas (H) = 768 o H = 1024. Sea detallada la configuración experimental para diferentes modalidades y propósitos.
Visión por computadora
El modelo data2vec incorpora imágenes de 224×224 píxeles como parches de 16×16 píxeles. Cada uno de estos parches se transforma linealmente, y se alimenta una secuencia con 196 representaciones a la red de Transformador estándar.
El modelo sigue BEiT para enmascarar bloques con parches adyacentes con cada bloque que tiene un mínimo de 16 parches con una relación de aspecto aleatoria. Sin embargo, en lugar de enmascarar el 40% del parche como en el modelo BEiT original, el modelo data2vec enmascara el 60% del parche para una mayor precisión.
Además, el modelo cambia aleatoriamente el tamaño de las recortes de imagen, las vueltas horizontales y la variación de color. Finalmente, el modelo data2vec utiliza la misma imagen modificada en ambos modos, maestro y estudiante.
Los modelos ViT-B se pre-entrenan durante 800 épocas, y el modelo data2vec utiliza un tamaño de lote de 8,192 para el modelo ViT-L y 2,048 para el modelo ViT-B. El modelo data2vec también utiliza un calendario de aprendizaje coseno y un calendario de Adam para calentar la tasa de aprendizaje durante 80 épocas hasta 0,001 para ViT-L y durante 40 épocas hasta 0,001 para ViT-B.
Para ambos ViT-B y ViT-L, el modelo data2vec utiliza β = 2, K = 6 y τ = 0,9998 como constante sin programación. El modelo también utiliza una tasa de profundidad estocástica de 0,2.
Además, para ViT-L, el modelo se entrena durante 1,600 épocas donde las primeras 800 épocas tienen una tasa de aprendizaje de 0,9998, y luego el modelo restablece el calendario de aprendizaje y continúa durante las últimas 800 épocas con una tasa de aprendizaje de 0,9999.
Para la clasificación de imágenes, el modelo utiliza el promedio de la salida del último bloque de Transformador y la alimenta a un clasificador normalizado con softmax. El modelo luego ajusta el ViT-L durante 50 épocas y el ViT-B durante 100 épocas utilizando el coseno y el Adam para calentar la tasa de aprendizaje.
Procesamiento de discurso
Para el procesamiento de discurso, el modelo data2vec utiliza Fairseq, un kit de modelado de secuencias utilizado para entrenar modelos personalizados para resumen, traducción y generación de texto. El modelo toma una onda de 16 kHz como entrada que se procesa utilizando un codificador de características que contiene convoluciones temporales con 512 canales, anchos de kernel (10,3,3,3,3,2,2) y pasos (5,2,2,2,2,2,2).
Los resultados anteriores dan como resultado la frecuencia de salida del codificador de 50 Hz y tienen un paso de 20 ms entre cada muestra. El campo receptivo comprende 400 muestras de entrada o 25 ms de audio. La onda de forma de onda cruda que se alimenta al codificador se normaliza a una varianza unitaria y media cero.
La estrategia de enmascaramiento utilizada por el modelo data2vec para el modelo Base se asemeja al marco de Baevski para el aprendizaje auto-supervisado en el reconocimiento de discurso. El modelo muestrea p = 0,065 para todos los pasos de tiempo para ser índices de inicio y procede a marcar los siguientes diez pasos de tiempo. Para una secuencia de entrenamiento típica, el proceso permite que casi el 49% de los pasos de tiempo totales estén enmascarados.
Durante el entrenamiento, el modelo data2vec anneala linealmente τ utilizando τo = 0,999, τe = 0,9999, y τn = 30,000. El modelo data2vec utiliza el optimizador Adam con la tasa de aprendizaje pico de 5×10-4 para el modelo Base. Además, el modelo Base utiliza un programador de tres etapas que calienta la tasa de aprendizaje linealmente durante las primeras 3% de actualizaciones, la mantiene durante las siguientes 90% y luego la reduce linealmente durante las 7% restantes.
Procesamiento de lenguaje natural
El modelo data2vec utiliza la codificación de pares de bytes de 50K tipos para tokenizar la entrada y el modelo luego aprende una incorporación para cada tipo. Después de que los datos se codifican, el modelo aplica la estrategia de enmascaramiento de BERT al 15% de los tokens seleccionados uniformemente, en los que el 80% se reemplaza con tokens de máscara aprendidos, el 10% se reemplaza con tokens de vocabulario aleatorios y el 10% restante no cambia.
Durante el pre-entrenamiento, el modelo utiliza τo = 0,999, τe = 0,9999, y τn = 100,000, K = 10 y β = 4. El modelo utiliza el optimizador Adam con un calendario de aprendizaje de tres etapas que calienta la tasa de aprendizaje linealmente durante las primeras 5% de actualizaciones, la mantiene durante las siguientes 80% y luego la reduce linealmente durante las 15% restantes, con una tasa de aprendizaje pico de 2×10-4.
Además, el modelo se entrena en 16 GPU con un tamaño de lote de 256 secuencias, y cada secuencia contiene alrededor de 512 tokens. Para el flujo descendente, el modelo se pre-entrena en cuatro diferentes tasas de aprendizaje: 1×10-4, 2×10-4, 3×10-4, 4×10-4, y se selecciona la que funciona mejor para tareas de NLP descendentes.
Resultados
Veamos cómo funciona el modelo data2vec cuando implementa las estrategias discutidas anteriormente para diferentes modalidades.
Visión por computadora
Para evaluar los resultados para la visión por computadora, el modelo data2vec se pre-entrena en las imágenes obtenidas del conjunto de datos ImageNet-1K. El modelo resultante se ajusta utilizando los datos etiquetados del mismo benchmark. Según la práctica estándar, el modelo se evalúa en términos de precisión superior a 1 en los datos de validación.
Los resultados se distinguen en función de un solo modelo auto-supervisado y el entrenamiento de un tokenizador visual separado en datos adicionales, o otros modelos de aprendizaje auto-supervisado.
La tabla a continuación compara el rendimiento del modelo data2vec para la visión por computadora y otros modelos existentes: ViT-L y ViT-B.

Los resultados de la tabla anterior se pueden resumir de la siguiente manera.
- El modelo data2vec supera el trabajo previo con ambos modelos ViT-L y ViT-B en la configuración de un solo modelo.
- El conjunto de predicción enmascarada utilizado en el algoritmo data2vec para predecir representaciones latentes contextualizadas funciona mejor cuando se compara con métodos que predicen objetivos locales como ingeniería de características de imagen, píxeles de entrada o tokens visuales.
- El modelo data2vec también supera los métodos de auto-destilación que regresan la capa final de la red del estudiante mientras toman dos versiones diferentes de una imagen como entradas.
Procesamiento de audio y discurso
Para el procesamiento de audio y discurso, el modelo data2vec se entrena en aproximadamente 960 horas de datos de audio obtenidos del conjunto de datos Librispeech(LS-960). El conjunto de datos contiene audio de discurso limpio de libros de audio en inglés y se trata como un benchmark estándar en la industria de procesamiento de audio y discurso.
Para analizar el rendimiento del modelo en diferentes configuraciones de recursos, los investigadores han ajustado el modelo data2vec para utilizar diferentes cantidades de datos etiquetados (desde unos minutos hasta varias horas) para el reconocimiento automático de discurso. Para analizar el rendimiento del modelo, data2vec se compara con HuBERT y wav2vec 2.0, dos de los algoritmos más populares para el aprendizaje de representaciones de discurso y audio que dependen de unidades de discurso discretas.

La tabla anterior compara el rendimiento de data2vec en términos de tasa de palabras para el reconocimiento de discurso con otros modelos existentes. LM representa el modelo de lenguaje utilizado para la decodificación. Los resultados se pueden resumir de la siguiente manera.
- El modelo data2vec muestra mejoras para la mayoría de las configuraciones de datos etiquetados con la mayor ganancia de 10 minutos de datos etiquetados para los modelos Base.
- Cuando se trata de modelos grandes, el modelo funciona significativamente mejor en conjuntos de datos etiquetados pequeños y el rendimiento es comparable en conjuntos de datos etiquetados ricos con más de 100 y 960 horas de datos etiquetados. Es porque el rendimiento generalmente se satura en conjuntos de datos etiquetados ricos para la mayoría de los modelos.
- Después de analizar el rendimiento, se puede deducir que cuando el modelo utiliza objetivos contextualizados ricos, no es esencial aprender unidades discretas.
- Aprender objetivos contextualizados durante el entrenamiento ayuda a mejorar el rendimiento general de manera significativa.
Además, para validar el enfoque de data2vec para el reconocimiento de discurso, el modelo también se entrena en el benchmark AudioSet. Aunque la configuración de pre-entrenamiento para AudioSet es similar a Librispeech, el modelo se entrena para K = 12 y durante más de 200,000 actualizaciones en Librispeech, y luego se ajusta en un conjunto de datos etiquetados equilibrado con un tamaño de lote de 21,3 minutos durante 13.000 actualizaciones. El modelo también utiliza DeepNorm y normalización de capas para ayudar a estabilizar el entrenamiento. Además, el modelo también se ajusta en subconjuntos equilibrados con un tamaño de lote de 21,3 minutos durante 13.000 actualizaciones. El modelo también utiliza almacenamiento de softmax lineal y mixup con una puntuación de probabilidad de 0,7. El modelo luego agrega una proyección lineal única en 527 clases únicas de audio y establece la tasa de aprendizaje de la proyección en 2e-4.
Además, los parámetros pre-entrenados tienen una tasa de aprendizaje de 3e-5 y el modelo utiliza técnicas de enmascaramiento para ajustar el conjunto de datos. La tabla a continuación resume los resultados y se puede ver que el modelo data2vec es capaz de superar una configuración comparable con el mismo ajuste y datos de pre-entrenamiento.

Procesamiento de lenguaje natural
Para analizar el rendimiento de data2vec en el texto, el modelo sigue la misma configuración de entrenamiento que BERT y pre-entrena el modelo en el conjunto de datos de Wikipedia en inglés con más de 1 millón de actualizaciones y un tamaño de lote de 256 secuencias. El modelo se evalúa en el benchmark GLUE o Evaluación de comprensión del lenguaje general que incluye tareas de inferencia de lenguaje natural (MNLI o Inferencia de lenguaje natural de varios géneros), similitud de oraciones (QQP o Benchmark de pares de preguntas de Quora, MRPC o Corpus de párrafos de investigación de Microsoft (MSFT ) y STS-B o Benchmark de similitud textual semántica), análisis de sentimientos (SST-2 o Árbol de sentimientos de Stanford) y gramatical (CoLA).
Además, para ajustar el modelo data2vec, se proporcionan los datos etiquetados para cada tarea y se informa la precisión promedio en los conjuntos de desarrollo con 5 corridas de ajuste. La siguiente tabla resume el rendimiento del modelo data2vec para tareas de NLP y lo compara con otros modelos.

- La tabla anterior muestra que el modelo data2vec supera al modelo de referencia RoBERTa porque la estrategia en el modelo data2vec no utiliza objetivos aleatorios.
- El modelo data2vec es el primer modelo de NLP pre-entrenado exitoso que no utiliza unidades discretas como caracteres, palabras o subpalabras como objetivos de entrenamiento. En su lugar, el marco data2vec predice representaciones latentes contextualizadas en toda la secuencia de texto no enmascarada.
- Ayuda a crear una tarea de aprendizaje en la que el modelo se requiere para predecir objetivos con propiedades específicas a partir de la secuencia actual en lugar de predecir representaciones que son genéricas para cada unidad de texto con discreción particular.
- Además, el conjunto de objetivos de entrenamiento no es fijo y el modelo es libre de definir nuevos objetivos y está abierto a configuraciones de vocabulario.
Estudio de ablación de Data2vec
La ablación es un término utilizado para definir la eliminación de un componente en los sistemas de IA y ML. Un estudio de ablación se utiliza para investigar o analizar el rendimiento de un modelo de IA o ML eliminando ciertos componentes clave del modelo que permiten a los investigadores comprender la contribución de ese componente en el sistema general.
Objetivos promediados por capa
Una diferencia importante entre data2vec y otros modelos de aprendizaje auto-supervisado es que el modelo data2vec utiliza objetivos que se basan en el promedio de múltiples capas de la red del maestro. La idea proviene del hecho de que las capas superiores del modelo wav2vec 2.0 no funcionan bien para tareas descendentes en comparación con las capas medias del modelo.
En el siguiente experimento, se mide el rendimiento de las tres modalidades promediando K = 1, 2, …, 12 capas donde K = 1 predice solo la capa superior. Sin embargo, para extraer un tiempo de respuesta más rápido, el modelo data2vec entrena el modelo Base con 12 capas en total. Para el reconocimiento de discurso, el modelo se pre-entrena en más de 200.000 actualizaciones en Librispeech y luego se ajusta en un conjunto de datos etiquetados de 10 horas de Libri-light. Para el NLP, el modelo informa la puntuación GLUE promedio para el conjunto de validación y pre-entrena el modelo durante 300 épocas para la visión por computadora y luego informa la precisión superior a 1 obtenida en el conjunto de datos ImageNet.

La figura anterior muestra que los objetivos basados en múltiples capas generalmente mejoran cuando solo se utiliza la capa superior K = 1 para todas las modalidades. Utilizar todas las capas disponibles es una buena práctica ya que las redes neuronales construyen características sobre diferentes tipos de características y numerosas capas que se extraen como capas de características.
Utilizar características de múltiples capas ayuda a aumentar la precisión y enriquece el proceso de aprendizaje auto-supervisado.
Tipo de característica de objetivo
Los bloques de Transformador en el modelo data2vec tienen varias capas que pueden servir como objetivos. Para analizar cómo las diferentes capas afectan el rendimiento, el modelo se pre-entrena en modelos de discurso de Librispeech que utilizan diferentes capas como características de objetivos.
La figura a continuación indica claramente que la salida de la red de alimentación directa o la FFN funciona idealmente, mientras que la salida de los bloques de auto-atención no produce un modelo utilizable.

Contextualización de objetivos
Las representaciones del maestro en el modelo data2vec utilizan la auto-atención en toda la entrada para producir objetivos contextualizados. Es lo que distingue al data2vec de otros modelos de aprendizaje auto-supervisado que construyen una tarea de aprendizaje reconstruyendo o prediciendo partes locales de la entrada. Plantea la pregunta: ¿requiere el modelo data2vec objetivos contextualizados para funcionar bien?
Para responder a la pregunta, los investigadores construyen representaciones de objetivos que no tienen acceso a toda la entrada, sino solo a una fracción preestablecida de la entrada. El modelo luego restringe el mecanismo de auto-atención del maestro que permite acceder solo a una parte de la entrada de contexto circundante. Después de que el modelo se ha entrenado, se ajusta para acceder al tamaño de contexto completo.
La figura a continuación indica que los tamaños de contexto más grandes a menudo conducen a un mejor rendimiento y cuando toda la entrada se hace visible, produce la mejor precisión. Además, demuestra que representaciones de objetivos más ricas pueden producir un mejor rendimiento.

Extractores de características y enmascaramiento específicos de la modalidad
El objetivo principal del data2vec es diseñar un mecanismo de aprendizaje simple que pueda funcionar con diferentes modalidades. Es porque, aunque los modelos y marcos actuales tienen un régimen de aprendizaje unificado, aún utilizan enmascaramiento y extractores de características específicos de la modalidad.
Tiene sentido que los marcos funcionen principalmente con una sola modalidad dado el carácter de los datos de entrada que varía mucho de uno a otro. Por ejemplo, los modelos de reconocimiento de discurso utilizan una entrada de alta resolución (como una onda de 10 kHz) que generalmente tiene miles de muestras. La onda se procesa luego mediante una red neuronal convolucional de capas múltiples para obtener secuencias de características de 50 Hz.
Objetivos estructurados y contextualizados
El punto de diferenciación principal entre el data2vec y otros modelos de predicción enmascarada es que en el modelo data2vec, las características de los objetivos de entrenamiento están contextualizadas. Estas características se construyen utilizando la auto-atención de toda la entrada enmascarada en el modo maestro.
Algunos otros marcos como BYOL (Bootstrap Your Own Latent) o DINO también utilizan representaciones latentes como el data2vec, pero su enfoque principal es aprender representaciones invariantes a la transformación.
Pensamientos finales
El trabajo reciente en la industria de la IA y el ML ha indicado que las arquitecturas de modelo uniformes pueden ser un enfoque efectivo para abordar múltiples modalidades. El modelo data2vec utiliza un enfoque de aprendizaje auto-supervisado para trabajar con tres modalidades: discurso, imágenes y lenguaje.
El concepto clave detrás del modelo data2vec es utilizar una vista parcial de la entrada para regresar información o datos de entrada contextualizados. El enfoque utilizado por el marco data2vec es efectivo ya que el modelo funciona mejor que los modelos de aprendizaje auto-supervisado anteriores en el conjunto de datos ImageNet-1K para ambos modelos ViT-B y ViT-L individuales.
El modelo data2vec es verdaderamente un hito en la industria del aprendizaje auto-supervisado, ya que demuestra que un solo método de aprendizaje para aprender múltiples modalidades puede hacer que sea más fácil para los modelos aprender a través de modalidades.












