Modelos y plataformas de IA
SEER: Un Avance en los Modelos de Visión por Computadora de Aprendizaje Autosupervisado

En la última década, la Inteligencia Artificial (IA) y el Aprendizaje Automático (AA) han experimentado un progreso tremendo. Hoy en día, son más precisos, eficientes y capaces que nunca. Los modelos de IA y AA modernos pueden reconocer objetos en imágenes o archivos de video de manera precisa y automática. Además, pueden generar texto y habla que rivaliza con la inteligencia humana.
Los modelos de IA y AA de hoy en día dependen en gran medida de la formación en conjuntos de datos etiquetados que les enseñan a interpretar un bloque de texto, identificar objetos en una imagen o cuadro de video y realizar varias tareas.
A pesar de sus capacidades, los modelos de IA y AA no son perfectos, y los científicos están trabajando para desarrollar modelos que puedan aprender de la información que se les proporciona, sin depender necesariamente de datos etiquetados o anotados. Este enfoque se conoce como aprendizaje autosupervisado, y es uno de los métodos más eficientes para desarrollar modelos de AA y IA que tengan “sentido común” o conocimiento de fondo para resolver problemas que están más allá de las capacidades de los modelos de IA actuales.
El aprendizaje autosupervisado ya ha demostrado sus resultados en el Procesamiento de Lenguaje Natural, ya que ha permitido a los desarrolladores entrenar modelos grandes que pueden trabajar con una enorme cantidad de datos y ha llevado a varios avances en campos como la inferencia de lenguaje natural, la traducción automática y la respuesta a preguntas.
El modelo SEER de Facebook (META ) AI tiene como objetivo maximizar las capacidades del aprendizaje autosupervisado en el campo de la visión por computadora. SEER o SElf SupERvised es un modelo de aprendizaje autosupervisado de visión por computadora que tiene más de mil millones de parámetros y es capaz de encontrar patrones o aprender incluso de un grupo aleatorio de imágenes encontradas en Internet sin anotaciones o etiquetas adecuadas.
La Necesidad de Aprendizaje Autosupervisado en Visión por Computadora
La anotación de datos o etiquetado de datos es una etapa de preprocesamiento en el desarrollo de modelos de aprendizaje automático y de inteligencia artificial. El proceso de anotación de datos identifica los datos brutos como imágenes o cuadros de video y luego agrega etiquetas a los datos para especificar el contexto de los datos para el modelo. Estas etiquetas permiten que el modelo haga predicciones precisas sobre los datos.
Uno de los mayores obstáculos y desafíos que enfrentan los desarrolladores al trabajar en modelos de visión por computadora es encontrar datos anotados de alta calidad. Los modelos de visión por computadora de hoy en día dependen de estos conjuntos de datos etiquetados para aprender los patrones que les permiten reconocer objetos en la imagen.
La anotación de datos y su uso en el modelo de visión por computadora plantean los siguientes desafíos:
Gestión de la Calidad del Conjunto de Datos
Probablemente el mayor obstáculo que enfrentan los desarrolladores es obtener acceso a un conjunto de datos de alta calidad de manera consistente, ya que un conjunto de datos de alta calidad con etiquetas y imágenes claras da como resultado un mejor aprendizaje y modelos más precisos. Sin embargo, acceder a un conjunto de datos de alta calidad de manera consistente tiene sus propios desafíos.
Gestión de la Fuerza Laboral
La anotación de datos a menudo conlleva problemas de gestión de la fuerza laboral, principalmente porque se requiere una gran cantidad de trabajadores para procesar y etiquetar grandes cantidades de datos no estructurados y no etiquetados, mientras se garantiza la calidad. Por lo tanto, es esencial que los desarrolladores equilibren la calidad y la cantidad en la anotación de datos.
Restricciones Financieras
Probablemente el mayor obstáculo es las restricciones financieras que acompañan al proceso de anotación de datos, y la mayoría de las veces, el costo de anotación de datos es un porcentaje significativo del costo total del proyecto.
Como se puede ver, la anotación de datos es un obstáculo importante en el desarrollo de modelos de visión por computadora avanzados, especialmente cuando se trata de desarrollar modelos complejos que manejan grandes cantidades de datos de entrenamiento. Es la razón por la que la industria de la visión por computadora necesita el aprendizaje autosupervisado para desarrollar modelos de visión por computadora complejos y avanzados que puedan abordar tareas que están más allá del alcance de los modelos actuales.
Con eso dicho, ya existen muchos modelos de aprendizaje autosupervisado que han funcionado bien en un entorno controlado, y principalmente en el conjunto de datos ImageNet. Aunque estos modelos pueden estar haciendo un buen trabajo, no satisfacen la condición principal del aprendizaje autosupervisado en visión por computadora: aprender de cualquier conjunto de datos no acotado o imagen aleatoria, y no solo de un conjunto de datos bien definido. Cuando se implementa de manera ideal, el aprendizaje autosupervisado puede ayudar a desarrollar modelos de visión por computadora más precisos y capaces que sean rentables y viables.
SEER o SElf-supERvised Model: Una Introducción
Las tendencias recientes en la industria de IA y AA han indicado que los enfoques de preentrenamiento de modelos como el aprendizaje semisupervisado, el aprendizaje débilmente supervisado y el aprendizaje autosupervisado pueden mejorar significativamente el rendimiento de la mayoría de los modelos de aprendizaje profundo para tareas posteriores.
Hay dos factores clave que han contribuido en gran medida al aumento del rendimiento de estos modelos de aprendizaje profundo.
Preentrenamiento en Conjuntos de Datos Masivos
El preentrenamiento en conjuntos de datos masivos generalmente da como resultado una mayor precisión y rendimiento porque expone el modelo a una amplia variedad de datos. Un conjunto de datos grande permite que los modelos comprendan mejor los patrones en los datos y, en última instancia, da como resultado que el modelo funcione mejor en escenarios del mundo real.
Algunos de los modelos con mejor rendimiento, como el modelo de lenguaje GPT-3 y el modelo Wav2vec 2.0 para reconocimiento de habla, se entrenan en conjuntos de datos masivos. El modelo de lenguaje GPT-3 utiliza un conjunto de datos de preentrenamiento con más de 300 mil millones de palabras, mientras que el modelo Wav2vec 2.0 para reconocimiento de habla utiliza un conjunto de datos con más de 53 mil horas de datos de audio.
Modelos con Capacidad Masiva
Los modelos con un mayor número de parámetros a menudo producen resultados precisos porque un mayor número de parámetros permite que el modelo se concentre solo en los objetos en los datos que son necesarios en lugar de centrarse en la interferencia o ruido en los datos.
Los desarrolladores en el pasado han intentado entrenar modelos de aprendizaje autosupervisado en datos no etiquetados o no curados, pero con conjuntos de datos más pequeños que contenían solo unos pocos millones de imágenes. ¿Pueden los modelos de aprendizaje autosupervisado producir alta precisión cuando se entrenan en una gran cantidad de datos no etiquetados y no curados? Es precisamente la pregunta que el modelo SEER pretende responder.
El modelo SEER es un marco de aprendizaje profundo que tiene como objetivo registrar imágenes disponibles en Internet de manera independiente de los conjuntos de datos curados o etiquetados. El marco SEER permite a los desarrolladores entrenar modelos de aprendizaje automático grandes y complejos en datos aleatorios sin supervisión, es decir, el modelo analiza los datos y aprende los patrones o la información por sí solo sin entrada manual adicional.
El objetivo final del modelo SEER es ayudar a desarrollar estrategias para el proceso de preentrenamiento que utilicen datos no curados para ofrecer un rendimiento óptimo en el aprendizaje de transferencia. Además, el modelo SEER también pretende crear sistemas que puedan aprender continuamente de un flujo interminable de datos de manera autosupervisada.
El marco SEER entrena modelos de alta capacidad en miles de millones de imágenes aleatorias y no restringidas extraídas de Internet. Los modelos entrenados en estas imágenes no dependen de los metadatos de la imagen o las anotaciones para entrenar el modelo o filtrar los datos. En tiempos recientes, el aprendizaje autosupervisado ha demostrado un gran potencial, ya que entrenar modelos en datos no curados ha producido mejores resultados en comparación con los modelos preentrenados supervisados para tareas posteriores.
SEER Framework y RegNet: ¿Cuál es la Conexión?
Para analizar el modelo SEER, se centra en la arquitectura RegNet con más de 700 millones de parámetros que se alinean con el objetivo de SEER de aprendizaje autosupervisado en datos no curados por dos razones principales:
- Ofrecen un equilibrio perfecto entre rendimiento y eficiencia.
- Son muy flexibles y se pueden utilizar para escalar para un número de parámetros.
SEER Framework: Trabajo Previo de Diferentes Áreas
El marco SEER pretende explorar los límites de la formación de grandes arquitecturas de modelos en conjuntos de datos no curados o no etiquetados utilizando el aprendizaje autosupervisado, y el modelo busca inspiración en el trabajo previo en el campo.
Preentrenamiento no Supervisado de Características Visuales
El aprendizaje autosupervisado se ha implementado en visión por computadora durante algún tiempo con métodos que utilizan autoencoders, discriminación a nivel de instancia o clustering. En tiempos recientes, los métodos que utilizan el aprendizaje contrastivo han indicado que el preentrenamiento de modelos utilizando el aprendizaje no supervisado para tareas posteriores puede funcionar mejor que un enfoque de aprendizaje supervisado.
La principal conclusión del aprendizaje no supervisado de características visuales es que siempre que se esté entrenando en datos filtrados, no se requieren etiquetas supervisadas. El modelo SEER pretende explorar si el modelo puede aprender representaciones precisas cuando se entrenan arquitecturas de modelos grandes en una gran cantidad de imágenes no curadas, no etiquetadas y aleatorias.
Aprendizaje de Características Visuales a Gran Escala
Los modelos anteriores se han beneficiado del preentrenamiento de los modelos en conjuntos de datos etiquetados grandes con aprendizaje semisupervisado, aprendizaje supervisado y semisupervisado en millones de imágenes filtradas. Además, el análisis del modelo también ha indicado que el preentrenamiento del modelo en miles de millones de imágenes a menudo produce una mayor precisión en comparación con el entrenamiento del modelo desde cero.
Además, el entrenamiento del modelo a gran escala generalmente depende de los pasos de filtrado de datos para hacer que las imágenes resuenen con los conceptos objetivo. Estos pasos de filtrado pueden utilizar predicciones de un clasificador preentrenado o pueden utilizar hashtags que a menudo son sinónimos de las clases de ImageNet. El modelo SEER funciona de manera diferente, ya que pretende aprender características en cualquier imagen aleatoria y, por lo tanto, los datos de entrenamiento para el modelo SEER no se curan para coincidir con un conjunto predefinido de características o conceptos.
Escalado de Arquitecturas para Reconocimiento de Imágenes
Los modelos generalmente se benefician del entrenamiento de arquitecturas grandes en mejores características visuales. Es esencial entrenar arquitecturas grandes cuando se realiza el preentrenamiento en un conjunto de datos grande, ya que un modelo con capacidad limitada a menudo se queda corto. Esto es aún más importante cuando el preentrenamiento se realiza junto con el aprendizaje contrastivo, ya que en tales casos, el modelo debe aprender a discriminar entre instancias del conjunto de datos para que pueda aprender mejores representaciones visuales.
Sin embargo, para el reconocimiento de imágenes, la escalada de la arquitectura implica mucho más que simplemente cambiar la profundidad y el ancho del modelo, y para construir un modelo escalable con mayor capacidad, se requiere mucha literatura. El modelo SEER muestra los beneficios de utilizar la familia de modelos RegNets para implementar el aprendizaje autosupervisado a gran escala.
SEER: Métodos y Componentes Utilizados
El marco SEER utiliza una variedad de métodos y componentes para preentrenar el modelo y aprender representaciones visuales. Algunos de los métodos y componentes principales utilizados por el marco SEER son: RegNet y SwAV. Analicemos brevemente los métodos y componentes utilizados en el marco SEER.
Preentrenamiento Autosupervisado con SwAV
El marco SEER se preentrena con SwAV, un enfoque de aprendizaje autosupervisado en línea. SwAV es un método de clustering en línea que se utiliza para entrenar marcos de convoluciones sin anotaciones. El marco SwAV funciona entrenando una incrustación que produce asignaciones de clúster consistentes entre diferentes vistas de la misma imagen. El sistema luego aprende representaciones semánticas mediante la minería de clústeres que son invariantes a las mejoras de los datos.
En la práctica, el marco SwAV compara las características de las diferentes vistas de una imagen mediante el uso de sus asignaciones de clúster independientes. Si estas asignaciones capturan las mismas características o características similares, es posible predecir la asignación de una imagen utilizando la representación de características de otra vista.
El modelo SEER considera un conjunto de K clústeres, y cada clúster está asociado con un vector d-dimensional aprendible vk. Para un lote de B imágenes, cada imagen i se transforma en dos vistas diferentes: xi1 y xi2. Las vistas se featurizan entonces con la ayuda de una convolución, y se obtienen dos conjuntos de características: (f11, …, fB2), y (f12, … , fB2). Cada conjunto de características se asigna entonces independientemente a prototipos de clúster con la ayuda de un solucionador de transporte óptimo.
El solucionador de transporte óptimo garantiza que las características se dividen uniformemente entre los clústeres y ayuda a evitar soluciones triviales donde todas las representaciones se asignan a un solo prototipo. La asignación resultante se intercambia entonces entre los dos conjuntos: la asignación de clúster yi1 de la vista xi1 se debe predecir utilizando la representación de características fi2 de la vista xi2, y viceversa.
Los pesos del prototipo y la convolución se entrenan entonces para minimizar la pérdida para todos los ejemplos. La pérdida de predicción de clúster l es esencialmente la entropía cruzada de una softmax del producto escalar de f y la asignación de clúster.

RegNetY: Familia de Modelos Eficientes en Escalado
Escalar la capacidad del modelo y los datos requiere arquitecturas que sean eficientes no solo en términos de memoria, sino también en términos de tiempo de ejecución y el marco RegNets es una familia de modelos diseñada específicamente para este propósito.
La familia de arquitecturas RegNet se define por un espacio de diseño de convoluciones con 4 etapas, donde cada etapa contiene una serie de bloques idénticos, mientras se mantiene fija la estructura de los bloques, principalmente el bloque de cuello de botella residual.
El marco SEER se centra en la arquitectura RegNetY y agrega una compresión y excitación a la arquitectura RegNet estándar en un intento por mejorar su rendimiento. Además, el modelo RegNetY tiene 5 parámetros que ayudan en la búsqueda de buenas instancias con un número fijo de FLOPs que consumen recursos razonables. El modelo SEER pretende mejorar sus resultados implementando la arquitectura RegNetY directamente en su tarea de preentrenamiento autosupervisado.
La Arquitectura RegNetY 256GF: El modelo SEER se centra principalmente en la arquitectura RegNetY 256GF en la familia RegNetY, y sus parámetros utilizan la regla de escalado de la arquitectura RegNet. Los parámetros se describen a continuación.

La arquitectura RegNetY 256GF tiene 4 etapas con anchos de etapa (528, 1056, 2904, 7392) y profundidades de etapa (2,7,17,1) que suman más de 696 millones de parámetros. Cuando se entrena en 512 GPU V100 de 32 GB de NVIDIA , cada iteración tarda alrededor de 6125 ms para un tamaño de lote de 8,704 imágenes. El entrenamiento del modelo en un conjunto de datos con más de mil millones de imágenes, con un tamaño de lote de 8,704 imágenes en más de 512 GPU, requiere 114,890 iteraciones, y el entrenamiento dura alrededor de 8 días.
Optimización y Entrenamiento a Gran Escala
El modelo SEER propone varias ajustes para entrenar métodos autosupervisados y adaptar estos métodos a gran escala. Estos métodos son:
- Programa de tasa de aprendizaje.
- Reducir el consumo de memoria por GPU.
- Optimizar la velocidad de entrenamiento.
- Preentrenamiento de datos a gran escala.
Programa de Tasa de Aprendizaje
El modelo SEER explora la posibilidad de utilizar dos programas de tasa de aprendizaje: el programa de tasa de aprendizaje en forma de onda coseno y el programa de tasa de aprendizaje fija.
El programa de tasa de aprendizaje en forma de onda coseno se utiliza para comparar modelos de manera justa, ya que se adapta al número de actualizaciones. Sin embargo, el programa de tasa de aprendizaje en forma de onda coseno no se adapta a un entrenamiento a gran escala, principalmente porque pesa las imágenes de manera diferente en función de cuándo se ven durante el entrenamiento y también utiliza actualizaciones completas para la programación.
El programa de tasa de aprendizaje fija mantiene la tasa de aprendizaje fija hasta que la pérdida no disminuya, y luego la tasa de aprendizaje se divide por 2. El análisis muestra que el programa de tasa de aprendizaje fija funciona mejor, ya que tiene espacio para hacer que el entrenamiento sea más flexible. Sin embargo, porque el modelo solo se entrena en 1 mil millones de imágenes, utiliza el programa de tasa de aprendizaje en forma de onda coseno para entrenar su modelo más grande, el RegNet 256GF.
Reducir el Consumo de Memoria por GPU
El modelo también pretende reducir la cantidad de GPU necesaria durante el período de entrenamiento, utilizando la precisión mixta y el checkpointing graduado. El modelo utiliza la biblioteca NVIDIA Apex Library con el nivel de optimización O1 para realizar operaciones como convoluciones y GEMMs en precisión de punto flotante de 16 bits. El modelo también utiliza la implementación de checkpointing de gradientes de PyTorch que intercambia cálculos por memoria.
Además, el modelo también descarta cualquier activación intermedia realizada durante el paso hacia adelante y, durante el paso hacia atrás, vuelve a calcular estas activaciones.
Optimizar la Velocidad de Entrenamiento
Utilizar la precisión mixta para optimizar el uso de memoria tiene beneficios adicionales, ya que los aceleradores se benefician del tamaño reducido de FP16 en comparación con FP32. Ayuda a acelerar el entrenamiento al mejorar el cuello de botella de la memoria-ancho de banda.
El modelo SEER también sincroniza la capa BatchNorm a través de las GPU para crear grupos de procesos en lugar de utilizar la sincronización global, que generalmente lleva más tiempo. Finalmente, el cargador de datos utilizado en el modelo SEER pre-carga más lotes de entrenamiento, lo que conduce a un mayor rendimiento de datos en comparación con el cargador de datos de PyTorch.
Preentrenamiento de Datos a Gran Escala
El modelo SEER utiliza más de mil millones de imágenes durante el preentrenamiento y considera un cargador de datos que muestrea imágenes aleatorias directamente de Internet e Instagram. Debido a que el modelo SEER entrena estas imágenes en la naturaleza y en línea, no aplica ningún preprocesamiento en estas imágenes ni las cura utilizando procesos como la eliminación de duplicados o la filtración de hashtags.
Es importante destacar que el conjunto de datos no es estático y las imágenes en el conjunto de datos se actualizan cada tres meses. Sin embargo, actualizar el conjunto de datos no afecta el rendimiento del modelo.
Implementación del Modelo SEER
El modelo SEER preentrena un RegNetY 256GF con SwAV utilizando seis cultivos por imagen, con cada imagen teniendo una resolución de 2×224 + 4×96. Durante la fase de preentrenamiento, el modelo utiliza una MLP de 3 capas o Perceptrón Multicapa con cabezas de proyección de dimensiones 10444×8192, 8192×8192 y 8192×256.
En lugar de utilizar capas BatchNorm en la cabeza, el modelo SEER utiliza 16 mil prototipos con la temperatura t ajustada a 0,1. El parámetro de regularización Sinkhorn se establece en 0,05 y se realizan 10 iteraciones del algoritmo. El modelo sincroniza además los estadísticos de BatchNorm a través de las GPU y crea varios grupos de procesos con un tamaño de 64 para la sincronización.
Además, el modelo utiliza un optimizador LARS o Escalado de Tasa de Aprendizaje Adaptativo por Capas, un decaimiento de peso de 10-5, puntos de control de activación y optimización de precisión mixta O1. El modelo se entrena entonces con descenso de gradiente estocástico utilizando un tamaño de lote con 8192 imágenes aleatorias distribuidas en 512 GPU de NVIDIA, lo que da como resultado 16 imágenes por GPU.
La tasa de aprendizaje se aumenta linealmente de 0,15 a 9,6 para las primeras 8.000 actualizaciones de entrenamiento. Después del calentamiento, el modelo sigue un programa de tasa de aprendizaje en forma de onda coseno que decae hasta un valor final de 0,0096. En general, el modelo SEER se entrena en más de mil millones de imágenes durante 122.000 iteraciones.
Resultados del Marco SEER
La calidad de las características generadas por el enfoque de preentrenamiento autosupervisado se estudia y analiza en una variedad de benchmarks y tareas posteriores. El modelo también considera un entorno de bajo disparo que otorga un acceso limitado a las imágenes y sus etiquetas para tareas posteriores.
Ajuste de Modelos Preentrenados Grandes
Se mide la calidad de los modelos preentrenados en el benchmark ImageNet para la clasificación de objetos. Los resultados del ajuste de modelos preentrenados grandes se determinan en los siguientes parámetros.
Configuración Experimental
El modelo preentrena 6 arquitecturas RegNet con diferentes capacidades, a saber, RegNetY- {8,16,32,64,128,256}GF, en más de mil millones de imágenes aleatorias y públicas de Instagram con SwAV. Los modelos se ajustan entonces para la clasificación de imágenes en ImageNet, que utiliza más de 1,28 millones de imágenes de entrenamiento estándar con etiquetas adecuadas y tiene un conjunto de validación estándar con más de 50.000 imágenes para la evaluación.
El modelo aplica las mismas técnicas de aumento de datos como en SwAV y se ajusta durante 35 épocas con un optimizador SGD o Descenso de Gradiente Estocástico con un tamaño de lote de 256 y una tasa de aprendizaje de 0,0125 que se reduce en un factor de 10 después de 30 épocas, momento de 0,9 y decaimiento de peso de 10-4. El modelo informa la precisión superior a 1 en el conjunto de validación utilizando el centro de la imagen de 224×224.
Comparación con Otros Enfoques de Preentrenamiento Autosupervisado
En la siguiente tabla, el modelo preentrenado más grande en RegNetY-256GF se compara con modelos preentrenados existentes que utilizan el enfoque de aprendizaje autosupervisado.

Como se puede ver, el modelo SEER devuelve una precisión superior a 1 del 84,2% en ImageNet y supera a SimCLRv2, el mejor modelo preentrenado existente, en un 1%.
Además, la siguiente figura compara el marco SEER con modelos de diferentes capacidades. Como se puede ver, independientemente de la capacidad del modelo, combinar el marco RegNet con SwAV produce resultados precisos durante el preentrenamiento.

El modelo SEER se preentrena en imágenes no curadas y aleatorias y tiene la arquitectura RegNet con el método de aprendizaje autosupervisado SwAV. El modelo SEER se compara con SimCLRv2 y los modelos ViT con diferentes arquitecturas de red. Finalmente, el modelo se ajusta en el conjunto de datos ImageNet y se informa la precisión superior a 1.
Impacto de la Capacidad del Modelo
La capacidad del modelo tiene un impacto significativo en el rendimiento del modelo durante el preentrenamiento y la siguiente figura compara esto con el impacto cuando se entrena desde cero.

Se puede ver claramente que la puntuación de precisión superior a 1 de los modelos preentrenados es mayor que la de los modelos entrenados desde cero y la diferencia sigue aumentando a medida que aumenta el número de parámetros. También es evidente que, aunque la capacidad del modelo beneficia tanto a los modelos preentrenados como a los entrenados desde cero, el impacto es mayor en los modelos preentrenados cuando se trata de un gran número de parámetros.
Una posible razón por la que entrenar un modelo desde cero podría sobreajustarse cuando se entrena en el conjunto de datos ImageNet es debido al pequeño tamaño del conjunto de datos.
Aprendizaje de Bajo Disparo
El aprendizaje de bajo disparo se refiere a la evaluación del rendimiento del modelo SEER en un entorno de bajo disparo, es decir, utilizando solo una fracción de los datos totales al realizar tareas posteriores.
Configuración Experimental
El marco SEER utiliza dos conjuntos de datos para el aprendizaje de bajo disparo, a saber, Places205 y ImageNet. Además, el modelo supone que tiene un acceso limitado al conjunto de datos durante el aprendizaje de transferencia, tanto en términos de imágenes como de sus etiquetas. Esta configuración de acceso limitado es diferente de la configuración predeterminada utilizada para el aprendizaje autosupervisado, donde el modelo tiene acceso al conjunto de datos completo y solo el acceso a las etiquetas de las imágenes es limitado.
Resultados en el Conjunto de Datos Place205
La siguiente figura muestra el impacto de preentrenar el modelo en diferentes porciones del conjunto de datos Place205.

El enfoque utilizado se compara con el preentrenamiento del modelo en el conjunto de datos ImageNet bajo supervisión con la misma arquitectura RegNetY-128 GF. Los resultados de la comparación son sorprendentes, ya que se puede observar que hay una ganancia estable de alrededor del 2,5% en la precisión superior a 1, independientemente de la porción de datos de entrenamiento disponibles para ajustar en el conjunto de datos Place205.
La diferencia observada entre el preentrenamiento supervisado y autosupervisado se puede explicar dada la diferencia en la naturaleza de los datos de entrenamiento, ya que las características aprendidas por el modelo de imágenes aleatorias en la naturaleza pueden ser más adecuadas para clasificar la escena. Además, una distribución no uniforme de conceptos subyacentes puede resultar en una ventaja para el preentrenamiento en un conjunto de datos no equilibrado como Place205.
Resultados en ImageNet

La tabla anterior compara el enfoque del modelo SEER con enfoques de aprendizaje autosupervisado y semisupervisado en el aprendizaje de bajo disparo. Es importante destacar que todos estos métodos utilizan las 1,2 millones de imágenes del conjunto de datos ImageNet para el preentrenamiento y solo restringen el acceso a las etiquetas. Por otro lado, el enfoque utilizado en el modelo SEER solo permite ver el 1 al 10% de las imágenes del conjunto de datos.
Como se puede ver, aunque el modelo SEER solo ve el 1 al 10% del conjunto de datos ImageNet, todavía puede lograr una puntuación de precisión superior a 1 del 80%, que es solo ligeramente inferior a la puntuación de precisión de los enfoques discutidos en la tabla anterior.
Impacto de la Capacidad del Modelo
La figura a continuación discute el impacto de la capacidad del modelo en el aprendizaje de bajo disparo: en el 1%, el 10% y el 100% del conjunto de datos ImageNet.

Se puede observar que aumentar la capacidad del modelo puede mejorar la puntuación de precisión del modelo, ya que disminuye el acceso a las imágenes y las etiquetas en el conjunto de datos.
Transferencia a Otros Benchmarks
Para evaluar el modelo SEER aún más y analizar su rendimiento, las características preentrenadas se transfieren a otras tareas posteriores.
Evaluación Lineal de la Clasificación de Imágenes

La tabla anterior compara las características de las características preentrenadas de SEER RegNetY-256GF y RegNetY128-GF preentrenadas en el conjunto de datos ImageNet con la misma arquitectura con y sin supervisión. Para analizar la calidad de las características, el modelo congela los pesos y utiliza un clasificador lineal en la parte superior de las características utilizando el conjunto de entrenamiento para las tareas posteriores. Los siguientes benchmarks se consideran para el proceso: Open-Images (OpIm), iNaturalist (iNat), Places205 (Places) y Pascal VOC (VOC).
Detección y Segmentación
La figura a continuación compara las características preentrenadas en la detección y la segmentación y las evalúa.

El marco SEER entrena un modelo Mask-RCNN en el benchmark COCO con RegNetY-64GF y RegNetY-128GF preentrenados como bloques de construcción. Para ambas arquitecturas y tareas posteriores, el enfoque de preentrenamiento autosupervisado de SEER supera el entrenamiento supervisado en 1,5 a 2 puntos AP.
Comparación con el Preentrenamiento Débilmente Supervisado
La mayoría de las imágenes disponibles en Internet generalmente tienen una descripción de metadatos o un texto alternativo, o descripciones, o geolocalizaciones que pueden proporcionar ventaja durante el preentrenamiento. El trabajo previo ha indicado que predecir un conjunto curado o etiquetado de hashtags puede mejorar la calidad de las características visuales resultantes. Sin embargo, este enfoque requiere filtrar imágenes y funciona mejor solo cuando hay metadatos textuales presentes.
La figura a continuación compara el preentrenamiento de una arquitectura ResNetXt101-32dx8d entrenada en imágenes aleatorias con la misma arquitectura entrenada en imágenes etiquetadas con hashtags y metadatos y informa la precisión superior a 1 para ambas.

Se puede ver que, aunque el marco SEER no utiliza metadatos durante el preentrenamiento, su precisión es comparable a la de los modelos que utilizan metadatos para el preentrenamiento.
Estudios de Ablación
Se realiza un estudio de ablación para analizar el impacto de un componente particular en el rendimiento general del modelo. Un estudio de ablación se realiza eliminando el componente del modelo por completo y comprendiendo cómo se desempeña el modelo. Proporciona a los desarrolladores una visión general del impacto de ese componente particular en el rendimiento del modelo.
Impacto de la Arquitectura del Modelo
La arquitectura del modelo tiene un impacto significativo en el rendimiento del modelo, especialmente cuando el modelo se escala o se modifican las especificaciones de los datos de preentrenamiento.
La siguiente figura discute el impacto de cómo cambiar la arquitectura afecta la calidad de las características preentrenadas al evaluar el conjunto de datos ImageNet de manera lineal. Las características preentrenadas se pueden sondear directamente en este caso porque la evaluación no favorece el modelo que devuelve una alta precisión cuando se entrena desde cero en el conjunto de datos ImageNet.

Se puede observar que, para las arquitecturas ResNeXts y ResNet, las características obtenidas de la capa penúltima funcionan mejor con la configuración actual. Por otro lado, la arquitectura RegNet supera a las demás arquitecturas.
En general, se puede concluir que aumentar la capacidad del modelo tiene un impacto positivo en la calidad de las características y hay una ganancia logarítmica en el rendimiento del modelo.
Escalado de los Datos de Preentrenamiento
Hay dos razones principales por las que entrenar un modelo en un conjunto de datos más grande puede mejorar la calidad general de las características visuales que el modelo aprende: más imágenes únicas y más parámetros. Analicemos brevemente cómo estas razones afectan el rendimiento del modelo.
Aumentar el Número de Imágenes Únicas

La figura anterior compara dos arquitecturas diferentes, RegNet8 y RegNet16, que tienen el mismo número de parámetros, pero se entrenan en diferentes números de imágenes únicas. El marco SEER entrena los modelos durante actualizaciones equivalentes a 1 época para mil millones de imágenes o 32 épocas para 32 imágenes únicas y con una onda coseno de aprendizaje única.
Se puede observar que, para que un modelo funcione bien, el número de imágenes únicas que se le proporcionan debe ser idealmente mayor. En este caso, el modelo funciona bien cuando se le proporcionan imágenes únicas mayores que las imágenes presentes en el conjunto de datos ImageNet.
Más Parámetros
La figura a continuación indica el rendimiento de un modelo mientras se entrena en mil millones de imágenes utilizando la arquitectura RegNet-128GF. Se puede observar que el rendimiento del modelo aumenta constantemente a medida que aumenta el número de parámetros.

Visión por Computadora Autosupervisada en el Mundo Real
Hasta ahora, hemos discutido cómo funciona el aprendizaje autosupervisado y el modelo SEER para la visión por computadora en teoría. Ahora, analicemos cómo funciona la visión por computadora autosupervisada en escenarios del mundo real y por qué SEER es el futuro de la visión por computadora autosupervisada.
El modelo SEER rivaliza con el trabajo realizado en la industria del Procesamiento de Lenguaje Natural, donde los modelos de alto rendimiento utilizan trillones de datos y parámetros acoplados con trillones de palabras de texto durante el preentrenamiento del modelo. El rendimiento en tareas posteriores generalmente aumenta con un aumento en la cantidad de datos de entrada para el entrenamiento del modelo y lo mismo es cierto para las tareas de visión por computadora.
Pero utilizar técnicas de aprendizaje autosupervisado para el Procesamiento de Lenguaje Natural es diferente de utilizar el aprendizaje autosupervisado para la visión por computadora. Es porque, cuando se trata de textos, los conceptos semánticos generalmente se descomponen en palabras discretas, pero cuando se trata de imágenes, el modelo debe decidir a qué concepto pertenece cada píxel.
Además, diferentes imágenes tienen diferentes vistas y, aunque varias imágenes pueden tener el mismo objeto, el concepto puede variar significativamente. Por ejemplo, considere un conjunto de datos con imágenes de un gato. Aunque el objeto principal, el gato, es común en todas las imágenes, el concepto puede variar significativamente, ya que el gato puede estar de pie en una imagen, mientras que puede estar jugando con una pelota en la siguiente, y así sucesivamente. Debido a que las imágenes a menudo tienen conceptos variables, es esencial que el modelo tenga una visión de una cantidad significativa de imágenes para comprender las diferencias alrededor del mismo concepto.
Escalar un modelo con éxito para que funcione de manera eficiente con datos de imágenes de alta dimensión y complejidad requiere dos componentes:
- Una red neuronal convolucional o CNN que sea lo suficientemente grande como para capturar y aprender conceptos visuales de un conjunto de datos de imágenes muy grande.
- Un algoritmo que pueda aprender patrones de una gran cantidad de imágenes sin etiquetas, anotaciones o metadatos.
El modelo SEER pretende aplicar los componentes anteriores al campo de la visión por computadora. El modelo SEER pretende explotar los avances realizados por SwAV, un marco de aprendizaje autosupervisado que utiliza el clustering en línea para agrupar o emparejar imágenes con conceptos visuales paralelos y aprovechar estas similitudes para identificar patrones mejor.

Con la arquitectura SwAV, el modelo SEER puede hacer que el aprendizaje autosupervisado en la visión por computadora sea mucho más efectivo y reducir el tiempo de entrenamiento hasta 6 veces.
Además, entrenar modelos a gran escala, en esta escala, en más de mil millones de imágenes, requiere una arquitectura de modelo que sea eficiente no solo en términos de tiempo de ejecución y memoria, sino también en precisión. Es donde entran en juego los modelos RegNet, ya que estos modelos de convoluciones son escalables hasta billones de parámetros y se pueden optimizar según sea necesario para cumplir con las limitaciones de memoria y las regulaciones de tiempo de ejecución.
Conclusión: Un Futuro Autosupervisado
El aprendizaje autosupervisado ha sido un tema importante en la industria de IA y AA durante un tiempo, ya que permite a los modelos de IA aprender información directamente de una gran cantidad de datos disponibles aleatoriamente en Internet en lugar de depender de conjuntos de datos cuidadosamente curados y etiquetados que tienen como único propósito entrenar modelos de IA.
El aprendizaje autosupervisado es un concepto vital para el futuro de la IA y el AA, ya que tiene el potencial de permitir a los desarrolladores crear modelos de IA que se adapten bien a escenarios del mundo real y tengan múltiples casos de uso en lugar de tener un propósito específico, y SEER es un hito en la implementación del aprendizaje autosupervisado en la industria de la visión por computadora.
El modelo SEER da el primer paso en la transformación de la industria de la visión por computadora y reduce nuestra dependencia de los conjuntos de datos etiquetados. El modelo SEER pretende eliminar la necesidad de anotar los conjuntos de datos, lo que permitirá a los desarrolladores trabajar con una gran cantidad de datos diversos y grandes. La implementación de SEER es especialmente útil para los desarrolladores que trabajan en modelos que se ocupan de áreas que tienen imágenes o metadatos limitados, como la industria médica.
Además, eliminar las anotaciones humanas permitirá a los desarrolladores desarrollar y desplegar el modelo más rápido, lo que les permitirá responder a situaciones que evolucionan rápidamente de manera más rápida y precisa.












