Ángulo de Anderson

Entrenar modelos de visión por computadora con ruido aleatorio en lugar de imágenes reales

mm
Añade Unite.AI a tus fuentes preferidas en Google

Investigadores del Laboratorio de Ciencia y Inteligencia Artificial de MIT (CSAIL) han experimentado con el uso de imágenes de ruido aleatorio en conjuntos de datos de visión por computadora para entrenar modelos de visión por computadora, y han encontrado que, en lugar de producir basura, el método es sorprendentemente efectivo:

Modelos generativos del experimento, ordenados por rendimiento. Fuente: https://openreview.net/pdf?id=RQUl8gZnN7O

Modelos generativos del experimento, ordenados por rendimiento. Fuente: https://openreview.net/pdf?id=RQUl8gZnN7O

Alimentar aparente ‘basura visual’ a arquitecturas de visión por computadora populares no debería resultar en este tipo de rendimiento. En el extremo derecho de la imagen de arriba, las columnas negras representan puntajes de precisión (en Imagenet-100) para cuatro conjuntos de datos ‘reales’. Mientras que los conjuntos de datos de ‘ruido aleatorio’ que los preceden (representados en varios colores, ver índice superior izquierdo) no pueden igualar eso, están casi todos dentro de límites respetables superior e inferior (líneas discontinuas rojas) para la precisión.

En este sentido, ‘precisión’ no significa que un resultado necesariamente se parezca a un rostro, una iglesia, una pizza, o cualquier otro dominio particular para el que pueda estar interesado en crear un sistema de síntesis de imágenes, como una Red Adversaria Generativa o un marco de codificador/decodificador.

Más bien, significa que los modelos de CSAIL han derivado ‘verdades’ centrales ampliamente aplicables de los datos de imagen tan aparentemente no estructurados que no deberían ser capaces de suministrarlos.

Diversidad Vs. Naturalismo

Tampoco pueden estos resultados atribuirse a sobreajuste: una animada discusión entre los autores y revisores en Open Review revela que mezclar diferentes contenidos de conjuntos de datos visualmente diversos (como ‘hojas muertas’, ‘fractales’ y ‘ruido procedural’ – ver imagen a continuación) en un conjunto de datos de entrenamiento mejora la precisión en estos experimentos.

Esto sugiere (y es un poco una noción revolucionaria) un nuevo tipo de ‘subajuste’, donde la ‘diversidad’ supera al ‘naturalismo’.

La página del proyecto permite ver interactivamente los diferentes tipos de conjuntos de datos de imágenes aleatorias utilizados en el experimento. Fuente: https://mbaradad.github.io/learning_with_noise/

La página del proyecto permite ver interactivamente los diferentes tipos de conjuntos de datos de imágenes aleatorias utilizados en el experimento. Fuente: https://mbaradad.github.io/learning_with_noise/

Los resultados obtenidos por los investigadores cuestionan la relación fundamental entre las redes neuronales basadas en imágenes y las ‘imágenes del mundo real’ que se les lanzan en alarmantemente mayores volúmenes cada año, y implican que la necesidad de obtener, curar y manejar conjuntos de datos de imágenes de hipercala puede eventualmente volverse redundante. Los autores afirman:

‘Los sistemas de visión actuales se entrenan con grandes conjuntos de datos, y estos conjuntos de datos conllevan costos: la curación es costosa, heredan sesgos humanos y hay preocupaciones sobre la privacidad y los derechos de uso. Para contrarrestar estos costos, ha surgido el interés en aprender de fuentes de datos más baratas, como imágenes no etiquetadas.’

‘En este documento, damos un paso más y preguntamos si podemos prescindir por completo de los conjuntos de datos de imágenes reales, aprendiendo de procesos de ruido procedural.’

Los investigadores sugieren que la actual generación de arquitecturas de aprendizaje automático puede estar infiriendo algo mucho más fundamental (o, al menos, inesperado) de las imágenes que lo que se pensaba anteriormente, y que las ‘imágenes sin sentido’ pueden potencialmente impartir gran parte de este conocimiento de manera mucho más barata, incluso con el posible uso de datos sintéticos ad hoc, a través de arquitecturas de generación de conjuntos de datos que generan imágenes aleatorias en el momento del entrenamiento:

Identificamos dos propiedades clave que hacen que los datos sintéticos sean buenos para entrenar sistemas de visión: 1) naturalismo, 2) diversidad. Resulta interesante que los datos más naturalistas no siempre sean los mejores, ya que el naturalismo puede ir en detrimento de la diversidad.

‘El hecho de que los datos naturalistas ayuden no puede ser sorprendente, y sugiere que, de hecho, los grandes conjuntos de datos reales tienen valor. Sin embargo, encontramos que lo que es crucial no es que los datos sean reales, sino que sean naturalistas, es decir, deben capturar ciertas propiedades estructurales de los datos reales.

‘Muchas de estas propiedades pueden capturarse en modelos de ruido simples.’

Visualizaciones de características resultantes de un codificador derivado de AlexNet en algunos de los varios conjuntos de datos de 'imágenes aleatorias' utilizados por los autores, cubriendo la 3ª y 5ª (final) capa convolucional. La metodología utilizada aquí sigue la establecida en la investigación de Google AI de 2017.

Visualizaciones de características resultantes de un codificador derivado de AlexNet en algunos de los varios conjuntos de datos de ‘imágenes aleatorias’ utilizados por los autores, cubriendo la 3ª y 5ª (final) capa convolucional. La metodología utilizada aquí sigue la establecida en la investigación de Google AI de 2017.

El documento, presentado en la 35ª Conferencia sobre Procesamiento de Información Neural (NeurIPS 2021) en Sydney, se titula Aprender a ver mirando el ruido, y proviene de seis investigadores de CSAIL, con contribución igualitaria.

El trabajo fue recomendado por consenso para una selección de destacados en NeurIPS 2021, con comentarios de pares que caracterizan el documento como ‘un avance científico’ que abre un ‘gran área de estudio’, incluso si plantea tantas preguntas como respuestas.

En el documento, los autores concluyen:

‘Hemos demostrado que, cuando se diseñan utilizando resultados de investigaciones pasadas sobre estadísticas de imágenes naturales, estos conjuntos de datos pueden entrenar con éxito representaciones visuales. Esperamos que este documento motive el estudio de nuevos modelos generativos capaces de producir ruido estructurado que logre un rendimiento aún mayor cuando se utilice en una variedad de tareas visuales.

‘¿Sería posible igualar el rendimiento obtenido con el preentrenamiento de ImageNet? Quizás, en ausencia de un conjunto de datos de entrenamiento grande específico para una tarea particular, el mejor preentrenamiento no sea utilizar un conjunto de datos reales estándar como ImageNet.’

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai