Ángulo de Anderson

DRM para conjuntos de datos de visión por computadora

mm
Añade Unite.AI a tus fuentes preferidas en Google

La historia sugiere que eventualmente la era “abierta” de la investigación en visión por computadora, donde la reproducibilidad y la revisión favorable por pares son centrales para el desarrollo de una nueva iniciativa, debe dar paso a una nueva era de protección de la propiedad intelectual – donde los mecanismos cerrados y las plataformas amuralladas impiden que los competidores socaven los altos costos de desarrollo de los conjuntos de datos, o que utilicen un proyecto costoso como un simple trampolín para desarrollar su propia versión (quizás superior).

Actualmente, la tendencia creciente hacia el proteccionismo se apoya principalmente en la vallación de marcos centrales propietarios detrás del acceso a la API, donde los usuarios envían tokens o solicitudes esparsos, y donde los procesos de transformación que hacen que las respuestas del marco sean valiosas están completamente ocultos.

En otros casos, el modelo final en sí puede ser lanzado, pero sin la información central que lo hace valioso, como los pesos preentrenados que pueden haber costado varios millones para generar; o sin un conjunto de datos propietario, o sin detalles exactos de cómo se produjo un subconjunto a partir de una serie de conjuntos de datos abiertos. En el caso del modelo de lenguaje natural transformador de OpenAI GPT-3, ambas medidas de protección están actualmente en uso, lo que deja a los imitadores del modelo, como GPT Neo, para armar una aproximación del producto lo mejor que puedan.

Protegiendo los conjuntos de datos de imágenes

Sin embargo, está creciendo el interés en los métodos para que un marco de aprendizaje automático “protegido” pueda recuperar algún nivel de portabilidad, asegurando que solo los usuarios autorizados (por ejemplo, los usuarios pagados) puedan utilizar el sistema en cuestión de manera rentable. Esto suele implicar cifrar el conjunto de datos de alguna manera programática, para que se lea “limpio” por el marco de IA en el momento del entrenamiento, pero está comprometido o es inutilizable en cualquier otro contexto.

Un sistema de este tipo acaba de ser propuesto por investigadores de la Universidad de Ciencia y Tecnología de China en Anhui y la Universidad de Fudan en Shanghai. Titulado Protección de conjuntos de datos de imágenes invertibles, el documento ofrece una canalización que agrega automáticamente perturbación de ejemplos adversos a un conjunto de datos de imágenes, para que no se pueda utilizar útilmente para el entrenamiento en caso de piratería, pero donde la protección se filtra completamente por un sistema autorizado que contiene un token secreto.

Del documento: una imagen de 'valor' se vuelve efectivamente no entrenable con técnicas de ejemplos adversos, con las perturbaciones eliminadas sistemáticamente y de manera completamente automática para un 'usuario autorizado'. Fuente: https://arxiv.org/pdf/2112.14420.pdf

Del documento: una imagen de ‘valor’ se vuelve efectivamente no entrenable con técnicas de ejemplos adversos, con las perturbaciones eliminadas sistemáticamente y de manera completamente automática para un ‘usuario autorizado’. Fuente: https://arxiv.org/pdf/2112.14420.pdf

El mecanismo que permite la protección se llama generador de ejemplos adversos reversibles (RAEG), y efectivamente equivale a cifrar la usabilidad de las imágenes para fines de clasificación, utilizando ocultación de datos reversibles (RDH). Los autores afirman:

‘El método primero genera la imagen adversa utilizando métodos AE existentes, luego incorpora la perturbación adversa en la imagen adversa, y genera la imagen esteganográfica utilizando RDH. Debido a la característica de reversibilidad, la perturbación adversa y la imagen original se pueden recuperar.’

Las imágenes originales del conjunto de datos se alimentan a una red neural invertible en forma de U (INN) para producir imágenes afectadas adversamente que están diseñadas para engañar a los sistemas de clasificación. Esto significa que la extracción de características típica se verá socavada, lo que dificultará clasificar rasgos como el género y otros rasgos basados en la cara (aunque la arquitectura admite una serie de dominios, en lugar de solo material basado en la cara).

Una prueba de inversión de RAEG, donde se realizan diferentes tipos de ataques a las imágenes antes de la reconstrucción. Los métodos de ataque incluyen desenfoque gaussiano y artefactos JPEG.

Una prueba de inversión de RAEG, donde se realizan diferentes tipos de ataques a las imágenes antes de la reconstrucción. Los métodos de ataque incluyen desenfoque gaussiano y artefactos JPEG.

Así, si se intenta utilizar el conjunto de datos “dañado” o “cifrado” en un marco diseñado para la generación de caras basada en GAN o para fines de reconocimiento facial, el modelo resultante será menos efectivo de lo que habría sido si se hubiera entrenado con imágenes no perturbadas.

Bloquear las imágenes

Sin embargo, eso es solo un efecto secundario de la aplicabilidad general de los métodos de perturbación populares. De hecho, en el caso de uso previsto, los datos estarán incapacitados excepto en el caso de acceso autorizado al marco objetivo, ya que la “clave” central para los datos limpios es un token secreto dentro de la arquitectura objetivo.

Esta cifración tiene un precio; los investigadores caracterizan la pérdida de calidad de la imagen original como ‘distorsión leve’, y afirman ‘[El] método propuesto puede restaurar casi perfectamente la imagen original, mientras que los métodos anteriores solo pueden restaurar una versión borrosa.’

Los métodos anteriores en cuestión son del documento No puedo ser reconocido por la IA no autorizada: Ejemplo adverso reversible, una colaboración entre dos universidades chinas y el Centro de Proyecto de Inteligencia Avanzada (AIP) de RIKEN; y Ataque adverso reversible basado en transformación de imagen reversible, un documento de 2019 también del sector de investigación académica china.

Los investigadores del nuevo documento afirman haber realizado mejoras notables en la usabilidad de las imágenes restauradas, en comparación con estos enfoques anteriores, observando que el primer enfoque es demasiado sensible a la interferencia intermedia y demasiado fácil de sortear, mientras que el segundo causa una degradación excesiva de las imágenes originales en el momento del entrenamiento (autorizado), lo que socava la aplicabilidad del sistema.

Arquitectura, datos y pruebas

El nuevo sistema consiste en un generador, una capa de ataque que aplica la perturbación, clasificadores objetivo preentrenados y un elemento discriminador.

La arquitectura de RAEG. A la izquierda en el medio, vemos el token secreto 'Iprt', que permitirá la desperturbación de la imagen en el momento del entrenamiento, identificando las características perturbadas incorporadas en las imágenes de origen y descontándolas.

La arquitectura de RAEG. A la izquierda en el medio, vemos el token secreto ‘Iprt‘, que permitirá la desperturbación de la imagen en el momento del entrenamiento, identificando las características perturbadas incorporadas en las imágenes de origen y descontándolas.

A continuación se muestran los resultados de una prueba de comparación con los dos enfoques anteriores, utilizando tres conjuntos de datos: CelebA-100; Caltech-101; y Mini-ImageNet.

Los tres conjuntos de datos se entrenaron como redes de clasificación objetivo, con un tamaño de lote de 32, en una NVIDIA RTX 3090 durante el transcurso de una semana, durante 50 épocas.

Los autores afirman que RAEG es el primer trabajo que ofrece una red neural invertible que puede generar activamente ejemplos adversos.

 

Publicado por primera vez el 4 de enero de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai