Ángulo de Anderson

Robo de modelos de aprendizaje automático a través de la salida de la API

mm
Añade Unite.AI a tus fuentes preferidas en Google

Nueva investigación de Canadá ofrece un método posible por el cual los atacantes podrían robar los frutos de costosos marcos de aprendizaje automático, incluso cuando el único acceso a un sistema propietario es a través de una API (interfaz o protocolo que procesa las consultas del usuario en el servidor y devuelve solo la respuesta de salida) altamente sanitizada y aparentemente bien defendida.

Como el sector de investigación se dirige cada vez más hacia la monetización de la formación de modelos costosos a través de implementaciones de Aprendizaje Automático como Servicio (MLaaS), el nuevo trabajo sugiere que los modelos de Aprendizaje Autosupervisado (SSL) son más vulnerables a este tipo de extracción de modelos, porque se entrenan sin etiquetas de usuario, lo que simplifica la extracción, y normalmente proporcionan resultados que contienen una gran cantidad de información útil para alguien que desee replicar el modelo de origen (oculto).

En simulaciones de pruebas “caja negra” (donde los investigadores se otorgaron a sí mismos ningún acceso a un modelo “víctima” local más allá de lo que un usuario típico tendría a través de una API web), los investigadores pudieron replicar los sistemas objetivo con recursos relativamente bajos:

‘[Nuestros] ataques pueden robar una copia del modelo víctima que logra un rendimiento considerable en tareas posteriores en menos de 1/5 de las consultas utilizadas para entrenar al modelo víctima. Contra un modelo víctima entrenado en 1,2 millones de muestras no etiquetadas de ImageNet, con una precisión del 91,9% en la tarea de clasificación Fashion-MNIST posterior, nuestro ataque de extracción directa con la pérdida InfoNCE robó una copia del codificador que logra una precisión del 90,5% en 200.000 consultas.

‘De manera similar, contra un modelo víctima entrenado en 50.000 muestras no etiquetadas de CIFAR10, con una precisión del 79,0% en la tarea de clasificación CIFAR10 posterior, nuestro ataque de extracción directa con la pérdida SoftNN robó una copia que logra una precisión del 76,9% en 9.000 consultas.’

Los investigadores utilizaron tres métodos de ataque, encontrando que la 'Extracción Directa' fue el más efectivo. Estos modelos fueron robados de un codificador CIFAR10 víctima recreado localmente utilizando 9.000 consultas del conjunto de pruebas CIFAR10. Fuente: https://arxiv.org/pdf/2205.07890.pdf

Los investigadores utilizaron tres métodos de ataque, encontrando que la ‘Extracción Directa’ fue el más efectivo. Estos modelos fueron robados de un codificador CIFAR10 víctima recreado localmente utilizando 9.000 consultas del conjunto de pruebas CIFAR10. Fuente: https://arxiv.org/pdf/2205.07890.pdf

Los investigadores también señalan que los métodos que se adaptan para proteger a los modelos supervisados contra ataques no se adaptan bien a los modelos entrenados en una base no supervisada – aunque dichos modelos representan algunos de los más anticipados y celebrados frutos del sector de síntesis de imágenes.

El nuevo artículo se titula Sobre la dificultad de defender el Aprendizaje Autosupervisado contra la extracción de modelos, y proviene de la Universidad de Toronto y el Instituto Vector para la Inteligencia Artificial.

Conciencia de uno mismo

En el Aprendizaje Autosupervisado, un modelo se entrena con datos no etiquetados. Sin etiquetas, un modelo SSL debe aprender asociaciones y grupos a partir de la estructura implícita de los datos, buscando facetas similares de los datos y gradualmente reuniéndolas en nodos, o representaciones.

Cuando se puede aplicar un enfoque SSL, es increíblemente productivo, ya que evita la necesidad de una costosa (a menudo subcontratada y controvertida) categorización por trabajadores de multitud, y racionaliza esencialmente los datos de manera autónoma.

Los tres enfoques SSL considerados por los autores del nuevo artículo son SimCLR, una Red Siamesa; SimSiam, otra Red Siamesa centrada en el aprendizaje de representaciones; y Barlow Twins, un enfoque SSL que logró un rendimiento de clasificador ImageNet de estado del arte en su lanzamiento en 2021.

La extracción de modelos para datos etiquetados (es decir, un modelo entrenado a través del aprendizaje supervisado) es un área de investigación relativamente bien documentada. También es más fácil de defender, ya que el atacante debe obtener las etiquetas del modelo víctima para recrear el modelo.

Un modelo de ataque 'classifier knockoff' contra una arquitectura de aprendizaje supervisado. Fuente: https://arxiv.org/pdf/1812.02766.pdf

De un artículo anterior, un modelo de ataque ‘classifier knockoff’ contra una arquitectura de aprendizaje supervisado. Fuente: https://arxiv.org/pdf/1812.02766.pdf

Sin acceso de caja blanca, esta no es una tarea trivial, ya que la salida típica de una solicitud de API a dicho modelo contiene menos información que con una API SSL típica.

Del artículo*:

‘El trabajo anterior sobre la extracción de modelos se centró en el entorno de Aprendizaje Supervisado (SL), donde el modelo víctima normalmente devuelve una etiqueta o salidas de baja dimensión como puntuaciones de confianza o logits.

‘En contraste, los codificadores SSL devuelven representaciones de alta dimensión; la de facto salida para un modelo Sim-CLR ResNet-50, una arquitectura popular en visión, es un vector de 2048 dimensiones.

‘Hipotetizamos que esta fuga de información significativamente mayor de los codificadores los hace más vulnerables a los ataques de extracción que los modelos SL.’

Arquitectura y datos

Los investigadores probaron tres enfoques para la inferencia/extracción de modelos SSL: Extracción Directa, en la que la salida de la API se compara con la salida de un codificador recreado a través de una función de pérdida apropiada como el Error Cuadrático Medio (MSE); recreación de la cabeza de proyección, donde una funcionalidad analítica crucial del modelo, normalmente descartada antes de la implementación, se reensambla y se utiliza en un modelo réplica; y acceso a la cabeza de proyección, que solo es posible en casos donde los desarrolladores originales han hecho que la arquitectura esté disponible.

En el método #1, Extracción Directa, la salida del modelo víctima se compara con la salida de un modelo local; el método #2 implica recrear la cabeza de proyección utilizada en la arquitectura de entrenamiento original (y normalmente no incluida en un modelo implementado).

En el método #1, Extracción Directa, la salida del modelo víctima se compara con la salida de un modelo local; el método #2 implica recrear la cabeza de proyección utilizada en la arquitectura de entrenamiento original (y normalmente no incluida en un modelo implementado).

Los investigadores encontraron que la Extracción Directa fue el método más efectivo para obtener una réplica funcional del modelo objetivo, y tiene el beneficio adicional de ser el más difícil de caracterizar como un ‘ataque’ (porque se comporta poco diferente a un usuario final típico y válido).

Los autores entrenaron modelos víctimas en tres conjuntos de datos de imágenes: CIFAR10, ImageNet, y los Números de Casas de la Calle de Stanford (SVHN). ImageNet se entrenó en ResNet50, mientras que CIFAR10 y SVHN se entrenaron en ResNet18 y ResNet24 sobre una implementación de PyTorch disponible gratuitamente de SimCLR.

El rendimiento posterior (es decir, implementado) de los modelos se probó contra CIFAR100, STL10, SVHN, y Fashion-MNIST. Los investigadores también experimentaron con métodos más ‘de caja blanca’ de apropiación de modelos, aunque resultó que la Extracción Directa, el enfoque menos privilegiado, dio los mejores resultados.

Para evaluar las representaciones que se infieren y replican en los ataques, los autores agregaron una capa de predicción lineal al modelo, que se ajustó a la conjunto de entrenamiento completo etiquetado de la tarea posterior (downstream), con el resto de las capas de la red congeladas. De esta manera, la precisión de la capa de predicción puede funcionar como una métrica de rendimiento. Dado que no contribuye al proceso de inferencia, esto no representa funcionalidad ‘de caja blanca’.

Resultados de las corridas de prueba, posibles gracias a la capa de Evaluación Lineal (no contribuyente). Puntuaciones de precisión en negrita.

Resultados de las corridas de prueba, posibles gracias a la capa de Evaluación Lineal (no contribuyente). Puntuaciones de precisión en negrita.

Al comentar sobre los resultados, los investigadores afirman:

‘Encontramos que el objetivo directo de imitar las representaciones de la víctima da un rendimiento alto en tareas posteriores a pesar de que el ataque requiere solo una fracción (menos del 15% en ciertos casos) del número de consultas necesarias para entrenar al codificador robado en primer lugar.’

Y continúan:

‘[Es] un desafío defender a los codificadores entrenados con SSL, ya que las representaciones de salida filtran una cantidad sustancial de información. Los métodos de defensa más prometedores son los métodos reactivos, como el marcado de agua, que pueden incrustar augmentaciones específicas en codificadores de alta capacidad.’

 

* Mi conversión de las citas en línea del artículo a hipervínculos.

Publicado por primera vez el 18 de mayo de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai