Ángulo de Anderson
MLaaS: Prevención del robo de modelos de API con Autoencoders Variacionales

Machine Learning como Servicio (MLaaS) comercializa los frutos de la investigación costosa y el entrenamiento de modelos a través de API que brindan a los clientes acceso a información del sistema. Aunque la lógica del sistema se revela inevitablemente en cierta medida a través de estas transacciones, la arquitectura del modelo central, los pesos que definen la utilidad del modelo y los datos de entrenamiento específicos que lo hicieron útil están celosamente guardados por varias razones.
En primer lugar, el marco probablemente haya explotado una serie de repositorios de código de código abierto (FOSS) y los rivales potenciales podrían hacer lo mismo de manera trivial en busca de los mismos fines; en segundo lugar, en muchos casos, los pesos utilizados por los modelos representan el 95% o más de la capacidad del modelo para interpretar los datos de entrenamiento mejor que los modelos rivales, y constituyen arguablemente el valor central de la inversión costosa, tanto en términos de horas de investigación como de entrenamiento de modelos a gran escala y bien recursos en GPUs de clase industrial.
Además, la mezcla de datos propietarios y de datos de cara al público detrás del conjunto de datos de entrenamiento del modelo es un asunto potencialmente inflamable: cuando los datos son “obra original” obtenidos a través de métodos costosos, la capacidad de un usuario de API para inferir la estructura de datos o el contenido a través de solicitudes permitidas por la API podría permitirles esencialmente reconstruir el valor del trabajo, ya sea entendiendo el esquema de los datos (lo que permite la reproducción práctica) o reproduciendo los pesos que orquestan las características de los datos, lo que potencialmente permite la reproducción de una arquitectura “vacía” pero efectiva en la que se podría procesar material posterior de manera útil.
Lavado de datos
Además, la forma en que los datos se abstraen en el espacio latente del modelo de aprendizaje automático durante el entrenamiento los “lava” efectivamente en funciones generalizadas que dificultan que los titulares de derechos de autor comprendan si su obra original se ha asimilado sin permiso en un modelo.
El clima actual de laissez faire en todo el mundo con respecto a esta práctica probablemente caerá bajo una regulación cada vez más estricta en los próximos 5-10 años. El borrador de regulaciones de la UE para la IA ya contiene disposiciones sobre la procedencia de los datos y un marco de transparencia putativo que haría difícil para las empresas de recopilación de datos eludir las regulaciones de dominio sobre la extracción de datos web para fines de investigación. Otros gobiernos, incluido el de EE. UU., ahora se comprometen a adoptar marcos regulatorios similares a largo plazo.
A medida que el campo del aprendizaje automático evoluciona desde una cultura de demostración de conceptos hasta una estructura comercial viable, los modelos de aprendizaje automático que se encuentren que han infringido restricciones sobre los datos, incluso en iteraciones anteriores de sus productos, podrían encontrarse expuestos legalmente.
Por lo tanto, el riesgo de inferir fuentes de datos a través de llamadas a la API se relaciona no solo con el espionaje industrial a través de la inversión del modelo y otros métodos, sino también con los métodos forenses emergentes para la protección de la propiedad intelectual que pueden afectar a las empresas después de que la “era del salvaje oeste” de la investigación de aprendizaje automático llegue a su fin.
Exfiltración impulsada por API como medio para desarrollar un ataque adversario
Algunos marcos de aprendizaje automático actualizan constantemente sus datos de entrenamiento y algoritmos, en lugar de derivar un modelo definitivo y a largo plazo de un gran corpus de datos históricos (como con GPT-3, por ejemplo). Estos incluyen sistemas relacionados con la información de tráfico y otros sectores donde los datos en tiempo real son fundamentales para el valor continuo de un servicio impulsado por aprendizaje automático.
Si la lógica o el peso de los datos de un modelo se pueden “mapear” mediante la sondaje sistemática a través de API, estos factores pueden potencialmente volverse en contra del sistema en forma de ataques adversarios, donde los datos maliciosamente elaborados pueden dejarse en la naturaleza, en áreas donde el sistema objetivo es probable que los recopile; o infiltrando las rutinas de adquisición de datos por otros métodos.
Por lo tanto, las medidas contra el mapeo centrado en la API tienen implicaciones también para la seguridad de los modelos de aprendizaje automático.
Prevención de la exfiltración impulsada por API
Han surgido varias iniciativas de investigación en los últimos años para proporcionar metodologías que puedan prevenir la inferencia de la arquitectura del modelo y los datos de origen específicos a través de llamadas a la API. La última de ellas se describe en un artículo de preimpresión en colaboración entre investigadores del Instituto de Ciencia de la India en Bangalore y Nference, una plataforma de software basada en IA con sede en Cambridge, Massachusetts.
Titulado Detección estatal de ataques de extracción de modelos, la investigación propone un sistema llamado VarDetect, para el cual se ha puesto a disposición el código preliminar en GitHub.
Al ejecutarse en el servidor, VarDetect monitorea continuamente las consultas de los usuarios a una API, buscando tres patrones de ataques de extracción de modelos repetitivos. Los investigadores informan que VarDetect es el primer mecanismo de defensa de su tipo que resiste los tres. Además, puede contrarrestar las contramedidas de los atacantes que se dan cuenta de un mecanismo de defensa y que buscan derrotarlo ocultando los patrones de ataque con pausas o aumentando el volumen de solicitudes para ofuscar las solicitudes que intentan crear un mapa del modelo.
VarDetect utiliza Autoencoders Variacionales (VAE) para crear efectivamente una sonda evaluativa de estilo heurístico para las solicitudes entrantes. A diferencia de los métodos anteriores, el sistema se entrena con datos propietarios, lo que elimina la necesidad de acceder a los datos de los atacantes, una debilidad de los enfoques anteriores, y un escenario poco probable.

El modelo personalizado diseñado para el proyecto se deriva de tres conjuntos de datos o enfoques públicamente disponibles: el trabajo desarrollado en 2016 por el Instituto Federal Suizo de Tecnología y Cornell Tech; agregando ruido a los datos del “dominio problemático”, como se demostró por primera vez en el documento PRADA de 2017 de Finlandia; y arrastrando imágenes de cara al público, inspirado en la investigación ActiveThief 2020 del Instituto de Ciencia de la India.

Una comparación de muestras de datos benignas y ‘malignas’ en los cinco conjuntos de datos utilizados en VarDetect.
Las distribuciones de frecuencia que coinciden con las características del conjunto de datos a bordo se marcarán como señales de extracción.
Los investigadores admiten que los patrones de solicitud ordinarios de los usuarios finales benignos pueden potencialmente desencadenar falsos positivos en el sistema, lo que impide el uso normal. Por lo tanto, esas señales “seguras” percibidas pueden agregarse posteriormente al conjunto de datos de VarDetect, incorporándose al algoritmo a través de un calendario de entrenamiento en curso, dependiendo de las preferencias del sistema host.













