Ángulo de Anderson
La Inteligencia Artificial Explicable puede Entregar Datos Confidenciales con Mayor Facilidad

Investigadores de la Universidad Nacional de Singapur han concluido que cuanto más explicable se vuelve la inteligencia artificial, más fácil será sortear las características de privacidad vitales en los sistemas de aprendizaje automático. También encontraron que, incluso cuando un modelo no es explicable, es posible utilizar explicaciones de modelos similares para ‘decodificar’ datos sensibles en el modelo no explicable.
La investigación, titulada Explotando Explicaciones para Ataques de Inversión de Modelos, destaca los riesgos de utilizar la ‘opacidad accidental’ de la forma en que funcionan las redes neuronales como si fuera una característica de seguridad de diseño – sobre todo porque una ola de nuevas iniciativas globales, incluidas las regulaciones de inteligencia artificial del borrador de la Unión Europea, están caracterizando la inteligencia artificial explicable (XAI) como un requisito previo para la eventual normalización del aprendizaje automático en la sociedad.

En la investigación, se reconstruye con éxito una identidad real a partir de datos supuestamente anónimos relacionados con expresiones faciales, mediante la explotación de múltiples explicaciones del sistema de aprendizaje automático. Fuente: https://arxiv.org/pdf/2108.10800.pdf
Los investigadores comentan:
‘La inteligencia artificial explicable (XAI) proporciona más información para ayudar a los usuarios a entender las decisiones del modelo, sin embargo, este conocimiento adicional expone riesgos adicionales para ataques de privacidad. Por lo tanto, proporcionar explicaciones perjudica la privacidad.’
Reidentificación de Datos Privados
Los participantes en los conjuntos de datos de aprendizaje automático pueden haber dado su consentimiento para ser incluidos en la suposición de anonimato; en el caso de la Información de Identificación Personal (PII) que termina en los sistemas de inteligencia artificial a través de la recopilación de datos ad hoc (por ejemplo, a través de redes sociales), la participación puede ser técnicamente legal, pero cuestiona la noción de ‘consentimiento’.
Varios métodos han surgido en los últimos años que han demostrado ser capaces de desanonimizar la PII de los flujos de datos de aprendizaje automático aparentemente opacos. La extracción de modelos utiliza el acceso a la API (es decir, ‘acceso de caja negra’, sin disponibilidad especial del código fuente o los datos) para extraer la PII incluso de los proveedores de MLaaS a gran escala, incluidos Amazon Web Services, mientras que los Ataques de Inferencia de Membresía (MIAs), que operan bajo restricciones similares, pueden potencialmente obtener información médica confidencial; además, los Ataques de Inferencia de Atributos (AIAs) pueden recuperar datos sensibles a partir de la salida de la API.
Revelar Rostros
Para el nuevo documento, los investigadores se han centrado en un ataque de inversión de modelo diseñado para obtener una identidad a partir de un subconjunto de datos de emociones faciales que no deberían ser capaces de revelar esta información.
El objetivo del sistema era asociar imágenes encontradas en la naturaleza (ya sea publicadas casualmente en Internet o en una posible filtración de datos) con su inclusión en los conjuntos de datos que subyacen a un algoritmo de aprendizaje automático.
Los investigadores entrenaron un modelo de ataque de inversión capaz de reconstruir la imagen contribuyente a partir de la salida anónima de la API, sin acceso especial al arquitectura original. El trabajo anterior en este campo se ha centrado en sistemas donde la identificación (proteger o revelar) era el objetivo tanto del sistema objetivo como del sistema atacante; en este caso, el marco ha sido diseñado para explotar la salida de un dominio y aplicarla a un dominio diferente.
Se utilizó una transpuesta red neuronal convolucional (CNN) para predecir una ‘fuente original’ basada en el vector de predicción de objetivo (mapa de saliencia) para un sistema de reconocimiento de emociones, utilizando una arquitectura U-Net para mejorar el rendimiento de la reconstrucción facial.

El sistema de reidentificación está impulsado y informado por la inteligencia artificial explicable (XAI), donde el conocimiento de la activación de las neuronas, entre muchos aspectos públicos de XAI, se explota para reconstruir las maquinaciones internas de la arquitectura solo a partir de su salida, lo que permite la reidentificación de las imágenes del conjunto de datos contribuyentes.
Pruebas
Al probar el sistema, los investigadores lo aplicaron contra tres conjuntos de datos: iCV-MEFED expresiones faciales; CelebA; y dígitos manuscritos MNIST. Para adaptarse al tamaño del modelo utilizado por los investigadores, los tres conjuntos de datos se redujeron respectivamente a 128×128, 265×256 y 32×32 píxeles. El 50% de cada conjunto se utilizó como datos de entrenamiento y la otra mitad se utilizó como conjunto de datos de ataque para entrenar los modelos antagonistas.
Cada conjunto de datos tenía modelos objetivo diferentes, y cada red de ataque se escaló a las limitaciones de las explicaciones que subyacen al proceso, en lugar de utilizar modelos neuronales más profundos cuya complejidad excedería la generalización de las explicaciones.
Los tipos de explicaciones de XAI utilizados para alimentar los intentos incluyeron Explicación de Gradiente, Entrada de Gradiente, Grad-CAM y Propagación de Relevancia por Capas (LRP). Los investigadores también evaluaron múltiples explicaciones a lo largo de los experimentos.

Reconstrucción de imagen facilitada por un ataque de inversión consciente de XAI a través de los tres conjuntos de datos, con tareas de objetivo y ataque idénticas.
Las métricas para la prueba fueron la similitud de píxeles evaluada por Error Cuadrático Medio (MSE); Similitud de Imagen (SSIM), un índice de similitud basado en la percepción; precisión del ataque, determinada por si un clasificador puede etiquetar con éxito una imagen reconstruida; y similitud de incrustación de ataque, que compara las incrustaciones de características de los datos de fuente conocidos con los datos reconstruidos.
Se logró la reidentificación, con diferentes niveles según la tarea y los conjuntos de datos, en todos los conjuntos. Además, los investigadores encontraron que al crear un modelo de objetivo sustituto (que naturalmente tenían control total), aún era posible lograr la reidentificación de datos de modelos ‘cerrados’ externos, basándose en principios de XAI conocidos.
Los investigadores encontraron que los resultados más precisos se obtuvieron mediante explicaciones basadas en activación (mapa de saliencia), que filtraron más PII que los enfoques basados en sensibilidad (gradiente).
En trabajos futuros, el equipo tiene la intención de incorporar diferentes tipos de explicaciones de XAI en ataques novedosos, como visualizaciones de características y vectores de activación de conceptos.












