Ángulo de Anderson
Reidentificación de datos de origen para generadores GAN

Nueva investigación de Francia ha propuesto una técnica para ‘reidentificar’ identidades de origen que han contribuido a datos generados sintéticamente, como las caras generadas por GAN en proyectos como This Person Does Not Exist.
El método descrito en el artículo, titulado This Person (Probably) Exists. Identity Membership Attacks Against GAN Generated Faces, no requiere (poco probable) acceso a la arquitectura de entrenamiento o datos del modelo, y se puede aplicar a una variedad de aplicaciones para las cuales se están explorando actualmente los Redes Adversarias Generativas (GAN) como métodos para anonimizar información personal identificable (PII) o generar datos sintéticos mientras se protege el material de origen.
Los investigadores han formulado un método llamado Ataque de membresía de identidad, que evalúa la probabilidad de que una identidad individual aparezca frecuentemente en un conjunto de datos contribuyente, en lugar de intentar centrarse en características particulares de una identidad (es decir, en los grupos de píxeles de una imagen original que se utilizó para entrenar el modelo generativo).
En la imagen anterior, de la investigación, cada fila comienza con una imagen generada por GAN creada por StyleGAN. El bloque izquierdo de imágenes se creó a partir de una base de datos de 40.000 imágenes, el bloque central a partir de 80.000 y el bloque derecho a partir de 46.000 imágenes. Todas las imágenes provienen del conjunto de datos VGG2Face2.
Algunas muestras tienen un parecido fugaz, mientras que otras se correlacionan fuertemente con los datos de entrenamiento. Las caras fueron identificadas con éxito por los investigadores utilizando una red de identificación de caras.
Más que valor facial
Los enfoques de reidentificación de este tipo tienen múltiples implicaciones en muchos campos de investigación; los investigadores, con sede en la Universidad de Caen en Normandía, enfatizan que su técnica no se limita a conjuntos de caras y marcos de trabajo de GAN para generación de caras, sino que es igualmente aplicable a conjuntos de datos de imágenes médicas y datos biométricos, entre otras posibles superficies de ataque en marcos de síntesis de imágenes.
‘Consideramos que si tiene éxito, tal ataque revelaría un obstáculo grave para el intercambio seguro de GAN en contextos sensibles. Por ejemplo, en el contexto de pinturas u otras obras de arte, distribuir un generador no privado podría estar descartado por obvias cuestiones de derechos de autor. Más importante aún, considere una empresa de biometría A que lanza un generador que expone la identidad del consumidor. Otra empresa B podría detectar potencialmente a cuáles de sus propios consumidores también son clientes de la empresa A. Situaciones similares pueden plantear problemas graves para los datos médicos, donde revelar un GAN podría violar información personal sobre una enfermedad del paciente.’
Reidentificando datos web raspados ilegítimamente o privados
Aunque el artículo solo toca ligeramente el tema, la capacidad de identificar datos de origen de la salida abstracta (como caras generadas por GAN, aunque esto se aplica igualmente a sistemas de codificador/decodificador y otras arquitecturas) tiene implicaciones notables para la implementación de la protección de derechos de autor en los próximos 5-10 años.
Actualmente, la mayoría de los países están operando con un enfoque laissez faire para el raspado de datos web de acceso público con el fin de no quedarse atrás en la etapa de desarrollo de las economías de aprendizaje automático por venir. A medida que este clima se comercializa y se consolida, hay un gran potencial para que surja una nueva generación de ‘trolls de datos’ que presenten reclamaciones de derechos de autor sobre imágenes confirmadas que se utilizaron históricamente en conjuntos de datos que contribuyeron a algoritmos de aprendizaje automático.
A medida que los algoritmos desarrollados maduran y se vuelven más valiosos con el tiempo, cualquier imagen no permitida que se utilizó en su desarrollo temprano y que se puede inferir de su salida mediante métodos similares a los propuestos en el nuevo artículo francés es una posible responsabilidad legal a la escala de SCO Vs IBM (un legendaria y prolongada demanda tecnológica que sigue amenazando el sistema operativo Linux).
Aprovechando el punto muerto mexicano de diversidad vs. frecuencia
La técnica principal utilizada por los investigadores franceses aprovecha la frecuencia de las imágenes del conjunto de datos original como clave para la reidentificación. Cuanto más frecuentemente aparezca una identidad particular en el conjunto de datos, más probable será que se pueda hacer una identificación de esa identidad original, correlacionando los resultados del ataque con conjuntos de datos públicos o privados disponibles.
Los investigadores señalan que esto se puede mitigar incluyendo una gran diversidad de datos (por ejemplo, de caras) en el conjunto de datos de origen, y no entrenando el conjunto de datos durante tanto tiempo que ocurra sobreajuste. El problema con esto es que el modelo debe lograr entonces una buena abstracción en un espacio de dimensiones mucho mayor, y con una cantidad de datos mucho mayor de lo estrictamente necesario para obtener resultados sintéticos plausibles.
Lograr una generalización óptima de este tipo es costoso y consume tiempo: el espacio latente (la parte de análisis formulaico del modelo de aprendizaje automático en el que se alimenta los datos) necesitará más recursos; el conjunto de datos necesitará más curación; y como la cantidad de datos necesitará ser significativa, los tamaños de lote y la programación de velocidad deberán optimizarse para la calidad y los altos niveles de generalización, en lugar de la velocidad de entrenamiento y la economía, lo que resulta en costos de desarrollo más altos y tiempos de desarrollo más largos.
Además, los algoritmos generativos sobreajustados pueden lograr datos sintéticos muy realistas, incluso si los datos de salida (es decir, caras, mapas, imágenes biomédicas, etc.) no están completamente abstractos, sino que presentan rasgos distinguibles más grandes del conjunto de datos de origen de lo que sería ideal – un atajo tentador. En el actual clima de ‘salvaje oeste’ del sector de aprendizaje automático, donde las iniciativas más pequeñas intentan desafiar la delantera de FAANG con recursos más escasos (o de lo contrario, ganar atención para una compra), es cuestionable si los estándares siempre alcanzan este nivel.
El artículo también observa que la diversidad de puntos de datos de origen (como caras) no es suficiente por sí sola para prevenir la reidentificación a través de estos y métodos similares, ya que la detención temprana del entrenamiento puede dejar las identidades de origen insuficientemente abstractas.













