Ángulo de Anderson

Los datos sintéticos no protegen de manera fiable la privacidad, afirman los investigadores

mm
Añade Unite.AI a tus fuentes preferidas en Google

Una nueva colaboración de investigación entre Francia y el Reino Unido ha generado dudas sobre la creciente confianza de la industria en que los datos sintéticos pueden resolver los problemas de privacidad, calidad y disponibilidad (entre otros) que amenazan el progreso en el sector del aprendizaje automático.

Entre varios puntos clave abordados, los autores afirman que los datos sintéticos modelados a partir de datos reales retienen suficiente información genuina como para no proporcionar una protección fiable contra ataques de inferencia y membresía, que buscan desanonimizar los datos y volver a asociarlos con personas reales.

Además, las personas que corren más riesgo de ser afectadas por dichos ataques, incluyendo aquellas con condiciones médicas críticas o altos gastos hospitalarios (en el caso de la anonimización de registros médicos), son, debido a la naturaleza de “outlier” de su condición, más propensas a ser reidentificadas por estas técnicas.

El documento observa:

‘Dado acceso a un conjunto de datos sintéticos, un adversario estratégico puede inferir, con alta confianza, la presencia de un registro objetivo en los datos originales.’

El documento también señala que los datos sintéticos con privacidad diferencial, que ocultan la firma de los registros individuales, sí protegen la privacidad de los individuos, pero solo al sacrificar significativamente la utilidad de los sistemas de recuperación de información que los utilizan.

Si algo, los investigadores observan que los enfoques con privacidad diferencial – que utilizan ‘información real’ ‘a una distancia’ a través de datos sintéticos – hacen que el escenario de seguridad sea peor de lo que sería de otra manera:

‘Los conjuntos de datos sintéticos no proporcionan transparencia sobre este intercambio. Es imposible predecir qué características de los datos se conservarán y qué patrones se suprimirán.’

El nuevo documento, titulado Datos sintéticos – Día de la anonimización, procede de dos investigadores de la École Polytechnique Fédérale de Lausanne (EPFL) en París y un investigador de la University College London (UCL).

Los investigadores realizaron pruebas de algoritmos de entrenamiento de modelos generativos privados existentes y encontraron que ciertas decisiones de implementación violan las garantías de privacidad formales proporcionadas en los marcos, dejando registros diversos expuestos a ataques de inferencia.

Los autores ofrecen una versión revisada de cada algoritmo que potencialmente mitiga estas exposiciones, y están poniendo el código a disposición como una biblioteca de código abierto. Afirman que esto ayudará a los investigadores a evaluar las ganancias de privacidad de los datos sintéticos y a comparar de manera útil los métodos de anonimización populares. El nuevo marco incorpora dos métodos de ataque de privacidad pertinentes que se pueden aplicar a cualquier algoritmo de entrenamiento de modelos generativos.

Datos sintéticos

Los datos sintéticos se utilizan para entrenar modelos de aprendizaje automático en varios escenarios, incluyendo casos en los que la falta de información integral puede ser potencialmente llenada por datos ficticios. Un ejemplo de esto es la posibilidad de utilizar caras generadas por CGI para proporcionar ‘difíciles’ o infrecuentes fotos de rostros para conjuntos de datos de síntesis de imágenes, donde las imágenes de perfil, ángulos agudos o expresiones inusuales son a menudo poco comunes en el material de origen.

Otros tipos de imágenes CGI se han utilizado para poblar conjuntos de datos que eventualmente se ejecutarán en datos no sintéticos, como conjuntos de datos que presentan manos y muebles.

En términos de protección de la privacidad, los datos sintéticos pueden generarse a partir de datos reales mediante sistemas de Redes Adversarias Generativas (GAN) que extraen características de los datos reales y crean registros ficticios similares que probablemente se generalicen bien a datos reales posteriores (no vistos), pero que pretenden ocultar detalles de personas reales presentes en los datos de origen.

Metodología

Con el fin de la nueva investigación, los autores evaluaron las ganancias de privacidad en cinco algoritmos de entrenamiento de modelos generativos. Tres de los modelos no ofrecen protección de privacidad explícita, mientras que los otros dos vienen con garantías de privacidad diferencial. Estos modelos tabulares se eligieron para representar una amplia gama de arquitecturas.

Los modelos atacados fueron BayNet, PrivBay (una derivación de PrivBayes/BayNet), CTGAN, PATEGAN y IndHist.

El marco de evaluación para los modelos se implementó como una biblioteca de Python con dos clases principales – GenerativeModels y PrivacyAttacks. La última presenta dos facetas – un adversario de inferencia de membresía y un ataque de inferencia de membresía. El marco también puede evaluar los beneficios de privacidad de los datos ‘sanitizados’ (es decir, anonimizados) y los datos sintéticos.

Los dos conjuntos de datos utilizados en las pruebas fueron el Conjunto de datos de adultos del Repositorio de Aprendizaje Automático de UCI, y el Archivo de datos de alta hospitalaria pública del Departamento de Servicios de Salud del Estado de Texas. La versión del conjunto de datos de Texas utilizada por los investigadores contiene 50,000 registros muestreados de registros de pacientes para el año 2013.

Ataques y hallazgos

El objetivo general de la investigación es establecer ‘enlace’ (la reasociación de datos reales con datos sintéticos que se inspiraron en ellos). Los modelos de ataque utilizados en el estudio incluyen clasificadores de regresión logística, bosques aleatorios y vecinos más cercanos.

Los autores seleccionaron dos grupos objetivo que consisten en cinco registros seleccionados al azar para ‘categorías minoritarias’ de la población, ya que estas son más propensas a ser susceptibles a un ataque de enlace. También seleccionaron registros con ‘valores de atributos categóricos raros’ fuera del cuantil 95% de ese atributo. Ejemplos incluyen registros relacionados con alto riesgo de mortalidad, altos gastos hospitalarios totales y gravedad de la enfermedad.

Aunque el documento no elabora sobre este aspecto, desde la perspectiva de posibles atacantes reales, estos son exactamente el tipo de ‘pacientes costosos’ o ‘de alto riesgo’ que es más probable que sean objetivo de ataques de inferencia de membresía y otros enfoques de exfiltración de registros de pacientes.

Se entrenaron múltiples modelos de ataque contra información de referencia pública para desarrollar ‘modelos sombra’ sobre diez objetivos. Los resultados a lo largo de una serie de experimentos (como se describió anteriormente) indican que una serie de registros fueron ‘altamente vulnerables’ a ataques de enlace dirigidos a ellos por los investigadores. Los resultados también encontraron que el 20% de todos los objetivos en las pruebas recibieron una ganancia de privacidad de cero de los datos sintéticos producidos por métodos GAN.

Los investigadores observan que los resultados variaron, dependiendo del método utilizado para generar datos sintéticos, el vector de ataque y las características del conjunto de datos objetivo. El informe encuentra que en muchos casos, la supresión efectiva de la identidad a través de enfoques de datos sintéticos reduce la utilidad de los sistemas resultantes. En efecto, la utilidad y precisión de dichos sistemas pueden, en muchos casos, ser un índice directo de cuán vulnerables son a ataques de reidentificación.

Los investigadores concluyen:

‘Si un conjunto de datos sintéticos conserva las características de los datos originales con alta precisión, y por lo tanto retiene la utilidad de los datos para los casos de uso para los que se anuncia, simultáneamente permite a los adversarios extraer información sensible sobre los individuos.

‘Una alta ganancia en privacidad a través de cualquiera de los mecanismos de anonimización que evaluamos solo se puede lograr si la versión publicada de los datos sintéticos o sanitizados no transmite la señal de los registros individuales en los datos brutos y en efecto suprime sus registros.’

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai