Ángulo de Anderson

Investigadores de inteligencia artificial estiman que el 97% de los sitios web de la UE no cumplen con los requisitos de privacidad del RGPD, especialmente en la creación de perfiles de usuario

mm
Añade Unite.AI a tus fuentes preferidas en Google

Investigadores en EE. UU. han utilizado técnicas de aprendizaje automático para estudiar las políticas de privacidad del RGPD de más de mil sitios web representativos con sede en la UE. Descubrieron que el 97% de los sitios estudiados no cumplían con al menos uno de los requisitos del marco regulatorio de la Unión Europea de 2018, y que cumplieron menos que nada con los requisitos regulatorios en torno a la práctica de “creación de perfiles de usuario”.

El documento establece:

‘[Dado que] la política de privacidad es el canal de comunicación esencial para que los usuarios entiendan y controlen su privacidad, muchas empresas actualizaron sus políticas de privacidad después de que se aplicó el RGPD. Sin embargo, la mayoría de las políticas de privacidad son prolijas, llenas de jerga y describen vagamente las prácticas de datos de las empresas y los derechos de los usuarios. Por lo tanto, no está claro si cumplen con el RGPD.’

Continúa:

‘Nuestros resultados muestran que incluso después de que el RGPD entró en vigor, el 97% de los sitios web aún no cumplen con al menos uno de los requisitos del RGPD.’

El estudio se titula Detección automática de requisitos de divulgación del RGPD en políticas de privacidad utilizando aprendizaje activo profundo, y proviene de tres investigadores de la Universidad de Virginia en Charlottesville.

Privacidad última

El área de menor cumplimiento, según el estudio, se refiere a las estipulaciones del RGPD sobre la creación de perfiles de usuario, con los autores afirmando que solo el 15,3% de los sitios estudiados estaban en pleno cumplimiento con esta regla en particular.

Un gráfico de cumplimiento entre 9761 sitios web estudiados para la investigación. Fuente: https://arxiv.org/pdf/2111.04224.pdf

Un gráfico de cumplimiento entre las políticas de privacidad de los sitios web estudiados para la investigación. Fuente: https://arxiv.org/pdf/2111.04224.pdf

La creación de perfiles de usuario (donde se registra la interacción de una persona con los sitios web y a menudo se utiliza para “seguir” a los usuarios en otros contextos en línea, como la publicidad) se ha convertido en uno de los temas más controvertidos en la tecnología desde el escándalo de Cambridge Analytica.

El martes, un comité clave del Parlamento Europeo aprobó la primera etapa de la nueva Ley de Mercados Digitales (DMA) legislación, que prohibiría la orientación comportamental de menores, imponiendo multas de hasta el 20% de las ventas anuales globales para las empresas infractoras.

Aunque la Ley ha sido recibida por los medios como una respuesta directa a la creciente influencia de los gigantes tecnológicos como Facebook y Google, la escala de incumplimiento representada por la nueva investigación sugiere que la gran mayoría de las empresas de la UE (incluidas las oficinas con sede en la UE de empresas estadounidenses que operan en Europa) están expuestas legalmente a multas del RGPD.

Además, Italia ha impuesto esta semana la multa máxima permitida de 10 millones de euros (11,2 millones de dólares estadounidenses) contra Apple y Google por explotar la creación de perfiles de usuario, entre otras infracciones.

Datos

Los sitios examinados en la nueva investigación se seleccionaron de los 10.000 sitios web principales enumerados en Quantcast, las políticas de privacidad en inglés de los cuales se extrajeron a través de búsquedas de Yandex en VPN con sede en el Reino Unido (para asegurarse de que las políticas no estuvieran bloqueadas geográficamente).

Los sitios web de la UE han estado obligados a proporcionar políticas de privacidad prescritas, que cubren 18 requisitos centrales (ver gráfico anterior) desde que el Reglamento General de Protección de Datos (RGPD) entró en vigor en mayo de 2018.

Los investigadores limitaron la extracción de las políticas de privacidad a un período a partir de agosto de 2018, para permitir un tiempo razonable para que los dominios publicaran las políticas requeridas (un requisito del que tenían conocimiento previo durante al menos un año de la fase de desarrollo de dos años del RGPD desde 2016).

El proceso de filtrado produjo un corpus de privacidad de 9.761 políticas, de las cuales 1.080 políticas se seleccionaron aleatoriamente por los investigadores.

Preprocesamiento

El equipo empleó a dos expertos legales para capacitar a cuatro anotadores humanos para etiquetar cada una de las 18 políticas de privacidad posibles exigidas por el RGPD.

Algunas de las expresiones legales en las políticas cubrían más de uno de los 18 requisitos, lo que hizo necesario utilizar una Red Neuronal Convolucional (CNN) para detectar características lingüísticas asociadas con cada política.

Un intento inicial de entrenar un modelo para identificar el cumplimiento basado en el lenguaje logró un éxito del 80,5%. Para mejorar estos resultados, los investigadores aplicaron Aprendizaje Activo para mejorar el rendimiento del modelo utilizando menos datos etiquetados. De esta manera, fue posible entrenar al clasificador CNN hasta una precisión del 89,2%, con una puntuación F1 de 0,88 (donde ‘1’ es el éxito total).

Para asegurarse de que las incrustaciones de palabras fueran específicas de la política de privacidad, los investigadores entrenaron un modelo de incrustación de palabras no supervisado utilizando la biblioteca Python FastText de Facebook.

Según la práctica estándar, los datos finales se dividieron 80/20 entre datos de entrenamiento y datos de prueba (es decir, datos seleccionados aleatoriamente contra los cuales se juzgará la precisión del algoritmo). Se agregó un estudio de medición con un humano en el bucle a la arquitectura para evaluar la calidad de los resultados.

La arquitectura para el sistema clasificador.

La arquitectura para el sistema clasificador.

En el transcurso del flujo de trabajo, se produjeron 11.271 segmentos de políticas de privacidad anotados por humanos, cada uno de los cuales fue revisado por cuatro anotadores humanos que habían sido capacitados por los dos expertos legales involucrados en el estudio. Cuando ocurrió un desacuerdo, se necesitaba una proporción de acuerdo del 75% para no rechazar los datos para su inclusión.

Humanos en el bucle – no fue posible automatizar completamente la etiquetado de los datos de la política, aunque el Aprendizaje Activo permitió un flujo de trabajo basado en un grupo que hizo que el proyecto fuera factible.

Humanos en el bucle – no fue posible automatizar completamente la etiquetado de los datos de la política, aunque el Aprendizaje Activo permitió un flujo de trabajo basado en un grupo que hizo que el proyecto fuera factible.

Además de los resultados ya mencionados, los usuarios encontraron que la portabilidad – el derecho bajo el RGPD para trasladar o exportar los datos mantenidos por una empresa – estuvo casi tan mal atendido como la creación de perfiles.

Los investigadores concluyen:

‘[Requisitos] como el derecho de los usuarios a la portabilidad y la provisión de la información de contacto del Oficial de Protección de Datos (contacto DPO) están cubiertos por el 15,5% y el 16,4% de los sitios web, respectivamente. Otros requisitos principales, como el derecho de los usuarios a presentar una queja, retirar el consentimiento, derecho a oponerse y decisión de adecuación, están cubiertos por el 17-20% de los sitios web.’

…y continúa:

‘Parece que solo el 3% de los sitios web cumplen completamente con los 18 requisitos. Estos hallazgos indican que muchos sitios web aún no siguen los requisitos del RGPD.’

 

 

7pm 26/11/2021 – Se aclaró la leyenda del primer gráfico. – MA

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai