Ángulo de Anderson

Protegiendo las peticiones de LLM de las filtraciones de datos

mm
Añade Unite.AI a tus fuentes preferidas en Google
ChatGPT-4o: 'Orthographic 1792x1024 view of a SIMs-like police officer holding up his hand to a citizen to stop them going any further'

Opinión Una interesante presentación de IBM en NeurIPS 2024 publicada a finales de 2024 resurgió en Arxiv la semana pasada. Propone un sistema que puede intervenir automáticamente para proteger a los usuarios de enviar información personal o sensible en un mensaje cuando tienen una conversación con un Modelo de Lenguaje Grande (LLM) como ChatGPT.

Ejemplos de simulación utilizados en un estudio de usuario para determinar las formas en que las personas preferirían interactuar con un servicio de intervención de petición. Fuente: https://arxiv.org/pdf/2502.18509

Ejemplos de simulación utilizados en un estudio de usuario para determinar las formas en que las personas preferirían interactuar con un servicio de intervención de petición. Fuente: https://arxiv.org/pdf/2502.18509

Los ejemplos de simulación que se muestran arriba fueron utilizados por los investigadores de IBM en un estudio para probar la posible fricción del usuario con este tipo de “interferencia”.

Aunque se proporcionan pocos detalles sobre la implementación de la interfaz de usuario, podemos asumir que dicha funcionalidad podría incorporarse en un complemento del navegador que se comunica con un marco de trabajo de LLM local; o que se podría crear una aplicación que pueda conectarse directamente a (por ejemplo) la API de OpenAI, recreando efectivamente el programa independiente de OpenAI para ChatGPT, pero con salvaguardias adicionales.

Dicho esto, ChatGPT en sí mismo censura automáticamente las respuestas a las peticiones que percibe que contienen información crítica, como detalles bancarios:

ChatGPT se niega a interactuar con peticiones que contienen información de seguridad crítica percibida, como detalles bancarios (los detalles en la petición anterior son ficticios y no funcionales). Fuente: https://chatgpt.com/

ChatGPT se niega a interactuar con peticiones que contienen información de seguridad crítica percibida, como detalles bancarios (los detalles en la petición anterior son ficticios y no funcionales). Fuente: https://chatgpt.com/

Sin embargo, ChatGPT es mucho más tolerante en cuanto a diferentes tipos de información personal – incluso si diseminar dicha información de alguna manera puede no estar en el mejor interés del usuario (en este caso, quizás por varias razones relacionadas con el trabajo y la divulgación):

El ejemplo anterior es ficticio, pero ChatGPT no duda en participar en una conversación con el usuario sobre un tema sensible que constituye un posible riesgo para la reputación o los ingresos (el ejemplo anterior es completamente ficticio).

El ejemplo anterior es ficticio, pero ChatGPT no duda en participar en una conversación con el usuario sobre un tema sensible que constituye un posible riesgo para la reputación o los ingresos (el ejemplo anterior es completamente ficticio).

En el caso anterior, podría haber sido mejor escribir: ¿Cuál es el significado de un diagnóstico de leucemia en la capacidad de una persona para escribir y en su movilidad?

El proyecto de IBM identifica y reinterpreta dichas solicitudes desde una postura “personal” a una postura “genérica”.

Esquema del sistema de IBM, que utiliza LLM locales o heurísticas basadas en NLP para identificar material sensible en posibles peticiones.

Esquema del sistema de IBM, que utiliza LLM locales o heurísticas basadas en NLP para identificar material sensible en posibles peticiones.

Esto supone que el material recopilado por LLM en línea, en esta etapa temprana de la adopción entusiasta del público de la inteligencia artificial, nunca se alimentará a modelos posteriores o a marcos de publicidad posteriores que podrían explotar las consultas de búsqueda de los usuarios para proporcionar publicidad dirigida.

Aunque no se conoce tal sistema o disposición en este momento, tampoco estaba disponible dicha funcionalidad al comienzo de la adopción de Internet en la década de 1990; desde entonces, la compartición de información entre dominios para alimentar publicidad personalizada ha llevado a diversos escándalos, así como paranoia.

Por lo tanto, la historia sugiere que sería mejor sanear las entradas de LLM ahora, antes de que dichos datos se acumulen en volumen, y antes de que nuestras presentaciones basadas en LLM terminen en bases de datos cíclicas permanentes y/o modelos, o en otras estructuras y esquemas de información.

Recuérdame

Un factor que pesa en contra del uso de peticiones “genéricas” o saneadas de LLM es que, francamente, la capacidad de personalizar una API costosa de LLM como ChatGPT es bastante atractiva, al menos en el estado actual de la técnica – pero esto puede implicar la exposición a largo plazo de información privada.

Con frecuencia, le pido a ChatGPT que me ayude a formular scripts de Windows PowerShell y archivos BAT para automatizar procesos, así como en otros asuntos técnicos. Para este fin, encuentro útil que el sistema recuerde permanentemente detalles sobre el hardware que tengo disponible; mis competencias técnicas existentes (o falta de ellas); y varios otros factores ambientales y reglas personalizadas:

ChatGPT permite a un usuario desarrollar una 'memoria' que se aplicará cuando el sistema considere respuestas a peticiones futuras.

ChatGPT permite a un usuario desarrollar una ‘memoria’ que se aplicará cuando el sistema considere respuestas a peticiones futuras.

Inevitablemente, esto mantiene información sobre mí almacenada en servidores externos, sujeta a términos y condiciones que pueden evolucionar con el tiempo, sin ninguna garantía de que OpenAI (aunque podría ser cualquier otro proveedor de LLM importante) respete los términos que establece.

En general, sin embargo, la capacidad de construir una memoria en ChatGPT es más útil debido a la ventana de atención limitada de los LLM en general; sin incrustaciones personalizadas a largo plazo, el usuario se siente, frustrantemente, que está conversando con una entidad que sufre de amnesia anterógrada.

Es difícil decir si los modelos más nuevos eventualmente se volverán lo suficientemente performantes como para proporcionar respuestas útiles sin la necesidad de cachear memorias, o de crear GPT personalizados que se almacenan en línea.

Amnesia Temporal

Aunque se puede hacer que las conversaciones de ChatGPT sean “temporales”, es útil tener el historial de chat como referencia que se puede destilar, cuando el tiempo lo permita, en un registro local más coherente, quizás en una plataforma de toma de notas; pero en cualquier caso, no podemos saber exactamente qué sucede con estos “chats descartados” (aunque OpenAI establece que no se utilizarán para capacitación, no establece que se destruyan), basado en la infraestructura de ChatGPT. Todo lo que sabemos es que los chats ya no aparecen en nuestro historial cuando se activa “Chats temporales” en ChatGPT.

Varios escándalos recientes indican que los proveedores de API como OpenAI no deberían necesariamente estar a cargo de proteger la privacidad del usuario, incluida la descubierta de memorización emergente, lo que significa que los LLM más grandes son más propensos a memorizar algunos ejemplos de capacitación en su totalidad, y aumentan el riesgo de divulgación de datos específicos del usuario – entre otros incidentes públicos que han convencido a una multitud de grandes empresas, como Samsung, a prohibir el uso de LLM para uso interno de la empresa.

Piensa Diferente

Esta tensión entre la utilidad extrema y el riesgo potencial de los LLM necesitará soluciones inventivas – y la propuesta de IBM parece ser un plantilla básica interesante en esta línea.

Tres reformulaciones basadas en IBM que equilibran la utilidad con la privacidad de datos. En la banda más baja (rosa), vemos una petición que está más allá de la capacidad del sistema para sanearla de manera significativa.

Tres reformulaciones basadas en IBM que equilibran la utilidad con la privacidad de datos. En la banda más baja (rosa), vemos una petición que está más allá de la capacidad del sistema para sanearla de manera significativa.

El enfoque de IBM intercepta paquetes salientes a un LLM a nivel de red y los reescribe según sea necesario antes de que la petición original se pueda enviar. Las integraciones de GUI más elaboradas que se ven al comienzo del artículo son solo ilustrativas de hacia dónde podría ir este enfoque, si se desarrolla.

Por supuesto, sin suficiente agencia, el usuario puede no entender que está recibiendo una respuesta a una reformulación ligeramente alterada de su presentación original. Esta falta de transparencia es equivalente a un firewall de sistema operativo que bloquea el acceso a un sitio web o servicio sin informar al usuario, que puede buscar erróneamente otras causas del problema.

Peticiones como Liabilidades de Seguridad

La perspectiva de “intervención de petición” se asemeja bien a la seguridad del sistema operativo Windows, que ha evolucionado desde un patchwork de productos comerciales (opcionalmente instalados) en la década de 1990 hasta una suite de herramientas de defensa de red no opcional y estrictamente aplicada que viene de serie con una instalación de Windows, y que requiere algún esfuerzo para desactivar o reducir.

Si la sanitización de peticiones evoluciona como los firewalls de red, la propuesta del papel de IBM podría servir como un plan para el futuro: desplegar un LLM completamente local en la máquina del usuario para filtrar peticiones salientes dirigidas a API de LLM conocidas. Este sistema naturalmente necesitaría integrar marcos de GUI y notificaciones, dando a los usuarios el control – a menos que las políticas administrativas lo anulen, como a menudo sucede en entornos empresariales.

Los investigadores realizaron un análisis de una versión de código abierto del conjunto de datos ShareGPT para comprender con qué frecuencia se viola la privacidad contextual en escenarios del mundo real.

Llama-3.1-405B-Instruct se empleó como modelo “juez” para detectar violaciones de integridad contextual. De un gran conjunto de conversaciones, un subconjunto de conversaciones de un solo giro se analizaron en función de la longitud. El modelo juez evaluó el contexto, la información sensible y la necesidad de completar la tarea, lo que llevó a la identificación de conversaciones que contenían posibles violaciones de integridad contextual.

Un subconjunto más pequeño de estas conversaciones, que demostraron violaciones definitivas de privacidad contextual, se analizaron más a fondo.

El marco en sí se implementó utilizando modelos que son más pequeños que los agentes de chat típicos como ChatGPT, para permitir el despliegue local a través de Ollama.

Esquema del sistema de intervención de petición.

Esquema del sistema de intervención de petición.

Los tres LLM evaluados fueron Mixtral-8x7B-Instruct-v0.1; Llama-3.1-8B-Instruct; y DeepSeek-R1-Distill-Llama-8B.

Las peticiones de los usuarios se procesan por el marco en tres etapas: identificación de contexto; clasificación de información sensible; y reformulación.

Se implementaron dos enfoques para la clasificación de información sensible: clasificación dinámica y clasificación estructurada: la clasificación dinámica determina los detalles esenciales en función de su uso dentro de una conversación específica; la clasificación estructurada permite la especificación de una lista predefinida de atributos sensibles que siempre se consideran no esenciales. El modelo reformula la petición si detecta detalles sensibles no esenciales, ya sea eliminándolos o reescribiéndolos para minimizar los riesgos de privacidad y mantener la utilidad.

Reglas de la Casa

Aunque la clasificación estructurada como concepto no está bien ilustrada en el papel de IBM, es más similar al método de “Definiciones de datos privados” en la iniciativa Private Prompts, que proporciona un programa independiente descargable que puede reescribir peticiones – aunque sin la capacidad de intervenir directamente a nivel de red, como lo hace el enfoque de IBM (en su lugar, el usuario debe copiar y pegar las peticiones modificadas).

El programa ejecutable Private Prompts permite una lista de sustituciones alternativas para el texto introducido por el usuario.

El programa ejecutable Private Prompts permite una lista de sustituciones alternativas para el texto introducido por el usuario.

En la imagen anterior, podemos ver que el usuario de Private Prompts puede programar sustituciones automatizadas para instancias de información sensible. En ambos casos, para Private Prompts y el método de IBM, parece poco probable que un usuario con suficiente presencia de ánimo y conocimiento personal para curar dicha lista realmente necesite este producto – aunque podría construirse con el tiempo a medida que se produzcan incidentes.

En un rol administrativo, la clasificación estructurada podría funcionar como un firewall o censor-net impuesto para empleados; y en una red doméstica, podría convertirse, con algunos ajustes difíciles, en un filtro de red doméstico para todos los usuarios de la red; pero en última instancia, este método es arguablemente redundante, ya que un usuario que pudiera configurarlo correctamente también podría autocensurarse de manera efectiva.

Opinión de ChatGPT

Dado que ChatGPT lanzó recientemente su herramienta de investigación profunda para usuarios pagados, utilicé esta herramienta para pedirle a ChatGPT que revise la literatura relacionada y me dé una “opinión cínica” sobre el papel de IBM. Recibí la respuesta más defensiva y despectiva que el sistema ha dado cuando se le pidió que evalúe o analice una nueva publicación:

ChatGPT-4o tiene una baja opinión del proyecto de IBM.

ChatGPT-4o tiene una baja opinión del proyecto de IBM.

‘Si los usuarios no confían en OpenAI, Google o Anthropic para manejar sus datos de manera responsable,’ establece ChatGPT. ‘¿por qué confiarían en una capa de software de terceros que se encuentra entre ellos y la IA? El intermediario en sí se convierte en un nuevo punto de fallo – potencialmente registrando, manipulando o incluso filtrando datos antes de que lleguen al LLM. No soluciona nada si solo crea una nueva entidad para explotar los datos del usuario.’

Esta objeción parece ser propia y no aplicable, dado el historial de proyectos de código abierto que genuinamente benefician a los usuarios finales a través de los esfuerzos a largo plazo de los desarrolladores y colaboradores de la comunidad; y dado el creciente potencial de los dispositivos móviles para ejecutar – e incluso entrenar – LLM ligeros. Ciertamente, en este caso, el caso de uso no es particularmente exigente.

A continuación, ChatGPT confiadamente pierde el punto de tener un LLM ligero que proporciona supervisión de la entrada hacia un LLM comercial que no podría posiblemente ejecutarse en una máquina local (porque el LLM es demasiado grande, y permitir el acceso local es demasiado arriesgado para la empresa que lo hace):

‘La filtración de privacidad efectiva requiere comprender la entrada antes de decidir qué eliminar. Si un intermediario es lo suficientemente inteligente como para reconocer datos sensibles (nombres, direcciones, detalles financieros), entonces ya está procesando y analizando esos datos – lo que significa que debe almacenar o examinar la misma cosa que se supone que debe borrar.

‘Esto introduce una paradoja: a) Un filtro tonto (sustitución de regex básica) será ineficaz y perderá riesgos de privacidad sutiles. b) Un filtro inteligente (reescritura impulsada por LLM) debe procesar la entrada completa, lo que lo hace tan peligroso como el LLM original.

‘Si confías en el intermediario lo suficiente como para leer y reescribir tus entradas, ¿por qué no confiar simplemente en el LLM en sí?’

La respuesta a la última pregunta aquí es que el LLM local está destinado a estar completamente del lado del usuario, e inevitablemente de código abierto, con una necesidad mínima o nula de acceso a la red. Una versión comercial equivalente, sin importar cuán bien intencionada sea al principio, eventualmente sería vulnerable a cambios corporativos y cambios en los términos del servicio, mientras que una licencia de código abierto adecuada evitaría este tipo de ‘corrupción inevitable’.

ChatGPT argumentó además que la propuesta de IBM “rompe la intención del usuario”, ya que podría reinterpretar una petición en una alternativa que afecta su utilidad. Sin embargo, este es un problema mucho más amplio en la sanitización de peticiones, y no específico de este caso de uso.

Al concluir (ignorando su sugerencia de usar LLM locales “en su lugar”, que es exactamente lo que el papel de IBM propone), ChatGPT opinó que el método de IBM representa una barrera para la adopción debido a la “fricción del usuario” de implementar métodos de advertencia y edición en un chat.

Aquí, ChatGPT puede tener razón; pero si se ejerce una presión significativa debido a más incidentes públicos, o si los beneficios en una zona geográfica están amenazados por una creciente regulación (y la empresa se niega a abandonar la región afectada por completo), la historia de la tecnología del consumidor sugiere que las salvaguardias eventualmente ya no serán opcionales de todos modos.

Conclusión

No podemos esperar razonablemente que OpenAI implemente salvaguardias del tipo que se proponen en el papel de IBM, y en el concepto central detrás de él; al menos no de manera efectiva.

Y ciertamente no a nivel global; al igual que Apple bloquea ciertas características del iPhone en Europa, y LinkedIn tiene reglas diferentes para explotar los datos de sus usuarios en diferentes países, es razonable sugerir que cualquier empresa de IA recurrirá a los términos y condiciones más rentables que sean tolerables en cualquier nación en particular en la que opere – en cada caso, a expensas del derecho del usuario a la privacidad de los datos, según sea necesario.

 

Publicado por primera vez el jueves 27 de febrero de 2025

Actualizado el jueves 27 de febrero de 2025 15:47:11 debido a un enlace relacionado con Apple incorrecto – MA

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]