Ângulo de Anderson

Protegendo os Prompt de Vazamentos de Dados do LLM

mm
Adicione Unite.AI às suas fontes preferidas no Google
ChatGPT-4o: 'Orthographic 1792x1024 view of a SIMs-like police officer holding up his hand to a citizen to stop them going any further'

OpiniÃĢo Uma interessante submissÃĢo da IBM NeurIPS 2024 publicada no final de 2024 reapareceu no Arxiv na semana passada. Ela propÃĩe um sistema que pode intervir automaticamente para proteger os usuÃĄrios de enviar informaçÃĩes pessoais ou sensíveis em uma mensagem quando estÃĢo tendo uma conversa com um Modelo de Linguagem Grande (LLM) como o ChatGPT.

Exemplos de mock-up usados em um estudo de usuÃĄrio para determinar as maneiras pelas quais as pessoas gostariam de interagir com um serviço de intervençÃĢo de prompt. Fonte: https://arxiv.org/pdf/2502.18509

Exemplos de mock-up usados em um estudo de usuÃĄrio para determinar as maneiras pelas quais as pessoas gostariam de interagir com um serviço de intervençÃĢo de prompt. Fonte: https://arxiv.org/pdf/2502.18509

Os mock-ups mostrados acima foram empregados pelos pesquisadores da IBM em um estudo para testar a fricçÃĢo potencial do usuÃĄrio com esse tipo de “interferÊncia”.

Embora haja poucos detalhes sobre a implementaçÃĢo da GUI, podemos supor que essa funcionalidade poderia ser incorporada a um plugin de navegador comunicando com um quadro de “firewall” LLM local; ou que um aplicativo poderia ser criado para se conectar diretamente à API do OpenAI, efetivamente recriando o programa autÃīnomo baixÃĄvel do ChatGPT, mas com salvaguardas extras.

Dito isso, o prÃģprio ChatGPT censura automaticamente as respostas a prompts que ele percebe conter informaçÃĩes críticas, como detalhes bancÃĄrios:

ChatGPT se recusa a interagir com prompts que contÊm informaçÃĩes de segurança críticas, como detalhes bancÃĄrios (os detalhes no prompt acima sÃĢo fictícios e nÃĢo funcionais). Fonte: https://chatgpt.com/

ChatGPT se recusa a interagir com prompts que contÊm informaçÃĩes de segurança críticas, como detalhes bancÃĄrios (os detalhes no prompt acima sÃĢo fictícios e nÃĢo funcionais). Fonte: https://chatgpt.com/

No entanto, o ChatGPT ÃĐ muito mais tolerante em relaçÃĢo a diferentes tipos de informaçÃĩes pessoais – mesmo que divulgar essas informaçÃĩes de alguma forma possa nÃĢo estar no melhor interesse do usuÃĄrio (neste caso, talvez por vÃĄrias razÃĩes relacionadas ao trabalho e à divulgaçÃĢo):

O exemplo acima ÃĐ fictício, mas o ChatGPT nÃĢo hesita em engajar-se em uma conversa com o usuÃĄrio sobre um assunto sensível que constitui um risco potencial para a reputaçÃĢo ou os ganhos (o exemplo acima ÃĐ totalmente fictício).

O exemplo acima ÃĐ fictício, mas o ChatGPT nÃĢo hesita em engajar-se em uma conversa com o usuÃĄrio sobre um assunto sensível que constitui um risco potencial para a reputaçÃĢo ou os ganhos (o exemplo acima ÃĐ totalmente fictício).

Nesse caso, poderia ter sido melhor escrever: ‘Qual ÃĐ o significado de um diagnÃģstico de leucemia na capacidade de uma pessoa de escrever e na sua mobilidade?’

O projeto da IBM identifica e reinterpreta esses pedidos de uma perspectiva “pessoal” para uma perspectiva “genÃĐrica”.

Esquema do sistema da IBM, que usa LLMs locais ou heurísticas baseadas em NLP para identificar material sensível em prompts potenciais.

Esquema do sistema da IBM, que usa LLMs locais ou heurísticas baseadas em NLP para identificar material sensível em prompts potenciais.

Isso pressupÃĩe que o material coletado por LLMs online, nessa fase nascente da adoçÃĢo pÚblica de AI chat, nunca serÃĄ transmitido para modelos subsequentes ou para estruturas de publicidade posteriores que possam explorar consultas de pesquisa de usuÃĄrio para fornecer publicidade direcionada direcionada.

Embora nenhum sistema ou arranjo desse tipo seja conhecido atualmente, nem era essa funcionalidade disponível no início da adoçÃĢo da internet nos anos 90; desde entÃĢo, compartilhamento de informaçÃĩes entre domínios para alimentar publicidade personalizada levou a diversos escÃĒndalos, bem como paranoia.

Portanto, a histÃģria sugere que seria melhor sanificar as entradas de prompts do LLM agora, antes que esses dados se acumulem em volume, e antes que nossas submissÃĩes baseadas em LLM acabem em bancos de dados cíclicos permanentes e/ou modelos, ou outras estruturas e esquemas baseados em informaçÃĩes.

Lembre-se de Mim?

Um fator que pesa contra o uso de prompts “genÃĐricos” ou sanitizados do LLM ÃĐ que, francamente, a capacidade de personalizar um LLM caro como o ChatGPT ÃĐ bastante atraente, pelo menos no estado atual da arte – mas isso pode envolver a exposiçÃĢo de longo prazo de informaçÃĩes privadas.

Eu frequentemente peço ao ChatGPT que me ajude a formular scripts do Windows PowerShell e arquivos BAT para automatizar processos, bem como em outras questÃĩes tÃĐcnicas. Para isso, eu acho Útil que o sistema memorize permanentemente detalhes sobre o hardware que eu tenho disponível; minhas competÊncias tÃĐcnicas existentes (ou falta delas); e vÃĄrios outros fatores ambientais e regras personalizadas:

ChatGPT permite que um usuÃĄrio desenvolva um 'cache' de memÃģrias que serÃĢo aplicadas quando o sistema considera respostas a prompts futuros.

ChatGPT permite que um usuÃĄrio desenvolva um ‘cache’ de memÃģrias que serÃĢo aplicadas quando o sistema considera respostas a prompts futuros.

Inevitavelmente, isso mantÃĐm informaçÃĩes sobre mim armazenadas em servidores externos, sujeitas a termos e condiçÃĩes que podem evoluir ao longo do tempo, sem garantia de que a OpenAI (embora possa ser qualquer outro grande provedor de LLM) respeite os termos que estabeleceu.

Em geral, no entanto, a capacidade de construir um cache de memÃģrias no ChatGPT ÃĐ mais Útil devido à janela de atençÃĢo limitada dos LLMs em geral; sem embeddings personalizados de longo prazo, o usuÃĄrio sente, frustrantemente, que estÃĄ conversando com uma entidade que sofre de amnÃĐsia anterÃģgrada.

É difícil dizer se os novos modelos eventualmente se tornarÃĢo suficientemente performÃĄticos para fornecer respostas Úteis sem a necessidade de armazenar memÃģrias ou criar GPTs personalizados que sejam armazenados online.

AmnÃĐsia TemporÃĄria

Embora seja possível tornar as conversas do ChatGPT “temporÃĄrias”, ÃĐ Ãštil ter o histÃģrico de conversa como uma referÊncia que possa ser destilada, quando o tempo permitir, em um registro local mais coerente, talvez em uma plataforma de notas; mas, em qualquer caso, nÃĢo podemos saber exatamente o que acontece com essas “conversas descartadas” (embora a OpenAI afirme que elas nÃĢo serÃĢo usadas para treinamento, nÃĢo afirma que elas serÃĢo destruídas), com base na infraestrutura do ChatGPT. Tudo o que sabemos ÃĐ que as conversas nÃĢo aparecem mais em nosso histÃģrico quando “Conversas temporÃĄrias” ÃĐ ativado no ChatGPT.

VÃĄrios controvÃĐrsias recentes indicam que provedores baseados em API, como a OpenAI, nÃĢo devem necessariamente ser deixados encarregados de proteger a privacidade do usuÃĄrio, incluindo a descoberta de memorizaçÃĢo emergente, que significa que LLMs maiores sÃĢo mais propensos a memorizar alguns exemplos de treinamento em sua totalidade, aumentando o risco de divulgaçÃĢo de dados específicos do usuÃĄrio – entre outros incidentes pÚblicos que convenceram uma multidÃĢo de grandes empresas, como a Samsung, a proibir LLMs para uso interno da empresa.

Pense Diferentemente

Essa tensÃĢo entre a utilidade extrema e o risco potencial dos LLMs precisarÃĄ de soluçÃĩes inventivas – e a proposta da IBM parece ser um modelo bÃĄsico interessante nessa linha.

TrÊs reformulaçÃĩes baseadas na IBM que equilibram utilidade contra privacidade de dados. Na faixa inferior (rosa), vemos um prompt que estÃĄ alÃĐm da capacidade do sistema de sanificar de forma significativa.

TrÊs reformulaçÃĩes baseadas na IBM que equilibram utilidade contra privacidade de dados. Na faixa inferior (rosa), vemos um prompt que estÃĄ alÃĐm da capacidade do sistema de sanificar de forma significativa.

A abordagem da IBM intercepta pacotes de saída para um LLM no nível da rede e os reescreve conforme necessÃĄrio antes que o original possa ser submetido. As integraçÃĩes GUI mais elaboradas vistas no início do artigo sÃĢo apenas ilustrativas de para onde essa abordagem poderia ir, se desenvolvida.

É claro que, sem agÊncia suficiente, o usuÃĄrio pode nÃĢo entender que estÃĄ recebendo uma resposta a uma reformulaçÃĢo ligeiramente alterada de sua submissÃĢo original. Essa falta de transparÊncia ÃĐ equivalente a um firewall de sistema operacional que bloqueia o acesso a um site ou serviço sem informar o usuÃĄrio, que pode entÃĢo erroneamente procurar outras causas para o problema.

Prompts como Liabilities de Segurança

A perspectiva de “intervençÃĢo de prompt” se assemelha bem à segurança do Windows OS, que evoluiu de um patchwork de produtos comerciais (opcionalmente instalados) nos anos 90 para um conjunto nÃĢo opcional e rigidamente aplicado de ferramentas de defesa de rede que vÊm como padrÃĢo com uma instalaçÃĢo do Windows, e que exigem algum esforço para desativar ou reduzir; se a sanitizaçÃĢo de prompts evoluir como as firewalls de rede fizeram nos Últimos 30 anos, a proposta do papel da IBM poderia servir como um modelo para o futuro: implantar um LLM totalmente local no computador do usuÃĄrio para filtrar prompts de saída direcionados a LLMs de API conhecidos. Esse sistema naturalmente precisaria integrar frameworks GUI e notificaçÃĩes, dando aos usuÃĄrios controle – a menos que políticas administrativas as substituam, como frequentemente ocorre em ambientes de negÃģcios.

Os pesquisadores realizaram uma anÃĄlise de uma versÃĢo de cÃģdigo aberto do conjunto de dados ShareGPT para entender como frequentemente a privacidade contextual ÃĐ violada em cenÃĄrios do mundo real.

Llama-3.1-405B-Instruct foi empregado como um modelo “juiz” para detectar violaçÃĩes de integridade contextual. De um grande conjunto de conversas, um subconjunto de conversas de uma Única volta foi analisado com base no comprimento. O modelo juiz entÃĢo avaliou o contexto, informaçÃĩes sensíveis e necessidade de conclusÃĢo da tarefa, levando à identificaçÃĢo de conversas que continham violaçÃĩes potenciais de integridade contextual.

Um subconjunto menor dessas conversas, que demonstrou violaçÃĩes definitivas de privacidade contextual, foi analisado mais a fundo.

O prÃģprio framework foi implementado usando modelos que sÃĢo menores do que os agentes de conversa típicos, como o ChatGPT, para permitir a implantaçÃĢo local via Ollama.

Esquema do sistema de intervençÃĢo de prompt.

Esquema do sistema de intervençÃĢo de prompt.

Os trÊs LLMs avaliados foram Mixtral-8x7B-Instruct-v0.1; Llama-3.1-8B-Instruct; e DeepSeek-R1-Distill-Llama-8B.

Os prompts do usuÃĄrio sÃĢo processados pelo framework em trÊs etapas: identificaçÃĢo de contexto; classificaçÃĢo de informaçÃĩes sensíveis; e reformulaçÃĢo.

Duas abordagens foram implementadas para a classificaçÃĢo de informaçÃĩes sensíveis: dinÃĒmica e estruturada classificaçÃĢo: a classificaçÃĢo dinÃĒmica determina os detalhes essenciais com base em seu uso dentro de uma conversa específica; a classificaçÃĢo estruturada permite a especificaçÃĢo de uma lista prÃĐ-definida de atributos sensíveis que sÃĢo sempre considerados nÃĢo essenciais. O modelo reformula o prompt se detectar detalhes sensíveis nÃĢo essenciais, removendo-os ou reescrevendo-os para minimizar os riscos de privacidade, mantendo a utilidade.

Regras da Casa

Embora a classificaçÃĢo estruturada como conceito nÃĢo seja bem ilustrada no papel da IBM, ÃĐ mais semelhante ao mÃĐtodo “DefiniçÃĩes de Dados Privados” da iniciativa Private Prompts, que fornece um programa autÃīnomo baixÃĄvel que pode reescrever prompts – embora sem a capacidade de intervir diretamente no nível da rede, como a abordagem da IBM (em vez disso, o usuÃĄrio deve copiar e colar os prompts modificados).

O executÃĄvel Private Prompts permite uma lista de substituiçÃĩes alternativas para texto de entrada do usuÃĄrio.

O executÃĄvel Private Prompts permite uma lista de substituiçÃĩes alternativas para texto de entrada do usuÃĄrio.

Na imagem acima, podemos ver que o usuÃĄrio do Private Prompts pode programar substituiçÃĩes automatizadas para instÃĒncias de informaçÃĩes sensíveis. Em ambos os casos, para Private Prompts e o mÃĐtodo da IBM, parece improvÃĄvel que um usuÃĄrio com presença de espírito e insight pessoal suficientes para curar essa lista realmente precisaria desse produto – embora possa ser construído ao longo do tempo à medida que incidentes se acumulam.

Em um papel de administrador, a classificaçÃĢo estruturada poderia funcionar como uma firewall ou rede de censor para funcionÃĄrios; e em uma rede domÃĐstica, poderia, com alguns ajustes difíceis, se tornar um filtro de rede domÃĐstico para todos os usuÃĄrios da rede; mas, em Última anÃĄlise, esse mÃĐtodo ÃĐ arguivelmente redundante, pois um usuÃĄrio que pudesse configurÃĄ-lo corretamente tambÃĐm poderia censurar a si mesmo efetivamente.

A OpiniÃĢo do ChatGPT

Como o ChatGPT recentemente lançou sua ferramenta de pesquisa profunda para usuÃĄrios pagantes, eu usei essa facilidade para perguntar ao ChatGPT para revisar a literatura relacionada e me dar uma visÃĢo “cínica” do papel da IBM. Eu recebi a resposta mais defensiva e depreciativa que o sistema jÃĄ deu quando solicitado a avaliar ou analisar uma nova publicaçÃĢo:

ChatGPT-4o tem uma opiniÃĢo baixa do projeto da IBM.

ChatGPT-4o tem uma opiniÃĢo baixa do projeto da IBM.

‘Se os usuÃĄrios nÃĢo confiam na OpenAI, Google ou Anthropic para lidar com seus dados de forma responsÃĄvel,’ o ChatGPT afirma. ‘por que confiariam em uma camada de software de terceiros entre eles e a IA? O intermediÃĄrio se torna um novo ponto de falha – potencialmente registrando, manipulando ou atÃĐ mesmo vazando dados antes que eles cheguem ao LLM. Isso nÃĢo resolve nada se apenas criar uma nova entidade para explorar os dados do usuÃĄrio.’

Essa objeçÃĢo parece ser auto-serviça e nÃĢo aplicÃĄvel, dado o histÃģrico de projetos de cÃģdigo aberto que genuinamente beneficiam os usuÃĄrios finais por meio dos esforços de longo prazo de desenvolvedores e colaboradores da comunidade; e dado o potencial crescente de dispositivos mÃģveis para executar – e atÃĐ mesmo treinar – LLMs leves. Certamente, nesse caso, o caso de uso nÃĢo ÃĐ muito exigente.

Em seguida, o ChatGPT confiantemente perde o ponto de ter um LLM leve fornecendo supervisÃĢo da entrada para um LLM comercial que nÃĢo pode ser executado em uma mÃĄquina local (porque o LLM ÃĐ muito grande e permitir acesso local ÃĐ muito arriscado para a empresa que o faz):

‘A filtragem de privacidade eficaz requer entender a entrada antes de decidir o que remover. Se um intermediÃĄrio ÃĐ inteligente o suficiente para reconhecer dados sensíveis (nomes, endereços, detalhes financeiros), entÃĢo jÃĄ estÃĄ processando e analisando esses dados – significando que precisa armazenar ou examinar exatamente a coisa que deveria apagar.

‘Isso introduz um paradoxo: a) Um filtro burro (substituiçÃĢo bÃĄsica de regex) serÃĄ ineficaz e perderÃĄ riscos de privacidade sutis. b) Um filtro inteligente (reescritor baseado em LLM) precisa processar a entrada completa, tornando-o tÃĢo perigoso quanto o LLM original.

‘Se vocÊ confia no intermediÃĄrio o suficiente para ler e reescrever suas entradas, por que nÃĢo confiar no prÃģprio LLM?’

A resposta para a Última pergunta aqui ÃĐ que o LLM local ÃĐ destinado a estar inteiramente do lado do usuÃĄrio e, inevitavelmente, de cÃģdigo aberto, com necessidade mínima ou zero de acesso à rede. Uma versÃĢo comercial equivalente, por mais bem-intencionada que seja no início, eventualmente estaria vulnerÃĄvel a mudanças corporativas e alteraçÃĩes nos termos de serviço, enquanto uma licença de cÃģdigo aberto adequada impediria esse tipo de ‘corrupçÃĢo inevitÃĄvel’.

O ChatGPT argumentou ainda que a proposta da IBM “quebra a intençÃĢo do usuÃĄrio”, pois poderia reinterpretar um prompt em uma alternativa que afeta sua utilidade. No entanto, isso ÃĐ um problema muito mais amplo na sanitizaçÃĢo de prompts, e nÃĢo específico para esse caso de uso.

Em conclusÃĢo (ignorando sua sugestÃĢo de usar LLMs locais “em vez”, que ÃĐ exatamente o que o papel da IBM propÃĩe), o ChatGPT opinou que o mÃĐtodo da IBM representa uma barreira à adoçÃĢo devido à “fricçÃĢo do usuÃĄrio” de implementar mÃĐtodos de aviso e ediçÃĢo em um chat.

Aqui, o ChatGPT pode estar certo; mas se uma pressÃĢo significativa surgir devido a incidentes pÚblicos adicionais, ou se os lucros em uma zona geogrÃĄfica forem ameaçados por regulamentaçÃĩes crescentes (e a empresa se recusar a simplesmente abandonar a regiÃĢo afetada inteiramente), a histÃģria da tecnologia de consumo sugere que as salvaguardas eventualmente nÃĢo serÃĢo mais opcionais de qualquer forma.

ConclusÃĢo

NÃĢo podemos realisticamente esperar que a OpenAI implemente salvaguardas do tipo proposto no papel da IBM, e no conceito central por trÃĄs dele; pelo menos, nÃĢo efetivamente.

E certamente nÃĢo globalmente; assim como a Apple bloqueia certas funcionalidades do iPhone na Europa, e o LinkedIn tem regras diferentes para explorar os dados de seus usuÃĄrios em diferentes países, ÃĐ razoÃĄvel sugerir que qualquer empresa de IA irÃĄ recorrer aos termos e condiçÃĩes mais lucrativos que sejam tolerÃĄveis em qualquer naçÃĢo em que opere – em cada caso, às custas do direito do usuÃĄrio à privacidade de dados, conforme necessÃĄrio.

 

Publicado pela primeira vez na quinta-feira, 27 de fevereiro de 2025

Atualizado na quinta-feira, 27 de fevereiro de 2025 15:47:11 devido a um link relacionado à Apple incorreto – MA

Escritor em aprendizado de mÃĄquina, especialista em síntese de imagem humana. Antigo chefe de conteÚdo de pesquisa da Metaphysic.ai, atÃĐ sua dissoluçÃĢo na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: [email protected]