Ãngulo de Anderson
Protegendo os Prompt de Vazamentos de Dados do LLM

OpiniÃĢo Uma interessante submissÃĢo da IBM NeurIPS 2024 publicada no final de 2024 reapareceu no Arxiv na semana passada. Ela propÃĩe um sistema que pode intervir automaticamente para proteger os usuÃĄrios de enviar informaçÃĩes pessoais ou sensÃveis em uma mensagem quando estÃĢo tendo uma conversa com um Modelo de Linguagem Grande (LLM) como o ChatGPT.

Exemplos de mock-up usados em um estudo de usuÃĄrio para determinar as maneiras pelas quais as pessoas gostariam de interagir com um serviço de intervençÃĢo de prompt. Fonte: https://arxiv.org/pdf/2502.18509
Os mock-ups mostrados acima foram empregados pelos pesquisadores da IBM em um estudo para testar a fricçÃĢo potencial do usuÃĄrio com esse tipo de âinterferÊnciaâ.
Embora haja poucos detalhes sobre a implementaçÃĢo da GUI, podemos supor que essa funcionalidade poderia ser incorporada a um plugin de navegador comunicando com um quadro de âfirewallâ LLM local; ou que um aplicativo poderia ser criado para se conectar diretamente à API do OpenAI, efetivamente recriando o programa autÃīnomo baixÃĄvel do ChatGPT, mas com salvaguardas extras.
Dito isso, o prÃģprio ChatGPT censura automaticamente as respostas a prompts que ele percebe conter informaçÃĩes crÃticas, como detalhes bancÃĄrios:

ChatGPT se recusa a interagir com prompts que contÊm informaçÃĩes de segurança crÃticas, como detalhes bancÃĄrios (os detalhes no prompt acima sÃĢo fictÃcios e nÃĢo funcionais). Fonte: https://chatgpt.com/
No entanto, o ChatGPT ÃĐ muito mais tolerante em relaçÃĢo a diferentes tipos de informaçÃĩes pessoais â mesmo que divulgar essas informaçÃĩes de alguma forma possa nÃĢo estar no melhor interesse do usuÃĄrio (neste caso, talvez por vÃĄrias razÃĩes relacionadas ao trabalho e à divulgaçÃĢo):

O exemplo acima ÃĐ fictÃcio, mas o ChatGPT nÃĢo hesita em engajar-se em uma conversa com o usuÃĄrio sobre um assunto sensÃvel que constitui um risco potencial para a reputaçÃĢo ou os ganhos (o exemplo acima ÃĐ totalmente fictÃcio).
Nesse caso, poderia ter sido melhor escrever: âQual ÃĐ o significado de um diagnÃģstico de leucemia na capacidade de uma pessoa de escrever e na sua mobilidade?â
O projeto da IBM identifica e reinterpreta esses pedidos de uma perspectiva âpessoalâ para uma perspectiva âgenÃĐricaâ.

Esquema do sistema da IBM, que usa LLMs locais ou heurÃsticas baseadas em NLP para identificar material sensÃvel em prompts potenciais.
Isso pressupÃĩe que o material coletado por LLMs online, nessa fase nascente da adoçÃĢo pÚblica de AI chat, nunca serÃĄ transmitido para modelos subsequentes ou para estruturas de publicidade posteriores que possam explorar consultas de pesquisa de usuÃĄrio para fornecer publicidade direcionada direcionada.
Embora nenhum sistema ou arranjo desse tipo seja conhecido atualmente, nem era essa funcionalidade disponÃvel no inÃcio da adoçÃĢo da internet nos anos 90; desde entÃĢo, compartilhamento de informaçÃĩes entre domÃnios para alimentar publicidade personalizada levou a diversos escÃĒndalos, bem como paranoia.
Portanto, a histÃģria sugere que seria melhor sanificar as entradas de prompts do LLM agora, antes que esses dados se acumulem em volume, e antes que nossas submissÃĩes baseadas em LLM acabem em bancos de dados cÃclicos permanentes e/ou modelos, ou outras estruturas e esquemas baseados em informaçÃĩes.
Lembre-se de Mim?
Um fator que pesa contra o uso de prompts âgenÃĐricosâ ou sanitizados do LLM ÃĐ que, francamente, a capacidade de personalizar um LLM caro como o ChatGPT ÃĐ bastante atraente, pelo menos no estado atual da arte â mas isso pode envolver a exposiçÃĢo de longo prazo de informaçÃĩes privadas.
Eu frequentemente peço ao ChatGPT que me ajude a formular scripts do Windows PowerShell e arquivos BAT para automatizar processos, bem como em outras questÃĩes tÃĐcnicas. Para isso, eu acho Útil que o sistema memorize permanentemente detalhes sobre o hardware que eu tenho disponÃvel; minhas competÊncias tÃĐcnicas existentes (ou falta delas); e vÃĄrios outros fatores ambientais e regras personalizadas:

ChatGPT permite que um usuÃĄrio desenvolva um âcacheâ de memÃģrias que serÃĢo aplicadas quando o sistema considera respostas a prompts futuros.
Inevitavelmente, isso mantÃĐm informaçÃĩes sobre mim armazenadas em servidores externos, sujeitas a termos e condiçÃĩes que podem evoluir ao longo do tempo, sem garantia de que a OpenAI (embora possa ser qualquer outro grande provedor de LLM) respeite os termos que estabeleceu.
Em geral, no entanto, a capacidade de construir um cache de memÃģrias no ChatGPT ÃĐ mais Útil devido à janela de atençÃĢo limitada dos LLMs em geral; sem embeddings personalizados de longo prazo, o usuÃĄrio sente, frustrantemente, que estÃĄ conversando com uma entidade que sofre de amnÃĐsia anterÃģgrada.
à difÃcil dizer se os novos modelos eventualmente se tornarÃĢo suficientemente performÃĄticos para fornecer respostas Úteis sem a necessidade de armazenar memÃģrias ou criar GPTs personalizados que sejam armazenados online.
AmnÃĐsia TemporÃĄria
Embora seja possÃvel tornar as conversas do ChatGPT âtemporÃĄriasâ, ÃĐ Ãštil ter o histÃģrico de conversa como uma referÊncia que possa ser destilada, quando o tempo permitir, em um registro local mais coerente, talvez em uma plataforma de notas; mas, em qualquer caso, nÃĢo podemos saber exatamente o que acontece com essas âconversas descartadasâ (embora a OpenAI afirme que elas nÃĢo serÃĢo usadas para treinamento, nÃĢo afirma que elas serÃĢo destruÃdas), com base na infraestrutura do ChatGPT. Tudo o que sabemos ÃĐ que as conversas nÃĢo aparecem mais em nosso histÃģrico quando âConversas temporÃĄriasâ ÃĐ ativado no ChatGPT.
VÃĄrios controvÃĐrsias recentes indicam que provedores baseados em API, como a OpenAI, nÃĢo devem necessariamente ser deixados encarregados de proteger a privacidade do usuÃĄrio, incluindo a descoberta de memorizaçÃĢo emergente, que significa que LLMs maiores sÃĢo mais propensos a memorizar alguns exemplos de treinamento em sua totalidade, aumentando o risco de divulgaçÃĢo de dados especÃficos do usuÃĄrio â entre outros incidentes pÚblicos que convenceram uma multidÃĢo de grandes empresas, como a Samsung, a proibir LLMs para uso interno da empresa.
Pense Diferentemente
Essa tensÃĢo entre a utilidade extrema e o risco potencial dos LLMs precisarÃĄ de soluçÃĩes inventivas â e a proposta da IBM parece ser um modelo bÃĄsico interessante nessa linha.

TrÊs reformulaçÃĩes baseadas na IBM que equilibram utilidade contra privacidade de dados. Na faixa inferior (rosa), vemos um prompt que estÃĄ alÃĐm da capacidade do sistema de sanificar de forma significativa.
A abordagem da IBM intercepta pacotes de saÃda para um LLM no nÃvel da rede e os reescreve conforme necessÃĄrio antes que o original possa ser submetido. As integraçÃĩes GUI mais elaboradas vistas no inÃcio do artigo sÃĢo apenas ilustrativas de para onde essa abordagem poderia ir, se desenvolvida.
à claro que, sem agÊncia suficiente, o usuÃĄrio pode nÃĢo entender que estÃĄ recebendo uma resposta a uma reformulaçÃĢo ligeiramente alterada de sua submissÃĢo original. Essa falta de transparÊncia ÃĐ equivalente a um firewall de sistema operacional que bloqueia o acesso a um site ou serviço sem informar o usuÃĄrio, que pode entÃĢo erroneamente procurar outras causas para o problema.
Prompts como Liabilities de Segurança
A perspectiva de âintervençÃĢo de promptâ se assemelha bem à segurança do Windows OS, que evoluiu de um patchwork de produtos comerciais (opcionalmente instalados) nos anos 90 para um conjunto nÃĢo opcional e rigidamente aplicado de ferramentas de defesa de rede que vÊm como padrÃĢo com uma instalaçÃĢo do Windows, e que exigem algum esforço para desativar ou reduzir; se a sanitizaçÃĢo de prompts evoluir como as firewalls de rede fizeram nos Últimos 30 anos, a proposta do papel da IBM poderia servir como um modelo para o futuro: implantar um LLM totalmente local no computador do usuÃĄrio para filtrar prompts de saÃda direcionados a LLMs de API conhecidos. Esse sistema naturalmente precisaria integrar frameworks GUI e notificaçÃĩes, dando aos usuÃĄrios controle â a menos que polÃticas administrativas as substituam, como frequentemente ocorre em ambientes de negÃģcios.
Os pesquisadores realizaram uma anÃĄlise de uma versÃĢo de cÃģdigo aberto do conjunto de dados ShareGPT para entender como frequentemente a privacidade contextual ÃĐ violada em cenÃĄrios do mundo real.
Llama-3.1-405B-Instruct foi empregado como um modelo âjuizâ para detectar violaçÃĩes de integridade contextual. De um grande conjunto de conversas, um subconjunto de conversas de uma Única volta foi analisado com base no comprimento. O modelo juiz entÃĢo avaliou o contexto, informaçÃĩes sensÃveis e necessidade de conclusÃĢo da tarefa, levando à identificaçÃĢo de conversas que continham violaçÃĩes potenciais de integridade contextual.
Um subconjunto menor dessas conversas, que demonstrou violaçÃĩes definitivas de privacidade contextual, foi analisado mais a fundo.
O prÃģprio framework foi implementado usando modelos que sÃĢo menores do que os agentes de conversa tÃpicos, como o ChatGPT, para permitir a implantaçÃĢo local via Ollama.

Esquema do sistema de intervençÃĢo de prompt.
Os trÊs LLMs avaliados foram Mixtral-8x7B-Instruct-v0.1; Llama-3.1-8B-Instruct; e DeepSeek-R1-Distill-Llama-8B.
Os prompts do usuÃĄrio sÃĢo processados pelo framework em trÊs etapas: identificaçÃĢo de contexto; classificaçÃĢo de informaçÃĩes sensÃveis; e reformulaçÃĢo.
Duas abordagens foram implementadas para a classificaçÃĢo de informaçÃĩes sensÃveis: dinÃĒmica e estruturada classificaçÃĢo: a classificaçÃĢo dinÃĒmica determina os detalhes essenciais com base em seu uso dentro de uma conversa especÃfica; a classificaçÃĢo estruturada permite a especificaçÃĢo de uma lista prÃĐ-definida de atributos sensÃveis que sÃĢo sempre considerados nÃĢo essenciais. O modelo reformula o prompt se detectar detalhes sensÃveis nÃĢo essenciais, removendo-os ou reescrevendo-os para minimizar os riscos de privacidade, mantendo a utilidade.
Regras da Casa
Embora a classificaçÃĢo estruturada como conceito nÃĢo seja bem ilustrada no papel da IBM, ÃĐ mais semelhante ao mÃĐtodo âDefiniçÃĩes de Dados Privadosâ da iniciativa Private Prompts, que fornece um programa autÃīnomo baixÃĄvel que pode reescrever prompts â embora sem a capacidade de intervir diretamente no nÃvel da rede, como a abordagem da IBM (em vez disso, o usuÃĄrio deve copiar e colar os prompts modificados).

O executÃĄvel Private Prompts permite uma lista de substituiçÃĩes alternativas para texto de entrada do usuÃĄrio.
Na imagem acima, podemos ver que o usuÃĄrio do Private Prompts pode programar substituiçÃĩes automatizadas para instÃĒncias de informaçÃĩes sensÃveis. Em ambos os casos, para Private Prompts e o mÃĐtodo da IBM, parece improvÃĄvel que um usuÃĄrio com presença de espÃrito e insight pessoal suficientes para curar essa lista realmente precisaria desse produto â embora possa ser construÃdo ao longo do tempo à medida que incidentes se acumulam.
Em um papel de administrador, a classificaçÃĢo estruturada poderia funcionar como uma firewall ou rede de censor para funcionÃĄrios; e em uma rede domÃĐstica, poderia, com alguns ajustes difÃceis, se tornar um filtro de rede domÃĐstico para todos os usuÃĄrios da rede; mas, em Última anÃĄlise, esse mÃĐtodo ÃĐ arguivelmente redundante, pois um usuÃĄrio que pudesse configurÃĄ-lo corretamente tambÃĐm poderia censurar a si mesmo efetivamente.
A OpiniÃĢo do ChatGPT
Como o ChatGPT recentemente lançou sua ferramenta de pesquisa profunda para usuÃĄrios pagantes, eu usei essa facilidade para perguntar ao ChatGPT para revisar a literatura relacionada e me dar uma visÃĢo âcÃnicaâ do papel da IBM. Eu recebi a resposta mais defensiva e depreciativa que o sistema jÃĄ deu quando solicitado a avaliar ou analisar uma nova publicaçÃĢo:

ChatGPT-4o tem uma opiniÃĢo baixa do projeto da IBM.
âSe os usuÃĄrios nÃĢo confiam na OpenAI, Google ou Anthropic para lidar com seus dados de forma responsÃĄvel,â o ChatGPT afirma. âpor que confiariam em uma camada de software de terceiros entre eles e a IA? O intermediÃĄrio se torna um novo ponto de falha â potencialmente registrando, manipulando ou atÃĐ mesmo vazando dados antes que eles cheguem ao LLM. Isso nÃĢo resolve nada se apenas criar uma nova entidade para explorar os dados do usuÃĄrio.â
Essa objeçÃĢo parece ser auto-serviça e nÃĢo aplicÃĄvel, dado o histÃģrico de projetos de cÃģdigo aberto que genuinamente beneficiam os usuÃĄrios finais por meio dos esforços de longo prazo de desenvolvedores e colaboradores da comunidade; e dado o potencial crescente de dispositivos mÃģveis para executar â e atÃĐ mesmo treinar â LLMs leves. Certamente, nesse caso, o caso de uso nÃĢo ÃĐ muito exigente.
Em seguida, o ChatGPT confiantemente perde o ponto de ter um LLM leve fornecendo supervisÃĢo da entrada para um LLM comercial que nÃĢo pode ser executado em uma mÃĄquina local (porque o LLM ÃĐ muito grande e permitir acesso local ÃĐ muito arriscado para a empresa que o faz):
âA filtragem de privacidade eficaz requer entender a entrada antes de decidir o que remover. Se um intermediÃĄrio ÃĐ inteligente o suficiente para reconhecer dados sensÃveis (nomes, endereços, detalhes financeiros), entÃĢo jÃĄ estÃĄ processando e analisando esses dados â significando que precisa armazenar ou examinar exatamente a coisa que deveria apagar.
âIsso introduz um paradoxo: a) Um filtro burro (substituiçÃĢo bÃĄsica de regex) serÃĄ ineficaz e perderÃĄ riscos de privacidade sutis. b) Um filtro inteligente (reescritor baseado em LLM) precisa processar a entrada completa, tornando-o tÃĢo perigoso quanto o LLM original.
âSe vocÊ confia no intermediÃĄrio o suficiente para ler e reescrever suas entradas, por que nÃĢo confiar no prÃģprio LLM?â
A resposta para a Última pergunta aqui ÃĐ que o LLM local ÃĐ destinado a estar inteiramente do lado do usuÃĄrio e, inevitavelmente, de cÃģdigo aberto, com necessidade mÃnima ou zero de acesso à rede. Uma versÃĢo comercial equivalente, por mais bem-intencionada que seja no inÃcio, eventualmente estaria vulnerÃĄvel a mudanças corporativas e alteraçÃĩes nos termos de serviço, enquanto uma licença de cÃģdigo aberto adequada impediria esse tipo de âcorrupçÃĢo inevitÃĄvelâ.
O ChatGPT argumentou ainda que a proposta da IBM âquebra a intençÃĢo do usuÃĄrioâ, pois poderia reinterpretar um prompt em uma alternativa que afeta sua utilidade. No entanto, isso ÃĐ um problema muito mais amplo na sanitizaçÃĢo de prompts, e nÃĢo especÃfico para esse caso de uso.
Em conclusÃĢo (ignorando sua sugestÃĢo de usar LLMs locais âem vezâ, que ÃĐ exatamente o que o papel da IBM propÃĩe), o ChatGPT opinou que o mÃĐtodo da IBM representa uma barreira à adoçÃĢo devido à âfricçÃĢo do usuÃĄrioâ de implementar mÃĐtodos de aviso e ediçÃĢo em um chat.
Aqui, o ChatGPT pode estar certo; mas se uma pressÃĢo significativa surgir devido a incidentes pÚblicos adicionais, ou se os lucros em uma zona geogrÃĄfica forem ameaçados por regulamentaçÃĩes crescentes (e a empresa se recusar a simplesmente abandonar a regiÃĢo afetada inteiramente), a histÃģria da tecnologia de consumo sugere que as salvaguardas eventualmente nÃĢo serÃĢo mais opcionais de qualquer forma.
ConclusÃĢo
NÃĢo podemos realisticamente esperar que a OpenAI implemente salvaguardas do tipo proposto no papel da IBM, e no conceito central por trÃĄs dele; pelo menos, nÃĢo efetivamente.
E certamente nÃĢo globalmente; assim como a Apple bloqueia certas funcionalidades do iPhone na Europa, e o LinkedIn tem regras diferentes para explorar os dados de seus usuÃĄrios em diferentes paÃses, ÃĐ razoÃĄvel sugerir que qualquer empresa de IA irÃĄ recorrer aos termos e condiçÃĩes mais lucrativos que sejam tolerÃĄveis em qualquer naçÃĢo em que opere â em cada caso, à s custas do direito do usuÃĄrio à privacidade de dados, conforme necessÃĄrio.
Â
Publicado pela primeira vez na quinta-feira, 27 de fevereiro de 2025
Atualizado na quinta-feira, 27 de fevereiro de 2025 15:47:11 devido a um link relacionado à Apple incorreto â MA












