Líderes de pensamento
Três Técnicas de Aprendizado de Máquina que Preservam a Privacidade para Resolver o Problema Mais Importante da Década

Por Amogh Tarcar, Pesquisador de Aprendizado de Máquina e Inteligência Artificial, Persistent Systems.
A privacidade dos dados, de acordo com especialistas de uma ampla gama de domínios, será o problema mais importante da década. Isso é particularmente verdadeiro para o aprendizado de máquina (ML), onde os algoritmos são alimentados com grandes quantidades de dados.
Tradionalmente, as técnicas de modelagem de ML dependiam da centralização de dados de múltiplas fontes em um único centro de dados. Afinal, os modelos de ML são mais poderosos quando têm acesso a grandes quantidades de dados. No entanto, existem uma série de desafios de privacidade que vêm com essa técnica. Agregar dados diversificados de múltiplas fontes é menos viável hoje devido a preocupações regulamentares, como HIPAA, GDPR e CCPA. Além disso, a centralização de dados aumenta o escopo e a escala de mau uso de dados e ameaças de segurança na forma de vazamentos de dados.
Para superar esses desafios, vários pilares de aprendizado de máquina que preserva a privacidade (PPML) foram desenvolvidos com técnicas específicas que reduzem o risco de privacidade e garantem que os dados permaneçam razoavelmente seguros. Aqui estão algumas das mais importantes:
1. Aprendizado Federado
O aprendizado federado é uma técnica de treinamento de ML que inverte o problema de agregação de dados. Em vez de agregar dados para criar um único modelo de ML, o aprendizado federado agrega os próprios modelos de ML. Isso garante que os dados nunca saiam de sua localização de origem e permite que várias partes colaborem e construam um modelo de ML comum sem compartilhar diretamente dados sensíveis.
Funciona assim. Você começa com um modelo de ML base que é compartilhado com cada nó de cliente. Esses nós executam um treinamento local nesse modelo usando seus próprios dados. As atualizações do modelo são periodicamente compartilhadas com o nó coordenador, que processa essas atualizações e as funde para obter um novo modelo global. Dessa forma, você obtém insights de conjuntos de dados diversificados sem ter que compartilhar esses conjuntos de dados.

Fonte: Persistent Systems
No contexto da saúde, isso é uma ferramenta incrivelmente poderosa e consciente da privacidade para manter os dados dos pacientes seguros, enquanto dá aos pesquisadores a sabedoria da multidão. Ao não agregar os dados, o aprendizado federado cria uma camada extra de segurança. No entanto, os modelos e as atualizações dos modelos ainda apresentam um risco de segurança se forem deixados vulneráveis.
2. Privacidade Diferencial
Os modelos de ML são frequentemente alvos de ataques de inferência de associação. Digamos que você compartilhasse seus dados de saúde com um hospital para ajudar a desenvolver uma vacina contra o câncer. O hospital mantém seus dados seguros, mas usa o aprendizado federado para treinar um modelo de ML disponível publicamente. Alguns meses depois, hackers usam um ataque de inferência de associação para determinar se seus dados foram usados no treinamento do modelo ou não. Eles então passam insights para uma companhia de seguros, que, com base no seu risco de câncer, poderia aumentar suas apólices.
A privacidade diferencial garante que ataques de adversários em modelos de ML não possam identificar pontos de dados específicos usados durante o treinamento, mitigando assim o risco de expor dados de treinamento sensíveis em aprendizado de máquina. Isso é feito aplicando “ruído estatístico” para perturbar os dados ou os parâmetros do modelo de ML durante o treinamento, tornando difícil executar ataques e determinar se os dados de um indivíduo específico foram usados para treinar o modelo.
Por exemplo, o Facebook recentemente lançou Opacus, uma biblioteca de alta velocidade para treinar modelos PyTorch usando um algoritmo de treinamento de ML com privacidade diferencial chamado Differentially Private Stochastic Gradient Descent (DP-SGD). O gif abaixo destaca como ele usa ruído para mascarar os dados.

Fonte: Blog do Opacus do Facebook
Esse ruído é governado por um parâmetro chamado Epsilon. Se o valor de Epsilon for baixo, o modelo tem privacidade de dados perfeita, mas utilidade e precisão pobres. Inversamente, se você tiver um valor de Epsilon alto, sua privacidade de dados diminuirá, enquanto sua precisão aumentará. A chave é encontrar um equilíbrio para otimizar ambos.
3. Criptografia Homomórfica
A criptografia tradicional é incompatível com o aprendizado de máquina porque, uma vez que os dados são criptografados, eles não podem mais ser compreendidos pelo algoritmo de ML. No entanto, a criptografia homomórfica é um esquema de criptografia especial que nos permite continuar a realizar certos tipos de computações.

Fonte: OpenMined
O poder disso é que o treinamento pode ocorrer em um espaço completamente criptografado. Isso não apenas protege os proprietários de dados, mas também protege os proprietários do modelo. O proprietário do modelo pode executar inferência em dados criptografados sem nunca vê-los ou mal utilizá-los.
Quando aplicada ao aprendizado federado, a fusão de atualizações de modelo pode ocorrer de forma segura porque elas estão acontecendo em um ambiente completamente criptografado, reduzindo drasticamente o risco de ataques de inferência de associação.
A Década da Privacidade
À medida que entramos em 2021, o aprendizado de máquina que preserva a privacidade é um campo emergente com pesquisas notavelmente ativas. Se a última década foi sobre desbloquear os dados, esta década será sobre desbloquear os modelos de ML enquanto preserva a privacidade dos dados subjacentes por meio do aprendizado federado, privacidade diferencial e criptografia homomórfica. Essas apresentam uma nova forma promissora de avançar as soluções de aprendizado de máquina de maneira consciente da privacidade. o último decênio foi sobre desbloquear os dados, esta década será sobre desbloquear os modelos de ML enquanto preserva a privacidade dos dados subjacentes por meio do aprendizado federado, privacidade diferencial e criptografia homomórfica. Essas apresentam uma nova forma promissora de avançar as soluções de aprendizado de máquina de maneira consciente da privacidade.












