Líderes de pensamento
Como o Viés Vai Matar Sua Estratégia de IA/ML e O Que Fazer a Respeito
‘Viés’ em modelos de qualquer tipo descreve uma situação em que o modelo responde de forma inaccurada a prompts ou dados de entrada porque não foi treinado com dados de alta qualidade e diversificados o suficiente para fornecer uma resposta precisa. Um exemplo seria a função de desbloqueio de tela com reconhecimento facial da Apple, que falhou em uma taxa significativamente mais alta para pessoas com pele mais escura em comparação com tons mais claros. O modelo não havia sido treinado com imagens suficientes de pessoas com pele mais escura. Esse foi um exemplo relativamente de baixo risco de viés, mas é exatamente por isso que o Ato de IA da UE estabeleceu requisitos para provar a eficácia do modelo (e controles) antes de ser lançado no mercado. Modelos com saídas que impactam negócios, finanças, saúde ou situações pessoais devem ser confiáveis, ou não serão utilizados.
Lidando com Viés com Dados
Grandes Volumes de Dados de Alta Qualidade
Entre muitas práticas importantes de gerenciamento de dados, um componente-chave para superar e minimizar o viés em modelos de IA/ML é adquirir grandes volumes de dados de alta qualidade e diversificados. Isso requer colaboração com múltiplas organizações que possuem esses dados. Tradicionalmente, a aquisição de dados e colaborações são desafiadas por preocupações de privacidade e/ou proteção de propriedade intelectual – dados sensíveis não podem ser enviados ao proprietário do modelo, e o proprietário do modelo não pode arriscar vazar sua propriedade intelectual para um proprietário de dados. Uma solução comum é trabalhar com dados sintéticos ou mock, que podem ser úteis, mas também têm limitações em comparação com o uso de dados reais e completos. É aqui que as tecnologias de melhoria de privacidade (PETs) fornecem respostas muito necessárias.
Dados Sintéticos: Próximos, mas não Exatamente
Dados sintéticos são gerados artificialmente para imitar dados reais. Isso é difícil de fazer, mas está se tornando ligeiramente mais fácil com ferramentas de IA. Dados sintéticos de boa qualidade devem ter as mesmas distâncias de recursos que os dados reais, ou não serão úteis. Dados sintéticos de alta qualidade podem ser usados para aumentar efetivamente a diversidade dos dados de treinamento, preenchendo lacunas para populações menores ou marginalizadas, ou para populações para as quais o provedor de IA simplesmente não tem dados suficientes. Dados sintéticos também podem ser usados para lidar com casos de bordo que podem ser difíceis de encontrar em volumes adequados no mundo real. Além disso, as organizações podem gerar um conjunto de dados sintéticos para atender a requisitos de residência e privacidade de dados que bloqueiam o acesso aos dados reais. Isso soa ótimo; no entanto, os dados sintéticos são apenas uma peça do quebra-cabeça, não a solução.
Uma das limitações óbvias dos dados sintéticos é a desconexão do mundo real. Por exemplo, veículos autônomos treinados apenas com dados sintéticos terão dificuldade com condições de estrada reais e imprevisíveis. Além disso, os dados sintéticos herdam o viés dos dados do mundo real usados para gerá-los – basicamente derrotando o propósito de nossa discussão. Em conclusão, os dados sintéticos são uma opção útil para ajustes finos e lidar com casos de bordo, mas melhorias significativas na eficácia do modelo e minimização do viés ainda dependem do acesso a dados do mundo real.
Um Melhor Caminho: Dados Reais via Fluxos de Trabalho Habilitados por PETs
As PETs protegem os dados enquanto estão em uso. Quando se trata de modelos de IA/ML, elas também podem proteger a propriedade intelectual do modelo sendo executado – “dois pássaros, uma pedra.” Soluções que utilizam PETs fornecem a opção de treinar modelos em conjuntos de dados reais e sensíveis que não estavam anteriormente acessíveis devido a preocupações de privacidade e segurança de dados. Essa liberação de fluxos de dados para dados reais é a melhor opção para reduzir o viés. Mas como isso funcionaria na prática?
Por agora, as principais opções começam com um ambiente de computação confidencial. Em seguida, uma integração com uma solução de software baseada em PETs que a torna pronta para uso fora da caixa, enquanto atende aos requisitos de governança e segurança de dados que não estão incluídos em um ambiente de execução confiável (TEE) padrão. Com essa solução, os modelos e os dados são todos criptografados antes de serem enviados para um ambiente de computação seguro. O ambiente pode ser hospedado em qualquer lugar, o que é importante ao abordar certos requisitos de localização de dados. Isso significa que tanto a propriedade intelectual do modelo quanto a segurança dos dados de entrada são mantidas durante a computação – nem mesmo o provedor do ambiente de execução confiável tem acesso aos modelos ou dados dentro dele. Os resultados criptografados são então enviados de volta para revisão e logs estão disponíveis para revisão.
Essa abordagem desbloqueia os melhores dados de alta qualidade, independentemente de onde estejam ou quem os possua, criando um caminho para a minimização do viés e modelos de alta eficácia que podemos confiar. Esse fluxo também é o que o Ato de IA da UE descreveu em seus requisitos para uma caixa de areia regulatória de IA.
Facilitando a Conformidade Ética e Legal
Adquirir dados reais de alta qualidade é difícil. Requisitos de privacidade e localização de dados imediatamente limitam os conjuntos de dados que as organizações podem acessar. Para que a inovação e o crescimento ocorram, os dados devem fluir para aqueles que podem extrair valor deles.
A Art. 54 do Ato de IA da UE fornece requisitos para tipos de modelos de “alto risco” em termos do que deve ser provado antes que possam ser levados ao mercado. Em resumo, as equipes precisarão usar dados do mundo real dentro de uma Caixa de Areia Regulatória de IA para demonstrar suficiente eficácia do modelo e conformidade com todos os controles detalhados no Título III, Capítulo 2. Os controles incluem monitoramento, transparência, explicabilidade, segurança de dados, proteção de dados, minimização de dados e proteção de modelos – pense DevSecOps + Data Ops.
O primeiro desafio será encontrar um conjunto de dados do mundo real para usar – pois esses são inherentemente dados sensíveis para esses tipos de modelos. Sem garantias técnicas, muitas organizações podem hesitar em confiar o modelo com seus dados ou não poderão fazer isso. Além disso, a forma como o ato define uma “Caixa de Areia Regulatória de IA” é um desafio em si. Alguns dos requisitos incluem uma garantia de que os dados sejam removidos do sistema após o modelo ter sido executado, bem como os controles de governança, aplicação, e relatórios para provar isso.
Muitas organizações tentaram usar salas de dados (DCRs) e ambientes de execução confiáveis (TEEs) prontos para uso. No entanto, por si só, essas tecnologias exigem expertise e trabalho significativos para operacionalizar e atender aos requisitos regulatórios de dados e IA.
As salas de dados são mais fáceis de usar, mas ainda não são úteis para necessidades de IA/ML mais robustas. Os ambientes de execução confiáveis são servidores seguros e ainda precisam de uma plataforma de colaboração integrada para serem úteis rapidamente. Isso, no entanto, identifica uma oportunidade para plataformas de tecnologia de melhoria de privacidade integrarem-se a ambientes de execução confiáveis para remover esse trabalho, trivializando a configuração e uso de uma caixa de areia regulatória de IA, e, portanto, a aquisição e uso de dados sensíveis.
Ao permitir o uso de conjuntos de dados mais diversificados e abrangentes de forma preservadora da privacidade, essas tecnologias ajudam a garantir que as práticas de IA e ML estejam em conformidade com padrões éticos e requisitos legais relacionados à privacidade de dados (por exemplo, GDPR e Ato de IA da UE na Europa). Em resumo, enquanto os requisitos são frequentemente recebidos com grunhidos e suspiros audíveis, esses requisitos estão simplesmente nos guiando para a construção de melhores modelos que podemos confiar e depender para tomadas de decisão importantes baseadas em dados, enquanto protegemos a privacidade dos sujeitos de dados usados para o desenvolvimento e personalização do modelo.












