Entrevistas

Amy Steier, Cientista de Aprendizado de Máquina Sênior da Gretel.ai – Série de Entrevistas

mm
Adicione Unite.AI às suas fontes preferidas no Google

Amy Steier é a Cientista de Aprendizado de Máquina Sênior da Gretel.ai, a plataforma de engenharia de privacidade mais avançada do mundo. A Gretel torna fácil incorporar a privacidade por design no tecido da tecnologia orientada a dados. Suas bibliotecas baseadas em IA e de código aberto são projetadas para transformar, anonimizar e sintetizar informações sensíveis.

Amy é uma cientista de aprendizado de máquina e cientista de dados altamente qualificada, com mais de 20 anos de experiência. Sua paixão é por big data e revelar a inteligência oculta dentro dele, utilizando técnicas de aprendizado de máquina, mineração de dados, inteligência artificial e estatística. Ela é altamente qualificada em modelagem preditiva, classificação, agrupamento, detecção de anomalias, visualização de dados, métodos de ensemble, recuperação de informações, análise de cibersegurança, NLP, modelos de recomendação e análise de comportamento do usuário.

O que inicialmente a atraiu a seguir uma carreira em ciência da computação e aprendizado de máquina?

Meu amor puro, sem reservas e duradouro por dados. O poder, mistério, intriga e potencial dos dados sempre me fascinou. A ciência da computação e o aprendizado de máquina são ferramentas para aproveitar esse potencial. É também muito divertido trabalhar em um campo onde o estado da arte se move tão rapidamente. Eu amo a interseção entre pesquisa e produto. É muito satisfatório pegar ideias de ponta, empurrá-las um pouco mais e, em seguida, transformá-las para atender às necessidades de produto tangíveis.

Para os leitores que não estão familiarizados, poderia explicar o que é dados sintéticos?

Dados sintéticos são dados que parecem e agem como os dados originais, mas também são diferentes o suficiente para atender a algum caso de uso. O caso de uso mais comum é a necessidade de proteger a privacidade das informações nos dados originais. Outro caso de uso é a necessidade de criar dados adicionais para aumentar o tamanho do conjunto de dados original. Outro caso de uso é ajudar a resolver um desequilíbrio de classes ou talvez viés demográfico no conjunto de dados original.

Os dados sintéticos permitem que continuemos desenvolvendo novos e inovadores produtos e soluções quando os dados necessários para isso de outra forma não estariam presentes ou disponíveis.

Como a plataforma Gretel funciona para criar dados sintéticos por meio de APIs?

As APIs de engenharia de privacidade da Gretel permitem que você ingira dados na Gretel e explore os dados que podemos extrair. Essas são as mesmas APIs usadas por nossa Console. Ao expor as APIs por meio de uma interface intuitiva, esperamos capacitar os desenvolvedores e cientistas de dados a construir seus próprios fluxos de trabalho em torno da Gretel.

Embora a console torna a criação de dados sintéticos muito fácil, as APIs permitem que você integre a criação de dados sintéticos em seu fluxo de trabalho. Eu amo usar as APIs porque elas me permitem personalizar a criação de dados sintéticos para um caso de uso muito particular.

Poderia discutir algumas das ferramentas oferecidas pela Gretel para ajudar a avaliar a qualidade dos dados sintéticos?

Após a criação de dados sintéticos, a Gretel gera um Relatório de Desempenho de Dados Sintéticos. Nesse relatório, você pode ver a Pontuação de Qualidade de Dados Sintéticos (SQS), bem como um grau de Nível de Proteção de Privacidade (PPL).

A pontuação SQS é uma estimativa de quão bem os dados sintéticos gerados mantêm as mesmas propriedades estatísticas que o conjunto de dados original. Nesse sentido, a pontuação SQS pode ser vista como uma pontuação de utilidade ou uma pontuação de confiança de que as conclusões científicas tiradas do conjunto de dados sintéticos seriam as mesmas se você tivesse usado o conjunto de dados original.

A Pontuação de Qualidade de Dados Sintéticos é calculada combinando as métricas de qualidade individuais: Estabilidade de Distribuição de Campo, Estabilidade de Correlação de Campo e Estabilidade de Estrutura Profunda.

Estabilidade de Distribuição de Campo é uma medida de quão bem os dados sintéticos mantêm as mesmas distribuições de campo que os dados originais. A Estabilidade de Correlação de Campo é uma medida de quão bem as correlações entre os campos são mantidas nos dados sintéticos. E, finalmente, a Estabilidade de Estrutura Profunda mede a integridade estatística de distribuições e correlações de vários campos. Para estimar isso, a Gretel compara uma Análise de Componentes Principais (ACP) calculada primeiro nos dados originais e, em seguida, novamente nos dados sintéticos.

Como os filtros de privacidade da Gretel funcionam?

Os Filtros de Privacidade da Gretel foram o resultado de muitas pesquisas sobre a natureza de ataques adversários a dados sintéticos. Os Filtros de Privacidade impedem a criação de dados sintéticos com fraquezas comumente exploradas por adversários. Temos dois Filtros de Privacidade, o primeiro é o Filtro de Semelhança e o segundo é o Filtro de Outlier. O Filtro de Semelhança impede a criação de registros sintéticos que sejam muito semelhantes a um registro de treinamento. Esses são alvos primários de adversários que buscam obter insights sobre os dados originais. O segundo Filtro de Privacidade é o Filtro de Outlier. Isso impede a criação de registros sintéticos que seriam considerados outliers no espaço definido pelos dados de treinamento. Outliers revelados em um conjunto de dados sintéticos podem ser explorados por ataques de inferência de membros, inferência de atributos e uma ampla variedade de outros ataques adversários. Eles são um sério risco de privacidade.

Como os dados sintéticos podem ajudar a reduzir o viés de IA?

A técnica mais comum é abordar o viés de representação dos dados que alimentam um sistema de IA. Por exemplo, se houver um forte desequilíbrio de classes nos seus dados ou talvez haja viés demográfico nos seus dados, a Gretel oferece ferramentas para ajudar a medir o desequilíbrio e, em seguida, resolvê-lo nos dados sintéticos. Ao remover o viés nos dados, você muitas vezes remove o viés no sistema de IA construído sobre os dados.

Você claramente gosta de aprender sobre novas tecnologias de aprendizado de máquina, como você pessoalmente se mantém atualizado sobre todas as mudanças?

Leia, leia e, em seguida, leia mais um pouco, lol! Eu gosto de começar meu dia lendo sobre novas tecnologias de ML. O Medium me conhece muito bem. Eu gosto de ler artigos em Towards Data Science, Analytics Vidhya e newsletters como The Sequence. Facebook (META ) AI, Google (GOOGL ) AI e OpenMined têm ótimos blogs. Há uma grande variedade de bons conferências para seguir, como NeurIPS, ICML, ICLR, AISTATS.

Eu também gosto de ferramentas que rastreiam trilhas de citação, ajudam a encontrar artigos semelhantes aos que você gosta e que conhecem seus interesses específicos e estão sempre observando em segundo plano por um artigo que possa interessá-lo. Zeta Alpha é uma ferramenta que eu uso muito.

Finalmente, você realmente não pode subestimar o benefício de ter colegas de trabalho com interesses semelhantes. Na Gretel, a equipe de ML rastreia artigos de pesquisa relevantes para os campos que exploramos e frequentemente se reúne para discutir artigos interessantes.

Qual é sua visão para o futuro do aprendizado de máquina?

O acesso fácil a dados instigará uma grande era de inovação no aprendizado de máquina, que, por sua vez, acelerará a inovação em uma ampla gama de campos, como saúde, finanças, manufatura e biosciências. Historicamente, muitos avanços importantes no ML podem ser atribuídos a um grande volume de dados ricos. No entanto, historicamente, muitas pesquisas foram dificultadas pela incapacidade de acessar ou compartilhar dados devido a preocupações de privacidade. À medida que ferramentas como a Gretel removem essa barreira, o acesso a dados será democratizado. A comunidade de aprendizado de máquina como um todo se beneficiará do acesso a conjuntos de dados ricos e grandes, em vez de apenas algumas megaempresas de elite.

Há algo mais que você gostaria de compartilhar sobre a Gretel?

Se você ama dados, você amará a Gretel (então, claramente, eu amo a Gretel!). O acesso fácil a dados tem sido o espinho no lado de todos os cientistas de dados que eu já conheci. Na Gretel, nos orgulhamos de ter criado uma console e um conjunto de APIs que tornam a criação de dados privados e compartilháveis tão simples quanto possível. Acreditamos profundamente que os dados são mais valiosos quando são compartilhados.

Obrigado pela grande entrevista e por compartilhar suas ideias, leitores que desejam aprender mais devem visitar Gretel.ai.

Antoine é um líder visionário e sócio-fundador da Unite.AI, impulsionado por uma paixão inabalável por moldar e promover o futuro da IA e da robótica. Um empreendedor serial, ele acredita que a IA será tão disruptiva para a sociedade quanto a eletricidade, e é frequentemente pego falando sobre o potencial das tecnologias disruptivas e da AGI.

Como um futurista, ele está dedicado a explorar como essas inovações moldarão nosso mundo. Além disso, ele é o fundador da Securities.io, uma plataforma focada em investir em tecnologias de ponta que estão redefinindo o futuro e remodelando setores inteiros.