Interviews

Amy Steier, Principal Machine Learning Scientist bij Gretel.ai – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Amy Steier is de Principal Machine Learning Scientist bij Gretel.ai, ‘s werelds meest geavanceerde privacy engineering platform. Gretel maakt het gemakkelijk om privacy by design in de fabric van data-gedreven technologie in te bedden. De AI-gebaseerde, open-sourced bibliotheken zijn ontworpen voor het transformeren, anonimiseren en synthetiseren van gevoelige informatie.

Amy is een zeer ervaren machine learning- en data scientist met meer dan 20 jaar ervaring. Haar passie is big data en het naar boven brengen van de verborgen intelligentie daarin met behulp van technieken uit machine learning, data mining, artificial intelligence en statistiek. Ze is zeer bedreven in predictief modelleren, classificatie, clustering, anomaliedetectie, data visualisatie, ensemble methoden, informatieopname, cybersecurity analytics, NLP, aanbevelingsmodellen en gebruikersgedragsanalyse.

Wat trok je aanvankelijk aan om een carrière in computerwetenschap en machine learning na te streven?

Mijn pure, ongebreidelde, blijvende liefde voor data. De kracht, het mysterie, de intrige en het potentieel van data hebben me altijd gefascineerd. Computerwetenschap en machine learning zijn hulpmiddelen om dat potentieel te benutten. Het is ook verschrikkelijk leuk om in een vakgebied te werken waar de stand van de techniek zo snel evolueert. Ik hou van de kruispunt van onderzoek en product. Het is zeer bevredigend om baanbrekende ideeën te nemen, ze een beetje verder te duwen en ze vervolgens aan te passen aan bestaande, tastbare productbehoeften.

Kun je voor lezers die onbekend zijn met het onderwerp uitleggen wat synthetische data is?

Synthetische data is data die eruitziet en zich gedraagt als de oorspronkelijke data, maar ook voldoende verschillend is om een bepaald gebruik te rechtvaardigen. Het meest voorkomende gebruik is de noodzaak om de privacy van de informatie in de oorspronkelijke data te beschermen. Een ander gebruik is de noodzaak om extra data te creëren om de grootte van de oorspronkelijke dataset te vergroten. Nog een ander gebruik is om te helpen bij het aanpakken van een klasse-ongelijkheid of demografische bias in de oorspronkelijke dataset.

Synthetische data stelt ons in staat om nieuwe en innovatieve producten en oplossingen te ontwikkelen wanneer de benodigde data anders niet aanwezig of beschikbaar zou zijn.

Hoe werkt het Gretel-platform om synthetische data via API’s te creëren?

De Gretel-privacy engineering API’s stellen je in staat om data in te voeren in Gretel en de data te onderzoeken die we kunnen extraheren. Dit zijn dezelfde API’s die worden gebruikt door onze Console. Door de API’s bloot te leggen via een intuïtieve interface, hopen we ontwikkelaars en data scientists in staat te stellen om hun eigen workflows rond Gretel te bouwen.

Terwijl de console het creëren van synthetische data heel gemakkelijk maakt, stellen de API’s je in staat om de creatie van synthetische data in je workflow te integreren. Ik hou ervan om de API’s te gebruiken omdat ze me in staat stellen om de creatie van synthetische data aan te passen aan een specifiek gebruik.

Kun je enkele van de tools bespreken die door Gretel worden aangeboden om de kwaliteit van de synthetische data te beoordelen?

Na het creëren van synthetische data, genereert Gretel een Synthetic Report. In dit rapport kun je de Synthetic Data Quality Score (SQS) zien, evenals een Privacy Protection Level-graad (PPL).

De SQS-score is een schatting van hoe goed de gegenereerde synthetische data dezelfde statistische eigenschappen behoudt als de oorspronkelijke dataset. In deze zin kan de SQS-score worden beschouwd als een nuttigheidsscore of een vertrouwensscore voor wetenschappelijke conclusies die uit de synthetische dataset worden getrokken.

De Synthetic Data Quality Score wordt berekend door de individuele kwaliteitsmetrieken te combineren: Field Distribution Stability, Field Correlation Stability en Deep Structure Stability.

Field Distribution Stability is een maatstaf voor hoe goed de synthetische data dezelfde veldverdelingen behoudt als in de oorspronkelijke data. De Field Correlation Stability is een maatstaf voor hoe goed de correlaties tussen velden in de synthetische data worden behouden. En ten slotte meet de Deep Structure Stability de statistische integriteit van diepere, meervoudige veldverdelingen en -correlaties.

Hoe werken de Gretel-privacyfilters?

De Gretel-privacyfilters waren het resultaat van veel onderzoek naar de aard van adversarial attacks op synthetische data. De Privacy Filters voorkomen het creëren van synthetische data met zwakheden die door adversarials worden uitgebuit. We hebben twee Privacy Filters, de eerste is de Similarity Filter en de tweede is de Outlier Filter.

Hoe kan synthetische data helpen bij het verminderen van AI-bias?

De meest voorkomende techniek is om de representatieve bias van de data die in een AI-systeem wordt gevoed, aan te pakken. Bijvoorbeeld, als er een sterke klasse-ongelijkheid in je data is, of als er een demografische bias in je data bestaat, biedt Gretel tools om je te helpen bij het meten en opheffen van die ongelijkheid in de synthetische data.

Je houdt duidelijk van leren over nieuwe machine learning-technologieën, hoe hou je persoonlijk bij met alle veranderingen?

Lees, lees en lees nog meer, lol! Ik begin mijn dag graag met het lezen over nieuwe ML-technologieën. Ik lees artikelen in Towards Data Science, Analytics Vidhya en nieuwsbrieven zoals The Sequence.

(META ) (GOOGL )

Wat is je visie op de toekomst van machine learning?

Gemakkelijke toegang tot data zal een geweldige periode van innovatie in machine learning inluiden, die op zijn beurt innovatie in een breed spectrum van gebieden zoals gezondheidszorg, financiën, productie en biosciences zal versnellen. Historisch gezien kan veel baanbrekend onderzoek in ML worden toegeschreven aan een grote hoeveelheid rijke data.

Is er nog iets anders dat je over Gretel wilt delen?

Als je van data houdt, zal je van Gretel houden (dus ik hou duidelijk van Gretel!). Gemakkelijke toegang tot data is de doorn in de zij van elke data scientist die ik ooit heb gekend. Bij Gretel zijn we trots op het creëren van een console en een set API’s die het creëren van private, deelbare data zo gemakkelijk mogelijk maken. We geloven diep dat data meer waarde heeft wanneer het wordt gedeeld.

Bedankt voor het geweldige interview en voor het delen van je inzichten, lezers die meer willen leren, moeten Gretel.ai bezoeken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.