Thought leaders

Hoe Bias Je AI/ML-Strategie Kan Doden En Wat Je Eraan Kan Doen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

‘Bias’ in modellen van elk type beschrijft een situatie waarin het model onnauwkeurig reageert op prompts of invoergegevens omdat het niet is getraind met voldoende hoge kwaliteit, gevarieerde gegevens om een nauwkeurig antwoord te geven. Een voorbeeld zou zijn Apple’s gezichtsherkenningfunctie voor het ontgrendelen van de telefoon, die bij mensen met donkere huidskleuren aanzienlijk vaker faalde dan bij mensen met lichtere tinten. Het model was niet getraind op voldoende afbeeldingen van mensen met donkere huidskleuren. Dit was een relatief laagrisicovoorbeeld van bias, maar precies waarom de EU AI-wet eisen heeft gesteld om de effectiviteit van modellen (en controles) te bewijzen voordat ze op de markt komen. Modellen met uitvoer die een impact hebben op bedrijfs-, financiële, gezondheids- of persoonlijke situaties moeten betrouwbaar zijn, anders zullen ze niet worden gebruikt.

Bias Tackelen Met Gegevens

Grote Hoeveelheden Hoge Kwaliteit Gegevens

Onder de vele belangrijke gegevensbeheerpraktijken is het verwerven van grote hoeveelheden hoge kwaliteit, gevarieerde gegevens een sleutelcomponent om bias in AI/ML-modellen te overwinnen en te minimaliseren. Dit vereist samenwerking met meerdere organisaties die over dergelijke gegevens beschikken. Traditioneel worden gegevensverwerving en samenwerking uitgedaagd door privacy- en/of IP-beschermingszorgen–gevoelige gegevens kunnen niet naar de model-eigenaar worden gestuurd, en de model-eigenaar kan niet riskeren zijn IP te lekken naar een gegevens-eigenaar. Een veelvoorkomende workaround is om te werken met mock- of synthetische gegevens, die nuttig kunnen zijn, maar ook beperkingen hebben in vergelijking met het gebruik van echte, volledige contextgegevens. Hier bieden privacy-verhogende technologieën (PET’s) veel-needed antwoorden.

Synthetische Gegevens: Dichtbij, Maar Nog Niet Helemaal

Synthetische gegevens worden kunstmatig gegenereerd om echte gegevens na te bootsen. Dit is moeilijk te doen, maar wordt iets gemakkelijker met AI-hulpmiddelen. Goedkwalitatieve synthetische gegevens moeten dezelfde kenmerken hebben als echte gegevens, of ze zullen niet nuttig zijn. Hoge kwaliteit synthetische gegevens kunnen worden gebruikt om effectief de diversiteit van trainingsgegevens te verhogen door gaten te vullen voor kleinere, gemarginaliseerde bevolkingsgroepen, of voor bevolkingsgroepen waarvoor de AI-leverancier simpelweg niet genoeg gegevens heeft. Synthetische gegevens kunnen ook worden gebruikt om randgevallen aan te pakken die moeilijk te vinden zijn in voldoende volumes in de echte wereld. Bovendien kunnen organisaties een synthetische gegevensset genereren om gegevensresidencie- en privacyvereisten te vervullen die toegang tot de echte gegevens blokkeren. Dit klinkt geweldig; echter is synthetische gegevens slechts een deel van de puzzel, niet de oplossing.

Een van de voor de hand liggende beperkingen van synthetische gegevens is de disconnectie van de echte wereld. Bijvoorbeeld, autonome voertuigen die uitsluitend zijn getraind op synthetische gegevens, zullen worstelen met echte, onvoorziene wegcondities. Bovendien erven synthetische gegevens bias van de echte wereldgegevens die zijn gebruikt om ze te genereren–het doel van ons gesprek te niet doen. In conclusie zijn synthetische gegevens een nuttige optie voor fine-tuning en het aanpakken van randgevallen, maar significante verbeteringen in model-effectiviteit en minimisatie van bias zijn nog steeds afhankelijk van het toegang krijgen tot echte wereldgegevens.

Een Beter Manier: Echte Gegevens Via PET’s-geactiveerde Workflows

PET’s beschermen gegevens tijdens het gebruik. Wanneer het gaat om AI/ML-modellen, kunnen ze ook de IP van het model beschermen dat wordt uitgevoerd–”twee vliegen in één klap.” Oplossingen die PET’s gebruiken, bieden de optie om modellen te trainen op echte, gevoelige datasets die eerder niet toegankelijk waren vanwege gegevensprivacy- en beveiligingszorgen. Deze ontgrendeling van gegevensstromen naar echte gegevens is de beste optie om bias te verminderen. Maar hoe zou het eigenlijk werken?

Op dit moment beginnen de leidende opties met een vertrouwelijke rekenomgeving. Vervolgens volgt een integratie met een PET’s-gebaseerde softwareoplossing die het klaar is voor gebruik uit de doos, terwijl het tegelijkertijd de gegevensgovernance- en beveiligingsvereisten aanpakt die niet zijn opgenomen in een standaard vertrouwde uitvoeromgeving (TEE). Met deze oplossing worden de modellen en gegevens allemaal versleuteld voordat ze naar een beveiligde rekenomgeving worden gestuurd. De omgeving kan overal worden gehost, wat belangrijk is bij het aanpakken van bepaalde gegevenslocalisatievereisten. Dit betekent dat zowel de model-IP als de beveiliging van invoergegevens worden behouden tijdens de berekening–zelfs de aanbieder van de vertrouwde uitvoeromgeving heeft geen toegang tot de modellen of gegevens binnenin. De versleutelde resultaten worden vervolgens teruggestuurd voor revisie en logs zijn beschikbaar voor revisie.

Deze stroom ontgrendelt de beste kwaliteit gegevens, ongeacht waar ze zijn of wie ze heeft, en creëert een pad naar bias-minimalisatie en hoge-effectiviteitsmodellen die we kunnen vertrouwen. Deze stroom is ook wat de EU AI-wet beschrijft in hun eisen voor een AI-regulatoirsandbox.

Faciliteren Van Ethische En Juridische Compliance

Het verkrijgen van goede kwaliteit, echte gegevens is moeilijk. Gegevensprivacy- en localisatievereisten beperken onmiddellijk de datasets die organisaties kunnen benaderen. Voor innovatie en groei moeten gegevens stromen naar diegenen die de waarde ervan kunnen extraheren.

Artikel 54 van de EU AI-wet biedt eisen voor “hoge-risico” modeltypen in termen van wat moet worden bewezen voordat ze op de markt kunnen worden gebracht. Kort samengevat, zullen teams moeten werken met echte wereldgegevens binnen een AI Regulatory Sandbox om voldoende model-effectiviteit en compliance met alle controles die zijn gedetailleerd in Titel III Hoofdstuk 2 te demonstreren. De controles omvatten monitoring, transparantie, verklarende waarde, gegevensbeveiliging, gegevensbescherming, gegevensminimalisatie en modelbescherming–denk aan DevSecOps + Data Ops.

De eerste uitdaging zal zijn om een echte wereldgegevensset te vinden–aangezien dit inherent gevoelige gegevens zijn voor dergelijke modeltypen. Zonder technische garanties kunnen veel organisaties aarzelen om de model-aanbieder te vertrouwen met hun gegevens of zullen ze niet toegestaan worden om dit te doen. Bovendien is de manier waarop de wet een “AI Regulatory Sandbox” definieert een uitdaging op zich. Sommige van de eisen omvatten een garantie dat de gegevens uit het systeem worden verwijderd nadat het model is uitgevoerd, evenals de governance-controles, handhaving en rapportage om het te bewijzen.

Veel organisaties hebben geprobeerd om out-of-the-box data clean rooms (DCR’s) en vertrouwde uitvoeromgevingen (TEE’s) te gebruiken. Maar op zichzelf vereisen deze technologieën aanzienlijke expertise en werk om operationeel te maken en te voldoen aan gegevens- en AI-regelgevingsvereisten.
DCR’s zijn eenvoudiger te gebruiken, maar nog niet nuttig voor meer robuuste AI/ML-behoeften. TEE’s zijn beveiligde servers en hebben nog steeds een geïntegreerde samenwerkingsplatform nodig om snel nuttig te zijn. Dit identificeert echter een kans voor privacy-verhogende technologieplatforms om te integreren met TEE’s om dat werk te verwijderen, het opzetten en gebruiken van een AI-regulatoirsandbox te trivialiseren, en dus het verkrijgen en gebruiken van gevoelige gegevens.

Door het gebruik van meer diverse en uitgebreide datasets op een privacy-bewarendende manier mogelijk te maken, helpen deze technologieën ervoor zorgen dat AI- en ML-praktijken voldoen aan ethische normen en juridische vereisten met betrekking tot gegevensprivacy (bijv. GDPR en EU AI-wet in Europa). In samenvatting, terwijl eisen vaak worden begroet met hoorbare kreten en zuchten, zijn deze eisen eenvoudigweg aan het leiden naar het bouwen van betere modellen die we kunnen vertrouwen en waarop we ons kunnen verlaten voor belangrijke gegevensgestuurde besluitvorming, terwijl we de privacy van de gegevensonderwerpen beschermen die worden gebruikt voor modelontwikkeling en aanpassing.

Adi Hirschtein is de VP of product bij Duality Technologies. Adi heeft meer dan 20 jaar ervaring als executive, productmanager en ondernemer in het opbouwen en stimuleren van innovatie in technologiebedrijven, met name gericht op B2B-startups op het gebied van data en AI. Voordat hij bij Duality kwam, was Adi VP of product bij Iguazio (MLOps-bedrijf) dat werd overgenomen door McKinsey en daarvoor was hij Director of product bij EMC na de overname van een andere startup genaamd Zettapoint (Database- en opslagbedrijf) waar hij VP of product was en het product leidde vanaf de start tot marktpenetratie en groei.