Ethiek
Onderzoekers ontwikkelen algoritmes om slecht gedrag in AI te voorkomen

Naast alle vooruitgang en voordelen die kunstmatige intelligentie tot nu toe heeft getoond, waren er ook berichten over ongewenste neveneffecten zoals raciale en geslachtsbias in AI. Dus zoals sciencealert.com de vraag stelt “hoe kunnen wetenschappers ervoor zorgen dat geavanceerde denksystemen eerlijk of zelfs veilig kunnen zijn?”
Het antwoord kan liggen in het rapport van onderzoekers aan Stanford en de University of Massachusetts Amherst, getiteld Preventing undesirable behavior of intelligent machines. Zoals eurekaalert.org in zijn verhaal over dit rapport opmerkt, begint AI nu gevoelige taken te verrichten, dus “vragen beleidsmakers aan computerwetenschappers om garanties te geven dat geautomatiseerde systemen zijn ontworpen om ongewenste resultaten zoals excessief risico of raciale en geslachtsbias te minimaliseren, zo niet volledig te vermijden.”
Het doel van het door dit team van onderzoekers gepresenteerde rapport was “om een nieuwe techniek te schetsen die een vaag doel, zoals het vermijden van geslachtsbias, vertaalt in precieze wiskundige criteria die een machine-learningalgoritme in staat stellen om een AI-toepassing te trainen om dat gedrag te vermijden.”
Het doel was, zoals Emma Brunskill, een assistent-professor in de computerwetenschappen aan Stanford en senior auteur van het artikel, opmerkt “we willen AI ontwikkelen die de waarden van zijn menselijke gebruikers respecteert en de vertrouwen rechtvaardigt dat we in autonome systemen stellen.”
Het idee was om “onveilig” of “oneerlijk” resultaten of gedragingen in wiskundige termen te definiëren. Dit zou, volgens de onderzoekers, het mogelijk maken “om algoritmes te creëren die kunnen leren van gegevens over hoe ze ongewenste resultaten met hoge zekerheid kunnen vermijden.”
Het tweede doel was om “een set technieken te ontwikkelen die het voor gebruikers gemakkelijk maken om aan te geven welk ongewenst gedrag ze willen beperken en om machine learning-ontwerpers in staat te stellen om met vertrouwen te voorspellen dat een systeem dat met behulp van historische gegevens is getraind, betrouwbaar kan worden gebruikt wanneer het in de praktijk wordt toegepast.”
ScienceAlert zegt dat het team dit nieuwe systeem ‘Seldonian’ algoritmes noemt, naar de centrale figuur in Isaac Asimovs beroemde Foundation-reeks sciencefictionromans. Philip Thomas, een assistent-professor in de computerwetenschappen aan de University of Massachusetts Amherst en eerste auteur van het artikel, merkt op, “Als ik een Seldonian-algoritme voor diabetesbehandeling gebruik, kan ik specificeren dat ongewenst gedrag gevaarlijk laag bloedsuiker of hypoglykemie betekent.”
“Ik kan tegen de machine zeggen, ‘Terwijl je de controller in de insulinepomp verbetert, maak geen veranderingen die de frequentie van hypoglykemie zouden verhogen.’ De meeste algoritmes geven je geen manier om dit soort beperkingen op het gedrag op te leggen; het was niet inbegrepen in de vroege ontwerpen.”
Thomas voegt eraan toe dat “dit Seldonian-kader het voor machine learning-ontwerpers gemakkelijker zal maken om instructies voor het vermijden van gedrag in alle soorten algoritmes op te nemen, op een manier die het mogelijk maakt om de waarschijnlijkheid te beoordelen dat getrainde systemen goed zullen functioneren in de praktijk.”
Voor haar part merkt Emma Brunskill ook op dat “het nadenken over hoe we algoritmes kunnen creëren die waarden zoals veiligheid en eerlijkheid het beste respecteren, essentieel is omdat de samenleving steeds meer afhankelijk wordt van AI.”












