Ethiek

Onderzoekers ontdekken dat AI-modellen mensen kunnen beïnvloeden om onethische beslissingen te nemen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Een team van onderzoekers heeft onlangs onderzocht of AI in staat is om mensen te corrumperen en hen te beïnvloeden om onethische beslissingen te nemen. De onderzoekers onderzochten hoe interacties met systemen die zijn gebaseerd op OpenAI’s GPT-2-model, mensen kunnen beïnvloeden om onethische beslissingen te nemen, zelfs als ze zich ervan bewust zijn dat de bron van het advies een AI-systeem is.

AI-systemen worden steeds meer overal aanwezig en hun invloed wordt steeds groter. AI-systemen beïnvloeden de beslissingen van mensen, en worden gebruikt voor alles, van het aanbevelen van films tot het aanbevelen van romantische partners. Gezien de grote invloed die AI heeft op het leven van mensen, is het belangrijk om te overwegen hoe AI mensen kan beïnvloeden om onethische beslissingen te nemen en morele richtlijnen te overtreden. Dit is vooral belangrijk omdat AI-modellen steeds geavanceerder worden.

Sociaal wetenschappers en datawetenschappers zijn steeds meer bezorgd dat AI-modellen kunnen worden gebruikt om schadelijke desinformatie en misinformatie te verspreiden. Een recent artikel dat is gepubliceerd door onderzoekers van het Middlebury Institute of International Studies’ Center on Terrorism, Extremism, and Counterterrorism (CTEC), toonde aan dat OpenAI’s GPT-3-model kan worden gebruikt om invloedrijke tekst te genereren die mensen kan radicaliseren en aanzetten tot “gewelddadige extreemrechtse extremistische ideologieën en gedragingen”.

Een studie die is uitgevoerd door een team van onderzoekers van het Max Planck Instituut, de Universiteit van Amsterdam, de Universiteit van Keulen en de Otto Beisheim School of Management, had als doel om te bepalen hoeveel invloed een AI kan hebben op de beslissingen van mensen als het gaat om onethische keuzes. Om te onderzoeken hoe een AI iemand kan “corrumperen”, gebruikten de onderzoekers een systeem dat is gebaseerd op OpenAI’s GPT-2-model. Volgens VentureBeat hebben de auteurs van het artikel een GPT2-gebaseerd model getraind om zowel “oneerlijkheid-bevorderend” als “eerlijkheid-bevorderend” advies te genereren. De data werd getraind op bijdragen van 400 verschillende deelnemers, en daarna wierf het onderzoeksteam meer dan 1500 mensen om interactie te hebben met de advies-verstrekkende AI-modellen.

De deelnemers aan de studie kregen de opdracht om advies te ontvangen van het model en vervolgens een taak uit te voeren die was ontworpen om oneerlijk of eerlijk gedrag te meten. De deelnemers aan de studie werden ingedeeld in paren van twee, en in deze paren van twee speelden ze een dobbelspelpje. De eerste deelnemer wierp een dobbelsteen en rapporteerde het resultaat van de dobbelsteen. De tweede deelnemer kreeg het resultaat van de dobbelsteen van de eerste deelnemer, en vervolgens wierp hij zelf een dobbelsteen. De tweede deelnemer wierp de dobbelsteen in privé en was alleen verantwoordelijk voor het rapporteren van zijn eigen resultaat, waardoor hij de mogelijkheid had om te liegen over het resultaat van de dobbelsteen. Als de dobbelstenen die door beide deelnemers werden gegooid, overeenkwamen, werden de twee deelnemers betaald. De deelnemers werden ook meer betaald als hun overeenkomstige worpen hoger waren. Als de gerapporteerde waarden niet overeenkwamen, werden de deelnemers niet betaald.

De deelnemers aan de studie werden willekeurig toegewezen aan een van de twee verschillende groepen. De ene groep kreeg de kans om eerlijkheid-bevorderend advies te lezen, terwijl de andere groep oneerlijkheid-bevorderend advies las. De adviesfragmenten waren geschreven door zowel mensen als AI’s. De deelnemers werden ook ingedeeld volgens hun kennisniveau over de bron van het advies. Er was een 50-50 kans dat een bepaalde deelnemer zou worden geïnformeerd over de bron van het advies, dus de helft van de deelnemers in elke groep wist dat de bron van het advies een AI-systeem was, terwijl de andere helft in het ongewisse werd gelaten. De tweede groep mensen had echter de mogelijkheid om bonusgeld te verdienen door correct te raden naar de bron van het advies.

Het onderzoek toonde aan dat wanneer het AI-gegenereerde advies overeenkomt met de voorkeuren van een persoon, hij het advies zal volgen, zelfs als hij weet dat het advies door een AI-systeem is gegenereerd. Volgens de onderzoekers waren er vaak discrepanties tussen de uitgesproken voorkeuren en het daadwerkelijke gedrag, waardoor het belangrijk is om te overwegen hoe algoritmes het gedrag van mensen kunnen beïnvloeden.

Het onderzoeksteam legde uit dat hun studie aantoont dat het nodig is om te testen hoe een AI het gedrag van een persoon kan beïnvloeden bij het overwegen van de ethische inzet van een AI-model. Bovendien waarschuwden ze dat AI-ethici en onderzoekers zich moeten voorbereiden op de mogelijkheid dat AI kan worden gebruikt door slechte actoren om anderen te corrumperen. Zoals het onderzoeksteam schreef:

“AI kan een kracht voor het goede zijn als het mensen kan overtuigen om meer ethisch te handelen. Toch laten onze resultaten zien dat AI-advies niet leidt tot meer eerlijkheid. AI-adviseurs kunnen dienen als zondebokken waaraan men (een deel van) de morele schuld van oneerlijkheid kan afwentelen. Bovendien … in de context van adviesgeving, is transparantie over algoritmische aanwezigheid niet voldoende om de potentiële schade te verminderen.”

Blogger en programmeur met specialisaties in Machine Learning en Deep Learning onderwerpen. Daniel hoopt anderen te helpen de kracht van AI te gebruiken voor het sociale goede.