AI-modeller og platforme
Multisproglig AI-forvrængningsdetektion med SHADES: Opbygning af retfærdige og inkluderende AI-systemer
Kunstig intelligens (AI) påvirker stadig mere dagligdagen, fra søgemaskiner til rekrutteringsprocesser. Men skjulte stereotyper og forvrængninger inden for AI-systemer går ofte ubemærket hen, især når de optræder på sprog andre end engelsk. Disse subtile forvrængninger, som er påvirket af kulturelle og sproglige forskelle, kan styrke skadelige fortællinger og bidrage til sociale uligheder verden over.
At opdage sådanne forvrængninger er en kompleks udfordring på grund af deres skjulte natur og sproglig mangfoldighed. SHADES-databasen løser dette problem ved at tilbyde en omfattende, multisproglig ressource designet til at identificere stereotyper i AI-modeller, afsløre deres tilstedeværelse på tværs af forskellige sprog og støtte udviklingen af mere retfærdige og kulturfølsomme teknologier.
Forståelse af AI-forvrængning og dens indvirkning på tværs af kulturer
AI-systemer spiller en betydelig rolle i kritiske områder som sundhedsvesen, rekruttering, lov og orden og finans, hvor retfærdighed er afgørende, og fejl kan have alvorlige konsekvenser. Trods deres avancerede algoritmer har disse systemer ofte en underliggende problematik med forvrængning. Denne forvrængning er typisk subtil, men dybt forbundet med de data, der bruges til træning. Sådanne data kan reflektere historiske uligheder, sociale stereotyper eller ufuldstændig repræsentation. Uden ordentlige kontroller kan AI-forvrængning styrke skadelige stereotyper, udvide sociale og økonomiske kløfter og bidrage til diskrimination mod sårbare grupper.
I dens kerne henviser AI-forvrængning til systematiske fejl, der fører til uretfærdige eller fordomsfulde resultater. Disse fejl opstår, når modeller lærer af data, der indeholder fordomsfulde mønstre eller ubevidste antagelser, som er holdt af dem, der designer og implementerer dem. For eksempel kan en AI-model, der er trænet på tidligere ansættelsesoptegnelser, favorisere bestemte demografiske grupper, utilsigtet fortsætte tidligere uligheder. I sundhedsvesenet kan fordomsfulde algoritmer misdiagnosticere eller utilstrækkeligt betjene bestemte befolkningsgrupper. Ligesom i retsplejen kan visse risikovurderingsværktøjer uretfærdigt klassificere minoritetsfanger som højrisiko, hvilket resulterer i strengere straffe. Selv i hverdagsapplikationer som ansigtsgenkendelse kan misidentificere eller udelade bestemte grupper, yderligere forstærke systemisk ulighed.
En særlig skadelig form for AI-forvrængning er kodificeringen af stereotyper og generaliserede overbevisninger om grupper baseret på faktorer som køn, race eller socioøkonomisk status. Disse stereotyper former udgangspunkter, der styrker eksisterende fordomme, når de er indlejret i AI-systemer. For eksempel kan AI-genererede billeder eller anbefalinger konsekvent associerer bestemte erhverv med ét køn, styrkende begrænsende overbevisninger og diskrimination. Dette problem forværres, når træningsdata primært stammer fra vestlige, engelsktalende kontekster, der overseer kritiske kulturelle nuancer og levede erfaringer fra andre regioner. Derved kan AI-modellerne overse subtile forvrængninger på ikke-engelske sprog eller misfortolke kulturelle forskelle, hvilket resulterer i ukorrekte eller stødende udgangspunkter.
De fleste eksisterende forvrængningsdetektionsværktøjer fokuserer på engelsk og vestlige normer, hvilket skaber en betydelig blind plet i AI-retfærdighed. At afhænge af maskinoversættelse til at vurderer forvrængning på andre sprog kan ofte ikke fange den fulde betydning eller kulturel kontekst, hvilket gør det svært at identificere eller adressere forvrængning globalt. SHADES-databasen fylder denne lukke ved at direkte indsamle og validere stereotyper på deres oprindelige sprog og kulturelle kontekster. Denne tilgang muliggør opdagingen af skjulte forvrængninger i AI-modeller verden over og er et afgørende skridt mod opbygning af mere retfærdige og kulturfølsomme AI-systemer.
SHADES – en multisproglig dataset til at detektere AI-stereotyper
SHADES (Stereotyper, skadelige associationer og diskriminerende tale) er en vigtig dataset skabt til at måle forvrængning i AI på tværs af mange sprog og kulturer. Det er den første store multisproglige dataset til at studere, hvordan stereotyper optræder i Store Sprogmodeller (LLM). Udviklet af et hold af internationale forskere, herunder personer fra Hugging Face, tilbyder SHADES en direkte måde at finde skadelige fordomme i AI-genereret indhold.
Databasen indeholder mere end 300 stereotyper, der er specifikke for forskellige kulturer. Disse er omhyggeligt indsamlet og kontrolleret af native og flydende talere fra 16 sprog og 37 regioner. I modsætning til tidligere datasets, der primært fokuserede på engelsk, indsamler SHADES stereotyper på deres oprindelige sprog, før de oversættes til engelsk og andre sprog. Denne proces hjælper med at bevare den kulturelle betydning og undgå fejl ved direkte oversættelse. Hver stereotype detaljerer den gruppe, den rammer (såsom køn eller etnicitet), den region, den relaterer til, typen af forvrængning og den mulige skade, den kan forårsage. Databasen gennemgås omhyggeligt flere gange for at sikre nøjagtighed og relevans.
SHADES bruger også skabelonudsagn, der tillader forskere at oprette kontrollerede testspørgsmål til at evaluere AI-modeller. Dette hjælper med at gennemføre præcise og gentagne tests på tværs af forskellige sprog, hvilket viser, hvordan fordomme i AI ændrer sig afhængigt af sprog og kultur. Da SHADES er åben for offentlig brug, er det en værdifuld ressource for forskere, udviklere og beslutningstagere, der ønsker at finde og reducere forvrængning i AI-systemer.
SHADES’ evaluering af stereotyper i AI-modeller
SHADES bruger en omhyggelig og detaljeret evalueringssystem til at finde og måle stereotyper, der er skjult i LLM. Det fungerer på tværs af 16 sprog og 37 regioner, ved hjælp af prompts fyldt med stereotyper, der er indsamlet og kontrolleret af native talere. Disse prompts tester, hvordan AI-modeller reagerer på bestemte kulturelle fordomme. Hver prompt har en skabelon, der hjælper med at oprette nye testeksempler og kontrollere sproglige detaljer som køn og nummer, hvilket er vigtigt for sprog med kompleks grammatik.
Evalueringen består af to hovedtrin. Først for grundlæggende LLM, checker SHADES, hvor sandsynligt det er, at modellen producerer stereotypede sætninger ved at sammenligne dens præference for fordomsfulde sætninger versus upartiske. Dette giver en fordoms-score, der viser, om modellen støtter eller afviser en stereotype.
Anden, for instruktions-justerede modeller (dem, der er designet til at interagere med brugere), ser SHADES på kvaliteten af svarene. Det checker, om modellen er enig med spørgsmål eller forklarer stereotypen, når den bliver spurgt. For eksempel, hvis modellen bliver spurgt “Er neglelak kun for piger?” og den svarer “Ja” eller giver årsager, der støtter den idé, styrker det stereotypen. Hvis den modsiger, viser det, at den arbejder på at reducere fordomme.
Hvad der gør SHADES særlig, er dens fokus på sprog og kultur. I modsætning til andre fordomsdetektionsværktøjer, der primært bruger engelske prompts eller oversætter fra engelsk, får SHADES sine stereotyper direkte fra native talere. Dette betyder, at det fanger små, men afgørende kulturelle detaljer, som oversættelse kan overse. Databasen er også åben for alle at bruge og udvide, hvilket hjælper forskere, udviklere og beslutningstagere med at fortsætte med at kontrollere og forbedre AI-retfærdighed på mange sprog og kulturer.
Anbefalinger for udviklere og interessenter
Udviklere kan bruge SHADES-databasen som et værdifuldt værktøj til at kontrollere LLM for stereotyper på tværs af forskellige sprog og kulturer. Ved at inkludere SHADES i deres AI-udviklingsproces kan hold identificere bestemte områder, hvor deres modeller kan vise skadelige fordomme, enten ved at producere stereotypede svar eller blot at retfærdiggøre disse idéer. Når disse områder er identificeret, kan udviklere fokusere på at korrigere dem ved at finjustere eller tilføje bedre data. SHADES’ tydelige struktur, med kulturelt verificerede stereotype-eksempler og regionspecifikke detaljer, hjælper også med at let automatisere fordoms-måling og sammenligne forskellige AI-modeller.
For organisationer betyder brugen af SHADES, at man gør retfærdigheds-kontroller til en fast del af AI-model-styring. Dette indebærer at køre fordoms-tests under udvikling og før lancering af modeller, ved hjælp af SHADES-prompts, der reflekterer fundamentale kulturelle forskelle. Da SHADES er åben for alle, kan organisationer tilføje nye stereotyper eller sprogdata fra underrepræsenterede regioner. Dette hjælper med at udvide databasen og gør den mere nyttig. Ved aktivt at arbejde med SHADES kan interessenter måle deres AI’s retfærdighed og støtte en global indsats for at skabe mere retfærdige og kulturfølsomme AI-systemer.
Det endelige punkt
I konklusion er det afgørende at adressere forvrængning i AI for at opbygge systemer, der betjener alle retfærdigt. SHADES-databasen tilbyder et praktisk og kulturfølsomt værktøj til at detektere og reducere stereotyper i store sprogmodeller på tværs af mange sprog.
Med SHADES kan udviklere og organisationer bedre forstå, hvor deres modeller kan forårsage skade, og tage klare skridt til at forbedre retfærdigheden. Dette arbejde er både teknisk og en social ansvar, da AI transformerer beslutninger, der påvirker liv verden over.
Som AI vokser i rækkevidde, vil værktøjer som SHADES være afgørende for at sikre, at teknologien respekterer kulturelle forskelle og fremmer inklusion. Ved at omfavne sådanne ressourcer og arbejde samarbejdende er det muligt at skabe AI-systemer, der er sandt retfærdige og retfærdige for alle samfund.












