Andersons vinkel

Flotte Diagrammer Kan Gøre Selv “Ond” Forskning Synlige Som Tillidsværdig

mm
Føj Unite.AI til dine foretrukne kilder på Google
AI-generated image (GPT-2): a man in a lab coat sits in a cluttered office with his feet on a desk, reading a printed journal that obscures his face, showing a cover titled ‘BOILED FROGS ARE GOOD FOR YOU’ with charts and a cartoon frog in a beaker, surrounded by books, notes, and a yellow warning-style border.

Nyt forskning viser, at opbygning af komplekse og detaljerede diagrammer kan gøre mennesker til at stole på fordomsfulde AI-beslutninger, selv når de er åbenbart uretfærdige.

 

Selv om praksis med at ‘blinde nogen med videnskab’ betydeligt forudgår den nuværende tidsalder af AI, er det sandsynligvis blevet perfektioneret i denne æra – ikke mindst fordi den seneste vækst af videnskabelige papirindsendelser har gjort signal-støj-forholdet ugunstigt, og ‘billige tricks’ sandsynligvis mere almindelige.

Trofast til den gamle adage ‘løgne, forbandede løgne og statistik‘, er det centrale værktøj, der bruges til at bedrage eller mislede læsere, når man præsenterer nye systemer og videnskabelige beviser, der forklarer eller retfærdiggør krav omkring dem, er grafer og datavisualiseringer.

I en undersøgelse fra 2019 af effekten af grafer på deltagere i rural Pennsylvania, observerede forfatterne af arbejdet:

‘Mennesker, der var berørt af misbrug eller afhængighed, tiltrak sig grafer, der repræsenterede disse stoffer. Mennesker bestemte ofte kvaliteten af en graf, der indeholdt geografisk information, ud fra hvor let eller svært det var at finde deres hjemstat.

‘Andre mennesker tendede til at værdsætte grafer ikke på grund af deres egen forståelse, men på grund af grafens antagede effektivitet til at kommunikere med andre mennesker.

‘Endelig foreslog en deltager endda, at de ville være mere opmærksomme på visualiseringer fra lokale nyhedssteder end nationale.’

Nogle af de grafer, der blev vist til beboerne i rural Pennsylvania i en undersøgelse fra 2019. Kilde - https://arxiv.org/pdf/1901.01920

Nogle af de grafer, der blev vist til beboerne i rural Pennsylvania i en undersøgelse fra 2019. Kilde

Hypnoseffekten af datagrafer bliver særligt relevant i den nye maskinlæringsæra, hvor tillid er afgørende for opretholdelsen af AI-økonomien (og, sandsynligvis, forhindringen af en krasch).

Det amerikansk-britiske samarbejde fra 2024 Trust Junk og Evil Knobs: Kalibrering af tillid i AI-visualisering introducerede begrebet Trust Junk: en XAI-visualisering ‘der ikke har nogen meningsfuld forbindelse med den underliggende model eller data [og] bruges til at forbedre tillid’:

Fra papiret 'Trust Junk og Evil Knobs: Kalibrering af tillid i AI-visualisering', et eksempel på data, der er blevet forvrænget til at tjene en forudgående formål (højre), i stedet for at blive præsenteret eksplicit (venstre). Denne type tilgang 'opmuntrer til overafhængighed og overvælder brugeren, mens den giver en illusion af kontrol', ifølge papiret. Kilde - https://emilywall.github.io/media/papers/TrustOnionPACVIS24.pdf

Fra papiret ‘Trust Junk og Evil Knobs: Kalibrering af tillid i AI-visualisering’, et eksempel på data, der er blevet forvrænget til at tjene en forudgående formål (højre), i stedet for at blive præsenteret eksplicit (venstre). Denne type tilgang ‘opmuntrer til overafhængighed og overvælder brugeren, mens den giver en illusion af kontrol’, ifølge papiret. Kilde

En Hurtig Studie

Siden begrebet Trust Junk blev foreslået, er det ikke blevet testet – en oversigt, der er blevet adresseret af en ny rapport fra USA, hvor deltagere blev præsenteret for resultater fra en påstået AI-undersøgelse om, hvilken af en gruppe af kandidater, der sandsynligvis ville bestå en juridisk eksamen i USA.

Hvis man så nøje efter, kunne man bemærke, at filterkriteriet var a) alle sorte mænd og b) alle andre – med forudsigelsen af, at alle sorte mænd ville ikke bestå eksamen:

Fra den nye rapport: en annoteret stimulus, der blev brugt i forfatternes eksperimenter, der viser en modelbeslutning (C) om, hvorvidt en kandidat (B) vil bestå eksamen, sammen med forklarende komponenter, der fungerer som ‘trust junk’ (A, D, E, F). Modellen er diskriminerende, men øgede mængder af stort set irrelevante forklarende information får deltagere til at være enige med dens udsagn og bedømme den som retfærdig.

Fra den nye rapport: en annoteret stimulus, der blev brugt i forfatternes eksperimenter, der viser en modelbeslutning (C) om, hvorvidt en kandidat (B) vil bestå eksamen, sammen med forklarende komponenter, der fungerer som ‘trust junk’ (A, D, E, F). Modellen er diskriminerende, men øgede mængder af stort set irrelevante forklarende information får deltagere til at være enige med dens udsagn og bedømme den som retfærdig. Kilde

De fleste deltagere gik med på modellens forudsigelser og vurderede den som retfærdig og tillidværdig, med enighed, tillid og opfattet retfærdighed, der steg, efterhånden som der blev tilføjet flere irrelevante grafer og detaljer – selv om færre mennesker bemærkede den åbenlyse og åbenlyst racistiske bias.

Nogle brugere gjorde indvendinger mod studiet, men ikke af åbenlyse årsager relateret til det centrale problem:

‘Vi bemærkede 19 tilfælde, hvor deltagere udtrykkeligt beskrev vores model som retfærdig (f.eks. sagde en deltager, “Det er retfærdigt, fordi det ikke har nogen racemæssig eller kønsrelateret bias.”). Alligevel udtrykte deltagere lejlighedsvis utilfredshed med modellen. En deltager sagde, at de var bekymrede for, “hvad slags mørke formål mennesker måske kunne bruge det til.”

Nonetheless, over tre studiegrupper inden for deltagere, hvor hver gruppe blev udsat for øgede mængder af Trust Junk, identificerede ingen den virkelige problem.

Forfatterne konkluderer*:

‘Kort sagt fandt vi, at trust junk virkede: deltagere blev enten “beroliget” af den irrelevante information eller “bedøvet” af den store mængde data i forklaringerne.

‘Alt dette manipulation og overbevisning skete i konteksten af en model, der var overfladisk og dybt uretfærdig, præcis det tilfælde, hvor vi havde håbet, at XAI ville give lægfolk mulighed for at træffe nøjagtige vurderinger.’

Siden vi stadig bliver rådet til at tjekke, hvad AI siger os (enten på grund af mistænkte selvoptjenende motiver eller på grund af fejlbehæftet output), kan vi være tilbøjelige til at grave dybere end overskrifterne og analysere kilde materialet fra forskningspapirer, virksomheds kvartalsrapporter og forskellige andre langt fra neutrale formater for informationsformidling.

Men er vi forberedt på at være mere opmærksomme på de ‘beroligende’ grafer, der forsikrer os om nøjagtighed – eller at least til at diskontere ‘miasma af sandhed’, som en masse grafer kan fremkalde?

Den nye rapport hedder “Trust Junk” fører til uretfærdiget støtte til højt diskriminerende prædiktive modeller, og kommer fra tre forskere ved Northeastern University i Boston, Massachusetts. En supplerende side er også blevet gjort tilgængelig.

Metode

Forfatterne gennemførte en mellem-subjekts crowdsourced eksperiment (dvs. forskellige deltagere blev tildelt til forskellige betingelser) på ‘trust junk’ i XAI-forklaringer, hvor de testede, om øgede mængder af teknisk korrekt, men irrelevant detaljer, kunne overbevise brugere om, at en fordomsfuld model var retfærdig og nyttig.

Stimuliene byggede på tidligere arbejde, og de resulterende XAI-dashboard kombinerede multiple forklaringsteknikker i et enkelt interface.

Til den nævnte højt fordomsfulde model udviklede forskerne ‘junk’-forklaringer til studiet, med forklaringer, der var tilsigtet til at være ‘misledende’ teknikker for datarepræsentation:

‘Vi tilføjede en overmængde af information til vores models binære klassificeringstask. Vores inklusion af store mængder komplekse, men ultimativt irrelevante detaljer var tilsigtet til at overvælde brugerstudie-deltagere snarere end at give nyttig data.

‘Denne teknik [metaforisk] bedøver brugeren til at acceptere deres egen udeevne til at fuldt ud forstå data […].’

Studiet bygger på tidligere kontroverser omkring AI-bedømmelse i International Baccalaureate og General Certificate of Education Advanced Level-eksamen, og bruger Law School Admissions Bar Passage dataset, der indeholder demografiske, akademiske og resultataktuelle data for 20.000 kandidater fra 1991-1997.

Dette data blev brugt til at konstruere en intentionelt fordomsfuld model, der forudsagde fiasko for sorte mandlige kandidater, mens alle andre ville bestå; dog opnår modellen stadig en nøjagtighed på 93,7%, på grund af klasse-ubalance på tværs af race og køn.

En ‘appel til autoritet’-strategi blev også testet, med overfladisk imponerende signaler som en prestigefyldt universitetsaffiliation, datasætstørrelse og misvisende nøjagtighed tilføjet.

Derudover blev mål, der ville have afsløret modellens afhængighed af race og køn, udeladt, og kun positive resultater præsenteret. En lille sæt af lignende kandidater blev derefter præsenteret sammen med deres virkelige eksamensresultater, snarere end modellens forudsigelser – og dette hjalp med at skjule den konsekvente mønster af fiasko, der blev tildelt sorte mandlige kandidater.

For at yderligere forme, hvordan deltagere tolkede systemet, blev information præsenteret på en måde, der opmuntrede dem til at danne simple, men misvisende forklaringer af, hvordan modellen fungerede. Detaljer om alle tilgængelige funktioner blev vist, hvilket skabte indtrykket af, at mange faktorer påvirkede beslutningen, selv om kun race og køn blev brugt. En cynisk fokus på individuelle attributter opmuntrede også deltagere til at konstruere plausibelt, men forkerte historier om, hvorfor en kandidat ville blive forudsat til at bestå eller ikke bestå.

‘Ofrene’

I testgruppen blev hver forklaring tildelt en af tre Trust Junk-niveauer på tværs af tre studiebetingelser: deltagere i Baseline-betingelsen så kun grundlæggende herkomst, en kandidatprofil og modellens beslutning; de i Model-betingelsen så også nøjagtighedsstatistik; og de i Alt-betingelsen blev også vist funktionshistogrammer og profiler af lignende kandidater trukket fra træningsdataene.

Studiet blev godkendt af en institutionel anmeldelsesudvalg og gennemført på Prolific, hvor deltagere blev betalt 15 dollars i timen og tilfældigt tildelt til betingelser.

Hver deltager gennemgik otte bar-eksamenskandidatprofiler i tilfældig rækkefølge og vurderede, om hver ville bestå, med enighed brugt som et tillidsmål, efterfulgt af spørgeskemaer for at vurdere tillid og en slutprøve på 28, 27 og 28 deltagere i Baseline, Model og Alt-betingelserne.

Forfatterne gik ud fra, at tilføjelsen af mere synligt rig og meningsfuld, men ultimativt irrelevant information, kunne fairwash modellen ved at skabe uretfærdiget tillid til dens udsagn. De forventede, at deltagere i Model og Alt-betingelserne ville vise højere enighed og stærkere opfattelser af retfærdighed, tillid og nyttighed end de i Baseline-betingelsen. De analyserede også deltagernes skrevne forklaringer for at se, hvordan bidragerne gjorde sig forklaringer om modellens beslutninger, med fokus på, om de bemærkede dens bias eller huller i den præsenterede information.

Testresultater

I forhold til modellenes enighed identificerede menneskelige studie-deltagere den korrekte udfald 66,6% af tiden, men var enige med modellen 73,9% af tiden – hvilket viser en tendens til at følge modellens beslutninger, selv når de var forkerte. Denne effekt styrkedes, efterhånden som der blev tilføjet mere forklarende detaljer, med den mest detaljerede betingelse, der øgede enigheden til 82,6%, og øgede sandsynligheden for, at deltagere forkert henviser til modellen:

Samlet score for enighed (venstre), tillid (midten) og tilfredshed (højre); deltagere i 'Alt'-betingelsen, der blev udsat for yderligere forklarende indhold, der ikke var relevant for retfærdighed, rapporterede betydeligt højere score på tværs af alle mål, på trods af, at modellen forblev identisk og åbenlyst uretfærdig.

Samlet score for enighed (venstre), tillid (midten) og tilfredshed (højre); deltagere i ‘Alt’-betingelsen, der blev udsat for yderligere forklarende indhold, der ikke var relevant for retfærdighed, rapporterede betydeligt højere score på tværs af alle mål, på trods af, at modellen forblev identisk og åbenlyst uretfærdig.

Tillidsvurderinger varierede betydeligt efter betingelse, med deltagere i Alt-betingelsen, der rapporterede højere tillid (M = 25,3) end de i Baseline-betingelsen (M = 16,8), mens Model-betingelsen (M = 20,1) ikke forskellige sig væsentligt fra nogen af dem.

Tilfredshed med forklaringen forskellige sig betydeligt efter betingelse, med deltagere i Alt-betingelsen, der rapporterede højere tilfredshed (M = 34,2) end de i de to andre betingelser (M = 26,4).

Deltagere vurderede retfærdighed ved hjælp af fire spørgsmål på en syv-punkts-skala, der dækkede kønsbias, samlet bias og etik, med ingen væsentlige forskelle mellem betingelser på disse mål:

Fordeling af deltagernes vurderinger på tværs af betingelser for opfattet retfærdighed på tværs af race og køn, fravær af bias og samlet etik. Højere niveauer af forklarende detaljer er fundet til at være forbundet med lidt højere retfærdigheds- og bias-frie vurderinger, på trods af, at den underliggende model forblev uændret og uretfærdig.

Fordeling af deltagernes vurderinger på tværs af betingelser for opfattet retfærdighed på tværs af race og køn, fravær af bias og samlet etik. Højere niveauer af forklarende detaljer er fundet til at være forbundet med lidt højere retfærdigheds- og bias-frie vurderinger, på trods af, at den underliggende model forblev uændret og uretfærdig.

En forskel dukkede op i forhold til retfærdighed på tværs af race, hvor Baseline-gruppen vurderede modellen som mindst retfærdig (M = 3,9), mens både Model- og Alt-grupperne vurderede den højere (M = 4,8). Af større bekymring er, at den største andel af deltagere, der vurderede den åbenlyst uretfærdige model som retfærdig, kom fra de to grupper, der blev præsenteret for den mest detaljerede information – som også var de mindst sandsynlige til at bemærke dens bias.

Kvalitetskontrol

Kvalitative svar viste, at deltagere, der fik mindst information, var mere tilbøjelige til at bemærke problemer med modellen – især dens afhængighed af race og køn. De var også mere tilbøjelige til at sige, at vigtige detaljer var fraværende.

Omvrendt var de, der blev præsenteret for mere detaljerede forklaringer, mindre tilbøjelige til at udtrykke disse bekymringer. Alligevel var det kun tre deltagere på tværs af alle betingelser, der demonstrerede en delvis forståelse af de nøglefaktorer, der drev modellens beslutninger; og ingen fuldt ud identificerede, hvordan den fungerede.

Grafer, der viser, hvor ofte deltagere rapporterede mulig race- eller kønsbias og manglende forklarende information på tværs af betingelser, med højere niveauer af forklarende detaljer forbundet med færre deltagere, der bemærkede bias eller rapporterede manglende information – på trods af, at modellen kun afhængige af race og køn.

Grafer, der viser, hvor ofte deltagere rapporterede mulig race- eller kønsbias og manglende forklarende information på tværs af betingelser, med højere niveauer af forklarende detaljer forbundet med færre deltagere, der bemærkede bias eller rapporterede manglende information – på trods af, at modellen kun afhængige af race og køn.

Mange deltagere udtrykte explicit, at modellen var retfærdig, med 19 sådanne svar registreret, på trods af dens åbenlyse bias.

Samtidig dukkede en vis utilfredshed op, med flere deltagere, der udtrykte bekymring over, hvordan et sådant system måske kunne blive brugt, og 15 svar, der spurgte, om modellen kunne fange kompleksiteten af enkelte kandidater.

Forfatterne fastslår:

‘Kun en minoritet af deltagere beskrev modellen som uretfærdig eller fordomsfuld. De få deltagere, der rapporterede bekymringer om modellen, var ikke i stand til at udtrykke præcist, hvorfor modellen var fejlbehæftet, og i mangelen på afgørende modelinformation, appellerede de til uformel, ofte forkert grund til at forklare, hvorfor modellen måske var forkert eller uretfærdig.’

Rapporten konkluderer*†:

‘Selv om nogle af de problemer, vi afslører, kan løses ved øget datalitteratus hos publikum, er uddannelse alene ikke nok (selv selv-erklærede AI-eksperter misfortolker eller forstår ikke XAI-teknikker).

‘Vi gentager påstandene fra Hullman et al.: succesen af AI-forklaringer kan kun vurderes retfærdigt, når man overvejer målene for sådanne forklaringer.

‘Vi opfordrer samfundet til at være opmærksom på de rhetoriske mål for XAI-forklaringer og deres manipulerende kraft som intrinsisk overbevisende artefakter.’

Konklusion

Da omfanget af, hvortil frontmodeller er tilbøjelige til at ‘pynter’ udsagn med falske grafer, bliver klart, er det ikke kun tydeligt, at AI-genererede grafer ikke skal bruges til at styrke autoritet, men også, at den generelle ‘ambient’-effekt af ledsagende visualiseringer er noget, vi skal begynde at diskontere – ligesom tilliden til fotografi er eroderet af opkomsten af deepfakes.

Dette er sandsynligvis en bekymrende udvikling, da det udgør endnu et ‘træthedspunkt’ i offentlighedens villighed til at gennemgående vurderer, hvad de ser og hører i medierne, og risikerer en slags ‘terminal underkastelse’ i misinformation.

 

* Min erstatning af forfatternes inline-citationer med hyperlinks.

† Forfatternes originale formatering, ikke min.

Først publiceret mandag, 20. juli 2026

Forfatter inden for maskinlæring, domænespecialist i menneskelig billedsyntese. Tidligere chef for forskningsindhold hos Metaphysic.ai, indtil den blev opløst i DNEGs Brahma.ai.
Websted: martinanderson.ai
Kontakt: martin@martinanderson.ai