AI-modeller og platforme
Nitin Madnani, Senior Research Scientist ved ETS – Interview Serie

Nitin Madnani er en senior forskningsvidenskabsmand med Natural Language Processing (NLP)-forskningsgruppen ved Educational Testing Service (ETS). ETS blev grundlagt i 1947 og er verdens største private nonprofit-uddannelses-test- og vurderingsorganisation.
Kan du begynde med at forklare, hvad ETS’s mission er?
ETS’s mission er at fremme kvalitet og lighed i uddannelsen for alle lærende verden over. Denne mission ligger til grund for vores produkter, tjenester, forskning og udviklingsindsats med det formål at fremme læring, støtte uddannelse, professionel udvikling og måle viden og færdigheder for alle.
Vi tror på, at alle, overalt kan gøre en forskel i deres liv gennem læring, og ETS’s arbejde med forskning, vurdering, måling og politik kan spille en vigtig rolle i at gøre denne læring mulig.
Hvad er det med NLP, der får dig så passioneret?
Alle menneskesprog er så smukke og komplekse. De tillader os at udtrykke en række følelser i vores tale og selv i vores skrift, og de udvikler sig over tid. På den anden side er en computer så deterministisk og klinisk i sin behandling af input. Natural Language Processing (NLP) er et område inden for kunstig intelligens, der forsøger at få denne ikke-menneskelige enhed til at forstå de smukke kompleksiteter i menneskesproget ved at kombinere teknikker fra computervidenskab, lingvistik og statistik. Hvordan kan man ikke finde dette fascinerende?
ETS’s NLP- og taleforskere har nyligt udviklet RSMTool. Kan du dele med os, hvad RSMTool gør?
Som vi har set de seneste par år, kan alle maskinlæringsmodeller potentielt udvise biasadferd uanset feltet, de anvendes i, herunder uddannelse. De automatiserede vurderingssystemer, der bruges til at tildele karakterer eller grader til studerendes tale eller essays i tests eller klasselokaler, bruger ofte maskinlæringsmodeller. Derfor er det absolut muligt for sådanne systemer at opføre sig på en bias-mæssig måde. Sådan bias kan have alvorlige konsekvenser, især hvis karaktererne fra sådanne systemer bruges til at træffe vigtige beslutninger.
RSMTool er et open-source-værktøj, som min kollega Anastassia Loukina (tidligere præsenteret på Unite.AI) og jeg har udviklet på ETS for at hjælpe med at sikre, at enhver systematisk, skadelig bias i automatiserede vurderingssystemer identificeres så tidligt som muligt, helst før systemerne deployes i den virkelige verden. RSMTool er designed til at give en komprehensiv vurdering af AI-vurderingsmotorer, herunder ikke kun standardmetrikker for prædictionsnøjagtighed, men også mål for model-fairness og metrikker baseret på testteori, hvilket hjælper udviklerne af sådanne motorer med at identificere mulig bias eller andre problemer i deres systemer.
Hvor kommer navnet RSMTool fra?
I uddannelsesvurderingsfeltet henvises personen, der tildeler en karakter (eller “bedømmer”) en essay, ofte til som en “bedømmer”. Der er både menneskelige bedømmere og automatiserede bedømmere. RSMTool – forkortelse for Rater Scoring Modeling Tool – er designed til at hjælpe med at bygge (og evaluere) de vurderingsmodeller, der bruges af automatiserede bedømmere.
Hvordan kan dette værktøj hjælpe udviklere med at identificere mulig bias eller andre problemer i deres AI-vurderingssystemer?
I de sidste fem årtier har uddannelsesmålingsforskere – herunder mange af vores kollegaer på ETS – gennemført værdifuld forskning i, hvad der gør automatiserede (og menneskelige) vurderingssystemer retfærdige. Som en del af denne forskning har de udviklet mange statistiske og psykometriske analyser til at beregne indikatorer for systematisk bias. Imidlertid er der, da psykometri- og NLP-fællesskaberne sjældent interagerer, lidt mulighed for krydsbesøg mellem idéer. Det betyder, at NLP-forskere og udviklere, der bygger faktiske automatiserede vurderingssystemer – især enkeltforskere og de i små virksomheder – ikke har let adgang til de psykometriske analyser, de bør bruge til at kontrollere deres systemer for bias. RSMTool forsøger at løse dette problem ved at tilbyde en stor, divers samling af psykometriske analyser i en enkelt, brugervenlig Python-pakke, der kan integreres let af enhver NLP-forsker i deres forskning eller operationspipeline.
Hvad er de almindelige typer af bias, der kan påvirke automatiserede vurderingssystemer?
Den mest almindelige type bias, der påvirker et automatiseret vurderingssystem, er differential undergruppepræstation, dvs. når det automatiserede system præsterer forskelligt for forskellige undergrupper af befolkningen. For eksempel kunne et bias-vurderingssystem producere systematisk lavere karakterer for essays skrevet af, for eksempel, sorte kvinder sammenlignet med dem for hvide mænd, selv om der måske ikke er nogen systematisk forskel i de faktiske skrivefærdigheder, der vises af disse to undergrupper i deres essays, så vidt en menneskelig bedømmer er bekymret.
Hvorfor valgte ETS at gøre RSMTool open-source?
Ja, RSMTool er tilgængelig på GitHub med en Apache 2.0-licens. Vi mener, det er vigtigt, at et sådant værktøj er open-source og non-proprietary, så fællesskabet kan (a) gennemgå kildekoden for de allerede tilgængelige analyser for at sikre overensstemmelse med fairness-standarder og (b) bidrage med nye analyser, da standarderne udvikler sig og ændrer sig. Vi ønsker også at gøre det let for NLP-forskere og udviklere at bruge RSMTool i deres arbejde og hjælpe os med at gøre det bedre. At gøre RSMTool open-source er et tydeligt eksempel på ETS’s fortsatte engagement i ansvarligt brug af AI i uddannelse.
Hvad er nogle af de lektioner, du har lært fra udvikling og vedligeholdelse af RSMTool?
Over de sidste fem år, hvor Anastassia og jeg har udviklet og vedligeholdt RSMTool – med hjælp fra mange ETS-kollegaer og ikke-ETS-GitHub-bidragsydere – har vi lært to overordnede lektioner. Den første er, at forskellige brugere har forskellige behov, og at have en enkelt størrelse, der passer alle, vil ikke fungere for tværfaglige software som RSMTool. Den anden lektion, vi har lært, er, at for at gøre det mere sandsynligt, at open-source-software bliver antaget, skal man virkelig gå den ekstra mil for at gøre den så robust som muligt.
Hvad håber ETS at opnå ved at udgive RSMTool?
Uddannelsessektoren har set en af de mest betydelige udvidelser af AI de seneste år med automatiseret vurdering af tekst og tale, der er blevet en stadig mere almindelig anvendelse af NLP. ETS har længe været en leder i feltet for automatiseret vurdering og har, siden sin grundlæggelse, været dedikeret til at bygge retfærdige produkter og vurderinger, der er designed til at tjene lærende verden over. Ved at udgive RSMTool, udviklet i tæt samarbejde mellem NLP-forskere og psykometrikere, ønsker ETS at fortsætte sin forkamp for ansvarligt brug af AI i uddannelse på en meget konkrete måde; specifikt ønsker vi at gøre det klart, at når AI-forskere tænker på “præstation” af et automatiseret vurderingssystem, skal de ikke kun overveje standardmetrikker for prædictionsnøjagtighed (f.eks. Pearsons korrelation), men også dem for model-fairness.
Er der noget andet, du gerne vil dele om RSMTool?
Vi ønsker at opmuntre læsere til at hjælpe os med at forbedre RSMTool! De behøver ikke at være en psykometriker eller en NLP-ekspert for at bidrage. Vi har mange åbne problemer relateret til dokumentation og Python-programmering, der ville være perfekt for enhver begynder til intermediate Python-programmer. Vi inviterer også bidrag til SKLL (Scikit-Learn Laboratory), – et andet ETS open-source-pakke til effektivt kørsel af bruger-konfigurerbare, batchede maskinlærings-eksperimenter – der bruges underliggende af RSMTool.












