AI-modeller og plattformer
Nitin Madnani, senior forskningsvitenskapelig ved ETS – Intervju-serie

Nitin Madnani er en senior forskningsvitenskapelig ved Natural Language Processing (NLP)-forskningsgruppen ved Educational Testing Service (ETS). ETS ble etablert i 1947 og er verdens største private nonprofit-organisasjon for utdanningsvurdering og testing.
Kunne du begynne med å forklare hva ETS’ misjon er?
ETS’ misjon er å fremme kvalitet og likhet i utdanningen for alle lærende verden over. Denne misjonen ligger til grunn for våre produkter, tjenester, forskning og utviklingsinnsats, med målet å fremme læring, støtte utdanning, profesjonsutvikling og måle kunnskap og ferdigheter for alle.
Vi tror at alle, overalt, kan gjøre en forskjell i sine liv gjennom læring, og ETS’ arbeid med forskning, vurdering, måling og politikk kan spille en viktig rolle i å gjøre denne læringen mulig.
Hva er det med NLP som gjør deg så lidenskapelig?
Alle menneskelige språk er så nyanserte og komplekse. De lar oss uttrykke en rekke følelser i vår tale og selv i vår skrift, og de utvikler seg over tid. På den andre siden er en datamaskin så deterministisk og klinisk i behandlingen av sine inndata. Natural Language Processing (NLP) er et område innen kunstig intelligens som prøver å gjøre denne usedvanlige ikke-menneskelige enheten forstå de nyanserte kompleksitetene i menneskelige språk ved å kombinere teknikker fra datavitenskap, lingvistikk og statistikk. Hvordan kunne du ikke finne dette fascinerende?
ETS’ NLP- og taleforskere har nylig utviklet RSMTool. Kunne du dele med oss hva RSMTool gjør?
Som vi har sett de siste årene, kan alle maskinlæringsmodeller potensielt vise biased atferd uavhengig av feltet de brukes i, og utdanning er ingen unntak. De automatiserte vurderingssystemene som brukes til å tildele poeng eller karakterer til studenter i tester eller klasserom ofte bruker maskinlæringsmodeller. Derfor er det absolutt mulig for slike systemer å oppføre seg på en biased måte. Slike bias kan ha alvorlige konsekvenser, spesielt hvis poengene fra slike systemer brukes til å ta viktige beslutninger.
RSMTool er et åpen kilde-verktøy som min kollega Anastassia Loukina (tidligere presentert på Unite.AI) og jeg har utviklet på ETS for å hjelpe med å sikre at noen systematiske, skadelige bias i automatiserte vurderingssystemer identifiseres så tidlig som mulig, håper vi før systemene deployeres i den virkelige verden. RSMTool er designet for å gi en omfattende vurdering av AI-vurderingsmotorer, inkludert ikke bare standard mål for prediksjonsnøyaktighet, men også mål for modellrettferdighet og mål basert på testteori, som hjelper utviklerne av slike motorer å identifisere mulige bias eller andre problemer i systemene sine.
Hva kommer navnet RSMTool fra?
I feltet utdanningsvurdering, kalles noen som tildeler en poeng til (eller “vurderer”) en tekst ofte en “vurderer”. Det finnes både menneskelige vurderere og automatiserte vurderere. RSMTool – forkortelse for Rater Scoring Modeling Tool – er designet for å hjelpe med å bygge (og evaluere) scoringsmodellene som brukes av automatiserte vurderere.
Hvordan kan dette verktøyet hjelpe utviklere å identifisere mulig bias eller andre problemer i deres AI-vurderingsmotorer?
De siste fem årene, har utdanningsmålingsforskere – inkludert mange av våre kolleger på ETS – utført verdifull forskning på hva som gjør automatiserte (og menneskelige) scoring rettferdig. Som en del av denne forskningen, har de utviklet mange statistiske og psykometriske analyser for å beregne indikatorer for systematisk bias. Men siden psykometri- og NLP-samfunnet sjelden samarbeider, er det lite mulighet for krysspollinering av ideer. Resultatet er at NLP-forskere og utviklere som bygger faktiske automatiserte vurderingssystemer – spesielt enkeltforskere og de i små selskaper – ikke har lett tilgang til de psykometriske analysene de bør bruke til å sjekke systemene sine for bias. RSMTool prøver å løse dette problemet ved å tilby en stor, divers samling av psykometriske analyser i en enkel, brukervennlig Python-pakke som kan lett inkorporeres av noen NLP-forsker i deres forskning eller operasjonelle pipeline.
I et typisk brukstilfelle, ville en forsker gi en fil eller en data-ramme med numeriske system-poeng, gull-standard (menneskelige) poeng og metadata, hvis aktuelt. RSMTool prosesserer denne dataen og genererer en HTML-rapport som inneholder en omfattende vurdering, inkludert beskrivende statistikk samt flere mål for system-ytelse og rettferdighet, blant annet. En eksempel-RSMTool-rapport kan finnes på https://bit.ly/fair-tool. RSMTool kan fungere med tradisjonelle, funksjonsdrevne maskinlæringsmodeller (f.eks. fra scikit-learn-biblioteket) og med dyptlæringsmodeller. Selv om den primære utdata fra RSMTool er HTML-rapporten som gjør det enklere å dele, genererer den også tabellformige datafiler (i CSV-, TSV- eller XLSX-format) som mellomliggende utdata for mer avanserte brukere. Til slutt, for å gjøre ting ekstremt tilpassbare, implementerer RSMTool hver seksjon av sin rapport som en Jupyter-notebook, så brukerne ikke bare kan velge hvilke seksjoner som er relevante for deres spesifikke scoringsmodeller, men også lett kan implementere egne analyser og inkludere dem i rapporten med svært lite arbeid.
Det finnes mange nye studier om automatisert scoring som har brukt RSMTool til å evaluere deres foreslåtte scoringsmodeller.
Hva er de vanligste typene bias som kan påvirke automatiserte vurderingssystemer?
Den vanligste typen bias som påvirker et automatisert vurderingssystem er differensial undergruppe-prestasjon, dvs. når det automatiserte systemet prestereer forskjellig for forskjellige undergrupper av befolkningen. For eksempel, kunne et biased vurderingssystem produsere systematisk lavere poeng for tekster skrevet av, for eksempel, svarte kvinner sammenlignet med hvite menn, selv om det kanskje ikke finnes noen systematisk forskjell i de faktiske skriveferdighetene som vises av disse to undergruppene i deres tekster, så langt en menneske er bekymret.
ETS har en rik historie med å gjennomføre forskning på rettferdighet for automatiserte vurderingsmotorer. For eksempel, har vi sett på om e-rater – vårt AI-automatiserte vurderingsmotor – viser noen differensial prestasjon for undergrupper definert av etnisitet, kjønn og land (de fant noen mindre forskjeller som ble adressert av påfølgende politiske endringer). Studier har også sett på om e-rater behandler svar skrevet av GRE-testtakerne med læringsvansker og/eller ADHD systematisk forskjellig i gjennomsnitt (det gjør det ikke). Nylig, en aktuell studie ser på om et automatisert system for scoring taleferdighet viser noen systematisk bias mot testtakerne som måtte bære ansiktsmasker sammenlignet med de som ikke bar ansiktsmasker (det gjør det ikke). RSMTool inneholder flere psykometriske analyser som prøver å kvantifisere differensial undergruppe-prestasjon over undergrupper som brukeren kan definere over deres eget data.
Hvorfor valgte ETS å gjøre RSMTool åpen kilde?
Ja, RSMTool er tilgjengelig på GitHub med en Apache 2.0-lisens. Vi tror det er viktig at et slikt verktøy er åpen kilde og ikke-proprietary, så samfunnet kan (a) granske kildekoden til de allerede tilgjengelige analysene for å sikre deres overensstemmelse med rettferdighetsstandarder og (b) bidra med nye analyser når standardene utvikler seg og endrer seg. Vi ønsker også å gjøre det enkelt for NLP-forskere og utviklere å bruke RSMTool i deres arbeid og å hjelpe oss med å gjøre det bedre. Å gjøre RSMTool åpen kilde er et tydelig eksempel på ETS’ fortsatte forpliktelse til ansvarlig bruk av AI i utdanningen.
Hva er noen av lærdommene du har lært fra å utvikle og vedlikeholde RSMTool?
Over de siste fem årene som Anastassia og jeg har utviklet og vedlikeholdt RSMTool – med hjelp fra mange ETS-kolleger og ikke-ETS-GitHub-bidragsytere – har vi lært to overordnede lærdommer. Den første er at forskjellige brukere har forskjellige behov, og å ha en en-size-fits-all-tilnærming vil ikke fungere for tverrfaglig programvare som RSMTool. Den andre lærdommen vi har lært, er at for å gjøre det mer sannsynlig at åpen kilde-programvare blir adoptert, må man gå den ekstra milen for å gjøre den så robust som mulig.
I vår periode som RSMTool-vedlikeholdere, har vi identifisert mange typer brukere av RSMTool. Noen av dem er “power users” (f.eks. NLP-forskere og utviklere) som ønsker å plukke og velge spesifikke RSMTool-funksjonalitet for å plugge inn i deres eget maskinlærings-pipeline, samt bruke andre Python-pakker. For å tilfredsstille slike brukere, endte vi opp med å skape en ganske omfattende API for å eksponere forskjellige for- og etterbehandlingsfunksjoner samt tilpassede metrikker i RSMTool. En annen gruppe brukere er det vi kaller “minimalister” – dataanalytikere og ingeniører som kanskje mangler den statistiske eller programmeringsbakgrunnen for å samhandle med API-et og foretrekker en “out-of-the-box”-pipeline isteden. For å tilfredsstille slike brukere, har vi skapt kommandolinje-verktøy som kan lett kalles i wrapper-skript, for eksempel. Vi har også funnet at minimalist-brukere ofte er motvillige til å lese gjennom (admittedly stor) liste over RSMTool-konfigurasjonsvalg. Derfor bygde vi en interaktiv konfigurasjons-generatoren med autokomplettering som kan hjelpe slike brukere å lage konfigurasjonsfiler basert på deres spesifikke behov.
For å møte behovene for alle våre brukergrupper, har vi måttet adoptere praksiser som vi trodde var nødvendige for å gjøre RSMTool robust. Hva mener vi med robust programvare? For å være robust, må ethvert programvare møte følgende kriterier: effekten av enhver kodeendring på dens nøyaktighet og ytelse kan måles (godt testet), dens dokumentasjon er alltid oppdatert (godt dokumentert), og programvaren (sammen med dens avhengigheter) er lett installerbart for brukerne. For RSMTool, har vi utnyttet flere åpen kilde-verktøy og tjenester for å gjøre det møte vårt definisjon. Vi har en omfattende test-suite (>90% kode-dekning) som vi automatisk kjører via kontinuerlig integrasjon for alle endringer som sendes til koden. Vi vedlikeholder omfattende dokumentasjon (inkludert flere virkelige tutorials) og enhver ny funksjonalitet foreslått for RSMTool må inkludere en dokumentasjonskomponent som også gjennomgås som en del av kode-gjennomgangen. Til slutt, gir vi ut RSMTool som pakker som kan lett installeres (via enten pip eller conda) og alle avhengigheter som trengs, installeres også automatisk.
Hva håper ETS å oppnå ved å utgi RSMTool?
Utdanningssektoren har sett en av de mest betydelige utvidelsene av AI de siste årene, med automatisert scoring av tekst og tale som en stadig mer vanlig anvendelse av NLP. ETS har lenge vært en leder i feltet for automatisert scoring og har, siden sin etablering, vært forpliktet til å bygge rettferdige produkter og vurderinger som er designet for å tjene lærende verden over. Ved å utgi RSMTool, utviklet i nært samarbeid mellom NLP-forskere og psykometrikere, ønsker ETS å fortsette sin advokatur for ansvarlig bruk av AI i utdanningen på en meget konkret måte; spesifikt, ønsker vi å gjøre det klart at når AI-forskere tenker på “ytelsen” til et automatisert vurderingssystem, bør de ikke bare vurdere standard mål for prediksjonsnøyaktighet (f.eks. Pearsons korrelasjon), men også mål for modellrettferdighet. Mer generelt, ønsker vi også at RSMTool skal tjene som et eksempel på måter som NLP-forskere og psykometrikere kan og bør samarbeide.
Er det noe annet du ønsker å dele om RSMTool?
Vi ønsker å oppmuntre lesere til å hjelpe oss med å forbedre RSMTool! De trenger ikke å være en psykometriker eller en NLP-ekspert for å bidra. Vi har mange åpne problemer relatert til dokumentasjon og Python-programmering som ville være perfekte for noen nybegynnere til intermediate Python-programmere. Vi inviterer også bidrag til SKLL (Scikit-Learn Laboratory), – et annet ETS åpen kilde-pakke for å kjøre bruker-konfigurerbare, batchede maskinlærings-eksperimenter – som brukes underliggende av RSMTool.












