AI-modeller och plattformar

Nitin Madnani, senior forskningsvetenskaplig medarbetare på ETS – Intervjuserie

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Nitin Madnani är en senior forskningsvetenskaplig medarbetare inom den naturliga språkbehandlingsforskargruppen (NLP) på Educational Testing Service (ETS). ETS grundades 1947 och är världens största privata icke-vinstdrivande utbildnings- och bedömningsorganisation.

Kan du börja med att förklara vad ETS uppdrag är?

ETS uppdrag är att främja kvalitet och jämlikhet i utbildningen för alla lärande i världen. Detta uppdrag ligger till grund för våra produkter, tjänster, forskning och utvecklingsinsatser med målet att främja lärande, stödja utbildning, professionell utveckling och mäta kunskap och färdigheter för alla.

Vi tror att vem som helst, var som helst kan göra en skillnad i sitt liv genom lärande och ETS arbete med forskning, bedömning, mätning och politik kan spela en viktig roll i att göra detta lärande möjligt.

Vad är det med NLP som gör dig så passionerad?

Alla mänskliga språk är så vackert komplexa och röriga. De tillåter oss att uttrycka en mängd känslor i vår tal och även i vår skrift och de utvecklas över tiden. Å andra sidan är en dator så deterministisk och klinisk i sin bearbetning av indata. Naturlig språkbehandling (NLP) är ett område inom artificiell intelligens som försöker göra denna icke-mänskliga enhet förstå de vackra komplexiteterna i mänskligt språk genom att kombinera tekniker från datavetenskap, lingvistik och statistik. Hur kan man inte hitta detta fascinerande?

ETS NLP- och talvetenskapsmän har nyligen utvecklat RSMTool. Kan du berätta för oss vad RSMTool gör?

Som vi har sett under de senaste åren kan alla maskinlärningsmodeller potentiellt uppvisa partiskt beteende oavsett området de tillämpas inom, utbildning inget undantag. De automatiserade betygsättningssystem som används för att tilldela poäng eller betyg till elevers tal eller uppsatser i tester eller klassrum använder ofta maskinlärningsmodeller. Därför är det fullt möjligt för sådana system att uppvisa partiskt beteende. Sådan partiskhet kan ha allvarliga konsekvenser, särskilt om poängen från sådana system används för att fatta viktiga beslut.

RSMTool är ett öppen källkodsverktyg som min kollega Anastassia Loukina (tidigare presenterad på Unite.AI) och jag har utvecklat på ETS för att hjälpa till att identifiera eventuella systematiska, skadliga partiskheter i automatiserade betygsättningssystem så tidigt som möjligt, helst innan systemen används i den verkliga världen. RSMTool är utformat för att ge en omfattande utvärdering av AI-betygssystem, inklusive inte bara standardmått för förutsägelseexakthet, utan också mått för modellrättvisa och mått baserade på testteori, vilket hjälper utvecklare av sådana system att identifiera eventuella partiskheter eller andra problem i sina system.

Varifrån kommer namnet RSMTool?

I utbildningsbedömningsfältet kallas en person som tilldelar ett betyg till (eller “betygsätter”) en uppsats ofta för en “betygsättare”. Det finns mänskliga betygsättare såväl som automatiserade betygsättare. RSMTool – förkortning för Rater Scoring Modeling Tool – är utformat för att hjälpa till att bygga (och utvärdera) de betygsättningsmodeller som används av automatiserade betygsättare.

Hur kan detta verktyg hjälpa utvecklare att identifiera eventuella partiskheter eller andra problem i sina AI-betygssystem?

Under de senaste fem decennierna har utbildningsmätningsforskare – inklusive många av våra kollegor på ETS – genomfört värdefull forskning om vad som gör automatiserad (och mänsklig) betygsättning rättvis. Som en del av denna forskning har de utvecklat många statistiska och psykometriska analyser för att beräkna indikatorer för systematisk partiskhet. Men eftersom psykometri- och NLP-samhällen sällan interagerar finns det liten möjlighet för idéer att spridas. Följden är att NLP-forskare och utvecklare som bygger faktiska automatiserade betygsättningssystem – särskilt enskilda forskare och de i små företag – inte har lätt tillgång till de psykometriska analyserna de borde använda för att kontrollera sina system för partiskhet. RSMTool försöker lösa detta problem genom att tillhandahålla en stor, diversifierad uppsättning psykometriska analyser i ett enda, lättanvänt Python-paket som kan enkelt införlivas av någon NLP-forskare i sin forskning eller produktionspipeline.

I ett typiskt användningsfall skulle en forskare tillhandahålla en fil eller en dataframe med numeriska systempoäng, guldstandard (mänskliga) poäng och metadata, om tillämpligt. RSMTool bearbetar dessa data och genererar en HTML-rapport som innehåller en omfattande utvärdering, inklusive beskrivande statistik samt flera mått för systemprestanda och rättvisa, bland annat. En exempel-RSMTool-rapport kan hittas på https://bit.ly/fair-tool. RSMTool kan fungera med traditionella funktionbaserade maskinlärningsmodeller (t.ex. från scikit-learn-biblioteket) och med djupinlärningsmodeller. Även om den primära utdata från RSMTool är den HTML-rapport som underlättar delning, genererar det också tabellformade datafiler (i CSV-, TSV- eller XLSX-format) som mellanliggande utdata för mer avancerade användare. Slutligen, för att hålla allt extremt anpassningsbart, implementerar RSMTool varje avsnitt av sin rapport som en Jupyter-anteckningsbok så att användarna inte bara kan välja vilka avsnitt som är relevanta för deras specifika betygsättningsmodeller, utan också enkelt kan implementera anpassade analyser och inkludera dem i rapporten med mycket lite arbete.

Det finns många nya studier om automatiserad betygsättning som har använt RSMTool för att utvärdera sina föreslagna betygsättningsmodeller.

Vilka är de vanligaste typerna av partiskhet som kan påverka automatiserade betygsättningssystem?

Den vanligaste typen av partiskhet som påverkar ett automatiserat betygsättningssystem är differential undergruppsprestanda, dvs. när det automatiserade systemet presterar annorlunda för olika undergrupper av befolkningen. Till exempel kan ett partiskt betygsättningssystem producera systematiskt lägre poäng för uppsatser skrivna av, till exempel, svarta kvinnor jämfört med dem för vita män, även om det inte finns några systematiska skillnader i de faktiska skrivfärdigheterna som visas av dessa två undergrupper i sina uppsatser, såsom en mänsklig bedömare ser det.

ETS har en rik historia av att genomföra forskning om rättvisa för automatiserade betygsättningssystem. Till exempel har vi tittat på om e-rater® – vårt AI-automatiserade betygsättningssystem – uppvisar någon differential prestanda för undergrupper definierade av etnicitet, kön och land (de fann några mindre skillnader som åtgärdades av efterföljande policyförändringar). Studier har också tittat på om e-rater® behandlar svar skrivna av GRE®-testtagare med inlärningssvårigheter och/eller ADHD systematiskt annorlunda i genomsnitt (det gör det inte). Mest nyligen undersökte en aktuell studie om ett automatiserat system för betygsättning av talförmåga uppvisar någon systematisk partiskhet mot testtagare som tvingades bära ansiktsmasker jämfört med dem som inte bar ansiktsmasker (det gör det inte). RSMTool innehåller flera psykometriska analyser som försöker kvantifiera differential undergruppsprestanda över undergrupper som användaren kan definiera över sina egna data.

Varför valde ETS att göra RSMTool öppen källkod?

Ja, RSMTool är tillgänglig på GitHub med en Apache 2.0-licens. Vi tror att det är viktigt att ett sådant verktyg är öppen källkod och icke-propriärt så att samhället kan (a) granska källkoden för de redan tillgängliga analyserna för att säkerställa deras överensstämmelse med rättvisestandarder och (b) bidra med nya analyser när standarderna utvecklas och förändras. Vi vill också göra det lätt för NLP-forskare och utvecklare att använda RSMTool i sitt arbete och att hjälpa oss att förbättra det. Att göra RSMTool öppen källkod är ett tydligt exempel på ETS fortsatta engagemang för ansvarsfull användning av AI i utbildningen.

Vilka är några av de lärdomar du lärde dig av att utveckla och underhålla RSMTool?

Under de senaste fem åren som Anastassia och jag har utvecklat och underhållit RSMTool – med hjälp av många ETS-kollegor och icke-ETS-GitHub-bidragsgivare – har vi lärt oss två övergripande lärdomar. Den första är att olika användare har olika behov och att ha en en-size-fits-all-approach inte kommer att fungera för tvärvetenskaplig programvara som RSMTool. Den andra lärdomen vi lärde oss var att för att göra det mer sannolikt att öppen källkodsprogramvara antas, måste man verkligen gå den extra milen för att göra den så robust som möjligt.

I vår roll som RSMTool-underhållare har vi identifierat många typer av användare av RSMTool. Vissa av dem är “power users” (t.ex. NLP-forskare och utvecklare) som vill välja och vraka specifik RSMTool-funktionalitet för att integrera den i sin egen maskinlärningspipeline medan de också använder andra Python-paket. För att tillfredsställa sådana användare skapade vi en ganska omfattande API för att exponera olika för- och efterbearbetningsfunktioner samt anpassade mått som ingår i RSMTool. En annan grupp av användare är vad vi kallar “minimalister”: dataanalytiker och ingenjörer som kan sakna den statistiska eller programmeringsbakgrund som krävs för att interagera med API:t och föredrar en färdig pipeline istället. För att tillfredsställa sådana användare har vi skapat kommandoradsverktyg som kan enkelt anropas i omslutande shell-skript, till exempel. Vi har också funnit att minimalistanvändare ofta är ovilliga att läsa igenom den (medgivande stora) listan med RSMTool-konfigurationsalternativ. Därför byggde vi en interaktiv konfigurationsgenerator med autokomplettering som kan hjälpa sådana användare att skapa konfigurationsfiler baserat på deras specifika behov.

Vad hoppas ETS uppnå genom att släppa RSMTool?

Utbildningssektorn har sett en av de mest betydande expansionerna av AI under de senaste åren, med automatiserad betygsättning av text och tal som en alltmer vanlig tillämpning av NLP. ETS har länge varit ledande inom området automatiserad betygsättning och har sedan sin tillblivelse varit engagerat i att bygga rättvisa produkter och bedömningar som är utformade för att tjäna lärande över hela världen. Genom att släppa RSMTool, utvecklat i nära samarbete mellan NLP-forskare och psykometriker, vill ETS fortsätta sitt engagemang för ansvarsfull användning av AI i utbildningen på ett mycket påtagligt sätt; specifikt vill vi göra det tydligt att när AI-forskare tänker på “prestanda” hos ett automatiserat betygsättningssystem, bör de inte bara överväga standardmått för förutsägelseexakthet (t.ex. Pearsons korrelation), utan också mått för modellrättvisa. Mer allmänt vill vi också att RSMTool ska tjäna som ett exempel på sätt på vilka NLP-forskare och psykometriker kan och bör arbeta tillsammans.

Finns det något annat du vill dela om RSMTool?

Vi vill uppmuntra läsarna att hjälpa oss förbättra RSMTool! De behöver inte vara en psykometriker eller en NLP-expert för att bidra. Vi har många öppna problem som rör dokumentation och Python-programmering som skulle vara perfekta för någon som är nybörjare till intermediär Python-programmerare. Vi inbjuder också bidrag till SKLL (Scikit-Learn Laboratory), – ett annat ETS-öppen källkods-paket för att effektivt köra användarkonfigurerade, batchade maskinlärnings-experiment – som används underliggande av RSMTool.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.