AI-modellen en platforms

Nitin Madnani, Senior Onderzoeker bij ETS – Interview Serie

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Nitin Madnani is een senior onderzoeker bij de onderzoeksgroep Natural Language Processing (NLP) van de Educational Testing Service (ETS). ETS is opgericht in 1947 en is ‘s werelds grootste particuliere non-profitorganisatie voor onderwijsbeoordeling en -toetsing.

Kunt u beginnen met uit te leggen wat de missie van ETS is?

De missie van ETS is om kwaliteit en gelijkheid in onderwijs voor alle leerlingen over de hele wereld te bevorderen. Deze missie ligt ten grondslag aan onze producten, diensten, onderzoek en ontwikkelingsinspanningen, met als doel het bevorderen van leren, ondersteunen van onderwijs, professionele ontwikkeling en meten van kennis en vaardigheden voor iedereen.

We geloven dat iedereen, overal, een verschil kan maken in hun leven door te leren en dat het onderzoek, de beoordeling, meting en beleid van ETS een belangrijke rol kunnen spelen bij het mogelijk maken van dat leren.

Wat is het aan NLP dat u zo gepassioneerd maakt?

Alle menselijke talen zijn zo mooi complex en rommelig. Ze stellen ons in staat om een breed scala aan emoties uit te drukken in ons spreken en zelfs in ons schrijven en ze evolueren met de tijd. Aan de andere kant is een computer zo deterministisch en klinisch in het verwerken van zijn invoer. Natural Language Processing (NLP) is een gebied van kunstmatige intelligentie dat probeert om dit niet-menselijke apparaat de prachtige complexiteit van de menselijke taal te laten begrijpen door technieken uit computerwetenschap, taalkunde en statistiek te combineren. Hoe kunt u dit niet fascinerend vinden?

ETS NLP- en spraakwetenschappers hebben onlangs RSMTool ontwikkeld. Kunt u ons vertellen wat RSMTool doet?

Zoals we de afgelopen jaren hebben gezien, kunnen alle machine learning-modellen potentieel gebiaseerd gedrag vertonen, ongeacht het veld waarin ze worden toegepast, inclusief onderwijs. De geautomatiseerde beoordelingssystemen die worden gebruikt om scores of cijfers toe te kennen aan de toespraken of essays van studenten in toetsen of klassen, gebruiken vaak machine learning-modellen. Daarom is het absoluut mogelijk dat dergelijke systemen op een gebiaseerde manier gedragen. Een dergelijke bias kan ernstige gevolgen hebben, vooral als de scores van dergelijke systemen worden gebruikt om belangrijke beslissingen te nemen.

RSMTool is een open-source tool die mijn collega Anastassia Loukina (eerder gepresenteerd op Unite.AI) en ik hebben ontwikkeld bij ETS om ervoor te zorgen dat eventuele systematische, schadelijke biases in geautomatiseerde beoordelingssystemen zo vroeg mogelijk worden geïdentificeerd, hopelijk zelfs voordat de systemen in de echte wereld worden ingezet. RSMTool is ontworpen om een uitgebreide evaluatie van AI-scoresystemen te bieden, inclusief niet alleen standaardmaten van voorspellingsnauwkeurigheid, maar ook maatregelen van modelrechtvaardigheid en metingen op basis van testtheorie, waardoor ontwikkelaars van dergelijke systemen mogelijke biases of andere problemen in hun systemen kunnen identificeren.

Waar komt de naam RSMTool vandaan?

In het veld van onderwijsbeoordeling wordt iemand die een score toekent (of “beoordeelt”) aan een essay vaak een “beoordelaar” genoemd. Er zijn zowel menselijke als geautomatiseerde beoordelaars. RSMTool – afgekort van Rater Scoring Modeling Tool – is ontworpen om te helpen bij het bouwen (en evalueren) van de scoresystemen die door geautomatiseerde beoordelaars worden gebruikt.

Hoe kan deze tool ontwikkelaars helpen om mogelijke bias of andere problemen in hun AI-scoresystemen te identificeren?

In de afgelopen vijf decennia hebben onderwijsmetingswetenschappers – waaronder veel van onze collega’s bij ETS – waardevol onderzoek gedaan naar wat maakt dat geautomatiseerde (en menselijke) beoordeling eerlijk is. Als onderdeel van dit onderzoek hebben ze veel statistische en psychometrische analyses ontwikkeld voor het berekenen van indicatoren van systematische bias. Echter, aangezien de psychometrische en NLP-gemeenschappen zelden interactie hebben, is er weinig gelegenheid voor kruisbestuiving van ideeën. Het gevolg is dat NLP-onderzoekers en ontwikkelaars die daadwerkelijk geautomatiseerde beoordelingssystemen bouwen – vooral individuele onderzoekers en die in kleine bedrijven – geen gemakkelijke toegang hebben tot de psychometrische analyses die ze zouden moeten gebruiken om hun systemen op bias te controleren. RSMTool probeert dit probleem op te lossen door een grote, diverse set van psychometrische analyses te bieden in een enkele, eenvoudig te gebruiken Python-pakket dat gemakkelijk door elke NLP-onderzoeker in hun onderzoek of operationele pipeline kan worden geïntegreerd.

In een typisch gebruiksscenario zou een onderzoeker een bestand of een data frame met numerieke systeem scores, gouden (menselijke) scores en metadata (indien van toepassing) als invoer leveren. RSMTool verwerkt deze gegevens en genereert een HTML-rapport met een uitgebreide evaluatie, inclusief beschrijvende statistieken en meerdere maatregelen van systeemprestaties en rechtvaardigheid. Een voorbeeld van een RSMTool-rapport kan worden gevonden op https://bit.ly/fair-tool. RSMTool kan werken met traditionele feature-gedreven machine learning-modellen (bijv. uit de scikit-learn-bibliotheek) en met deep learning-modellen. Hoewel de primaire uitvoer van RSMTool het HTML-rapport is dat gemakkelijker te delen is, genereert het ook tabulaire gegevensbestanden (in CSV, TSV of XLSX-formaat) als tussenproducten voor geavanceerde gebruikers. Ten slotte, om dingen extreem aanpasbaar te houden, implementeert RSMTool elke sectie van zijn rapport als een Jupyter-notebook, zodat gebruikers niet alleen kunnen kiezen welke secties relevant zijn voor hun specifieke scoresystemen, maar ook gemakkelijk aangepaste analyses kunnen implementeren en opnemen in het rapport met heel weinig werk.

Er zijn veel recente studies over geautomatiseerde beoordeling die RSMTool hebben gebruikt om hun voorgestelde scoresystemen te evalueren.

Wat zijn de meest voorkomende soorten bias die geautomatiseerde beoordelingssystemen kunnen beïnvloeden?

De meest voorkomende soort bias die een geautomatiseerd beoordelingssysteem kan beïnvloeden, is differentiële subgroepprestatie, d.w.z. wanneer het geautomatiseerde systeem anders presteert voor verschillende subgroepen van de bevolking. Bijvoorbeeld, een gebiaseerd beoordelingssysteem kan systematisch lagere scores produceren voor essays geschreven door, bijvoorbeeld, zwarte vrouwen in vergelijking met die voor blanke mannen, zelfs als er geen systematische verschillen zijn in de daadwerkelijke schrijfvaardigheden die door die twee subgroepen in hun essays worden getoond, voor zover een mens dat kan beoordelen.

ETS heeft een rijke geschiedenis van onderzoek naar eerlijkheid voor geautomatiseerde beoordelingssystemen. Bijvoorbeeld, we hebben gekeken of onze AI-geautomatiseerde beoordelingsmotor e-rater® enige differentiële prestatie vertoont voor subgroepen gedefinieerd door etniciteit, geslacht en land (ze vonden enkele kleine verschillen die werden aangepakt door latere beleidsveranderingen). Studies hebben ook gekeken of e-rater® systematisch anders behandelt dan antwoorden geschreven door GRE®-testkandidaten met een leerbeperking en/of ADHD (het doet dat niet). Meest recentelijk, een actuele studie kijkt of een geautomatiseerd systeem voor het beoordelen van spreekvaardigheid enige systematische bias vertoont ten opzichte van testkandidaten die verplicht waren een mondmasker te dragen versus diegenen die geen mondmasker droegen (het doet dat niet). RSMTool bevat verschillende psychometrische analyses die proberen differentiële subgroepprestatie over subgroepen te kwantificeren die de gebruiker kan definiëren over hun eigen gegevens.

ETS heeft ervoor gekozen om RSMTool open-source te maken, kunt u de redenering en het belang achter deze beslissing uitleggen?

Ja, RSMTool is beschikbaar op GitHub met een Apache 2.0-licentie. We geloven dat het belangrijk is dat een dergelijk instrument open-source en niet-eigendomsgebonden is, zodat de gemeenschap (a) de broncode van de reeds beschikbare analyses kan controleren op naleving van de eerlijkheidsnormen en (b) nieuwe analyses kan bijdragen als de normen evolueren en veranderen. We willen ook dat het gemakkelijk is voor NLP-onderzoekers en ontwikkelaars om RSMTool in hun werk te gebruiken en ons te helpen bij het verbeteren ervan. Het open-source maken van RSMTool is een duidelijk voorbeeld van de voortdurende inzet van ETS voor het verantwoord gebruik van AI in onderwijs.

Wat zijn enkele van de lessen die u heeft geleerd van de ontwikkeling en het onderhoud van RSMTool?

In de afgelopen vijf jaar dat Anastassia en ik RSMTool hebben ontwikkeld en onderhouden – met de hulp van veel ETS-collega’s en niet-ETS-GitHub-bijdragers – hebben we twee overkoepelende lessen geleerd. De eerste is dat verschillende gebruikers verschillende behoeften hebben en dat een single-size-fits-all-benadering niet zal werken voor cross-disciplinaire software zoals RSMTool. De tweede les die we hebben geleerd, is dat het, om het waarschijnlijker te maken dat open-source software wordt geadopteerd, echt nodig is om extra moeite te doen om het zo robuust mogelijk te maken.

In onze tijd als RSMTool-beheerders hebben we veel soorten RSMTool-gebruikers geïdentificeerd. Sommigen van hen zijn “power users” (bijv. NLP-onderzoekers en ontwikkelaars) die specifieke RSMTool-functionaliteit willen kiezen om in hun eigen machine learning-pipeline te integreren, evenals andere Python-pakketten. Om dergelijke gebruikers tevreden te stellen, hebben we een vrij uitgebreide API ontwikkeld om verschillende voor- en naverwerkingen en aangepaste metrics in RSMTool te exposeren. Een andere groep gebruikers zijn wat we “minimalisten” noemen: data-analisten en ingenieurs die misschien niet de statistische of programmeringsachtergrond hebben om met de API te communiceren en die een out-of-the-box-pipeline prefereren. Om dergelijke gebruikers tevreden te stellen, hebben we opdrachtregelhulpmiddelen gemaakt die gemakkelijk in wrapper-shellscripts kunnen worden aangeroepen, bijvoorbeeld. We hebben ook ontdekt dat minimalistische gebruikers vaak aarzelen om door de (overigens grote) lijst met RSMTool-configuratieopties te bladeren. Daarom hebben we een interactieve configuratiegenerator met autocompletion gebouwd die gebruikers kan helpen configuratiebestanden te maken op basis van hun specifieke behoeften.

Om aan de behoeften van al onze gebruikersgroepen te voldoen, hebben we praktijken moeten aannemen die we nodig achtten om RSMTool robuust te maken. Wat bedoelen we met robuuste software? Om robuust te zijn, moet elk stuk software aan de volgende criteria voldoen: de impact van elke codeverandering op zijn nauwkeurigheid en prestaties kan worden gemeten (goed getest), zijn documentatie is altijd up-to-date (goed gedocumenteerd) en de software (samen met zijn afhankelijkheden) is gemakkelijk te installeren door gebruikers. Voor RSMTool hebben we verschillende open-source tools en diensten gebruikt om het aan onze definitie te laten voldoen. We hebben een uitgebreide testsuite (>90% code-coverage) die we automatisch uitvoeren via continue integratie voor alle wijzigingen die aan de code worden voorgesteld. We onderhouden uitgebreide documentatie (inclusief meerdere real-world-tutorials) en elke nieuwe functionaliteit die voor RSMTool wordt voorgesteld, moet een documentatiecomponent bevatten die ook wordt beoordeeld als onderdeel van de codebeoordeling. Ten slotte geven we RSMTool uit als pakketten die gemakkelijk kunnen worden geïnstalleerd (via pip of conda) en alle benodigde afhankelijkheden worden automatisch geïnstalleerd.

Wat hoopt ETS te bereiken door RSMTool uit te brengen?

De onderwijssector heeft een van de meest significante uitbreidingen van AI gezien in de afgelopen jaren, met geautomatiseerde beoordeling van tekst en spraak als een steeds vaker voorkomende toepassing van NLP. ETS is al lang een leider in het veld van geautomatiseerde beoordeling en is sinds zijn oprichting toegewijd aan het bouwen van eerlijke producten en beoordelingen die zijn ontworpen om leerlingen over de hele wereld te dienen. Door RSMTool uit te brengen, ontwikkeld in nauwe samenwerking tussen NLP-wetenschappers en psychometrische onderzoekers, wil ETS zijn pleidooi voor het verantwoord gebruik van AI in onderwijs op een zeer tastbare manier voortzetten; specifiek willen we duidelijk maken dat wanneer AI-onderzoekers denken aan de “prestaties” van een geautomatiseerd beoordelingssysteem, ze niet alleen de standaardmaten van voorspellingsnauwkeurigheid (bijv. Pearson-correlatie) in overweging moeten nemen, maar ook die van modelrechtvaardigheid. Breder gezien, zouden we RSMTool ook graag als voorbeeld willen zien van de manieren waarop NLP-onderzoekers en psychometrische onderzoekers samen kunnen werken.

Is er nog iets anders dat u over RSMTool wilt delen?

We willen lezers aanmoedigen om ons te helpen RSMTool te verbeteren! Ze hoeven geen psychometrist of NLP-expert te zijn om bij te dragen. We hebben veel open issues met betrekking tot documentatie en Python-programmering die perfect zouden zijn voor elke beginner tot intermediate Python-programmeur. We nodigen ook bijdragen uit aan SKLL (Scikit-Learn Laboratory), – een andere ETS-open-source-pakket voor het efficiënt uitvoeren van gebruikersconfigurabele, batch-geautomatiseerde machine learning-experimenten – dat onderliggend door RSMTool wordt gebruikt.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.