Modele i platformy AI
Nitin Madnani, Starszy Naukowiec Badawczy w ETS – Seria Wywiadów

Nitin Madnani jest Starszym Naukowcem Badawczym w grupie badawczej Natural Language Processing (NLP) w Educational Testing Service (ETS). ETS zostało założone w 1947 roku i jest największą prywatną organizacją non-profit zajmującą się edukacyjnym testowaniem i ocenianiem.
Czy mógłbyś zacząć od wyjaśnienia, jaka jest misja ETS?
Misją ETS jest promowanie jakości i równości w edukacji dla wszystkich uczniów na świecie. Ta misja leży u podstaw naszych produktów, usług, badań i wysiłków rozwojowych, których celem jest promowanie uczenia się, wspieranie edukacji, rozwoju zawodowego oraz mierzenie wiedzy i umiejętności dla wszystkich.
Wierzymy, że każdy, w każdym miejscu, może uczynić różnicę w swoim życiu poprzez naukę, a praca ETS nad badaniami, ocenianiem, pomiarami i polityką może odegrać ważną rolę w umożliwieniu tej nauki.
Co takiego jest w NLP, co tak bardzo cię pasjonuje?
Wszystkie języki ludzkie są tak pięknie złożone i skomplikowane. Pozwalają one wyrażać szeroki zakres emocji w mowie i nawet w piśmie, a także ewoluują z czasem. Z drugiej strony, komputer jest tak deterministyczny i kliniczny w przetwarzaniu danych wejściowych. Natural Language Processing (NLP) jest dziedziną sztucznej inteligencji, która próbuje sprawić, by ten nie-ludzki urządzenie zrozumiał piękne złożoności języka ludzkiego, łącząc techniki z dziedziny informatyki, lingwistyki i statystyki. Jak można nie być tym fascynowanym?
Naukowcy z ETS i mówcy niedawno opracowali RSMTool. Czy mógłbyś podzielić się z nami, co robi RSMTool?
Jak widzieliśmy w ciągu ostatnich kilku lat, wszystkie modele uczenia maszynowego mogą potencjalnie wykazywać zachowania uprzedzone, niezależnie od dziedziny, w której są stosowane, a edukacja nie jest wyjątkiem. Zautomatyzowane systemy oceniania używane do przyznawania punktów lub ocen za mowę lub eseje w testach lub w klasach często wykorzystują modele uczenia maszynowego. Dlatego też jest całkiem możliwe, że takie systemy będą wykazywać uprzedzenia. Takie uprzedzenia mogą mieć poważne konsekwencje, szczególnie jeśli punkty z takich systemów są używane do podejmowania ważnych decyzji.
RSMTool to narzędzie open-source, które moja koleżanka Anastassia Loukina (wcześniej zaprezentowana na Unite.AI) i ja opracowaliśmy w ETS, aby pomóc upewnić się, że wszelkie systematyczne, szkodliwe uprzedzenia w zautomatyzowanych systemach oceniania są identyfikowane jak najwcześniej, najlepiej jeszcze przed wdrożeniem tych systemów w świecie rzeczywistym. RSMTool został zaprojektowany, aby zapewnić kompleksową ocenę silników oceniania AI, w tym nie tylko standardowych wskaźników dokładności predykcji, ale także miar sprawiedliwości modelu i wskaźników opartych na teorii testów, co pomaga twórcom takich silników identyfikować możliwe uprzedzenia lub inne problemy w ich systemach.
Skąd pochodzi nazwa RSMTool?
W dziedzinie edukacyjnego testowania osoba, która przyznaje punkty (lub „ocenia”) esej, jest często nazywana „oceniającym”. Są oceniający ludzcy, a także zautomatyzowani. RSMTool – skrót od Rater Scoring Modeling Tool – został zaprojektowany, aby pomóc w budowaniu (i ocenianiu) modeli oceniania używanych przez zautomatyzowanych oceniających.
Jak to narzędzie może pomóc twórcom w identyfikowaniu możliwych uprzedzeń lub innych problemów w ich silnikach oceniania AI?
W ciągu ostatnich pięciu dekad naukowcy z dziedziny edukacyjnego pomiaru – w tym wielu naszych kolegów z ETS – przeprowadzili cenne badania nad tym, co sprawia, że zautomatyzowane systemy oceniania są sprawiedliwe. W ramach tych badań opracowali wiele analiz statystycznych i psychometrycznych do obliczania wskaźników systematycznych uprzedzeń. Jednakże, ponieważ społeczności psychometryczne i NLP rzadko互одействują, jest mało okazji do wymiany pomysłów. W efekcie badacze i twórcy NLP, którzy budują rzeczywiste systemy oceniania – szczególnie pojedynczy badacze i ci z małych firm – nie mają łatwego dostępu do analiz psychometrycznych, których powinni używać do sprawdzania swoich systemów pod kątem uprzedzeń. RSMTool próbuje rozwiązać ten problem, zapewniając duży, zróżnicowany zestaw analiz psychometrycznych w jednym, łatwym w użyciu pakiecie Pythona, który może być łatwo włączony do badań lub operacyjnego potoku przez każdego badacza NLP.
W typowym przypadku użycia badacz dostarcza plik lub ramkę danych z punktami systemu, punktami złotego standardu (ludzkimi) i metadanymi, jeśli są dostępne. RSMTool przetwarza te dane i generuje raport HTML zawierający kompleksową ocenę, w tym statystyki opisowe, a także wiele miar wydajności systemu i sprawiedliwości. Przykładowy raport RSMTool można znaleźć pod adresem https://bit.ly/fair-tool. RSMTool może współpracować z tradycyjnymi modelami uczenia maszynowego opartymi na cechach (np. z biblioteki scikit-learn) oraz z modelami głębokiego uczenia. Chociaż głównym wyjściem RSMTool jest raport HTML, który ułatwia udostępnianie, generuje również pliki danych tabelarycznych (w formatach CSV, TSV lub XLSX) jako wyjścia pośrednie dla zaawansowanych użytkowników. Wreszcie, aby uczynić wszystko niezwykle dostosowalnym, RSMTool implementuje każdy dział raportu jako notes Jupyter, dzięki czemu użytkownicy mogą nie tylko wybrać, które działy są istotne dla ich konkretnych modeli oceniania, ale także łatwo wdrożyć niestandardowe analizy i uwzględnić je w raporcie z minimalnym nakładem pracy.
Istnieje wiele niedawnych badań nad zautomatyzowanym ocenianiem, które wykorzystały RSMTool do oceny proponowanych modeli oceniania.
Jakie są najczęstsze typy uprzedzeń, które mogą wpłynąć na systemy oceniania zautomatyzowanego?
Najczęstszym typem uprzedzenia wpływającym na system oceniania zautomatyzowanego jest różnicowa wydajność podgrup, czyli gdy system zautomatyzowany działa inaczej dla różnych podgrup populacji. Na przykład, uprzedzony system oceniania mógłby produkować systematycznie niższe punkty za eseje napisane przez, na przykład, czarnoskóre kobiety w porównaniu z tymi dla białych mężczyzn, nawet jeśli nie ma systematycznych różnic w rzeczywistych umiejętnościach pisarskich wykazanych przez te dwie podgrupy w ich esejach, jeśli chodzi o ludzkie oceny.
ETS ma bogatą historię prowadzenia badań nad sprawiedliwością dla silników oceniania zautomatyzowanego. Na przykład, zbadaliśmy czy e-rater® – nasz silnik oceniania zautomatyzowanego AI – wykazuje jakiekolwiek różnice w wydajności dla podgrup określonych przez etniczność, płeć i kraj (stwierdzono pewne nieznaczne różnice, które zostały następnie zaadresowane przez zmiany polityki). Badania również zbadano, czy e-rater® traktuje odpowiedzi napisane przez zdających test GRE® z niepełnosprawnościami lub ADHD systematycznie inaczej średnio (nie robi). Najnowsze badanie bada, czy zautomatyzowany system oceniania mówienia wykazuje systematyczne uprzedzenia wobec zdających, którzy musieli nosić maski w porównaniu z tymi, którzy nie nosili masek (nie wykazuje). RSMTool zawiera kilka analiz psychometrycznych, które próbują zmierzyć różnicową wydajność podgrup, które użytkownik może zdefiniować na podstawie własnych danych.
Dlaczego ETS zdecydowało się udostępnić RSMTool jako oprogramowanie open-source?
Tak, RSMTool jest dostępny na GitHubie z licencją Apache 2.0. Uważamy, że jest to ważne, aby takie narzędzie było open-source i nie własnościowe, aby społeczność mogła (a) sprawdzić kod źródłowy dostępnych analiz, aby upewnić się, że są one zgodne z standardami sprawiedliwości, oraz (b) przyczynić się do nowych analiz, gdy standardy ewoluują i zmieniają się. Chcemy również ułatwić badaczom NLP i twórcom wykorzystywanie RSMTool w swojej pracy i pomóc nam w udoskonaleniu go. Udział RSMTool jako oprogramowania open-source jest wyraźnym przykładem ciągłego zaangażowania ETS w odpowiedzialne wykorzystanie AI w edukacji.
Jakie są najważniejsze wnioski, które wyciągnąłeś z rozwoju i utrzymania RSMTool?
Przez ostatnie pięć lat, gdy Anastassia i ja rozwijaliśmy i utrzymywaliśmy RSMTool – przy pomocy wielu kolegów z ETS i spoza niego – nauczyliśmy się dwóch podstawowych lekcji. Pierwsza to to, że różni użytkownicy mają różne potrzeby i podejście „jeden rozmiar pasuje do wszystkich” nie zadziała dla oprogramowania międzydyscyplinarnego, takiego jak RSMTool. Druga lekcja, którą się nauczyliśmy, polega na tym, że aby zwiększyć prawdopodobieństwo przyjęcia oprogramowania open-source, trzeba naprawdę „iść o krok dalej”, aby uczynić je jak najbardziej solidnym.
W trakcie naszego okresu jako opiekunów RSMTool zidentyfikowaliśmy wiele typów użytkowników RSMTool. Niektórzy z nich to „użytkownicy zaawansowani” (np. badacze NLP i twórcy), którzy chcą wybrać określoną funkcjonalność RSMTool, aby włączyć ją do swojego potoku uczenia maszynowego, a także używać innych pakietów Pythona. Aby zadowolić takich użytkowników, stworzyliśmy dość kompleksowy interfejs API, aby udostępnić różne funkcje przetwarzania przed i po, a także niestandardowe miary zawarte w RSMTool. Inna grupa użytkowników to tzw. „minimaliści” – analitycy danych i inżynierowie, którzy mogą nie mieć wystarczającej wiedzy statystycznej lub programistycznej, aby wchodzić w interakcje z API i wolą gotowy potok zamiast. Aby zadowolić takich użytkowników, stworzyliśmy narzędzia wiersza poleceń, które mogą być łatwo wywołane w skryptach powłoki, na przykład. Stwierdziliśmy również, że użytkownicy minimalistyczni często niechętnie czytają przez (przyzwoicie dużą) listę opcji konfiguracyjnych RSMTool. Dlatego też zbudowaliśmy interaktywny generator konfiguracji z autouzupełnianiem, który może pomóc takim użytkownikom tworzyć pliki konfiguracyjne na podstawie ich konkretnych potrzeb.
Aby spełnić potrzeby wszystkich naszych grup użytkowników, musieliśmy przyjąć praktyki, które uważaliśmy za konieczne, aby uczynić RSMTool solidnym. Co rozumiemy przez solidne oprogramowanie? Aby być solidnym, każdy kawałek oprogramowania musi spełniać następujące kryteria: wpływ każdej zmiany kodu na jego dokładność i wydajność może być mierzony (dobrze przetestowany), jego dokumentacja jest zawsze aktualna (dobrze udokumentowany), a oprogramowanie (wraz z zależnościami) jest łatwe w instalacji przez użytkowników. Dla RSMTool wykorzystaliśmy kilka narzędzi i usług open-source, aby uczynić go spełniającym nasze wymagania. Mamy kompleksowy zestaw testów (>90% pokrycia kodu), który automatycznie uruchamiamy za pomocą ciągłej integracji dla wszystkich zmian wprowadzonych do kodu. Utrzymujemy obszerną dokumentację (w tym wiele tutoriali z prawdziwego świata) i każda nowa funkcjonalność proponowana dla RSMTool musi zawierać składnik dokumentacyjny, który jest również przeglądany w ramach przeglądu kodu. Wreszcie, wydajemy RSMTool jako pakiety, które mogą być łatwo zainstalowane (za pomocą pip lub conda), a wszystkie wymagane zależności są również automatycznie instalowane.
Co ETS chce osiągnąć, udostępniając RSMTool?
Sektor edukacji doświadczył jednego z największych rozszerzeń AI w ciągu ostatnich kilku lat, a zautomatyzowane ocenianie tekstu i mowy stało się coraz bardziej powszechnym zastosowaniem NLP. ETS od dawna jest liderem w dziedzinie zautomatyzowanego oceniania i od samego początku był zaangażowany w tworzenie sprawiedliwych produktów i ocen, które są zaprojektowane, aby służyć uczniom na całym świecie. Udostępniając RSMTool, opracowany we współpracy między naukowcami NLP i psychometrykami, ETS chce kontynuować swoje zaangażowanie w odpowiedzialne wykorzystanie AI w edukacji w bardzo konkretny sposób; konkretnie, chcemy podkreślić, że gdy badacze AI myślą o „wydajności” systemu oceniania zautomatyzowanego, powinni brać pod uwagę nie tylko standardowe miary dokładności predykcji (np. korelacja Pearsona), ale także miary sprawiedliwości modelu. Szerzej, chcielibyśmy, aby RSMTool służył jako przykład sposobów, w jakie badacze NLP i psychometrycy mogą i powinni współpracować.
Czy jest coś jeszcze, co chciałbyś podzielić się na temat RSMTool?
Chcemy zachęcić czytelników do pomocy w udoskonaleniu RSMTool! Nie muszą być psychometrykami ani ekspertami NLP, aby przyczynić się. Mamy wiele otwartych problemów związanych z dokumentacją i programowaniem Pythona, które będą idealne dla każdego początkującego lub średniozaawansowanego programisty Pythona. Zachęcamy również do współpracy przy SKLL (Scikit-Learn Laboratory), innym pakiecie open-source ETS do efektywnego wykonywania konfigurowalnych, wsadowych eksperymentów z uczeniem maszynowym, który jest używany przez RSMTool.












