Modele i platformy AI
Anastassia Loukina, Starszy Naukowiec Badawczy (NLP/Mowa) w ETS – Seria Wywiadów

Anastassia Loukina jest naukowcem badawczym w Educational Testing Services (ETS), gdzie pracuje nad automatycznym ocenianiem mowy.
Jej zainteresowania badawcze obejmują szeroki zakres tematów. Pracowała między innymi nad dialektami nowogreckimi, rytmiką mowy i automatyczną analizą prozodii.
Jej obecna praca koncentruje się na łączeniu narzędzi i metod z dziedziny technologii mowy i uczenia maszynowego z wglądem w badania nad percepcją i produkcją mowy w celu budowania modeli oceniania automatycznego dla oceny mowy nie rodzimej.
Czy mogłabyś powiedzieć, co spowodowało, że zainteresowałaś się językami?
Wychowałam się mówiąc po rosyjsku w Petersburgu, Rosja i pamiętam, jak byłem fascynowany, gdy po raz pierwszy spotkałem język angielski: dla niektórych słów istniał wzorzec, który pozwalał “przekształcić” rosyjskie słowo w angielskie słowo. I potem spotykałem słowo, w którym “mój” wzorzec nie działał i próbowałem znaleźć lepszy, bardziej ogólny wzorzec. W tym czasie oczywiście nie wiedziałem nic o typologii językowej ani o różnicy między cognatami a słowami pożyczonymi, ale to zapaliło moją ciekawość i chęć nauki więcej języków. Ta pasja do identyfikowania wzorców w sposobie, w jaki ludzie mówią, i testowania ich na danych, to co doprowadziło mnie do fonetyki, uczenia maszynowego i pracy, którą wykonuję teraz.
Przed swoją obecną pracą w dziedzinie Przetwarzania Języka Naturalnego (NLP) byłaś tłumaczką z języka angielskiego i nowogreckiego na rosyjski. Czy uważasz, że Twoja praca jako tłumaczka dała Ci dodatkowe spojrzenie na niektóre z niuansów i problemów związanych z NLP?
Moja podstawowa tożsamość zawsze była tożsamością badacza. Prawdą jest, że zaczęłam swoją karierę akademicką jako uczony nowogrecki, a konkretnie nowogreckiej fonetyki. W swojej pracy doktorskiej badałam różnice fonetyczne między kilkoma dialektami nowogreckimi i jak te różnice mogły być związane z historią regionu. Uważałam, że niektóre z tych różnic mogły powstać w wyniku kontaktu językowego między każdym dialektem a innymi językami mówionymi w tym regionie. Chociaż nie pracuję już nad nowogreckim, zmiany, które występują, gdy dwa języki mają kontakt ze sobą, nadal są istotne w mojej pracy: tym razem koncentruję się na tym, co dzieje się, gdy osoba uczy się nowego języka i jak technologia może pomóc w tym procesie.
Gdy chodzi o język angielski, istnieje wiele akcentów. Jak projektujesz system NLP, który może zrozumieć wszystkie różne dialekty? Czy jest to prosta sprawa, polegająca na podaniu algorytmowi głębokiego uczenia dodatkowych danych z każdego typu akcentu?
Istnieje kilka podejść, które były używane w przeszłości, aby rozwiązać ten problem. Oprócz budowy jednego dużego modelu, który obejmuje wszystkie akcenty, można najpierw zidentyfikować akcent, a następnie użyć niestandardowego modelu dla tego akcentu, lub można spróbować kilku modeli jednocześnie i wybrać ten, który działa najlepiej. Ostatecznie, aby osiągnąć dobre wyniki na szerokim zakresie akcentów, potrzebne są dane szkoleniowe i testowe, które reprezentują wiele akcentów, z którymi system może się spotkać.
W ETS prowadzimy kompleksowe oceny, aby upewnić się, że wyniki uzyskane przez nasze systemy automatycznego oceniania odzwierciedlają różnice w rzeczywistych umiejętnościach, które chcemy mierzyć, i nie są wpływane przez cechy demograficzne ucznia, takie jak jego płeć, rasa czy kraj pochodzenia.
Dzieci i/lub uczniowie języka często mają trudności z poprawną wymową. Jak pokonujesz problem wymowy?
Nie ma takiej rzeczy jak idealna wymowa: sposób, w jaki mówimy, jest ściśle związany z naszą tożsamością, a jako deweloperzy i badacze naszym celem jest upewnienie się, że nasze systemy są uczciwe dla wszystkich użytkowników.
Obydwa, dzieci i uczniowie języka, stanowią szczególne wyzwania dla systemów opartych na mowie. Na przykład, głosy dzieci mają bardzo odmienną jakość akustyczną, a dzieci mówią inaczej niż dorośli, a istnieje wiele zmienności między dziećmi. W związku z tym, rozwijanie systemu automatycznego rozpoznawania mowy dla dzieci jest zwykle oddzielnym zadaniem, które wymaga dużej ilości danych mowy dziecięcej.
Podobnie, chociaż istnieją wiele podobieństw między uczniami języka z tego samego tła, uczniowie mogą się znacznie różnić w swoim użyciu wzorców fonetycznych, gramatycznych i leksykalnych, co sprawia, że rozpoznawanie mowy jest szczególnie trudnym zadaniem. Podczas budowy naszych systemów do oceniania umiejętności językowych angielskiego, używamy danych od uczniów języka z szerokim zakresem umiejętności i języków ojczystych.
W styczniu 2018 roku opublikowałaś artykuł ‘Używanie odpowiedzi egzemplarzowych do szkolenia i oceniania systemów automatycznego oceniania mowy’. Jakie są główne przełomowe podstawy, które powinny być zrozumiane z tego artykułu?
W tym artykule, zbadaliśmy, jak jakość danych szkoleniowych i testowych wpływa na wyniki systemów automatycznego oceniania.
Systemy automatycznego oceniania, jak wiele innych systemów automatycznych, są szkolone na danych, które zostały oznaczone przez ludzi. W tym przypadku, są to oceny przydzielone przez ludzkich oceniających. Ludzcy oceniający nie zawsze zgadzają się co do ocen, które przydzielają. Istnieją różne strategie, które są używane w ocenianiu, aby upewnić się, że ostateczna ocena raportowana do ucznia pozostaje bardzo niezawodna, pomimo zmienności w porozumieniu między ludzkimi oceniającymi. Jednakże, ponieważ silniki automatycznego oceniania są zwykle szkolone przy użyciu ocen na poziomie odpowiedzi, jakiekolwiek nieścisłości w tych ocenach z powodu różnych powodów mogą negatywnie wpłynąć na system.
Udało nam się uzyskać dostęp do dużej ilości danych z różnym stopniem porozumienia między ludzkimi oceniającymi i porównać wyniki systemu w różnych warunkach. To, co odkryliśmy, to fakt, że szkolenie systemu na idealnych danych nie poprawia jego wyników w porównaniu z systemem szkolonym na danych z głośniejszymi etykietami. Idealne etykiety dają Ci przewagę tylko wtedy, gdy Twoja całkowita wielkość zestawu szkoleniowego jest bardzo niska. Z drugiej strony, jakość etykiet ludzkich miała ogromny wpływ na ocenę systemu: Twoje szacunki wyników mogą być nawet o 30% wyższe, jeśli oceniasz je na czystych etykietach.
Podsumowując, jeśli masz wiele danych i zasobów, aby oczyścić Twoje etykiety wzorcowe, może być mądrzejsze, aby oczyścić etykiety w zestawie oceny, a nie etykiety w zestawie szkoleniowym. I to odkrycie dotyczy nie tylko automatycznego oceniania, ale także wielu innych dziedzin.
Czy mogłabyś opowiedzieć o swojej pracy w ETS?
Pracuję nad systemem oceniania mowy, który przetwarza język mówiony w kontekście edukacyjnym. Jednym z takich systemów jest SpeechRater®, który używa zaawansowanej technologii rozpoznawania i analizy mowy, aby ocenić i zapewnić szczegółową informację zwrotną o umiejętnościach językowych angielskiego. SpeechRater to bardzo dojrzała aplikacja, która istnieje już ponad 10 lat. Buduję modele oceniania dla różnych aplikacji i pracuję z innymi kolegami w ETS, aby upewnić się, że nasze oceny są niezawodne, uczciwe i ważne dla wszystkich uczniów. Pracujemy również z innymi grupami w ETS, aby stale monitorować wyniki systemu.
Ponadto, oprócz utrzymania i poprawy naszych systemów operacyjnych, prototypujemy nowe systemy. Jednym z projektów, którym jestem bardzo zainteresowana, jest RelayReader™: aplikacja zaprojektowana, aby pomóc rozwijać czytelnictwo i pewność siebie. Podczas czytania z RelayReader, użytkownik na zmianę słucha i czyta głośno książkę. Jego czytanie jest następnie wysłane na nasze serwery, aby zapewnić informację zwrotną. W zakresie przetwarzania mowy, głównym wyzwaniem tej aplikacji jest, jak zmierzyć naukę i zapewnić informację zwrotną, która jest zarówno użyteczna, jak i niezawodna, bez przeszkadzania w zaangażowaniu czytelnika w książkę.
Jaki jest Twój ulubiony aspekt pracy w ETS?
To, co początkowo przyciągnęło mnie do ETS, to fakt, że jest to organizacja non-profit, której misją jest poprawa jakości edukacji dla wszystkich ludzi na świecie. Chociaż oczywiście jest wspaniale, gdy badania prowadzą do produktu, cenię sobie możliwość pracy nad projektami, które są bardziej podstawowe, ale które pomogą w rozwoju produktów w przyszłości. Cenię również fakt, że ETS traktuje poważnie kwestie takie jak prywatność danych i uczciwość, a wszystkie nasze systemy przechodzą bardzo surową ocenę przed wdrożeniem operacyjnym.
Ale to, co naprawdę sprawia, że ETS jest wspaniałym miejscem do pracy, to ludzie. Mamy niesamowitą społeczność naukowców, inżynierów i deweloperów z różnych środowisk, co pozwala na wiele interesujących współpracy.
Czy uważasz, że sztuczna inteligencja kiedykolwiek będzie w stanie przejść test Turinga?
Od lat 50. istnieje wiele interpretacji, jak test Turinga powinien być przeprowadzony w praktyce. Prawdopodobnie istnieje ogólne porozumienie, że test Turinga nie został jeszcze przejęty w filozoficznym sensie, że nie ma systemu sztucznej inteligencji, który myśli jak człowiek. Jednak stało się to bardzo wąskim tematem. Większość ludzi nie buduje systemów, aby przejść test Turinga – chcemy, aby osiągały one określone cele.
Dla niektórych z tych zadań, na przykład rozpoznawania mowy lub zrozumienia języka naturalnego, wyniki człowieka mogą być słusznie uważane za standard złoty. Jednakże, istnieją również wiele innych zadań, w których oczekujemy, że system automatyczny będzie działał znacznie lepiej niż ludzie, lub w których system automatyczny i ekspert ludzki muszą współpracować, aby osiągnąć najlepszy wynik. Na przykład, w kontekście edukacyjnym, nie chcemy, aby system sztucznej inteligencji zastąpił nauczyciela: chcemy, aby pomagał nauczycielom, czy to przez identyfikację wzorców w trajektoriach uczenia się uczniów, pomoc w ocenianiu czy znalezieniu najlepszych materiałów dydaktycznych.
Czy jest coś jeszcze, co chciałabyś podzielić się na temat ETS lub NLP?
Wiele osób kojarzy ETS z ocenami i systemami automatycznego oceniania. Ale robimy o wiele więcej. Mamy wiele możliwości, od biometrii głosowej do aplikacji dialogowych, i zawsze szukamy nowych sposobów, aby integrować technologię z edukacją. Teraz, gdy wielu uczniów uczy się w domu, otworzyliśmy wiele naszych możliwości badawczych dla ogółu.
Dziękuję za wywiad i za zaoferowanie tego spojrzenia na najnowsze postępy w dziedzinie NLP i rozpoznawania mowy. Każdy, kto chce dowiedzieć się więcej, może odwiedzić Educational Testing Services.












