Modele i platformy AI

Generowanie Parafraz z Użyciem Głębokiego Uczenia ze Wzmocnieniem – Liderzy Myśli

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Kiedy piszemy lub rozmawiamy, wszyscy kiedyś zastanawialiśmy się, czy jest lepszy sposób przekazania idei innym. Jakie słowa powinniśmy użyć? Jak powinniśmy zbudować myśl? Jak oni prawdopodobnie zareagują? W Phrasee spędzamy dużo czasu na myśleniu o języku – co działa, a co nie.

Wyobraź sobie, że piszesz temat wiadomości e-mail, która trafi do 10 milionów ludzi na Twojej liście, promując 20% zniżki na nowy, elegancki laptop.

Jaki temat wybrałbyś:

  • Masz możliwość uzyskania dodatkowej 20% zniżki na Twoje następne zamówienie
  • Priorytet – dodatkowa 20% zniżki

Chociaż przekazują te same informacje, jeden z nich osiągnął prawie 15% wyższy wskaźnik otwieralności niż drugi (i zakładam, że nie możesz pokonać naszego modelu w przewidywaniu, który z nich jest lepszy ?). Chociaż język można często testować za pomocą testów A/B lub multi-armed bandits, automatyczne generowanie parafraz pozostaje bardzo trudnym problemem badawczym.

Dwie zdania są uważane za parafrazy, jeśli mają ten sam sens i mogą być używane zamiennie. Inną ważną rzeczą, która jest często przyjmowana za pewnik, jest to, czy zdanie wygenerowane przez maszynę jest płynne.

W przeciwieństwie do uczenia nadzorowanego, agenci RL uczą się poprzez interakcje ze swoim środowiskiem i obserwowanie nagród, które otrzymują w wyniku. Ta nieco subtelna różnica ma ogromne implikacje dla tego, jak algorytmy działają i jak modele są szkolone. Głębokie Uczenie ze Wzmocnieniem wykorzystuje sieci neuronowe jako przybliżenie funkcji, aby pozwolić agentowi nauczyć się, jak przewyższyć ludzi w złożonych środowiskach, takich jak Go, Atari i StarCraft II.

Pomimo tego sukcesu, uczenie ze wzmocnieniem nie zostało jeszcze szeroko zastosowane w rzeczywistych problemach, w tym w Przetwarzaniu Języka Naturalnego (NLP).

W ramach mojej pracy magisterskiej z dziedziny nauki o danych wykazaliśmy, jak głębokie RL można wykorzystać do przewyższenia metod uczenia nadzorowanego w automatycznym generowaniu parafraz wejściowego tekstu. Problem generowania najlepszej parafrazy można uznać za znalezienie serii słów, które maksymalizują podobieństwo semantyczne między zdaniem a zachowaniem płynności w danych wyjściowych. Agenci RL są dobrze przystosowani do znalezienia najlepszego zestawu działań w celu osiągnięcia maksymalnej oczekiwanej nagrody w środowiskach kontrolnych.

W przeciwieństwie do większości problemów w uczeniu maszynowym, największy problem w większości aplikacji generowania języka naturalnego (NLG) nie leży w modelowaniu, ale raczej w ocenie. Podczas gdy ocena ludzka jest obecnie uważana za standard złoty w ocenie NLG, cierpi na znaczne wady, w tym jest droga, czasochłonna, trudna do dostrojenia i brakuje jej powtarzalności w doświadczeniach i zbiorach danych (Han, 2016). W związku z tym naukowcy od dawna szukają automatycznych miar, które są proste, ogólnoustne i odzwierciedlają osąd ludzki (Papineni et al., 2002).

Najczęstsze automatyczne metody oceny w ocenianiu wygenerowanych podpisów obrazów są podsumowane poniżej wraz z ich zaletami i wadami:

Generowanie Parafraz z Użyciem Uczenia ze Wzmocnieniem – Potok

Stworzyliśmy system o nazwie ParaPhrasee, który generuje parafrazy wysokiej jakości. System składa się z kilku kroków w celu zastosowania uczenia ze wzmocnieniem w sposób komputacyjnie wydajny. Krótkie podsumowanie potoku jest przedstawione poniżej, a więcej szczegółów można znaleźć w pracy magisterskiej.

Zestaw Danych

Istnieje kilka zestawów danych parafraz, które są używane w badaniach, w tym: Microsoft Paraphrase corpus (MSFT ), konkurs Semantic Text Similarity ACL, Quora Duplicate Questions i Twitter Shared Links. Wybraliśmy MS-COCO ze względu na jego rozmiar, czystość i użycie jako punkt odniesienia dla dwóch znaczących prac nad generowaniem parafraz. MS-COCO zawiera 120k obrazów scen codziennych z 5 podpisami obrazu na obraz, dostarczonymi przez 5 różnych ludzkich anotatorów.

Chociaż jest głównie zaprojektowany do badań nad widzeniem komputerowym, podpisy mają wysokie podobieństwo semantyczne i są interesującymi parafrazami. Ponieważ podpisów obrazu dostarczają różne osoby, tendencja jest taka, że wygenerowane zdania mają skłonność do halucynacji szczegółów.

Model Nadzorowany

Pomimo że uczenie ze wzmocnieniem znacznie poprawiło się pod względem wydajności próbek, czasów szkolenia i najlepszych praktyk, szkolenie modeli RL od podstaw jest nadal porównywalnie bardzo wolne i niestabilne (Arulkumaran et al., 2017). Dlatego zamiast szkolić od podstaw, najpierw szkolimy model nadzorowany, a następnie dostosowujemy go za pomocą RL.

Używamy ramy Encoder-Decoder i oceniamy wydajność kilku modeli nadzorowanych. Podczas dostosowywania modelu za pomocą RL, dostosowujemy tylko sieć dekodera i traktujemy sieć encodera jako statyczną. Jako taki rozważamy dwie główne ramy:

  • Szkolenie modelu nadzorowanego od podstaw za pomocą standardowej ramy encodera-dekodera z GRU
  • Użycie wstępnie wytrenowanych modeli osadzania zdania dla encodera, w tym: zlanych osadzania słów (GloVe), InferSent i BERT

Modele nadzorowane tendencję do osiągania podobnych wyników w różnych modelach, przy czym BERT i ramy encodera-dekodera osiągają najlepsze wyniki.

Pomimo że wyniki tendencję do bycia rozsądnymi, istnieją trzy typowe źródła błędów: jąkanie, generowanie fragmentów zdania i halucynacje. Są to główne problemy, których rozwiązanie ma na celu zastosowanie RL.

Model Uczenia ze Wzmocnieniem

Wdrożenie algorytmów RL jest bardzo trudne, zwłaszcza gdy nie wiadomo, czy problem można rozwiązać. Mogą wystąpić problemy w implementacji Twojego środowiska, agentów, hiperparametrów, funkcji nagrody lub kombinacji wszystkich powyższych! Te problemy są nasilone, gdy wykonuje się głębokie RL, ponieważ masz do czynienia z dodatkową złożonością debugowania sieci neuronowych.

Podobnie jak w przypadku wszystkich debugowania, jest niezwykle ważne, aby zacząć od prostych rzeczy. Wdrożyliśmy warianty dwóch dobrze zrozumianych środowisk RL (CartPole i FrozenLake), aby przetestować algorytmy RL i znaleźć powtarzalną strategię przenoszenia wiedzy z modelu nadzorowanego.

Stwierdziliśmy, że używanie algorytmu Actor-Critic przewyższa REINFORCE w tych środowiskach. Pod względem przenoszenia wiedzy do modelu Actor-Critic, stwierdziliśmy, że inicjowanie wag aktora za pomocą wytrenowanego modelu nadzorowanego i wstępne szkolenie krytyka osiągnęło najlepsze wyniki. Stwierdziliśmy, że jest to trudne do uogólnienia sofistykowanych podejść do destylacji polityki do nowych środowisk, ponieważ wprowadzają one wiele nowych hiperparametrów, które wymagają dostrojenia, aby działać.

Wspierani przez te spostrzeżenia, następnie zwróciliśmy się ku opracowaniu podejścia do zadania generowania parafraz. Po pierwsze, musimy stworzyć środowisko.

Środowisko pozwala nam łatwo przetestować wpływ korzystania z różnych metryk oceny jako funkcji nagrody.

Następnie definiujemy agenta, biorąc pod uwagę jego wiele zalet, używamy architektury Actor-Critic. Aktor jest używany do wyboru następnego słowa w sekwencji i ma swoje wagi inicjowane przy użyciu modelu nadzorowanego. Krytyk zapewnia szacunkową nagrodę, którą stan prawdopodobnie otrzyma, aby pomóc aktorowi w nauce.

Projektowanie Właściwej Funkcji Nagrody

Najważniejszym składnikiem projektowania systemu RL jest funkcja nagrody, ponieważ jest to to, co agent RL próbuje zoptymalizować. Jeśli funkcja nagrody jest niepoprawna, wyniki będą cierpieć, nawet jeśli każdy inny część systemu działa!

Klasycznym przykładem jest CoastRunners, gdzie badacze OpenAI ustalili funkcję nagrody jako maksymalizację łącznego wyniku, a nie wygranie wyścigu. Wynikiem jest to, że agent odkrył pętlę, w której mógł uzyskać najwyższy wynik, uderzając w turbodoładowanie bez ukończenia wyścigu.

https://www.youtube.com/watch?time_continue=2&v=tlOIHko8ySg&feature=emb_title

Ponieważ ocena jakości parafraz jest sama w sobie nierozwiązanym problemem, projektowanie funkcji nagrody, która automatycznie ujmuje ten cel, jest jeszcze trudniejsze. Większość aspektów języka nie rozkłada się ładnie na liniowe metryki i są zależne od zadania (Novikova et al., 2017).

Agent RL często odkrywa interesującą strategię maksymalizacji nagród, która wykorzystuje słabości w metryce oceny, a nie generuje wysokiej jakości tekst. To tendencję do prowadzenia do słabej wydajności na metrykach, które agent nie bezpośrednio optymalizuje.

Rozważamy trzy główne podejścia:

  1. Metryki Nakładu Słów

Typowe metryki NLP oceny biorą pod uwagę udział nakładu słów między wygenerowaną parafrazą a zdaniem oceny. Im większy nakład, tym większa nagroda. Wyzwaniem w podejściach opartych na słowach jest to, że agent zawiera zbyt wiele słów łącznikowych, takich jak “a jest na z” i nie ma miary płynności. To prowadzi do bardzo niskiej jakości parafraz.

  1. Metryki Podobieństwa i Płynności na Poziomie Zdania

Główne właściwości wygenerowanej parafrazy są takie, że musi być płynna i semantycznie podobna do zdania wejściowego. Dlatego próbujemy jawnie ocenić je oddzielnie, a następnie połączyć metryki. Dla podobieństwa semantycznego używamy podobieństwa cosinusowego między osadzaniem zdań z wstępnie wytrenowanych modeli, w tym BERT. Dla płynności używamy oceny opartej na zaskoczeniu zdania z GPT-2. Im większe podobieństwo cosinusowe i ocena płynności, tym większa nagroda.

Próbowaliśmy wielu różnych kombinacji modeli osadzania zdań i modeli płynności, a chociaż wyniki były rozsądnymi, głównym problemem, z którym spotkał się agent, było niewystarczające zbalansowanie podobieństwa semantycznego z płynnością. Dla większości konfiguracji agent priorytetowo traktował płynność, co skutkowało usunięciem szczegółów i umieszczeniem większości encji “w środku” czegoś lub przeniesieniem ich “na stole” lub “obok drogi”.

Wielokryterialne uczenie ze wzmocnieniem jest otwartym pytaniem badawczym i jest bardzo trudne w tym przypadku.

  1. Użycie Modelu Przeciwnika jako Funkcji Nagrody

Ponieważ ludzie są uważani za standard złoty w ocenie, trenujemy oddzielny model o nazwie dyskryminator, aby przewidzieć, czy dwa zdania są parafrazami siebie nawzajem (podobnie jak ludzie byliby oceniali). Celem modelu RL jest teraz przekonanie tego modelu, że wygenerowane zdanie jest parafrazą wejściową. Dyskryminator generuje ocenę, jak prawdopodobne jest, że dwa zdania są parafrazami siebie nawzajem, która jest używana jako nagroda do szkolenia agenta.

Każde 5,000 prób dyskryminator jest informowany, która parafraza pochodzi z zestawu danych, a która została wygenerowana, aby mógł poprawić swoje przyszłe zgadywanie. Proces ten jest kontynuowany przez kilka rund, przy czym agent próbuje oszukać dyskryminatora, a dyskryminator próbuje różnicować między wygenerowanymi parafrazami a parafrazami oceny z zestawu danych.

Po kilku rundach szkolenia agent generuje parafrazy, które przewyższają modele nadzorowane i inne funkcje nagrody.

Wnioski i Ograniczenia

Podejścia przeciwnika (w tym samogry, dla gier) zapewniają niezwykle obiecujące podejście do szkolenia algorytmów RL w celu przewyższenia ludzkiej wydajności na pewnych zadaniach bez definiowania jawnego funkcji nagrody.

Pomimo że RL przewyższyło uczenie nadzorowane w tym przypadku, dodatkowy nakład w postaci kodu, obliczeń i złożoności nie jest wart wydajności dla większości aplikacji. RL jest najlepszy, gdy jest stosowany w sytuacjach, w których uczenie nadzorowane nie może być łatwo zastosowane, a funkcja nagrody jest łatwa do zdefiniowania (takich jak gry Atari). Podejścia i algorytmy są o wiele bardziej dojrzałe w uczeniu nadzorowanym, a sygnał błędu jest o wiele silniejszy, co skutkuje szybszym i bardziej stabilnym szkoleniem.

Innym rozważaniem jest to, że jak w przypadku innych podejść opartych na sieciach neuronowych, agent może dramatycznie zawieść w przypadkach, w których dane wejściowe są różne od tych, które widział wcześniej, co wymaga dodatkowej warstwy kontroli poprawności dla aplikacji produkcyjnych.

Eksplozja zainteresowania podejściami RL i postępy w infrastrukturze obliczeniowej w ciągu ostatnich kilku lat odblokują ogromne możliwości zastosowania RL w przemyśle, zwłaszcza w ramach NLP.

Andrew Gibbs-Bravo jest naukowcem danych w Phrasee skupionym na poprawie technologii za światowo wiodącym AI-Powered Copywritingiem Phrasee. Jest również współorganizatorem spotkania London Reinforcement Learning Community Meetup i jest zainteresowany wszystkim, co dotyczy RL, NLP i machine learning.