Modely a platformy AI
Generování parafrází pomocí hlubokého učení s posilováním – Thought Leaders
Když píšeme nebo mluvíme, všichni jsme se někdy ptali, zda existuje lepší způsob, jak sdělit náš nápad ostatním. Jaká slova bychom měli použít? Jak bychom měli strukturovat myšlenku? Jak pravděpodobně ostatní budou reagovat? V Phrasee trávíme spoustu času přemýšlením o jazyce – co funguje a co nefunguje.
Představte si, že píšete předmět emailové kampaně, která bude odeslána 10 milionům lidí ve vašem seznamu a bude propagovat 20% slevu na nový laptop.
Kterou řádku byste zvolili:
- Můžete nyní získat dalších 20% slevu na svou příští objednávku
- Připravte se – další 20% slevy
Ačkoli obě možnosti sdělují stejné informace, jedna z nich dosáhla téměř o 15% vyšší otevírací rychlosti než druhá (a vsadím se, že nemůžete porazit náš model při předpovídání, která z nich to je ?). Zatímco jazyk lze často testovat pomocí A/B testování nebo vícehlavých banditů, automatické generování parafrází zůstává velmi náročným výzkumným problémem.
Dvě věty jsou považovány za parafráze navzájem, pokud sdílejí stejný význam a mohou být použity vzájemně nahraditelně. Další důležitou věcí, která je často brána jako samozřejmost, je, zda je věta generovaná strojem srozumitelná.
Na rozdíl od dohledovaného učení se agenti učení s posilováním učí interagující se svým prostředím a pozorováním odměn, které za tím účelem získají. Tento somewhat nuancovaný rozdíl má obrovské důsledky pro to, jak algoritmy fungují a jak jsou modely trénovány. Hluboké učení s posilováním používá neuronové sítě jako aproximátor funkce, aby umožnil agentovi naučit se, jak překonat lidi v komplexních prostředích, jako je Go, Atari a StarCraft II.
Přes tento úspěch nebylo učení s posilováním široce aplikováno na reálné problémy, včetně zpracování přirozeného jazyka (NLP).
Jako součást mé magisterské práce v oboru Data Science, jsme prokázali, jak hluboké učení s posilováním může být použito k překonání dohledovaných metod při automatickém generování parafrází vstupního textu. Problém generování nejlepší parafráze lze považovat za nalezení série slov, která maximalizuje sémantickou podobnost mezi větami a současně zachovává srozumitelnost výstupu. Agenti učení s posilováním jsou dobře přizpůsobeni pro nalezení nejlepší sady akcí, aby dosáhli maximální očekávané odměny v řídicích prostředích.
Na rozdíl s většinou problémů v strojovém učení, největší problém v meisten aplikacích generování přirozeného jazyka (NLG) neleží v modelování, ale spíše v hodnocení. Zatímco hodnocení člověkem je v současné době považováno za zlatý standard v hodnocení NLG, trpí významnými nevýhodami, včetně toho, že je drahé, časově náročné, obtížné naladit a chybí reprodukovatelnost napříč experimenty a datovými sadami (Han, 2016). Jako výsledek, výzkumníci již dlouho hledají automatické metriky, které jsou jednoduché, obecně použitelné a které odrážejí lidské úsudky (Papineni et al., 2002).
Nejběžnější automatické metody hodnocení v hodnocení automaticky generovaných popisků obrázků jsou shrnuty níže s jejich výhodami a nevýhodami:

Generování parafrází pomocí učení s posilováním – Potrubí
Vyvinuli jsme systém nazvaný ParaPhrasee, který generuje vysoce kvalitní parafráze. Systém se skládá z několika kroků, aby se aplikovalo učení s posilováním způsobem, který je výpočetně efektivní. Stručné shrnutí vysoké úrovně potrubí je uveden níže s více podrobnostmi obsaženými v práci.

Dataset
Existuje několik datasetů parafrází, které jsou používány ve výzkumu, včetně: Microsoft Paraphrase korpus (MSFT ), ACL’s Semantic Text Similarity soutěž, Quora Duplicate Questions a Twitter Shared Links. Vybrali jsme MS-COCO kvůli jeho velikosti, čistotě a použití jako benchmarku pro dva pozoruhodné papíry o generování parafrází. MS-COCO obsahuje 120k obrázků běžných scén s 5 popisky obrázků pro každý obrázek poskytnutých 5 různými lidskými anotátory.
Zatímco je primárně navržen pro výzkum počítačového vidění, popisky tendují mít vysokou sémantickou podobnost a jsou zajímavé parafráze. Díky tomu, že popisky jsou poskytovány různými lidmi, tendují mít malé variace v detailech scény, a proto generované věty tendují halucinovat detaily.

Dohlížený model
Zatímco učení s posilováním se zlepšilo výrazně v terms of vzorkové efektivity, trénovací časy a celkovém nejlepších postupů, trénování modelů RL od začátku je stále relativně velmi pomalé a nestabilní (Arulkumaran et al., 2017). Protože, místo aby trénovali od začátku, nejdříve trénujeme dohlížený model a poté jej jemně ladíme pomocí RL.
Používáme Encoder-Decoder modelový rámec a vyhodnocujeme výkon několika základních dohlížených modelů. Když jemně ladíme model pomocí RL, pouze jemně ladíme dekodérskou síť a považujeme encoder síť za statickou. Jako takový, zvažujeme dva hlavní rámce:
- Trénování dohlíženého modelu od začátku pomocí standardního/vanilového encoder-decoderu s GRUs
- Používání předtrénovaných sentence embedding modelů pro encoder, včetně: pooled word embeddings (GloVe), InferSent a BERT
Dohlížené modely tendují mít poměrně podobný výkon napříč modely, s BERT a vanilovým encoder-decoderem dosahujícím nejlepšího výkonu.

Zatímco výkon tenduje být rozumný, existují tři běžné zdroje chyb: koktání, generování větných fragmentů a halucinace. Tyto jsou hlavní problémy, které použití RL snaží vyřešit.

Model učení s posilováním
Implementace algoritmů RL je velmi náročná, zejména když nevíte, zda lze problém vyřešit. Může existovat problém v implementaci vašeho prostředí, vašich agentů, vašich hyperparametrů, vaší odměňovací funkce nebo kombinace všech výše uvedených! Tyto problémy jsou zhoršeny, když děláte hluboké RL, protože máte navíc složitost ladění neuronových sítí.
Stejně jako u všech ladění, je crucial začít jednoduše. Implementovali jsme variace dvou dobře pochopitelných toy RL prostředí (CartPole a FrozenLake), aby otestovali RL algoritmy a našli opakující se strategii pro přenos znalostí ze supervizovaného modelu.
Našli jsme, že použití Actor-Critic algoritmu překonalo REINFORCE v těchto prostředích. Při přenosu znalostí do actor-critic modelu, jsme našli, že inicializace actorových váh se supervizovaným modelem a předtrénování kritika dosáhlo nejlepšího výkonu. Našli jsme to obtížné generalizovat sofistikované policy distillation přístupy do nových prostředí, protože zavedly mnoho nových hyperparametrů, které vyžadují ladění, aby fungovaly.
Podporováno těmito poznatky, jsme se poté obrátili na vývoj přístupu pro úlohu generování parafrází. Nejdříve musíme vytvořit prostředí.

Prostředí nám umožňuje snadno testovat dopad použití různých hodnocení metrik jako odměňovacích funkcí.
Pak definujeme agenta, díky mnoha výhodám, používáme actor-critic architekturu. Actor je použit k výběru dalšího slova v sekvenci a má své váhy inicializovány pomocí supervizovaného modelu. Kritik poskytuje odhad očekávané odměny, kterou stav pravděpodobně obdrží, aby pomohl actorovi naučit se.
Navrhování správné odměňovací funkce
Nejdůležitější součástí návrhu RL systému je odměňovací funkce, protože to je to, co se RL agent snaží optimalizovat. Pokud je odměňovací funkce nesprávná, výsledky budou trpět, i když každá jiná část systému funguje!
Klasickým příkladem je CoastRunners, kde výzkumníci z OpenAI nastavili odměňovací funkci jako maximální skóre, místo aby vyhráli závod. Výsledkem je, že agent objevil smyčku, ve které mohl získat nejvyšší skóre, aniž by dokončil závod.
https://www.youtube.com/watch?time_continue=2&v=tlOIHko8ySg&feature=emb_title
Pokud hodnocení kvality parafrází je samo o sobě nevyřešeným problémem, návrh odměňovací funkce, která automaticky zachycuje tento cíl, je ještě obtížnější. Většina aspektů jazyka se nedá rozložit pěkně do lineárních metrik a jsou závislé na úkolu (Novikova et al., 2017).
RL agent často objevuje zajímavou strategii, aby maximalizoval odměny, která využívá slabiny v hodnocení metrice, místo aby generoval vysoce kvalitní text. To tenduje k výsledkům, které jsou špatné na metrikách, které agent přímo neoptimalizuje.
Zvažujeme tři hlavní přístupy:
- Metriky překrytí slov
Běžné NLP hodnocení metriky zvažují poměr překrytí slov mezi generovanou parafrází a hodnocení větou. Čím větší je překrytí, tím větší je odměna. Výzvou s word-level přístupy je, že agent zahrnuje příliš mnoho spojovacích slov, jako je “a je na z” a není zde žádná míra srozumitelnosti. To vede k velmi nízkokvalitním parafrázím.

- Metriky podobnosti a srozumitelnosti na úrovni vět
Hlavní vlastnosti generované parafráze jsou, že musí být srozumitelná a sémanticky podobná vstupní větě. Proto se snažíme explicitně ohodnotit tyto jednotlivě a poté kombinovat metriky. Pro sémantickou podobnost, používáme kosinovou podobnost mezi sentence embeddingy z předtrénovaných modelů, včetně BERT. Pro srozumitelnost, používáme skóre založené na perplexitě věty z GPT-2. Čím větší je kosinová podobnost a srozumitelnost skóre, tím větší je odměna.
Zkoušeli jsme mnoho různých kombinací sentence embedding modelů a srozumitelnost modelů a zatímco výkon byl rozumný, hlavní problém, se kterým se agent setkal, nebyl dostatečně vyvážený sémantickou podobností s srozumitelností. Pro většinu konfigurací, agent priorizoval srozumitelnost, což vedlo k odstranění detailů a většina entit byla umístěna “uprostřed” něčeho nebo byla přesunuta “na stůl” nebo “na stranu silnice”.
Multi-objective učení s posilováním je otevřenou výzkumnou otázkou a je velmi náročné v tomto případě.

- Použití adversářského modelu jako odměňovací funkce
Díky tomu, že lidé jsou považováni za zlatý standard v hodnocení, trénujeme samostatný model nazvaný diskriminátor, aby předpověděl, zda dvě věty jsou parafrázemi navzájem (podobně jako by to hodnotil člověk). Cílem RL modelu je pak přesvědčit tento model, že generovaná věta je parafrází vstupní věty. Diskriminátor generuje skóre, jak pravděpodobně jsou dvě věty parafrázemi navzájem, které se používá jako odměna pro trénování agenta.
Každých 5,000 pokusů, diskriminátor je informován, která parafráze pochází z datasetu a která byla generována, aby mohl vylepšit své budoucí pokusy. Proces pokračuje po několik kol, kdy se agent snaží oklamat diskriminátor a diskriminátor se snaží rozlišit mezi generovanými parafrázemi a hodnoceními parafrázemi z datasetu.
Po několika kolech trénování, agent generuje parafráze, které překonávají supervizované modely a ostatní odměňovací funkce.

Závěr a omezení
Adversářské přístupy (včetně self-play pro hry) poskytují velmi slibný přístup pro trénování RL algoritmů, aby překonaly lidskou úroveň výkonu na určitých úkolech bez definování explicitní odměňovací funkce.
Zatímco RL bylo schopno překonat dohledované učení v tomto případě, množství extra režie v terms of kódu, výpočtu a složitosti není stojí za výkonový zisk pro většinu aplikací. RL je nejlépe ponechán situacím, kde dohledované učení nemůže být snadno aplikováno a odměňovací funkce je snadno definovatelná (jako Atari hry). Přístupy a algoritmy jsou mnohem zralejší v dohledovaném učení a signál chyby je mnohem silnější, což vede k rychlejšímu a stabilnějšímu trénování.
Jinou úvahou je, jako u jiných neuronových přístupů, že agent může selhat velmi dramaticky v případech, kde vstup je jiný než vstupy, které dříve viděl, vyžadující další vrstvu sanity checků pro produkční aplikace.
Exploze zájmu o RL přístupy a pokroky v komputační infrastruktuře v posledních letech odemknou obrovské příležitosti pro aplikaci RL v průmyslu, zejména v rámci NLP.












