AI-modeller och plattformar
Paraphrasgenerering med hjÃĪlp av djup fÃķrstÃĪrkt inlÃĪrning – Tankeledare

NÃĪr vi skriver eller talar har vi alla undrat om det finns ett bÃĪttre sÃĪtt att kommunicera en idÃĐ till andra. Vilka ord ska jag anvÃĪnda? Hur ska jag strukturera tanken? Hur kommer de att svara? PÃĨ Phrasee tillbringar vi mycket tid med att tÃĪnka pÃĨ sprÃĨk â vad som fungerar och vad som inte fungerar.
FÃķrestÃĪll dig att du skriver ÃĪmnesraden fÃķr en e-postkampanj som ska skickas till 10 miljoner personer i din lista och som frÃĪmjar 20 % rabatt pÃĨ en ny laptop.
Vilken rad skulle du vÃĪlja:
- Du kan nu fÃĨ 20 % rabatt pÃĨ din nÃĪsta bestÃĪllning
- VÃĪnta â 20 % rabatt
Medan de fÃķrmedlar samma information, uppnÃĨdde en av dem en Ãķppningsfrekvens som var nÃĪstan 15 % hÃķgre ÃĪn den andra (och jag tror att du inte kan slÃĨ vÃĨr modell pÃĨ att fÃķrutsÃĪga vilken som ÃĪr den bÃĪsta ?). Medan sprÃĨk ofta kan testas genom A/B-testning eller multi-armed bandits, kvarstÃĨr automatisk generering av parafraser som ett mycket svÃĨrt forskningsproblem.
TvÃĨ meningar anses vara parafraser av varandra om de har samma betydelse och kan anvÃĪndas utbytbart. En annan viktig sak som ofta tas fÃķr givet ÃĪr om en maskingenererad mening ÃĪr flytande.
Till skillnad frÃĨn Ãķvervakad inlÃĪrning lÃĪr sig fÃķrstÃĪrkt inlÃĪrning (RL) genom att interagera med sin miljÃķ och observera de belÃķningar de fÃĨr som ett resultat. Denna nÃĨgot nyanserade skillnad har enorma implikationer fÃķr hur algoritmerna fungerar och hur modellerna trÃĪnas. Djup fÃķrstÃĪrkt inlÃĪrning anvÃĪnder neurala nÃĪtverk som en approximator fÃķr att lÃĨta agenten lÃĪra sig att ÃķvertrÃĪffa mÃĪnniskor i komplexa miljÃķer som Go, Atari och StarCraft II.
Trots denna framgÃĨng har fÃķrstÃĪrkt inlÃĪrning inte tillÃĪmpats pÃĨ riktiga problem, inklusive naturligt sprÃĨkbehandling (NLP).
Som en del av min masteruppsats i datavetenskap visar vi hur djup RL kan anvÃĪndas fÃķr att ÃķvertrÃĪffa Ãķvervakad inlÃĪrning vid automatisk generering av parafraser av indata. Problemet med att generera den bÃĪsta parafrasen kan ses som att hitta den serie av ord som maximalt Ãķkar den semantiska likheten mellan meningar samtidigt som den upprÃĪtthÃĨller flytande utdata. RL-agenter ÃĪr vÃĪl lÃĪmpade fÃķr att hitta den bÃĪsta uppsÃĪttningen ÃĨtgÃĪrder fÃķr att uppnÃĨ den maximala fÃķrvÃĪntade belÃķningen i kontrollmiljÃķer.
Till skillnad frÃĨn de flesta problemen i maskinlÃĪrning ligger det stÃķrsta problemet i de flesta naturliga sprÃĨkgenereringsapplikationer (NLG) inte i modelleringen utan snarare i utvÃĪrderingen. Medan mÃĪnsklig utvÃĪrdering fÃķr nÃĪrvarande anses vara den gyllene standarden i NLG-utvÃĪrdering, lider den av betydande nackdelar, inklusive att den ÃĪr dyr, tidskrÃĪvande, svÃĨr att justera och saknar reproducerbarhet Ãķver experiment och datamÃĪngder (Han, 2016). Som ett resultat har forskare lÃĪnge sÃķkt efter automatiska mÃĨtt som ÃĪr enkla, allmÃĪngiltiga och som ÃĨterspeglar mÃĪnskliga bedÃķmningar (Papineni et al., 2002).
De vanligaste automatiska utvÃĪrderingsmetoderna fÃķr att utvÃĪrdera maskingenererade bildtexter sammanfattas nedan med deras fÃķr- och nackdelar:

Paraphrasgenerering med fÃķrstÃĪrkt inlÃĪrning â pipeline
Vi utvecklade ett system som heter ParaPhrasee som genererar hÃķgkvalitativa parafraser. Systemet bestÃĨr av flera steg fÃķr att tillÃĪmpa fÃķrstÃĪrkt inlÃĪrning pÃĨ ett berÃĪkningsmÃĪssigt effektivt sÃĪtt. En kort sammanfattning av den hÃķgnivÃĨpipeline som visas nedan med mer information som finns i uppsatsen.

Dataset
Det finns flera parafrasdatauppsÃĪttningar tillgÃĪngliga som anvÃĪnds i forskning, inklusive Microsoft Paraphrase-korpus (MSFT ), ACL:s semantiska textlikhetstÃĪvling, Quora Duplicate Questions och Twitter Shared Links. Vi har valt MS-COCO med tanke pÃĨ dess storlek, renhet och anvÃĪndning som en benchmark fÃķr tvÃĨ noterbara parafrasgenereringsartiklar. MS-COCO innehÃĨller 120 000 bilder av vanliga scener med 5 bildtexter per bild som tillhandahÃĨlls av 5 olika mÃĪnskliga annotatorer.
Medan det frÃĪmst ÃĪr utformat fÃķr datorseende-forskning tenderar bildtexterna att ha hÃķg semantisk likhet och ÃĪr intressanta parafraser. Eftersom bildtexterna tillhandahÃĨlls av olika personer tenderar de att ha smÃĨ variationer i detaljer som tillhandahÃĨlls i scenen, varfÃķr de genererade meningarna tenderar att hallucinera detaljer.

Ãvervakad modell
Medan fÃķrstÃĪrkt inlÃĪrning har fÃķrbÃĪttrats avsevÃĪrt i termer av exempelverksamhet, trÃĪningsgÃĨnger och allmÃĪnna bÃĪsta metoder, ÃĪr utbildning av RL-modeller frÃĨn scratch fortfarande relativt lÃĨngsam och instabil (Arulkumaran et al., 2017). DÃĪrfÃķr, istÃĪllet fÃķr att utbilda frÃĨn scratch, utbildar vi fÃķrst en Ãķvervakad modell och finjusterar sedan den med RL.
Vi anvÃĪnder en Encoder-Decoder-modellram och utvÃĪrderar prestandan fÃķr flera baslinje-Ãķvervakade modeller. NÃĪr vi finjusterar modellen med RL finjusterar vi endast decoder-nÃĪtverket och behandlar encoder-nÃĪtverket som statiskt. Som sÃĨdan ÃķvervÃĪger vi tvÃĨ huvudsakliga ramverk:
- Utbildning av den Ãķvervakade modellen frÃĨn scratch med en standard/vanlig encoder-decoder med GRU:er
- AnvÃĪndning av fÃķrutbildade meningsinbÃĪddningsmodeller fÃķr encoder, inklusive: poolade ordinbÃĪddningar (GloVe), InferSent och BERT
De Ãķvervakade modellerna tenderar att prestera ganska lika Ãķver modeller, med BERT och den vanliga encoder-decoder som uppnÃĨr den bÃĪsta prestandan.

Medan prestandan tenderar att vara rimlig, finns det tre vanliga kÃĪllor till fel: stuttering, generering av meningsfragment och hallucinationer. Dessa ÃĪr de primÃĪra problemen som anvÃĪndning av RL syftar till att lÃķsa.

FÃķrstÃĪrkt inlÃĪrningsmodell
Att implementera RL-algoritmer ÃĪr mycket utmanande, sÃĪrskilt nÃĪr du inte vet om problemet kan lÃķsas. Det kan finnas problem i implementeringen av din miljÃķ, dina agenter, dina hyperparametrar, din belÃķningsfunktion eller en kombination av alla ovanstÃĨende! Dessa problem fÃķrvÃĪrras nÃĪr du gÃķr djup RL, eftersom du fÃĨr den extra komplexiteten att felsÃķka neurala nÃĪtverk.
Som med all felsÃķkning ÃĪr det avgÃķrande att bÃķrja enkelt. Vi implementerade variationer av tvÃĨ vÃĪl fÃķrstÃĨdda leksaks-RL-miljÃķer (CartPole och FrozenLake) fÃķr att testa RL-algoritmer och hitta en upprepad strategi fÃķr att ÃķverfÃķra kunskap frÃĨn den Ãķvervakade modellen.
Vi fann att anvÃĪndning av en Actor-Critic-algoritm presterade bÃĪttre ÃĪn REINFORCE i dessa miljÃķer. NÃĪr det gÃĪller att ÃķverfÃķra kunskap till Actor-Critic-modellen fann vi att initiering av aktÃķrens vikter med den trÃĪnade Ãķvervakade modellen och fÃķrtrÃĪning av kritikern uppnÃĨdde den bÃĪsta prestandan. Vi fann det svÃĨrt att generalisera sofistikerad policydestilleringstillÃĪmpningar till nya miljÃķer, eftersom de introducerar mÃĨnga nya hyperparametrar som krÃĪver justering fÃķr att fungera.
Med stÃķd av dessa insikter vÃĪnde vi oss sedan till att utveckla en strategi fÃķr parafrasgenerering. Vi behÃķvde fÃķrst skapa en miljÃķ.

MiljÃķn gÃķr det mÃķjligt fÃķr oss att enkelt testa effekten av att anvÃĪnda olika utvÃĪrderingsmÃĨtt som belÃķningsfunktioner.
Sedan definierar vi agenten, med tanke pÃĨ dess mÃĨnga fÃķrdelar, anvÃĪnder vi en Actor-Critic-arkitektur. AktÃķren anvÃĪnds fÃķr att vÃĪlja nÃĪsta ord i sekvensen och har sina vikter initierade med den Ãķvervakade modellen. Kritikern tillhandahÃĨller en uppskattning av den fÃķrvÃĪntade belÃķningen som en tillstÃĨnd troligen kommer att ta emot fÃķr att hjÃĪlpa aktÃķren att lÃĪra sig.
Designa rÃĪtt belÃķningsfunktion
Den viktigaste komponenten i designen av ett RL-system ÃĪr belÃķningsfunktionen, eftersom detta ÃĪr vad RL-agenten fÃķrsÃķker optimera. Om belÃķningsfunktionen ÃĪr felaktig, kommer resultaten att lida, ÃĪven om alla andra delar av systemet fungerar!
Ett klassiskt exempel pÃĨ detta ÃĪr CoastRunners, dÃĪr OpenAI-forskarna satte belÃķningsfunktionen till att maximera den totala poÃĪngen snarare ÃĪn att vinna loppet. Resultatet av detta var att agenten upptÃĪckte en loop dÃĪr den kunde fÃĨ den hÃķgsta poÃĪngen genom att trÃĪffa turbos utan att nÃĨgonsin slutfÃķra loppet.
https://www.youtube.com/watch?time_continue=2&v=tlOIHko8ySg&feature=emb_title
Med tanke pÃĨ att utvÃĪrdering av parafrasers kvalitet i sig ÃĪr ett olÃķst problem, ÃĪr det ÃĪnnu svÃĨrare att designa en belÃķningsfunktion som automatiskt fÃĨngar detta mÃĨl. De flesta aspekter av sprÃĨk kan inte brytas ned i linjÃĪra mÃĨtt och ÃĪr beroende av uppgiften (Novikova et al., 2017).
RL-agenten upptÃĪcker ofta en intressant strategi fÃķr att maximera belÃķningar som utnyttjar svagheterna i utvÃĪrderingsmÃĨttet snarare ÃĪn att generera hÃķgkvalitativ text. Detta tenderar att resultera i dÃĨlig prestanda pÃĨ mÃĨtt som agenten inte direkt optimerar.
Vi ÃķvervÃĪger tre huvudsakliga tillvÃĪgagÃĨngssÃĪtt:
- Ord-ÃķverlappningsmÃĨtt
Vanliga NLP-utvÃĪrderingsmÃĨtt ÃķvervÃĪger andelen ordÃķverlappning mellan den genererade parafrasen och utvÃĪrderingsmeningen. Ju stÃķrre Ãķverlapp, desto stÃķrre belÃķning. Utmaningen med ordnivÃĨtillvÃĪgagÃĨngssÃĪtt ÃĪr att agenten inkluderar fÃķr mÃĨnga kopplingsord som âen ÃĪr pÃĨ avâ och det finns inget mÃĨtt pÃĨ flytande. Detta resulterar i mycket lÃĨgkvalitativa parafraser.

- MeningsnivÃĨlikhet och flytande mÃĨtt
De viktigaste egenskaperna hos en genererad parafras ÃĪr att den mÃĨste vara flytande och semantiskt lik den ingÃĨende meningen. DÃĪrfÃķr fÃķrsÃķker vi explicit poÃĪngsÃĪtta dessa individuellt och kombinera mÃĨtten. FÃķr semantisk likhet anvÃĪnder vi kosinuslikheten mellan meningsinbÃĪddningar frÃĨn fÃķrutbildade modeller, inklusive BERT. FÃķr flytande anvÃĪnder vi en poÃĪng baserad pÃĨ meningsperplexitet frÃĨn GPT-2. Ju stÃķrre kosinuslikhet och flytande poÃĪng, desto stÃķrre belÃķning.
Vi fÃķrsÃķkte mÃĨnga olika kombinationer av meningsinbÃĪddningsmodeller och flytandemodeller, och medan prestandan var rimlig, var det primÃĪra problemet som agenten stod infÃķr att den inte tillrÃĪckligt balanserade semantisk likhet med flytande. FÃķr de flesta konfigurationer prioriterade agenten flytande, vilket resulterade i att detaljer togs bort och de flesta entiteter placerades âi mittenâ av nÃĨgot eller flyttades âpÃĨ ett bordâ eller âvid sidan av vÃĪgenâ.
MultiobjektsfÃķrstÃĪrkt inlÃĪrning ÃĪr en Ãķppen forskningsfrÃĨga och ÃĪr mycket utmanande i detta fall.

- AnvÃĪndning av en antagonistisk modell som belÃķningsfunktion
Med tanke pÃĨ att mÃĪnniskor anses vara den gyllene standarden i utvÃĪrdering, trÃĪnar vi en separat modell som kallas diskriminanten fÃķr att fÃķrutsÃĪga om tvÃĨ meningar ÃĪr parafraser av varandra (pÃĨ samma sÃĪtt som en mÃĪnniska skulle utvÃĪrdera). MÃĨlet fÃķr RL-modellen ÃĪr sedan att Ãķvertyga denna modell om att den genererade meningen ÃĪr en parafras av ingÃĨngsmeningen. Diskriminanten genererar en poÃĪng fÃķr hur sannolikt det ÃĪr att de tvÃĨ meningarna ÃĪr parafraser av varandra, som anvÃĪnds som belÃķning fÃķr att trÃĪna agenten.
Vart och ett av 5 000 gissningar berÃĪttar diskriminanten vilken parafras som kom frÃĨn datauppsÃĪttningen och vilken som genererades, sÃĨ att den kan fÃķrbÃĪttra sina framtida gissningar. Processen fortsÃĪtter under flera omgÃĨngar, med agenten som fÃķrsÃķker lura diskriminanten och diskriminanten som fÃķrsÃķker differentiera mellan de genererade parafraserna och utvÃĪrderingsparafraserna frÃĨn datauppsÃĪttningen.
Efter flera omgÃĨngar av trÃĪning genererar agenten parafraser som ÃķvertrÃĪffar de Ãķvervakade modellerna och andra belÃķningsfunktioner.

Slutsats och begrÃĪnsningar
Antagonistiska tillvÃĪgagÃĨngssÃĪtt (inklusive sjÃĪlvspel fÃķr spel) erbjuder ett extremt lovande tillvÃĪgagÃĨngssÃĪtt fÃķr att trÃĪna RL-algoritmer fÃķr att ÃķvertrÃĪffa mÃĪnsklig nivÃĨ pÃĨ vissa uppgifter utan att definiera en explicit belÃķningsfunktion.
Medan RL kunde ÃķvertrÃĪffa Ãķvervakad inlÃĪrning i detta fall, ÃĪr den extra Ãķverhuvudtagandet i termer av kod, berÃĪkning och komplexitet inte vÃĪrt prestandavinster fÃķr de flesta tillÃĪmpningar. RL ÃĪr bÃĪst lÃĪmpat fÃķr situationer dÃĪr Ãķvervakad inlÃĪrning inte kan tillÃĪmpas lÃĪtt och en belÃķningsfunktion ÃĪr lÃĪtt att definiera (sÃĨsom Atari-spel). TillvÃĪgagÃĨngssÃĪtten och algoritmerna ÃĪr lÃĨngt mer mogna i Ãķvervakad inlÃĪrning och fel signalen ÃĪr mycket starkare, vilket resulterar i mycket snabbare och stabilare trÃĪning.
En annan ÃķvervÃĪgning ÃĪr, som med andra neurala tillvÃĪgagÃĨngssÃĪtt, att agenten kan misslyckas mycket dramatiskt i fall dÃĪr indata ÃĪr annorlunda ÃĪn de indata den tidigare har sett, vilket krÃĪver ett extra lager av sanity checks fÃķr produktionsapplikationer.
Explosionen av intresse fÃķr RL-tillvÃĪgagÃĨngssÃĪtt och framsteg inom berÃĪkningsinfrastruktur under de senaste ÃĨren kommer att lÃĨsa upp enorma mÃķjligheter fÃķr att tillÃĪmpa RL inom industrin, sÃĪrskilt inom NLP.












