AI-modeller og platforme
Parfraseringsskabelon ved hjælp af dyb forstærket læring – Tankeledere
Når vi skriver eller taler, har vi alle undret os over, om der er en bedre måde at kommunikere en idé til andre. Hvilke ord skal jeg bruge? Hvordan skal jeg strukturere tanken? Hvordan vil de sandsynligvis reagere? Hos Phrasee bruger vi meget tid på at tænke over sprog – hvad der virker og hvad der ikke gør.
Forestil dig, at du skriver emnefeltet for en e-mail-kampagne, der vil gå til 10 millioner mennesker på din liste for at promovere 20% rabat på en ny laptop.
Hvilken linje ville du vælge:
- DU kan nu få yderligere 20% rabat på din næste ordre
- Vær parat – yderligere 20% rabat
Selvom de formidler den samme information, opnåede den en næsten 15% højere åbningsrate end den anden (og jeg vædder, du ikke kan slå vores model i at forudsige, hvilken af dem ?). Selvom sprog ofte kan testes gennem A/B-test eller multi-armed bandits, er automatisk generering af parfraser stadig et meget udfordrende forskningsspørgsmål.
To sætninger betragtes som parfraser af hinanden, hvis de deler den samme betydning og kan bruges som udskiftelige. En anden vigtig ting, der ofte tages for givet, er, om en maskin genereret sætning er flydende.
I modsætning til overvåget læring lærer forstærket læring-agenter gennem at interagere med deres omgivelser og observere de belønninger, de modtager som følge. Denne lidt nuancerede forskel har massive implikationer for, hvordan algoritmerne fungerer, og hvordan modellerne trænes. Dyb forstærket læring bruger neurale netværk som en funktionel approximator til at låse agenten til at lære, hvordan man overgår mennesker i komplekse miljøer såsom Go, Atari og StarCraft II.
Trods denne succes er forstærket læring ikke blevet bredt anvendt til virkelige problemer, herunder naturligt sprogbehandling (NLP).
Som en del af min MSc-afhandling i Datavidenskab demonstrerer vi, hvordan dyb forstærket læring kan bruges til at overgå overvåget læring-metoder i automatisk generering af parfraser af indputtekst. Problemet med at generere den bedste parfrase kan ses som at finde serien af ord, der maksimerer den semantiske lignende mellem sætninger, mens man opretholder flydende i output. Forstærket læring-agenter er godt egnede til at finde den bedste sæt af handlinger til at opnå den maksimale forventede belønning i kontrolmiljøer.
I modsætning til de fleste problemer i maskinlæring ligger det største problem i de fleste naturlige sproggenereringsapplikationer ikke i modelleringen, men i evalueringen. Mens menneskelig evaluering i øjeblikket anses for at være den guldstandard i NLG-evaluering, lider den under betydelige ulemper, herunder, at det er dyrt, tidskrævende, vanskeligt at justere og mangler reproducerbarhed på tværs af eksperimenter og datasæt (Han, 2016). Som følge heraf har forskere længe søgt efter automatiske metrikker, der er simple, generelle og som afspejler menneskelig dom (Papineni et al., 2002).
De mest almindelige automatiske evalueringssmetoder til vurdering af maskin genererede billedbeskrivelser er sammenfattet nedenfor med deres fordele og ulemper:

Parfraseringsskabelon ved hjælp af forstærket læring-rørledning
Vi udviklede et system kaldet ParaPhrasee, der genererer højkvalitetsparfraser. Systemet består af flere trin for at anvende forstærket læring på en komputationelt effektiv måde. En kort sammenfatning af den højtstående rørledning vises nedenfor med mere detaljer i afhandlingen.

Dataset
Der er flere parfrasedatasæt tilgængelige, der bruges i forskning, herunder: Microsoft Paraphrase-korpus (MSFT ), ACL’s semantiske tekstlighedskonkurrence, Quora Duplicate Spørgsmål og Twitter Shared Links. Vi har valgt MS-COCO på grund af dets størrelse, renhed og brug som en benchmark for to bemærkelsesværdige parfrasingspapirer. MS-COCO indeholder 120k billeder af almindelige scener med 5 billedbeskrivelser per billede leveret af 5 forskellige menneskelige annotatorer.
mens det primært er designet til computer vision-forskning, har billedbeskrivelserne tendens til at have høj semantisk lignende og er interessante parfraser. Givet, at billedbeskrivelserne er leveret af forskellige mennesker, har de tendens til at have små variationer i detaljer, der er givet i scenen, og derfor har de genererede sætninger tendens til at hallucinere detaljer.

Overvåget model
mens forstærket læring har forbedret sig betydeligt i terms of prøveeffektivitet, træningstider og generelle bedste praksis, er træning af forstærket læring-modeller fra scratch stadig relativt meget langsommere og ustabil (Arulkumaran et al., 2017). Derfor træner vi ikke fra scratch, men træner først en overvåget model og finjusterer derefter med forstærket læring.
Vi bruger en Encoder-Decoder-modelramme og vurderer præstationen af flere baseline-overvågede modeller. Når vi finjusterer modellen med forstærket læring, finjusterer vi kun decoder-netværket og behandler encoder-netværket som statisk. Som sådan overvejer vi to hovedrammer:
- Træning af den overvågede model fra scratch ved hjælp af en standard/vanilla encoder-decoder med GRUs
- Brug af forudtrænede sætningsembedding-modeller til encoderen, herunder: pooled word-embeddings (GloVe), InferSent og BERT
De overvågede modeller tenderer til at opføre sig ret ens på tværs af modeller, med BERT og den vanilla encoder-decoder, der opnår den bedste præstation.

mens præstationen tenderer til at være rimelig, er der tre almindelige kilder til fejl: stuttering, generering af sætningsfragmenter og hallucinationer. Disse er de primære problemer, som brug af forstærket læring søger at løse.

Forstærket læring-model
Implementering af forstærket læring-algoritmer er meget udfordrende, især når du ikke ved, om problemet kan løses. Der kan være problemer i implementeringen af din omgivelser, dine agenter, dine hyperparametre, din belønningsfunktion eller en kombination af alle ovenstående! Disse problemer forværres, når du laver dyb forstærket læring, da du får det sjove med den tilføjede kompleksitet af at fejlfinde neurale netværk.
Som med al fejlfinde er det afgørende at starte simpelt. Vi implementerede variationer af to velkendte legetøj-forstærket læring-miljøer (CartPole og FrozenLake) for at teste forstærket læring-algoritmer og finde en gentagen strategi for overføring af viden fra den overvågede model.
Vi fandt ud af, at brug af en Actor-Critic-algoritme overgik REINFORCE i disse miljøer. I terms of overføring af viden til Actor-Critic-modellen fandt vi, at initialisering af actor-weights med den trænede overvågede model og fortræning af kritikeren opnåede den bedste præstation. Vi fandt det udfordrende at generalisere sofistikerede politik-destillations-tilgange til nye miljøer, da de introducerer mange nye hyperparametre, der kræver justering for at fungere.
Med støtte fra disse indsighter vendte vi os derefter til udvikling af en tilgang til parfrasingsgenerering-opgaven. Vi behøver først at oprette en omgivelser.

Omgivelsen giver os mulighed for let at teste effekten af at bruge forskellige evalueringssmetrikker som belønningsfunktioner.
Derefter definerer vi agenten, og givet dets mange fordele bruger vi en Actor-Critic-arkitektur. Actor bruges til at vælge det næste ord i sekvensen og har sine vægte initialiseret med den overvågede model. Kritikeren giver en estimat af den forventede belønning, en tilstand sandsynligvis vil modtage, for at hjælpe actor med at lære.
Design af den rette belønningsfunktion
Den vigtigste komponent i design af et forstærket læring-system er belønningsfunktionen, da dette er, hvad forstærket læring-agenten forsøger at optimere. Hvis belønningsfunktionen er forkert, vil resultaterne lide, selv hvis alle andre dele af systemet fungerer!
Et klassisk eksempel på dette er CoastRunners, hvor OpenAI-forskerne satte belønningsfunktionen til at maksimere den samlede score i stedet for at vinde løbet. Resultatet af dette er, at agenten opdagede en løkke, hvor den kunne få den højeste score ved at ramme turbos uden nogensinde at fuldføre løbet.
https://www.youtube.com/watch?time_continue=2&v=tlOIHko8ySg&feature=emb_title
Givet, at evaluering af parfrasers kvalitet i sig selv er et uløst problem, er det endnu hårdere at designe en belønningsfunktion, der automatisk fanger dette formål. De fleste aspekter af sprog dekomponerer ikke pænt i lineære metrikker og er afhængige af opgaven (Novikova et al., 2017).
Forstærket læring-agenten opdager ofte en interessant strategi til at maksimere belønninger, der udnytter svaghederne i evalueringssmålingen i stedet for at generere højkvalitets tekst. Dette tenderer til at resultere i dårlig præstation på metrikker, som agenten ikke direkte optimerer.
Vi overvejer tre hovedtilgange:
- Ord-overlappsmetrikker
Almindelige NLP-evalueringssmetrikker overvejer proportionen af ord-overlapp mellem den genererede parfrase og evalueringssætningen. Jo større overlapp, desto større belønning. Udfordringen med ordniveau-tilgange er, at agenten inkluderer for mange forbinder-ord som “en er på af” og der er ingen måde at måle flydende på. Dette resulterer i meget lavkvalitetsparfraser.

- Sætningsniveau-lighed og flydighedsmetrikker
De primære egenskaber af en genereret parfrase er, at den skal være flydende og semantisk lignende input-sætningen. Derfor prøver vi at score disse individuelt og derefter kombinere metrikkerne. Til semantisk lignende bruger vi cosinus-lignende mellem sætningsembeddings fra forudtrænede modeller, herunder BERT. Til flydighed bruger vi en score baseret på sætningens forvirring fra GPT-2. Jo større cosinus-lignende og flydighedsscore, desto større belønning.
Vi prøvede mange forskellige kombinationer af sætningsembedding-modeller og flydighedsmodeller, og mens præstationen var rimelig, var det primære problem, agenten stod overfor, ikke at balancere semantisk lignende nok med flydighed. For de fleste konfigurationer prioriterede agenten flydighed, hvilket resulterede i fjernelse af detaljer og de fleste enheder blev placeret “i midten” af noget eller blev flyttet “på en bord” eller “side af vejen”.
Multi-objekt-forstærket læring er et åbent forskningsspørgsmål og er meget udfordrende i dette tilfælde.

- Brug af en modstander-model som belønningsfunktion
Givet, at mennesker anses for at være den guldstandard i evaluering, træner vi en separat model kaldet diskriminatoren til at forudsige, om to sætninger er parfraser af hinanden (ligesom en menneskelig evaluering). Målet for forstærket læring-modellen er derefter at overbevise denne model om, at den genererede sætning er en parfrase af input-sætningen. Diskriminatoren genererer en score for, hvor sandsynligt det er, at de to sætninger er parfraser af hinanden, som bruges som belønning til at træne agenten.
Hver 5.000 gæt fortæller diskriminatoren, hvilken parfrase der kom fra datasættet og hvilken der blev genereret, så den kan forbedre sine fremtidige gæt. Processen fortsætter i flere runder med, at agenten forsøger at narre diskriminatoren, og diskriminatoren forsøger at differentiere mellem de genererede parfraser og evaluering-parfraserne fra datasættet.
Efter flere runder af træning genererer agenten parfraser, der overgår de overvågede modeller og andre belønningsfunktioner.

Konklusion og begrænsninger
Modstander-tilgange (herunder selv-spil for spil) giver en ekstremt lovende tilgang til træning af forstærket læring-algoritmer til at overgå menneskelig niveau-præstation på visse opgaver uden at definere en ekspllicit belønningsfunktion.
mens forstærket læring var i stand til at overgå overvåget læring i dette tilfælde, er den ekstra overhæng i terms of kode, beregning og kompleksitet ikke værd at præstationsgevinsten for de fleste anvendelser. Forstærket læring er bedst ladet til situationer, hvor overvåget læring ikke kan let anvendes, og en belønningsfunktion er let at definere (såsom Atari-spil). Tilgange og algoritmer er langt mere modne i overvåget læring, og fejlsignalet er meget stærkere, hvilket resulterer i hurtigere og mere stabil træning.
En anden overvejelse er, som med andre neurale tilgange, at agenten kan fejle meget dramatisk i tilfælde, hvor input er forskellig fra de input, den tidligere har set, kræver en ekstra lag af sanity-tjek til produktionsapplikationer.
Eksplosionen af interesse for forstærket læring-tilgange og fremskridt i beregningsinfrastruktur i de sidste par år vil låse op for enorme muligheder for at anvende forstærket læring i industrien, især inden for NLP.












