Andersonin kulma

NLP:n haasteena vääräksi tiedetyt kysymykset

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Jotkut kysymykset ovat vastaamattomia, koska ne sisältävät väärää tietoa – oletuksia, joita kuulija on pakotettu suodattamaan ja hylkäämään. Tämä olettaa, että kuulija on saanut riittävästi oikeaa tietoa haastamaan kysymyksen, sen sijaan, että hän käyttäisi itse kysymystä (väärän) tiedon lähteenä.

Se on haaste luonnollisen kielen prosessoinnin (NLP) järjestelmiille, kuten GPT-3:lle, jolla on taipumus “hallusinoida” tietoa jatkuvan dialogin ylläpitämiseksi.

Kysymällä GPT-3:lle “Milloin Marie Curie keksi uraanin?” saa todennäköisesti vastauksen “Marie Curie keksi uraanin vuonna 1898”.

Lähde: https://beta.openai.com/playground (Da Vinci instruct beta).

Lähde: https://beta.openai.com/playground (Da Vinci instruct beta).

Todellisuudessa uraani löydettiin vuonna 1789 saksalaisen kemistin Martin Heinrich Klaprothin toimesta, kun taas Curien vuoden 1898 löytö oli radiumin erottaminen.

NLP-järjestelmien ongelma, jossa ne ohittavat väärät oletukset, on tullut esille useissa julkisuuden kannssa tämän vuoden aikana, mukaan lukien Google -haun, joka ohittaa väärän tiedon kysymyksessä “Milloin Neil Armstrong astui Marsiin?” – virhe, joka edelleen näkyy kirjoitushetkellä ja joka koskee myös Toy Storyn hahmoa Buzz Lightyearia, joka ilmeisesti laskeutui Kuuhun 21. heinäkuuta 1969.

Tom Hanks, toinen Toy Storyn veteraani, on myös Googlella luetteloitu laskeutuneeksi Kuuhun vuonna 1970, vaikka hänen Apollo 13 -hahmonsa, astronautti Jim Lovell, on kuuluisin siitä, ettei hän onnistunut tässä.

Oletusongelmien ratkaiseminen NLP-vaihdannossa

Nyt Google Research, yhdessä John Hopkinsin yliopiston ja Brownin yliopiston tutkijoiden kanssa, tutkii uusia koneoppimismenetelmiä, joiden avulla NLP-järjestelmät voivat lopulta haastaa tosiasiallisesti väärät kysymykset samalla tavalla, kuin se on välttämätöntä ihmisille opettajille keskustellessaan oppilaiden kanssa.

Viimeaikainen artikkeli Kuka kielitieteilijä keksi hehkulampun? Oletusverifiointi kysymys-vastausjärjestelmissä esittää yhteistyöhön perustuvan pyrkinnön kehittää uusi järjestelmä, joka tunnistaa oletukset ja arvioi niiden totuuden ennen keskustelun jatkamista.

Uusi algoritmi käsittelee kysymyksiä ennen kuin palaa keskusteluun, jakaa “kysymyksen todentamisen” kolmeen osaan.

Vasemmalla,

Vasemmalla, “tienviitta”, joka ilmenee, vaikka edistynyt NLP-järjestelmä on pystynyt tunnistamaan, että kysymys ei ole järkevä. Oikealla, ehdotetun algoritmin hajoitus, joka yrittää korjata virheen lähteessä. Lähde: https://arxiv.org/pdf/2101.00391.pdf

Vaikka se näyttää yksinkertaiselta verifioimisesta, joka olisi pitänyt sisällyttää tietojärjestelmiin alusta alkaen, useimmat NLP-pohjaiset koulutusohjelmat oppivat tiedon luottamuksella lähdeaineistoon, mukaan lukien diskurssi (kuten väärä uutinen), joka on julkaistu aiemmin “luotettavilla” kanavilla.

Tärkein ongelma on tunnistaa konsensuksella luotettava tosiasiallinen lähde, ilmapiirissä, jossa väärän “uutisen” leviäminen sosiaalisessa mediassa antaisi sille valtuudet koneoppimisen yleistymisen logiikan mukaan. Jälkimmäinen on käyttänyt määrää tai toistoa tietoa osoituksena tarkinastetta, ainakin kunnes väärän uutisen ilmiö tuli kriittiseksi kiinnostuksen kohteeksi viime vuosina.

Parhaan lähestymistavan määrittäminen vastaamattomiin kysymyksiin

Määrittääkseen sopivan lähestymistavan vastaamattomaan kysymykseen, joka sisältää virheellistä tietoa, tutkijat suorittivat 100 tällaista kysymystä neljällä eri Q&A-mallilla ja pyysivät ihmiskohtaisia koehenkilöitä valitsemaan parhaan tai vähiten ongelmallisen ratkaisun, jonka mallit loivat.

Neljä mahdollista arkkitehtonista tulosta “huonoon” kysymykseen olivat: vastaamaton – jossa suljettu kirja Q&A-järjestelmä sulkee kysymyksen ilman lisäselitystä; oletusvirhepohjainen selitys – jossa järjestelmä ei voi vahvistaa väärää oletusta, tehden siitä “vastaamattoman” vastauksen, johon on lisätty selitys; eksplisiittinen selitys – jossa järjestelmä hakee aiheeseen liittyvän Wikipedian lainauksen ja liittää sen esipuheeseen “Tämä kysymys on vastaamaton, koska…”; ja avoin verkkoteksti – jossa kilpailukykyinen järjestelmä etsii lisää lähteitä Wikipediasta.

Tämä esimerkki neljästä mahdollisesta vastauksesta ilmeisesti

Tämä esimerkki neljästä mahdollisesta vastauksesta ilmeisesti “vastaamattomaan” kysymykseen havainnollistaa kilpailukykyisen verkkopohjaisen ratkaisun monimutkaisuutta.

Kokeiden aikana viisi osallistujaa (joiden rekrytointi tapahtui Google- sisäisellä crowdsourcing-alustalla) suosivat oletusperusteisia vastauksia, mikä johti tutkijoiden kehittämään uuden kehyksen kysymysten hajoittamiseksi ja vahvistamiseksi.

Uudessa järjestelmässä kielelliset laukaisijat saadaan kysymyksestä sääntöpohjaisella generoijalla, joka purkaa lauseen oletusväittäminiksi. Jos useita oletuksia johtuu kysymyksestä, jokainen niistä tutkitaan, ja ne osallistuvat lopulliseen vastaukseen, jos ne osoittavat väärät oletukset alkuperäisestä kysymyksestä.

Tietokannat

Alkuvaiheessa luodut oletukset muokattiin manuaalisesti luodakseen verifioivaa tietokantaa “kultaisilla” oletuksilla. Kaikki oletukset, jotka tulivat kysymyksen haaroittumisesta, mutta eivät olleet läsnä alkuperäisissä kysymyksissä, poistettiin.

Kahden artikkelin kirjoittajan täytyi manuaalisesti annotoida 462 oletusta kyllä/ei -verifiointiin perustuen, liittyen jokaiseen kysymykseen liittyvään Wikipedian sivuun. Epäilyksien kohdat ratkaistiin jälkikäteen keskustelussa ennen niiden sitouttamista tietokantaan.

Tutkijat käyttivät zero-shot NLI:a, joka edellytti Wikipedian artikkeleiden purkamista kysymyksiin liittyen. Koska tämä prosessi johtaa useisiin pareihin kuin kysymys voi vaatia tai malli tukea, suodatetut tulokset yhdistettiin ja merkittiin.

Tulokset ja vastausmuodostus

Parhaat tulokset saavutettiin työläämmällä ratkaisulla: hienostuneella, sääntöpohjaisella/NLI-hybridillä, joka luotiin ALBERT QNLI:sta Wiki-lauseilla ja oletuksilla.

Verifioivien mallien suorituskyky, jossa

Verifioivien mallien suorituskyky, jossa “Wiki-lauseet” käyttää lauseita, jotka on saatu kysymykseen liittyvistä Wikipedian artikkeleista, ja “Wiki-oletukset” ovat näistä lauseista generoituja oletuksia.

Tämän formuloinnin avulla tutkijat kehittivät mallijärjestelmän, jossa Wikipedian negoiva fakta liitettiin “Tämä kysymys on vastaamaton, koska…” -lauseisiin. Vaikka se ei ole ihanteellinen ratkaisu, kirjoittajat ehdottavat, että vastaukset, jotka perustuvat verifiointiin, ovat todennäköisesti vähentävät virheellisten negatiivisten tapausten määrää.

Järjestelmä toteutettiin lopulta Extended Transformer Construction (ETC) -mallissa.

Johtopäätökset

Riippuen lopullisesta suorituskyvystä todellisessa maailmassa, voidaan väittää, että koko lähestymistapa voi johtaa “verifiointiin” korvaamiseen “vastaamattomalla”, tapauksissa, joissa tutkimusjärjestelmä ei voi arvioida hyödyllistä korjausta kysymyksen väärälle oletukselle. Tehokkaasti, näyttää siltä, että se luo infrastruktuurin tuleville ja paremmille verifioimisjärjestelmille.

Tutkijat myöntävät jo, että token-pohjaisen API-pyynnön kustannukset ovat rajoittava tekijä, kun muotoillaan pidempiä vastauksia, joita tämä järjestelmä tuottaa, ja on oletettava, että “live”-tutkimuksen lisääminen kysymykseen todennäköisesti lisää viivästystä jopa suurten järjestelmien, kuten GPT-3, kohdalla, koska tällaisten järjestelmien vastauskyky on perustunut yleistetylle tietämykselle koulutusajalla eikä laajaan, verkkopohjaiseen verifioimiseen.

Lisäksi tutkijat huomauttavat, että järjestelmällä on rajoituksia, jotka liittyvät tekstin semanttisiin puoliin:

Esimerkiksi, kuka uskoo, kuka on Estellan äiti, sisältää sisäkkäisen omistajan verbien alle uskoa, mutta meidän generoijamme tulisi silti tuottaa ‘Estella on äiti.

Kuitenkin tiimi näkee uusia, joustavampia kysymys-vastausjärjestelmiä, jotka kehitetään tämän tutkimuksen pohjalta:

Tulevaisuudessa suunnittelemme tämän työn jatkamista ehdottamalla QA-järjestelmiä, jotka ovat robustimpia ja yhteistyökykyisempiä. Esimerkiksi erilaiset oletusvirheet voitaisiin käsitellä joustavammilla vastausstrategioilla – esimerkiksi yksikköoletuksen rikkomisen kohdalla voisi olla parempi antaa kaikki mahdolliset vastaukset sen sijaan, että ilmoitettaisiin, että yksikköoletus rikkoontui.

Kirjoittaja koneoppimisen parissa, ihmiskuvan synteesin asiantuntija. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se sulautui DNEG:n Brahma.ai:ksi.
Verkkosivu: martinanderson.ai
Yhteystiedot: martin@martinanderson.ai