Andersonův úhel

Získání NLP pro vyzyvání špatně informovaných otázek

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Některé otázky jsou nezodpověditelné, protože obsahují nesprávné informace – předpoklady, které musí osoba, která slyší otázku, filtrovat a odmítat. To předpokládá, že posluchač má dostatek správných informací, aby mohl zpochybnit otázku, místo aby používal otázku samotnou jako zdroj (nesprávných) informací.

Je to výzva pro systémy zpracování přirozeného jazyka (NLP), jako je GPT-3, které mají tendenci “hallucinovat” informace, aby udržely dialog.

Wenn se například GPT-3 zeptáte “Kdy Marie Curie vynalezla uran?”, pravděpodobně dostanete odpověď “Marie Curie vynalezla uran v roce 1898”.

Zdroj: https://beta.openai.com/playground (Da Vinci instruct beta).

Zdroj: https://beta.openai.com/playground (Da Vinci instruct beta).

Ve skutečnosti byl uran objeven v roce 1789 německým chemikem Martinem Heinrichem Klaprothem, zatímco zjištění Curieů v roce 1898 bylo izolací radia.

Problém systémů NLP, které ignorují nesprávné předpoklady, se stal předmětem pozornosti v několika případech letos, včetně způsobu, jakým výsledky vyhledávání Google ignorují nesprávné informace v otázce “Kdy Neil Armstrong přistál na Marsu?” – chyba, která je stále zobrazena v době psaní tohoto článku, a stejně tak platí pro postavy z filmu Toy Story, jako je Buzz Lightyear, který údajně přistál na Měsíci 21. července 1969.

Tom Hanks, další herec z filmu Toy Story, je také uveden jako člověk, který přistál na Měsíci v roce 1970, přestože jeho postava astronauta Jima Lovella je nejznámější tím, že tento čin nedokončil.

Řešení problémů s předpoklady v interakcích NLP

Nyní výzkumníci z Google, společně s výzkumníky z Univerzity Johnse Hopkinse a Univerzity Brown, zkoumají nové metody strojového učení, které by umožnily systémům NLP zpochybnit fakticky nesprávné otázky stejným způsobem, jako je to nezbytné pro lidské učitele během konverzací se studenty.

Nová práce Který lingvista vynalezl žárovku? Verifikace předpokladů pro otázku a odpověď popisuje úsilí o vývoj nového systému, který by identifikoval předpoklady a zkoumal jejich pravdivost před pokračováním interakce.

Nový algoritmus efektivní předzpracovává otázky předtím, než se vrátí k interakci, rozdělující “autentizaci” otázky do tří částí.

Nesprávné zpracování! Vlevo, 'blokáda', která nastává, i když pokročilý systém NLP dokáže identifikovat, že otázka nedává smysl. Vpravo, rozklad navrhovaného algoritmu, který se snaží napravit chybu zdroje. Zdroj: https://arxiv.org/pdf/2101.00391.pdf

Nesprávné zpracování! Vlevo, ‘blokáda’, která nastává, i když pokročilý systém NLP dokáže identifikovat, že otázka nedává smysl. Vpravo, rozklad navrhovaného algoritmu, který se snaží napravit chybu zdroje. Zdroj: https://arxiv.org/pdf/2101.00391.pdf

Ještě předtím, než se zdá, že je to jednoduchá verifikační rutina, která by měla být součástí znalostních systémů od začátku, většina trénovacích rutin NLP učí informace s nadměrnou důvěrou ve zdrojová data, včetně diskurzu (jako je fake news), které mohly být publikovány na dříve “důvěryhodných” kanálech.

Klíčovým problémem je identifikovat konsensuální spolehlivý zdroj faktů v prostředí, kde šíření nesprávných “novin” prostřednictvím sociálních médií by automaticky udělilo autoritu logice strojového učení, alespoň do té doby, než se fenomén fake news stal kritickou oblastí zájmu v oboru v posledních letech.

Určení nejlepšího přístupu k nezodpověditelným otázkám

Aby bylo možné určit vhodný přístup pro řešení otázky, která obsahuje nesprávné informace, výzkumníci provedli 100 takových dotazů prostřednictvím čtyř různých modelů otázek a odpovědí a požádali lidské subjekty, aby vybraly nejlepší nebo nejméně problematickou odpověď, kterou modely vygenerovaly.

Čtyři možné architektonické výsledky “špatné” otázky byly: ‘nezodpověditelné’ – kde systém otázek a odpovědí s uzavřenou knihou efektivní shuts down dotaz bez dalšího vysvětlení; ‘selhání předpokladu založené na vysvětlení’ – kde systém nezjišťuje nesprávný předpoklad, efektivní “nezodpověditelnou” odpověď, s přidruženým vysvětlením; ‘extraktivní vysvětlení’ – kde systém extrahuje topicky související citaci z Wikipedie a přidružuje ji k úvodu “Tato otázka je nezodpověditelná, protože…”; a ‘otevřená doménová rekonstrukce’ – kde konkurenční systém hledá další zdroje z Wikipedie.

Tento příklad čtyř možných odpovědí na zdánlivě 'nezodpověditelnou' otázku ilustruje složitost pokusu o konkurenční doménovou řešení problému.

Tento příklad čtyř možných odpovědí na zdánlivě ‘nezodpověditelnou’ otázku ilustruje složitost pokusu o konkurenční doménovou řešení problému.

Během testů pět účastníků (náborem na interní platformě Google Crowdsourcing) preferovalo předpoklad-založené odpovědi, což vedlo výzkumníky k vývoji nového rámce pro dekompozici a verifikaci otázek.

V novém systému jsou lingvistické spouštěče získány z otázky pomocí pravidlově založeného generátoru, který dekonstruuje větu na předpokládané výpovědi o faktu. Pokud jsou z otázky odvozeny více předpokladů, každý z nich je prozkoumán a bude přispívat k finální odpovědi, pokud se týkají chybných předpokladů z původní otázky.

Datové sady

Předpoklady generované v počáteční fázi byly ručně upraveny, aby vytvořily verifikační datovou sadu s “zlatými” předpoklady. Jakékoli předpoklady, které vyšly z větví dotazu, ale nebyly přítomny v původních otázkách, byly odstraněny.

Dva z autorů práce pak ručně označili 462 předpokladů z hlediska ano/ne ověřitelnosti, na základě relevantní stránky Wikipedie spojené s každou otázkou. Případy nesouhlasu byly vyřešeny v následné diskusi předtím, než byly přidány do datové sady.

Výzkumníci použili zero-shot NLI, klasifikační úloha premise/hypotézy, která vyžadovala dekonstrukci článků Wikipedie souvisejících s otázkami. Jelikož tento proces vede k mnoha více párů, než otázka může obsahovat nebo model podporovat, filtrované výsledky byly poté agregovány a označeny.

Výsledky a formulace odpovědi

Nejúčinnější výsledky byly získány nejlaborativnějším řešením: jemně vyladěným, pravidlově založeným/NLI hybridním generovaným z ALBERT QNLI s větami Wiki a předpoklady.

Výkon verifikačních modelů, kde 'Wiki věty' používají věty získané z otázek souvisejících s články Wikipedie, a 'Wiki předpoklady' jsou generované předpoklady z těchto vět.

Výkon verifikačních modelů, kde ‘Wiki věty’ používají věty získané z otázek souvisejících s články Wikipedie, a ‘Wiki předpoklady’ jsou generované předpoklady z těchto vět.

Pomocí této formulace výzkumníci vyvinuli šablonový systém, kde negující fakt z Wikipedie byl připojen k “Tato otázka je nezodpověditelná, protože…” a podobným frázím. Ačkoli to není ideální řešení, autoři navrhují, že odpovědi založené na neověřitelnosti jsou pravděpodobně snižovat incidenci falešných negativ.

Systém byl nakonec implementován v Extended Transformer Construction (ETC) modelu.

Důsledky

V závislosti na jeho konečném výkonu ve skutečném světě by se mohlo zdát, že celý přístup povede pouze k nahrazení “neověřitelného” za “nezodpověditelné”, v případech, kdy podpůrný výzkumný systém nemůže vyhodnotit užitečnou korekci pro chybný předpoklad otázky. Efektivně se zdá, že buduje infrastrukturu pro budoucí a lepší verifikační systémy.

Výzkumníci již uznávají, že náklady na tokenové požadavky API jsou omezujícím faktorem při formulaci delších odpovědí, které tento systém vygeneruje, a je třeba předpokládat, že dodatečné náklady na “živý” výzkum otázky pravděpodobně přidají latenci i velkým systémům, jako je GPT-3, protože reaktivita takových systémů dosud závisela na obecné inkorporaci znalostí během trénování, spíše než na rozsáhlých, síťových verifikačních rutinách.

Dále výzkumníci poznamenávají, že systém目前 má omezení související s parsováním sémantických aspektů textu:

Například, kdo věří, že Estella je matkou , má vložený posesivní pod verbem believe, ale náš generátor by nicméně vygeneroval ‘Estella má ‘matku’.

Nicméně tým předpokládá nové a flexibilnější systémy otázek a odpovědí, které budou vyvinuty na základě této práce:

Do budoucna plánujeme postavit na této práci navrhnout systémy otázek a odpovědí, které jsou více robustní a kooperativní. Například různé typy selhání předpokladů by mohly být řešeny pomocí více flexibilních strategií odpovědí – například, porušení předpokladu jedinečnosti by mohlo být lépe zpracováno poskytnutím všech možných odpovědí, spíše než prohlášením, že předpoklad jedinečnosti byl porušen.

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai