Andersonův úhel
Google představuje systém dotazů podobný GPT-3, bez výsledků vyhledávání

Nová studie od čtyř výzkumníků z Googlu navrhuje “expertní” systém, který je schopen autoritativně odpovídat na dotazy uživatelů bez předkládání seznamu možných výsledků vyhledávání, podobně jako paradigma Q&A, které se stalo veřejně známým prostřednictvím vzniku GPT-3 za poslední rok.
Studie nazvaná Rethinking Search: Making Experts out of Dilettantes navrhuje, že současný standard předkládání uživateli seznamu výsledků vyhledávání v odpovědi na dotaz je “kognitivní zátěží” a navrhuje zlepšení schopnosti systému zpracování přirozeného jazyka (NLP) poskytovat autoritativní a definitivní odpověď.

Podle navrhovaného modelu ‘expertního’ systému, cross-doménového oracle, budou tisíce možných zdrojů výsledků vyhledávání začleněny do jazykového modelu místo toho, aby byly explicitně k dispozici jako zdroj pro uživatele k vyhodnocení a navigaci. Zdroj: https://arxiv.org/pdf/2105.02274.pdf
Studie vedená Donaldem Metzlerem z Google Research navrhuje zlepšení typu multi-doménových odpovědí, které lze目前 získat z hlubokých autoregresivních jazykových modelů, jako je GPT-3. Hlavní zlepšení, která jsou navrhována, jsou a) že model by byl schopen přesně citovat zdroje, které informovaly odpověď, a b) že model by byl zabráněn v “hallucinaci” odpovědí nebo vynálezů neexistujících zdrojů, což je目前 problém s těmito architekturami.
Školení a schopnosti v多 doménách
Navrhovaný jazykový model by byl charakterizován jako “Jeden model pro všechny úkoly vyhledávání informací” a by byl školen na různých doménách, včetně obrazů a textu. By by také potřeboval pochopení o původu znalostí, které chybí v architekturách stylu GPT-3.
‘Abyste nahradili indexy jediným, sjednoceným modelem, musí být model sám o sobě schopen mít znalosti o univerzu identifikátorů dokumentů, stejně jako tradiční indexy. Jedním ze způsobů, jak toho dosáhnout, je odejít od tradičních LM a přesunout se k modelům korpusu, které společně modelují vztahy mezi termíny, termíny a dokumenty a dokumenty a dokumenty.’

Na obrázku výše, ze studie, jsou tři přístupy k odpovědi na dotaz uživatele: vlevo, jazykové modely implicitní v algoritmu vyhledávání Googlu vybraly a prioritizovaly “nejlepší odpověď”, ale ponechaly ji jako horní výsledek mnoha. Uprostřed, odpověď stylu GPT-3, která mluví s autoritou, ale neospravedlňuje svá tvrzení ani neuvádí zdroje. Vpravo, navrhovaný expertní systém zahrnuje “nejlepší odpověď” z vyhledávacích výsledků přímo do didaktické odpovědi, s akademickými stylem poznámky pod čarou (neuvedenými v původním obrázku) označujícími zdroje, které informovaly odpověď.
Odstranění jedovatých a nepřesných výsledků
Výzkumníci poznamenávají, že dynamická a neustále aktualizovaná povaha vyhledávacích indexů je výzvou pro replikaci v modelu strojového učení tohoto typu. Například, kde byl dříve důvěryhodný zdroj školen přímo do modelu, odstranění jeho vlivu (například po jeho diskreditaci) může být obtížnější než odstranění URL z výsledků vyhledávání, protože datové koncepty se mohou stát abstraktními a široce reprezentovanými během školení.
Navíc by takový model potřeboval být neustále školen, aby poskytoval stejnou úroveň reaktivity na nové články a publikace, jako je目前 poskytována Googlem prostřednictvím neustálého procházení zdrojů. To znamená kontinuální a automatizované nasazení, na rozdíl od současného režimu, kdy jsou provedeny menší úpravy vah a nastavení volného vyhledávacího algoritmu, ale sám algoritmus je通常 aktualizován pouze příležitostně.
Útočné povrchy pro centralizovaný expertní oracle
Centralizovaný model, který neustále asimiluje a generalizuje nová data, by mohl transformovat útočný povrch pro vyhledávací dotazy.
Currently, an attacker can obtain benefit by achieving high ranking for domains or pages that either contain misinformation or malicious code. Under the auspices of a more opaque ‘expert’ oracle, the opportunity to redirect users to attack domains is greatly diminished, but the possibility of injecting poisonous data attacks is greatly increased.
To je proto, že navrhovaný systém neeliminuje algoritmus vyhledávání, ale skrývá ho před uživatelem, efektivní automatizaci priority horních výsledků a jejich začlenění do didaktické odpovědi. Útočníci již dlouho dokázali orchestrovat útoky proti algoritmu vyhledávání Googlu, aby prodávali falešné produkty, směrovali uživatele na domény, které šíří malware, nebo pro účely politické manipulace, mezi mnoha dalšími případy.
Není to obecná umělá inteligence
Výzkumníci zdůrazňují, že takový systém by byl nepravděpodobně kvalifikován jako obecná umělá inteligence (AGI) a umístili perspektivu univerzálního expertního respondéra do kontextu zpracování přirozeného jazyka, podrobeného všem výzvám, kterým tyto modely目前 čelí.
Studie uvádí pět požadavků na “high-quality” odpověď:
1: Autorita
As with current ranking algorithms, ‘autorita’ appears to be derived from citation from high quality domains that are considered authoritative in themselves. The researchers observe:
‘Odpovědi by měly generovat obsah tak, že budou čerpat z vysoce autoritativních zdrojů. To je další důvod, proč je tak důležité stanovit explicitní souvislosti mezi sekvencemi termínů a metadaty dokumentu. Pokud všechny dokumenty v korpusu jsou anotovány skóre autoritativnosti, toto skóre by mělo být zohledněno při školení modelu, generování odpovědí nebo obou.’
Ačkoli výzkumníci nenavrhují, že tradiční výsledky vyhledávání by se staly nedostupnými, pokud by expertní oracle tohoto typu byl nalezen jako výkonný a populární, celá studie prezentuje tradiční systém rankingu a seznamy výsledků vyhledávání jako “desítky let starý” a zastaralý systém vyhledávání informací.
‘Skutečnost, že ranking je kritickou součástí tohoto paradigmatu, je symptomem toho, že systém vyhledávání poskytuje uživatelům výběr potenciálních odpovědí, což indukuje poměrně značnou kognitivní zátěž na uživatele. Přání vrátit odpovědi místo seznamů výsledků vyhledávání bylo jedním z motivačních faktorů pro vývoj systému otázek a odpovědí. ‘
2: Transparentnost
Výzkumníci komentují:
‘Kdykoli je to možné, mělo by být uživatelům zpřístupněno původu informací, které jsou jim předkládány. Je-li to primární zdroj informací? Pokud ne, co je primární zdroj?’
3: Zpracování zkreslení
Studie poznamenává, že předškolní jazykové modely jsou navrženy tak, aby nehodnotily empirickou pravdu, ale generalizovaly a prioritizovaly dominantní trendy v datech. Přiznává, že tato direktiva otevírá model útokům (jako se stalo u neúmyslně rasistického chatbota Microsoftu v roce 2016) a že budou potřebné pomocné systémy, aby chránily proti takovým zkresleným systémovým odpovědím.
4: Povolení různých pohledů
Studie také navrhuje mechanismy, aby zajistila pluralitu pohledů:
‘Generované odpovědi by měly reprezentovat řadu různých perspektiv, ale neměly by být polarizující. Například pro dotazy na kontroverzní témata by měly být pokryty obě strany tématu v férové a vyvážené podobě. To má blízké vazby na zkreslení modelu.’
5: Přístupný jazyk
Kromě poskytování přesných překladů v případech, kdy je považována za autoritativní odpověď v jiném jazyce, studie navrhuje, že odpovědi by měly být “napsány v co nejjednodušších termínech”.










