Andersonův úhel

Systém strojového učení pro přepis článku během čtení

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nový výzkum z Kanady navrhuje metodu automatického přepisu článku během čtení, založenou na principu “swipování” ve stylu Tinderu, nebo na pasivní observaci čtenářova chování při interakci s různými typy obsahu, které článek obsahuje.

Systém, nazvaný Hone As You Read (HARE), je představen v článku ze Western University v Ontariu, Kanada, s příslušným Python kódem na GitHubu.

Centrální myšlenka projektu spočívá v tom, že článek může obsahovat různé typy obsahu, které se vyvíjejí (podobně jako tento článek) od nadpisu až po další detaily. Pozdější části článku mohou obsahovat různé typy podpůrného materiálu, použití, hypotézy nebo spekulace o důsledcích zprávy.

Podle HARE, pokud se vám nelíbí takový materiál, můžete ho odstranit na základě parafového hlasování, zatímco systém se učí vaše preference, aby mohl odstranit nebo přepisovat obsah podobný materiálu, který jste “odhlasovali”, ještě předtím, než se dostanete k němu. Pokud nechcete aktivně participovat na trénování systému, HARE může odvodit vaše volby pozorováním vašich pasivních interakcí s dokumentem.

Tinder-Style Voting For Displeasing Sentences

Na obrázku níže vidíme tři možné typy inferované kategoriizace pro HARE, založené na uživatelském explicitním nebo implicitním chování. V prvním případě (vlevo) uživatel aktivně “swipuje vlevo” (nebo vpravo), v gestu vyjadřujícím schválení nebo neschválení obsahu parafového nebo větného, nebo jeho stylu, složitosti nebo tónu.

Source: https://arxiv.org/pdf/2105.02923.pdf

Source: https://arxiv.org/pdf/2105.02923.pdf

V druhém případě (uprostřed) systém používá dobu setrvání jako metriku uživatelského zájmu, založenou na poloze a délce pauzy při scrollování.

V třetím případě (vpravo) HARE používá smartphone kameru k odhadu dráhy a doby setrvání pohledu uživatele na jednotlivých odstavcích viditelného dokumentu.

Vědci tvrdí, že prodloužená doba setrvání na kterémkoli odstavci může indikovat zvýšený uživatelský zájem, i když logicky to nemusí být případ, kdy uživatel se snaží vstřebat text, který může být komplikovaný nebo jen špatně napsaný.

Uživatelská zpětná vazba efektivně edituje, přepisuje nebo zcela odstraňuje dosud neviditelné části článku.

Uživatelská zpětná vazba efektivně edituje, přepisuje nebo zcela odstraňuje dosud neviditelné části článku.

Pre-Processing Content To The User’s Preferences

Článek se zabývá uživatelským zážitkem HARE na základě jednotlivých článků, ale jasně uživatelská historie interakce s dokumenty umožňuje přizpůsobení budoucích čtenářských zážitků, tím, že konzistentně rozpoznává typy obsahu a aplikuje šablonované uživatelské preference na nové články, aby se potřeba interakce snížila, jakmile uživatel vidí méně a méně “nežádoucího” obsahu.

HARE je charakterizován jako algoritmus sumarizace, který umožňuje přepisovat neviditelný obsah dále na stránce ve stylu nebo stručnosti, než se uživatel dostane k němu; ale článek jasně uvádí, že může také preventivně odstranit obsah na základě uživatelské zpětné vazby.

Pro testovací účely systém využil korpus 11 222 článků z britského deníku Daily Mail a byl vyhodnocen prostřednictvím testovacího nasazení na aplikaci Telegram. Články s méně než deseti odstavci byly vyřazeny pro zkušební účely.

Aplikace Telegram HARE v testovací fázi s uživateli.

Aplikace Telegram HARE v testovací fázi s uživateli.

Vědců metodika používá K-Means clustering na SBERT sentence embeddings v článcích, s inicializovanými náhodnými váhami pro koncepty.

Mezi širokou skupinou algoritmů a přístupů HARE zahrnuje tři srovnávací modely, z nichž první (ORACLEGREEDY) má přístup k předchozím uživatelským preferencím, což naznačuje, že algoritmus by mohl předzpracovávat články při načítání, spíše než interaktivně.

Ostatní modely, ORACLESORTED a ORACLEUNIFORM, vybírají věty na základě úrovně zájmu nebo náhodně po celém článku.

Content Removal And Rewriting

Překvapivě, ORACLEUNIFORM překonal kontrolní sadu, i když nemá přístup k předchozím uživatelským zájmům. Vědci tvrdí, že je to proto, že se zabývá celým článkem najednou, “vybírající pouze nejzajímavější věty”. Vědci připouštějí, že to může omezit dostupný obsah na věty, které se zabývají pouze nejvýznamnějším konceptem, logicky odstraňující ostatní text, který se zabývá důsledky nebo hodnocením konceptu.

Extraktivní sumarizéry používané v HARE jsou LexRank, SumBasic a TextRank.

HARE byl testován na 13 dobrovolnících po dobu 70 pokusů a různých algoritmických přístupů a byl schopen aktualizovat sumarizace (přepsané/odstraněné texty) někde mezi 1,3 milisekundami a 100 ms na spotřebitelském laptopu, v závislosti na testovaném modelu. Výsledky ukázaly, že modely, které odstranily většinu textu, se neosvědčily, hlavně proto, že to může ovlivnit soudržnost zbývajícího textu.

Ethical Implications Of Dynamic Article Rewriting

Vědci uznávají etické obavy týkající se technologií tohoto typu:

‘Úloha HARE je určena pro návrh budoucích uživatelských aplikací. Tyto aplikace mají schopnost kontrolovat, co uživatel čte z daného článku. Je možné, že, když jsou nasazeny bez dostatečné péče, tyto nástroje by mohly zhoršit “echo-chamber” efekt, který je již produkován automatizovanými zpravodajskými kanály, výsledky vyhledávání a online komunitami.’

Ale také poznamenávají, že takový systém by mohl být použit v budoucích aplikacích k zmírnění efektu “echo-chamber” tím, že by injektoval text, který navrhuje alternativní názory, které nemusely být původně přítomny v článku. Poznamenávají: ‘Váha tohoto faktoru by mohla být upravena tak, aby poskytovala både atraktivní čtenářský zážitek a expozici rozmanitosti myšlenek.’

Ti, kteří by mohli těžit z takového systému, jsou podle vědců čtenáři, kteří chtějí ušetřit čas při získávání informací, a vydavatelé obsahu.

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai