Andersonin kulma

Konenäytön oppimisjärjestelmä uudelleenkirjoittaa artikkelin luettavaksi

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Uusi tutkimus Kanadasta ehdottaa menetelmää, jolla voidaan automaattisesti uudelleenkirjoittaa artikkeli luettavaksi, perustuen Tinder-tyylisiin “vipeihin” tai passiiviseen havainnointiin lukijan vuorovaikutuksesta erilaisen sisällön kanssa, jota artikkeli sisältää.

Järjestelmä, joka on nimeltään Hone As You Read (HARE), on esitetty tutkimuspaperissa Länsi-Ontarion yliopistosta Kanadassa, ja siihen liittyvä Python-koodi on saatavilla GitHubissa.

Hankkeen keskeinen idea on, että artikkeli voi sisältää erilaisia sisältötyyppejä, kehittyen (kuten tämä) otsikosta yksityiskohtiin. Artikkelin myöhemmät osat voivat sisältää erilaisia tukimateriaaleja, käyttötapauksia, hypoteeseja tai oletuksia uutisten seuraamuksista.

HARE-järjestelmässä, jos et pidä tällaisesta materiaalista, voit äänestää sitä pois kappale kappaleelta, kun järjestelmä oppii mieltymyksesi, jotta kun eteni alas, sisältö, joka on samanlainen kuin materiaali, jonka “alennit”, on jo poistettu tai uudelleenkirjoitettu. Jos et halua osallistua aktiivisesti järjestelmän koulutukseen, HARE voi päätellä valintasi havainnoimalla passiivista vuorovaikutustasi asiakirjan kanssa.

Tinder-tyylinen äänestäminen miellyttämättömistä lauseista

Alla olevassa kuvassa nähdään kolme mahdollista tyyppiä HARE:n käyttäjän eksplisiittisestä tai implisiittisestä käyttäytymisestä johtuvaa luokittelua. Ensimmäisessä tapauksessa (vasemmalla) käyttäjä “vipeää vasemmalle” (tai oikealle) Tinder-tyylisellä äänestysliikkeellä, joka ilmaisee hyväksyntää tai epämiellyttävyyttä sisällön, tyylisuunnitelman, monimutkaisuuden tai sävyn suhteen.

Lähde: https://arxiv.org/pdf/2105.02923.pdf

Lähde: https://arxiv.org/pdf/2105.02923.pdf

Toisessa tapauksessa (keskellä) järjestelmä käyttää oleskeluaikaa mittarina käyttäjän kiinnostuksesta, perustuen siihen, missä kohdassa ja kuinka kauan käyttäjä pysähtyy.

Kolmannessa tapauksessa (oikealla) HARE käyttää älypuhelimen kameraa arvioimaan katseen sijaintia ja oleskeluaikaa asiakirjan näkyvissä olevien kappaleiden yli.

Tutkijat väittävät, että lisääntynyt oleskeluaika millä tahansa kappaleella voi osoittaa lisääntynyttä käyttäjän kiinnostusta, vaikka logiikka ei välttämättä ole tapauksessa, jossa katsoja yrittää omaksua tekstiä, joka voi olla monimutkainen tai huonosti kirjoitettu.

Käyttäjän palautteen avulla voidaan muokata, uudelleenkirjoittaa tai poistaa kokonaan artikkelin näkymättömiä osia.

Käyttäjän palautteen avulla voidaan muokata, uudelleenkirjoittaa tai poistaa kokonaan artikkelin näkymättömiä osia.

Sisällön esikäsittely käyttäjän mieltymyksien mukaan

Tutkimuspaperi käsittelee HARE:n käyttökokemusta artikkeleittain, mutta ilmiselvästi käyttäjän historiallinen vuorovaikutus asiakirjojen kanssa mahdollistaa tulevien lukukokemusten mukauttamisen, tunnistamalla johdonmukaisesti sisällön tyypit ja soveltamalla käyttäjän mieltymyksiä uusiin artikkeleihin, jotta tarve vuorovaikutukseen vähenee, kun käyttäjä näkee vähemmän ja vähemmän “ei-toivottua” sisältöä.

HARE on luonnehdittu tiivistysalgoritmiksi, joka sallii näkymättömän sisällön uudelleenkirjoittamisen tyylin tai tiivisyyden suhteen ennen kuin käyttäjä saapuu siihen; mutta tutkimuspaperi tekee selväksi, että se voi myös ennaltaehkäistä sisällön poistamisen käyttäjän palautteen perusteella.

Kokeilutarkoituksiin järjestelmä käytti korpus 11 222 artikkelia UK:n Daily Mail -sanomalehdestä, ja se arvioitiin kokeellisella otolla Telegram-viestisovelluksessa. Artikkeleita, joissa oli vähemmän kuin kymmenen kappaletta, hylättiin kokeilutarkoituksessa.

Telegram HARE -sovellus kokeiluvaiheessa käyttäjien kanssa.

Telegram HARE -sovellus kokeiluvaiheessa käyttäjien kanssa.

Tutkijoiden menetelmä käyttää K-Means -klusterointia SBERT -lausekkeiden sisäänartikkeleissa, aluksi satunnaisilla painoarvoilla käsiteltävissä käsitteissä.

Muiden algoritmien ja lähestymistapojen joukossa HARE sisältää kolme vertailumallia, joista ensimmäinen (ORACLEGREEDY) pääsee aiempiin käyttäjän mieltymyksiin, osoittaen aikomusta, että algoritmi voisi esikäsitellä artikkeleita latauksen aikana, ei interaktiivisesti.

Muiden mallien, ORACLESORTED ja ORACLEUNIFORM, valitsevat lauseita kiinnostustason tai satunnaisesti koko artikkelin ajan.

Sisällön poistaminen ja uudelleenkirjoittaminen

Yllättäen ORACLEUNIFORM suoriutui vertailuryhmästä paremmin, vaikka sillä ei ollut pääsyä aiempiin käyttäjän kiinnostuksiin. Tutkijat väittävät, että tämä johtuu siitä, että se käsittelee koko artikkelin yhdellä kertaa, “valitsemalla vain mielenkiintoisimmat lauseet”. Tutkijat myöntävät, että tämä voi rajoittaa saatavilla olevan sisällön lauseisiin, jotka käsittelevät vain tärkeintä käsitettä, loogisesti poistaen muun tekstin, joka voi käsitellä käsitteen seuraamuksia tai arviointia.

HARE:ssa käytetyt tiivistysalgoritmit ovat LexRank, SumBasic ja TextRank.

HARE kokeiltiin 13 vapaaehtoisen kanssa 70 kokeen ajan ja vaihtelevien algoritmien lähestymistapojen kanssa, ja se pystyi päivittämään tiivistelmät (uudelleenkirjoitetut / poistetut tekstit) noin 1,3 millisekunnissa ja 100 ms kuluttajaluokan kannettavalla tietokoneella, riippuen kokeiltavasta mallista. Tulokset osoittivat, että mallit, jotka poistivat eniten tekstiä, eivät suoriutuneet hyvin, pääasiassa siksi, että se voi vaikuttaa jäljelle jäävän tekstin yhtenäisyyteen.

Dynaamisen artikkelin uudelleenkirjoittamisen eettiset vaikutukset

Tutkijat tunnustavat eettiset huolenaiheet tällaisia teknologioita koskien:

‘HARE-tehtävän tavoitteena on tulevien käyttäjälähtöisten sovellusten suunnittelu. Suunnittelun perusteella nämä sovellukset voivat hallita, mitä käyttäjä lukee tietyssä artikkelissa. On mahdollista, että nämä työkalut voivat pahentaa “kaikko-kammion” -vaikutusta, jota automaattiset uutisvirrat, hakutulokset ja verkkoyhteisöt jo tuottavat.’

Kuitenkin he huomauttavat myös, että tällainen järjestelmä voisi tulevaisuudessa käytettäväksi sovelluksissa, joissa pyritään vähentämään kaikko-kammio-vaikutusta esittämällä vaihtoehtoisia näkökulmia, jotka eivät olleet alun perin artikkelissa. He huomauttavat: ‘Tämän tekijän painotus voidaan säätää siten, että se tarjoaa sekä mielenkiintoisen lukukokemuksen että monipuolisen ajatuksien esittämisen.’

Niihin, jotka todennäköisesti hyötyvät tällaisesta järjestelmästä, kuuluvat lukijat, jotka haluavat säästää aikaa tietojen omaksumisessa, ja sisällön julkaisijat.

Kirjoittaja koneoppimisen parissa, ihmiskuvan synteesin asiantuntija. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se sulautui DNEG:n Brahma.ai:ksi.
Verkkosivu: martinanderson.ai
Yhteystiedot: martin@martinanderson.ai