Andersonin kulma

Vanhentuneiden “tietojen” alentaminen koneoppimisen avulla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Joskus totuus on voimassa vain tietyn ajan. Kun aikakohtainen väite (kuten “maskit ovat pakollisia julkisessa liikenteessä”) ilmestyy hakukoneiden luokissa, sen näennäinen “virallinen” ratkaisu voi jäädä voimaan jopa useita vuosia, ohittaa myöhemmän ja tarkemman sisällön samasta aiheesta.

Tämä on hakukonealgoritmien määräytymisen seuraus, jossa pyritään tunnistamaan ja edistämään “pitkäaikaisia” määrättyjä ratkaisuja, ja jossa priorisoidaan hyvin linkitettyä sisältöä, joka ylläpitää liikennettä ajan myötä – ja jossa on yhä varovaisempi suhtautuminen uuteen sisältöön, joka ilmestyy valeuutisten aikakaudella.

Toisaalta, arvokkaan verkkosisällön alentaminen yksinomaan sen vuoksi, että siihen liittyvä aikaleima on ylittänyt jonkin “voimassaoloikkunan”, voi johtaa siihen, että joukko todella hyödyllistä sisältöä alentuu automaattisesti myöhemmän, mahdollisesti heikomman tasoisella materiaalilla.

Tätä oireyhtymää vastaan on nyt kehitetty uusi tutkimus Italian, Belgian ja Tanskan tutkijoiden toimesta, jossa on käytetty koneoppimismenetelmiä kehittääksesi aikaa havainnointiin perustuvaa menetelmää todisteiden luokitteluun.

Vanhenemisen ylittäminen

Tutkimus on tehty Euroopan komission tutkimuskeskuksessa (JRC) Isprassa, Katholieke Universiteit Leuvenissa ja Kööpenhaminan yliopistossa.

Tutkimuksessa tarkastellaan neljää aikaperusteista luokittelumenetelmää, joita sovelletaan kolmeen eri tosiasialaisiin menetelmiin, ja tarjotaan uusi menetelmä, joka käyttää todisteiden aikaleimoja “kultaisena standardina”. Tutkimus osoittaa, että aikaa havainnointiin perustuva todisteiden luokittelu parantaa tulosten tarkkuutta ja myös parantaa auktoriteetin ja totuuden arviointeja ajanherkkien tosiasiallisten väittämien ja väitteiden osalta.

Tutkimus tarjotaan mahdollisena lisänä myöhempään tai olemassa oleviin järjestelmiin, ja se on suunniteltu avustamaan tutkimuksessa ja mahdollisena lisätekijänä kehittääkseen uusia ja kehittyneitä hakukonealgoritmeja.

Tutkimuksessa mallinnetaan todisteiden aikadynamiikkaa sisällön perusteella, ja se ylittää “semanttisen samankaltaisuuden” lähestymistavat, jotka ovat tyypillisiä hakukoneiden luokittelualgoritmeille. Tutkijoiden kouluttama malli käyttää optimoituja oppimismenetelmiä, jotka voidaan helposti yhdistää olemassa olevaan tosiasialliseen arkkitehtuuriin. Tutkijat väittävät, että järjestelmä on uusi panos automaattiseen tosiasialliseen tarkasteluun.

Useiden tosiasiallisten arkkitehtuurien muokkaaminen

Tutkijat sovelsivat aikarajoitettua tekijää kolmeen olemassa olevaan tosiasialliseen arkkitehtuuriin. Ensimmäinen näistä on Bidirectional Long Short Term Memory (BiLSTM) -malli, joka on ehdotettu MultiFC-aineistossa vuonna 2019.

Toinen on muutos ensimmäiseen, jossa yksisuuntainen Recurrent Neural Network (RNN) korvaa LSTM-komponentin.

Kolmas malli, jonka tutkijat käyttivät, on DistilBERT-transistori Hugging Faces -kirjastosta, joka on tiivis versio Google BERT -NLP-mallista.

Kaikkien kolmen arkkitehtuurien yhteydessä tutkijat sovelsivat ListMLE-häviötä, jota on johtanut Microsoft, ja joka on jo useita vuosia vaikuttanut uusiin tosiasiallisiin tutkimuksiin.

Kaksi pääasiallista tosiasiallista mallia, joihin tutkimusryhmä on lisännyt aikakomponentin auktoriteetin ja myöhempään luokitteluarvon suodattimena. Lähde: https://arxiv.org/pdf/2009.06402.pdf

Kaksi pääasiallista tosiasiallista mallia, joihin tutkimusryhmä on lisännyt aikakomponentin auktoriteetin ja myöhempään luokitteluarvon suodattimena. Lähde: https://arxiv.org/pdf/2009.06402.pdf

Aikaleimat haettiin koulutusmetatiedosta, ja ne sisällytettiin luokittelutekijöihin kussakin mallissa.

Testaus

Järjestelmän kokeellinen arviointi tapahtui MultiFC-aineiston avulla, koska se on tällä hetkellä ainoa suuren volyymin avoimen lähdekoodin aineisto, joka on saatavilla tämän tietyn tutkimuksen aihealueelle. MultiFC sisältää 34 924 todellista väitettä, jotka on saatu 26 eri tosiasiallisesta alueesta, mukaan lukien Snopes ja Washington Post.

Kunkin väitteen totuuden ennustaminen on täydennetty kymmenellä todisteella, jotka on saatu Google-hakukoneen API:sta, ja ennustetta on saatu yhdistämällä useita tekijöitä, mukaan lukien puhuja, tunnisteet ja luokat.

Usein relevantti aikaleima ei välttämättä ole sama, joka on sisällytetty metatietoihin; artikkeli voi viitata aiempiin tapahtumiin, ja tutkijoiden järjestelmien on täytynyt huolehtia siitä, että ne poimivat ja muuttavat tiedot suoraan tekstistä. Ilman tätä prosessia “vanhan uutisen” uudelleenajaminen voi antaa sille uuden ulkoasun, erityisesti korkean auktoriteetin sivuilla, ja levittää vanhentuneita tietoja.

Päivämäärät haettiin Python-rutiinilla, ja viralliset metatietojen päivämäärät testattiin muodollisen yhdenmukaisuuden varmistamiseksi (koska esimerkiksi Yhdysvaltain ja Yhdistyneen kuningaskunnan päivämäärämuodot ovat erilaisia). Kun ne tarkistettiin manuaalisesti, ei löydetty yhtään virhettä aikaleimassa.

Tulokset

Verrattaessa automaattisia tuloksia manuaaliseen tarkasteluun, tutkijat totesivat, että aikaa havainnointiin perustuva todisteiden luokittelu paransi merkittävästi oletuksia, jotka perustuivat pelkästään semanttiseen samankaltaisuuteen tai hakutuloksien luokitteluun. He myös totesivat, että heidän menetelmänsä parantaa totuuden ennustamista ajanherkkien väittämien (kuten tilanteissa, joissa uutistilanne voi muuttua nopeasti, ja joissa on tärkeää priorisoida ajantasaisia tietoja ilman, että pelkästään priorisoidaan uusimmat tulokset aihealueella) osalta.

Tutkijat toteavat, että tämä lähestymistapa on erittäin arvokas parantamassa luokittelumalleja herkillä aihealueilla, kuten politiikassa ja viihteessä, joissa tiedot muuttuvat nopeasti, ja joissa korkean tason kehitys vaatii puitteita automaattiselle alentamiselle ylin luokittelusijoituksista, joita ne saavuttavat julkaisun yhteydessä.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai