Andersonin kulma
Konen ytimeen koneoppimisen avulla

EtelÃĪ-Korean tutkijat ovat kÃĪyttÃĪneet koneoppimista kehittÃĪÃĪkseen parannetun menetelmÃĪn todellisen sisÃĪllÃķn erottamiseksi verkkosivuilta, jotta verkkosivun âhuonekalutâ â kuten sivupalkit, alatunnisteet ja navigointipÃĪÃĪtekstit sekÃĪ mainoslohkot â katoavat lukijalle.
Vaikka tÃĪllainen toiminto on joko rakennettu useimpiin suosittuihin verkkoselaimiin tai on helposti saatavilla laajennuksina ja lisÃĪosina, nÃĪmÃĪ teknologiat perustuvat semanttiseen muotoiluun, joka saattaa ei ole lÃĪsnÃĪ verkkosivulla tai joka on tahallisesti heikennetty sivuston omistajan toimesta estÃĪmÃĪÃĪn lukijaa piilotamasta âtÃĪysipainoistaâ sivun kokemusta.

Yksi omista verkkosivustamme âlaimentanutâ Firefoxin sisÃĪÃĪnrakennetun Reader View -toiminnon avulla.
Sen sijaan uusi menetelmÃĪ kÃĪyttÃĪÃĪ ruutupohjaista jÃĪrjestelmÃĪÃĪ, joka kÃĪy verkkosivun lÃĪpi arvioiden, kuinka merkityksellistÃĪ sisÃĪltÃķ on sivun ydinkohdalle.

SisÃĪllÃķn erottamisputki jakaa sivun ruudukkoon (ylÃĪrivi) ennen kuin arvioi lÃķydettyjen merkityksellisten solujen suhdetta muihin soluihin (keski) ja lopulta yhdistÃĪÃĪ hyvÃĪksytyt solut (ala). LÃĪhde: https://arxiv.org/ftp/arxiv/papers/2110/2110.14164.pdf
Kun merkityksellinen solu on tunnistettu, sen suhdetta lÃĪhellÃĪ oleviin soluihin arvioidaan myÃķs ennen kuin se yhdistetÃĪÃĪn tulkittuun âydinsisÃĪltÃķÃķnâ.
LÃĪhestymistavan keskeinen idea on hylÃĪtÃĪ koodipohjainen merkintÃĪ merkityksellisyyden indeksinÃĪ (ts. HTML-tunnisteet, jotka normaalisti merkitsevÃĪt esimerkiksi kappaleen alkua, jotka voidaan korvata vaihtoehtoisilla tunnisteilla, jotka âhuijaavatâ nÃĪytÃķn lukijat ja Reader View -kaltaiset tyÃķkalut) ja johtopÃĪÃĪtÃķs sisÃĪllÃķstÃĪ pelkÃĪstÃĪÃĪn sen visuaalisesta ulkonÃĪÃķstÃĪ.
LÃĪhestymistapa, jota kutsutaan Grid-Center-Expand (GCE) -menetelmÃĪksi, on laajennettu tutkijoiden toimesta syvÃĪn neuroverkkomallin (DNN) malleiksi, jotka hyÃķdyntÃĪvÃĪt Google:n TabNet -tulkintaa tabulaarisen oppimisarkkitehtuurin avulla.
Menestykseen
Artikkeli on otsikoitu ÃlÃĪ lue, vaan katso: PÃĪÃĪsisÃĪllÃķn erottaminen verkkosivuilta visuaalisesti ilmenevien ominaisuuksien avulla, ja se on perÃĪisin kolmelta Hanyangin yliopiston tutkijalta ja yhdeltÃĪ tutkijalta Institute of Convergence Technology -yliopistosta, kaikki sijaitsevat Soulissa.
Parannettu ydinsisÃĪllÃķn erottaminen verkkosivuilta on potentiaalisesti arvokasta sekÃĪ vapaa-ajan loppukÃĪyttÃĪjÃĪlle ettÃĪ konejÃĪrjestelmille, jotka ovat tehtÃĪvÃĪnÃĪÃĪn sisÃĪllÃķn niistÃĪmiselle tai indeksointiin luonnollisen kielen prosessoinnin (NLP) ja muiden tekoÃĪlysektorien tarkoituksiin.
Sen nykyisessÃĪ tilassa, jos epÃĪmerkityksellistÃĪ sisÃĪltÃķÃĪ sisÃĪllytetÃĪÃĪn tÃĪllaisiin erottamisprosesseihin, se voi vaatia manuaalista suodatusta (tai merkintÃĪÃĪ) suurilla kustannuksilla; pahimmassa tapauksessa, jos ei-toivottu sisÃĪltÃķ sisÃĪllytetÃĪÃĪn ydinsisÃĪltÃķÃķn, se voi vaikuttaa siihen, miten ydinsisÃĪltÃķ tulkitaan, ja transformer- ja encoder/decoder -jÃĪrjestelmien lopputulokseen, jotka riippuvat puhtaasta sisÃĪllÃķstÃĪ.
Parannettu menetelmÃĪ on tutkijoiden mukaan erityisen tarpeen, koska olemassa olevat lÃĪhestymistavat usein epÃĪonnistuvat ei-englanninkielisillÃĪ verkkosivuilla.

Ranskan, japanin ja venÃĪjÃĪn verkkosivut mainitaan saavuttaneen huonoimmat onnistumisprosentit neljÃĪllÃĪ yleisimmÃĪllÃĪ âReader Viewâ -lÃĪhetyksellÃĪ: Mozillan Readability.js; Google DOM Distiller; Web2Text; ja Boilernet.
Tietojoukot ja koulutus
Tutkijat kokosivat tietojoukkomateriaalia englanninkielisistÃĪ avainsanoista GoogleTrends-2017 â ja GoogleTrends-2020 -tietojoukoista, vaikka he huomauttavat, ettÃĪ tuloksissa ei ollut kÃĪytÃĪnnÃķn eroja nÃĪiden kahden tietojoukon vÃĪlillÃĪ.
LisÃĪksi kirjoittajat kerÃĪsivÃĪt ei-englanninkielisiÃĪ avainsanoja EtelÃĪ-Koreasta, Ranskasta, Japanista, VenÃĪjÃĪltÃĪ, Indonesiasta ja Saudi-Arabiasta. Kiinalaiset avainsanat lisÃĪttiin Baidu -tietojoukosta, koska Google Trends ei voinut tarjota kiinalaista dataa.
Testaus ja tulokset
JÃĪrjestelmÃĪn testaamisessa kirjoittajat totesivat, ettÃĪ se tarjoaa saman tason suorituskyvyn kuin viimeaikaiset DNN-mallit, samalla tarjoten paremman mukautumisen laajalle valikoimalle kieliÃĪ.
Esimerkiksi Boilernet -arkkitehtuuri, joka yllÃĪpitÃĪÃĪ hyvÃĪÃĪ suorituskykyÃĪ merkityksellisen sisÃĪllÃķn erottamisessa, sopeutuu huonosti kiinalaisiin ja japanilaisiin tietojoukkoihin, kun taas Web2Text kirjoittajat lÃķysivÃĪt âsuhteellisen heikon suorituskyvynâ yleisesti, jolla on kielelliset ominaisuudet, jotka eivÃĪt ole monikielisiÃĪ, ja jotka eivÃĪt sovellu ydinsisÃĪllÃķn erottamiseen verkkosivuilta.
Mozillan Readbility.js havaittiin saavuttaneen hyvÃĪksytyn suorituskyvyn useilla kielillÃĪ, mukaan lukien englanti, vaikka sÃĪÃĪnnÃķnpohjainen menetelmÃĪ. Kuitenkin tutkijat lÃķysivÃĪt, ettÃĪ sen suorituskyky laski merkittÃĪvÃĪsti japanin- ja ranskalaisilla tietojoukoilla, korostamalla sÃĪÃĪnnÃķnpohjaisia lÃĪhestymistapoja alueen ominaisuuksien parsimisen rajoituksia.
Toisaalta Google:n DOM Distiller, joka yhdistÃĪÃĪ heuristiikkaa ja koneoppimista, havaittiin suorittavan hyvin yleisesti.

Tulosten taulukko testatulle menetelmille, mukaan lukien tutkijoiden oma GCE-moduuli. Suuremmat numerot ovat parempia.
Tutkijat pÃĪÃĪttelevÃĪt, ettÃĪ âGCE ei tarvitse pysyÃĪ mukana nopeasti muuttuvassa verkkoympÃĪristÃķssÃĪ, koska se perustuu ihmisen luonteeseen â aidoille maailmanlaajuisille ja monikielisille ominaisuuksilleâ.












