Andersons vinkel

Identificering af sponsorerede indhold pÃĨ nyhedssteder med maskinlÃĶring

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

Forskere fra Nederlandene har udviklet en ny maskinlÃĶringsmetode, der kan skelne mellem sponsorerede eller betalte indhold pÃĨ nyhedsplatforme med en nÃļjagtighed pÃĨ over 90%, som svar pÃĨ den stigende interesse fra annoncÃļrer i ‘native’ reklameformater, der er svÃĶre at skelne fra ‘ÃĶgte’ journalistiske udgivelser.

Den nye rapport, med titlen At skelne mellem kommercielt og redaktionelt indhold i nyheder, kommer fra forskere ved Leiden Universitet.

Kommersielle (rÃļd) og redaktionelle (blÃĨ) undergrafer, der opstÃĨr fra analyse af dataene. Kilde: https://arxiv.org/pdf/2111.03916.pdf

Kommersielle (rÃļd) og redaktionelle (blÃĨ) undergrafer, der opstÃĨr fra analyse af dataene. Kilde: https://arxiv.org/pdf/2111.03916.pdf

Forfatterne observerer, at selvom mere alvorlige udgivelser, der kan diktere vilkÃĨr for annoncÃļrer, vil gÃļre en rimelig indsats for at skelne ‘partnerindhold’ fra den generelle nyheds- og analysestrÃļm, standarderne langsomt men uafvendeligt skifter til en Ãļget integration mellem redaktionelle og kommercielle hold pÃĨ en udgivelse, hvilket de betragter som en alarmerende og negativ trend.

‘Evnen til at forklaede indhold, frivilligt eller ufrivilligt, og sandsynligheden for, at annonceringsartikler ikke genkendes som sÃĨdanne, selv hvis de er korrekt mÃĶrket, er betydelig. MarkedsfÃļrere kalder det for native [reklame] af en grund.’

Nogle nuvÃĶrende eksempler pÃĨ native reklame, der forskelligt kaldes 'partnerindhold', 'brandindhold' og mange andre betegnelser, der er designet til at skjule forskellen mellem native og kommercielt placeret indhold pÃĨ journalistiske platforme.

Nogle nuvÃĶrende eksempler pÃĨ native reklame, der forskelligt kaldes ‘partnerindhold’, ‘brandindhold’ og mange andre betegnelser, der er designet til at skjule forskellen mellem native og kommercielt placeret indhold pÃĨ journalistiske platforme.

Arbejdet blev udfÃļrt som en del af en bredere undersÃļgelse af netvÃĶrksnyheds-kultur ved ACED Reverb Channel, der er baseret i Amsterdam, og som koncentrerer sig om data-dreven analyse af udviklende journalistiske tendenser.

Indsamling af data

For at udvikle kilde-data til projektet brugte forfatterne 1.000 artikler og 1.000 annonceringsartikler fra fire hollandske nyhedsudgivelser og klassificerede dem pÃĨ basis af deres tekstlige funktioner. Da datasettet var relativt beskedent i stÃļrrelse, undgik forfatterne store skala-tilgange som BERT, og i stedet vurderede de effekten af mere klassiske maskinlÃĶrings-rammer, herunder Support Vector Machine (SVM), LinearSVC, Decision Tree, Random Forest, K-Nearest Neighbor (K-NN), Stochastic Gradient Descent (SGD) og NaÃŊve Bayes.

Reverb Channel-korpusset kunne levere de 1.000 nÃļdvendige ‘rene’ artikler, men forfatterne mÃĨtte skrabe annonceringsartikler direkte fra de fire hollandske websites, der var med. De erhvervede data er tilgÃĶngelige i begrÃĶnset form (pÃĨ grund af ophavsrets bekymringer) pÃĨ GitHub, sammen med nogle af de Python-koder, der blev brugt til at erhverve og evaluere dataene.

De fire udgivelser, der blev studeret, var den konservative Nu.nl, den mere progressive Telegraaf, NRC og erhvervsbladet De Ondernemer. Hver udgivelse var lige reprÃĶsenteret i dataene.

Det var nÃļdvendigt at identificere og fratrage potentielle ‘lÃĶkere’ i leksikonet, der blev dannet af forskningen – ord, der kunne optrÃĶde i begge typer indhold med lidt forskel i deres hyppighed og brug, for at etablere klare mÃļnstre for virkelig native og sponsorerede indhold.

Resultater

Over de metoder, der blev testet til identifikation, blev de bedste resultater opnÃĨet af SVM, linearSVC, Random Forest og SGD. Derfor fortsatte forskerne med at bruge SVM i yderligere analyse.

Den bedste modeltilgang til at trÃĶkke klassificering over korpusset overgik 90% nÃļjagtighed, selv om forskerne bemÃĶrker, at det at opnÃĨ en klar klassificering bliver mere svÃĶrt, nÃĨr man har med B2B-orienterede udgivelser at gÃļre, hvor den leksikalske overlap mellem opfattet ‘ÃĶgte’ og ‘sponsorerede’ indhold er excessiv – mÃĨske fordi den native stil af erhvervssprog allerede er mere subjektiv end den generelle strÃļm af rapporterings- og analysekonventioner, og kan mere let skjule en dagsorden.

t-Distributed Stochastic Neighbor Embedding (t-SNE) plots for separation of real og sponsorerede indhold over de fire udgivelser.

t-Distributed Stochastic Neighbor Embedding (t-SNE) plots for separation of real og sponsorerede indhold over de fire udgivelser.

Er sponsorerede indhold ‘falske nyheder’?

Forfatternes forskning antyder, at deres projekt er nyt i feltet for nyhedsindholdsanalyse. Rammer, der kan identificere sponsorerede indhold, kan bana vejen for at udvikle ÃĨr-for-ÃĨr-overvÃĨgning af balancen mellem objektiv journalistik og den voksende tranche af ‘native reklame’, der sidder i nÃĶsten samme kontekst i de fleste udgivelser, ved at bruge samme visuelle signaler (CSS-stilarter og andre formateringer) som generel indhold.

PÃĨ en vis mÃĨde opstÃĨr den hyppige mangel pÃĨ ÃĨbenlys kontekst for sponsorerede indhold som en underdisciplin for studiet af ‘falske nyheder’. Selv om de fleste udgivere erkender behovet for adskillelse af ‘kirke og stat’, og forpligtelsen til at give lÃĶserne klare skel mellem betalte og organisk genererede indhold, har realiteterne i den post-trykte journalistiske scene og den Ãļgede afhÃĶngighed af annoncÃļrer vendt afsvÃĶkkelsen af sponsorerede indikatorer til en fin kunst i UI-psykologi. Nogle gange er belÃļnningerne for at kÃļre sponsorerede indhold tilstrÃĶkkeligt til at risikere en major optisk katastrofe.

I 2015 tilbÃļd den sociale medie- og konkurrence-benchmarking-platform Quintly en AI-baseret detectionsmetode til at bestemme, om en post pÃĨ Facebook er sponsorerede, og hÃĶvdede en nÃļjagtighedsrate pÃĨ 96%. Året efter pÃĨstod en studie fra University of Georgia, at mÃĨden, hvorpÃĨ udgivere hÃĨndterer erklÃĶringen af sponsorerede indhold, kan vÃĶre ‘medskyldig i bedrag’.

I 2017 observerede MediaShift, en organisation, der undersÃļger intersectionen mellem medie og teknologi, , at The New York Times moneterer sine operationer gennem sin brandede indholdsstudio, T Brand Studio, og hÃĶvdede, at der var en aftagende niveau af gennemsigtighed omkring sponsorerede indhold, med den underforstÃĨede hensigt, at lÃĶserne ikke kan let skelne, om indhold er organisk genereret eller ej.

I 2020 udviklede en anden forskningsinitiativ fra Nederlandene maskinlÃĶringsklassifikatorer til at automatisk identificere russisk statsfinansieret nyheder, der optrÃĶder i serbiske nyhedsplatforme. Yderligere blev det estimeret i 2019, at Forbes’ ‘medieindholdslÃļsninger’ stÃĨr for 40% af deres samlede omsÃĶtning gennem BrandVoice, det indholdsstudio, der blev lanceret af udgiveren i 2010.

Forfatter til maskinlÃĶringsartikler, domÃĶneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold pÃĨ Metaphysic.ai, indtil oplÃļsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]