Kąt Andersona

Identyfikowanie sponsorowanego contenu w serwisach informacyjnych za pomocą uczenia maszynowego

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Badacze z Holandii opracowali nową metodę uczenia maszynowego, która pozwala odróżnić sponsorowany lub płatny content w serwisach informacyjnych, z dokładnością przekraczającą 90%, w odpowiedzi na rosnące zainteresowanie reklamodawców formatami “native” reklam, które są trudne do odróżnienia od “prawdziwych” treści dziennikarskich.

Nowy artykuł, zatytułowany Różnicowanie treści komercyjnych i redakcyjnych w serwisach informacyjnych, pochodzi od badaczy z Uniwersytetu w Leiden.

Komercyjne (czerwone) i redakcyjne (niebieskie) subgrafy wynikające z analizy danych. Źródło: https://arxiv.org/pdf/2111.03916.pdf

Komercyjne (czerwone) i redakcyjne (niebieskie) subgrafy wynikające z analizy danych. Źródło: https://arxiv.org/pdf/2111.03916.pdf

Autorzy zauważają, że chociaż bardziej poważne publikacje, które mogą łatwiej dyktować warunki reklamodawcom, będą starały się odróżnić “treści partnerskie” od ogólnego nurtu wiadomości i analiz, standardy powoli ale nieubłaganie zmieniają się w kierunku zwiększonej integracji między zespołami redakcyjnymi i komercyjnymi w wydawnictwie, co uważają za niepokojącą i negatywną tendencję.

‘Możliwość maskowania treści, dobrowolnie lub niedobrowolnie, oraz prawdopodobieństwo, że artykuły sponsorowane nie są rozpoznawane jako takie, nawet jeśli są właściwie oznaczone, jest znaczące. Marketerzy nazywają to “native” [reklamą] z powodu.’

Niektóre bieżące przykłady reklam

Niektóre bieżące przykłady reklam “native”, które są różnie nazywane “treściami partnerskimi”, “treściami marki” i innymi określeniami, które mają subtelnienie zaciemnić różnicę między treściami “native” a komercyjnymi w serwisach informacyjnych.

Praca została przeprowadzona w ramach szerszego badania kultury informacyjnej w sieci w ACED Reverb Channel, z siedzibą w Amsterdamie, który koncentruje się na analizie danych ewoluujących trendów dziennikarskich.

Pobieranie danych

Aby opracować dane źródłowe dla projektu, autorzy wykorzystali 1000 artykułów i 1000 treści sponsorowanych z czterech holenderskich serwisów informacyjnych i sklasyfikowali je na podstawie ich cech tekstowych. Ponieważ zestaw danych był względnie skromny, autorzy unikali podejść dużego zakresu, takich jak BERT, i zamiast tego oceniali skuteczność bardziej klasycznych ram uczenia maszynowego, w tym Support Vector Machine (SVM), LinearSVC, Decision Tree, Random Forest, K-Nearest Neighbor (K-NN), Stochastic Gradient Descent (SGD) i Naïve Bayes.

Korpus Reverb Channel był w stanie dostarczyć 1000 niezbędnych “czystych” artykułów, ale autorzy musieli wyodrębnić treści sponsorowane bezpośrednio z czterech holenderskich stron internetowych. Uzyskane dane są dostępne w ograniczonej formie (ze względu na problemy z prawem autorskim) w GitHub, wraz z częścią kodu Pythona użytego do uzyskania i oceny danych.

Cztery badane publikacje to konserwatywny Nu.nl, bardziej postępowy Telegraaf, NRC i biznesowy dziennik De Ondernemer. Każda publikacja była równo reprezentowana w danych.

Było konieczne zidentyfikowanie i wykluczenie potencjalnych “przecieków” w leksykonie utworzonym przez badanie – słów, które mogą pojawić się w obu typach treści z niewielką różnicą w częstotliwości i użyciu, aby ustalić wyraźne wzorce dla prawdziwie natywnych i sponsorowanych treści.

Wyniki

Wśród wszystkich testowanych metod identyfikacji najlepsze wyniki uzyskano za pomocą SVM, linearSVC, Random Forest i SGD. Dlatego badacze postanowili użyć SVM w dalszej analizie.

Najlepsze podejście modelowe do ekstrakcji klasyfikacji w całym korpusie przekroczyło 90% dokładności, chociaż badacze zauważają, że uzyskanie wyraźnej klasyfikacji staje się trudniejsze przy dealing z publikacjami B2B, gdzie nakładanie się leksykalne między postrzeganymi “prawdziwymi” a “sponsorowanymi” treściami jest nadmierne – być może dlatego, że styl języka biznesowego jest już bardziej subiektywny niż ogólny nurt konwencji raportowania i analizy, i może łatwiej ukryć agendę.

t-Distributed Stochastic Neighbor Embedding (t-SNE) plots for separation of real and sponsored content across the four publications.

t-Distributed Stochastic Neighbor Embedding (t-SNE) plots for separation of real and sponsored content across the four publications.

Czy treści sponsorowane to “fałszywe wiadomości”?

Badania autorów sugerują, że ich projekt jest nowy w dziedzinie analizy treści informacyjnych. Ramy zdolne do identyfikacji treści sponsorowanych mogą otworzyć drogę do opracowania rocznych monitorowań równowagi między obiektywną dziennikarstwem a rosnącym udziałem “reklam natywnych”, które znajdują się w prawie takim samym kontekście w większości publikacji, używając tych samych wskazówek wizualnych (arkusze stylów CSS i inne formatowanie) jak ogólne treści.

W pewnym sensie, częste brak oczywistego kontekstu dla treści sponsorowanych jest pojawiającym się jako sub-dziedzina badania “fałszywych wiadomości”. Chociaż większość wydawców rozpoznaje potrzebę rozdziału “kościoła i państwa” oraz obowiązek dostarczania czytelnikom wyraźnych podziałów między płatnymi a organicznymi treściami, rzeczywistości sceny dziennikarskiej po wydruku oraz zwiększona zależność od reklamodawców, przekształciły minimalizację wskaźników sponsorowanych w sztukę psychologii UI. Czasami nagrody za publikowanie treści sponsorowanych są wystarczająco kuszące, aby ryzykować poważną katastrofę optyczną.

W 2015 roku platforma mediów społecznościowych i benchmarking Quintly zaoferowała metodę wykrywania opartą na AI, aby określić, czy post na Facebooku jest sponsorowany, twierdząc, że osiągnęli dokładność 96%. W następnym roku badanie z Uniwersytetu w Georgii twierdziło, że sposób, w jaki wydawcy obsługują deklarację treści sponsorowanych, może być ‘współwinny oszustwa’.

W 2017 roku MediaShift, organizacja, która bada przecięcie między mediami a technologią, zauważyła, że The New York Times zwiększa swoje dochody poprzez swoje studio treści marki, T Brand Studio, twierdząc, że malejące poziomy transparentności wokół treści sponsorowanych, z tymi samymi niejawno zamierzonymi wynikami, że czytelnicy nie mogą łatwo rozpoznać, czy treść jest organiczna czy nie.

W 2020 roku inicjatywa badawcza z Holandii opracowała klasyfikatory uczenia maszynowego, aby automatycznie identyfikować rosyjskie państwowe serwisy informacyjne pojawiające się w serbskich platformach informacyjnych. Ponadto, w 2019 roku oszacowano, że “rozwiązania treściowe mediów” Forbesa stanowią 40% jego całkowitego dochodu poprzez BrandVoice, studio treści uruchomione przez wydawcę w 2010 roku.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai