Andersonův úhel

Umělá inteligence může pomoci identifikovat „růžový sliz“ v novinách

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
AI-generated illustration featuring two 'perfect' and typical US-style newsreaders in a news anchor room – an older male and younger blonde female both Caucasian, with robots and technicians in the background. Z-Image, Firefly 3, et al.

if AI is used to make them sound more original and rational. So the race is on to stay ahead in the ‘pink slime detection’ game. Definancing tradičních místních médií za posledních dvacet let, způsobený jak změnou trendů

 

Agenda-driven opinion mills, designed more to sway public opinion than serve the public, might be harder to spot v médiích, taknedávnou US government policy , zanechal void v regionálním reportingu, který byl ochotně převzat partisan organizations using AIto drive their agendas . Chceme-li uvést termín “partisan” do kontextu (vzhledem k tomu, že žádná zpravodajská organizace není zcela bez politických tendencí), mluvíme o ropných společnostech, které provozují regionální zpravodajské weby z vzdálených míst, bez jakýchkoli skutečných místních zdrojů, ale s cílem hájit veřejnou pověst společnosti; politicky motivované zpravodajské weby bez jakéhokoli příjmu se připravují před volbami; a celé sítě pro-republikánskýchzpravodajských webů se objevují zničehonic , blízko volebního času. V roce 2024 se odhadovalo, že AI-driven pink slime news konečně převýšila skutečné zpravodajské kanály; v té době australský průzkum zjistil, že 41% spotřebitelů preferuje pink slime zdroje před “skutečnými” zdroji. Tento typ skrytého volebního inženýrství se může zdát jako evoluce od pouhého temného umění k existenční hrozbě pro demokracii (co se týče politicky motivovaných kanálů) a pro veřejnou důvěru v rozumné standardy férovosti ve zprávách. Metody, které by umožnily rozlišit charakteristické výstupy pink slime vydavatelů a vysílatelů od tradičních médií, by byly velmi užitečné, alespoň pro pochopení, kdo jsou hráči a hnací síly v současném informačním klimatu. Jak tomu je, tropes a šablony skutečných zpravodajských organizací jsou velmi snadno napodobitelné a AI dělá publikování škálovatelným a dostupným, pomocí mnoha stejných triků přijímaných rozpočtově omezenými “starými” vydavateli a vysílateli.

Signál a šum

Nová studie z USA se zabývá touto otázkou, zkoumáním rostoucího používání Large Language Models, aby pink slime weby zněly méně genericky a snadno identifikovatelné, a vytvořením učení frameworku, který je navržen tak, aby držely krok s vývojem změn v pink slime (PS) výstupu. Název , nová Exposing Pink Slime Journalism: Linguistic Signatures and Robust Detection Against LLM-Generated Threatspráce pochází od pěti výzkumníků z University of Texas. Nová práce zkoumá, jak se masově vyráběné PS lokální zpravodajské články liší od legitimitních zpráv, zaměřujících se na jejich závislost na krátkých, repetitivních strukturách a šablonovitých frázích s minimální variací; a autoři poznamenávají, že PS články tendují k opětovnému použití identických šablon, navržených k manipulaci veřejným míněním, s apely na emoce na prvním

From the new paper - multiple outlets publish near-identical articles with only location details changed, revealing a copy-paste strategy used to mass-produce content that mimics legitimate local news. Source - https://arxiv.org/pdf/2512.05331 místě v obsahu: From the new paper – multiple outlets publish near-identical articles with only location details changed, revealing a copy-paste strategy used to mass-produce content that mimics legitimate local

news.Source Tradiční detekční modely trénované na těchto funkcích fungují proti takovému obsahu dobře, ale selhávají, když jsou články přepsány chatboty s umělou inteligencí tak, aby vypadaly přirozeněji nebo sofistikovaněji. Vlastní testy autorů ukazují, že i malé stylistické změny zavedené rozsáhlými jazykovými modely mohou snížit přesnost detekce až o 40 %. Aby se tomu zabránilo, navrhují kontinuální učení framework, který postupně přeškoluje detekční modely na původních i AI-přepsaných článcích, aby se přizpůsobil měnícím se lingvistickým vzorcům.

Metoda

Pro založení dat pro projekt autoři použili Pink Slime Dataset ,který obsahuje 7,9 milionu článků pokrývajících 1 093 kanálů v letech 2021-2023, z nichž získali 9 472 pink slime článků po filtrování. Použili také LIARdataset , který obsahuje anotované falešné zprávy, a NELA-GT-2021 kolekci, která obsahuje pouze články z USA*. Pro přípravu svých trénovacích a testovacích sad autoři nejprve použili algoritmus T-distributed Stochastic NeighborEmbedding( t-SNE ) k redukci článku embeddings na dvě dimenze. Poté aplikovali algoritmus Density-Based-Spatial-Clustering-of-Applications-with-Noise ( DBSCAN ) k izolaci klastrů podobnýchpink-slimečlánků. Každý klastr byl považován za skupinu souvisejících příběhů, z nichž mnohé stále následovaly stejnou šablonu, navzdory úsilí o vyřešení duplikátů. Pro zabránění podobným článkům ve výskytu v trénovacích i Tento proces byl opakovaný třikrát, aby se zajistilakonzistence a snížila testovacích sadách byly celé klastry náhodně vybrány, s 80% použitými pro trénování a 20% pro testování. Protože legitimitní zpravodajské články netvořily jasné klastry, byl aplikován náhodný split . sampling bias . Charakteristiky Pink Slime Komentář

než devět vět

k rozlišujícím rysům PS ve srovnání s běžnými zprávami, výzkumníci tvrdí, že PS-style lokální zpravodajské články jsou významně kratší a jednodušší než legitimitní reportáže, průměrně méně na článek. Vyšší podíl jednoduchých vět a větší závislost na adjektivech jsou dalšími charakteristickými rysy pink slime, podle článku, a naznačují sklon k repetitivní, emocionálně nabité řeči. Tyto vzorce naznačují

omezenou slovní zásobu a formulaický styl, v kontrastu slegitimitnímimístní zprávy, které se vyznačují složitými slovními druhy postavenými na pomocných slovesech, zájmenech a spojkách. Místo toho falešné články upřednostňují základní strukturu podstatných jmen a předložek s častým používáním interpunkce založené na Lexikální bohatost byla měřena poměrem kořenových typů a tokenů (RTTR) a byla zjištěna jako výrazně nižší u PS článků, které také vykazovaly mnohem méně unikátních jmenných frází. trigramů, naznačujících méně formální, fragmentovanější styl psaní.

Testy

Pro zkoumání asociací mezi různými typy zpravodajských článků, založených na lingvistických a strukturálních vlastnostech, byly generovány embeddings pomocí 435-milionového parametru stella_en_400M_v5 modelu, a redukovány pomocí Principal Component Analysis ( PCA),a t-SNE pro visualizaci. Když byly projekovány do dvou dimenzí, falešné lokální zpravodajské články tvořily malé, husté klastry, každá odpovídající úzce zaměřeným tématům, jako jsou statistiky zločinnosti, akciové aktualizace nebo charitativní dary:

Clustering patterns from a t-SNE projection reveal that pink slime articles form tight, repetitive groupings, while legitimate news displays broader, more varied distributions aligned with topic and style diversity. Vzory shlukování z projekce t-SNE ukazují, že články o růžovém slizu tvoří těsné, opakující se seskupení, zatímco legitimní zprávy vykazují širší a pestřejší rozdělení v souladu s rozmanitostí témat a stylů.

Jako můžeme vidět, alespoň částečně, ve výše uvedené visualizaci, tento vzorec naznačuje rigidní, šablonovitou formu, s minimální variací mezi články. Zajímavé je, že články označené jako “falešné zprávy” se odchýlily od falešného lokálního obsahu, ukazující distribuci více v souladu s skutečnými zprávami, naznačující, že masově vyráběné lokální falešné zprávy nemusí být jednoduše méně pravdivé, ale mohou být také mechanicky odlišné ve formě a složení. Naproti tomu “legitimní” lokální zprávy tvoří méně a více rozptýlené klastry, odpovídající více rozmanitým jazykovým a tématům, zatímco národní zpravodajské články ukazují ještě větší rozptýlení, odrážející širší tématický rozsah a volnější stylistickou konzistenci.

Feature comparisons between legitimate local news and pink slime content, indicating that PS articles are shorter, use simpler sentence structures, contain more adjectives, exhibit lower lexical richness, favor basic part-of-speech trigrams, and contain fewer unique noun phrases. Srovnání mezi legitimními místními zprávami a obsahem růžového slizu naznačuje, že články PS jsou kratší, používají jednodušší větné struktury, obsahují více přídavných jmen, vykazují nižší lexikální bohatost, upřednostňují základní trigramy slovních druhů a obsahují méně jedinečných jmenných frází.

Detection

Výzkumníci hodnotili dva hlavní přístupy k detekci pink slime obsahu: klasifikaci , založenou na ručně vytvořenýchlingvistických vlastnostech; tomto souborua transformer -založenou . fine-tuning Pro ručně vytvořený přístup byly zdůrazněny strukturální spíše než sémantické charakteristiky, pomocí počtu vět; lexikální bohatosti; syntaktické hloubky; částí řeči koexistenčních pravděpodobností; závislostních tagů koexistenčních pravděpodobností; čitelnosti; a částí řeči počtů. Tři modely byly testovány na vlastností:XGBoost ; RandomForest ; a Support Vector Machine (SVM) – s Random Forest ukazujícím mírně lepší výsledky celkově. Oba XGBoost a Random Forest přiřadily vysokou předpovědní důležitost vlastnostem, jako je počet vět a počet unikátních noun frází. Čitelnost a lexikální bohatost měření také silně ovlivňovaly klasifikaci, i když modely tyto vážily odlišně, s XGBoost favorizujícím Flesch a RTTR, zatímco Random Forest se

Feature importance scores based on SHAP (SHapley Additive exPlanations) highlight how each input feature influences the model’s output across samples. In this case, SHAP values reveal that both XGBoost and Random Forest relied most heavily on sentence count and unique noun phrases to distinguish pink slime from real news, while assigning varying weight to measures of lexical richness and readability. naklonil k CTTR: Feature importance scores based on SHAP (SHapley Additive exPlanations) highlight how each input feature influences the model’s output across samples. In this case, SHAP values reveal that both XGBoost and Random Forest relied most heavily on sentence count and unique noun phrases to distinguish pink slime from real news, while assigning varying weight to measures

of lexical richness and readability. Jako můžeme vidět v předchozích srovnáních (výše), pink slime články favorizují senzacionalismus nad detaily, s nižší lexikální bohatostí, a s méně rozdílnými noun frázemi – potvrzující závěr, že tento typ obsahu je vysoce šablonovitý a repetitivní. Části řeči trigram vzorce potvrzují, že legitimitní lokální zprávy tendují k použití více strukturálně komplexních forem, zahrnujících pomocná verba, zájmena a spojky, zatímco pink slime favorizuje fragmentované nebo minimální syntax. Tyto vzorce naznačují spolehlivý základ pro rozlišení syntetického lokálního obsahu od skutečné žurnalistiky. Druhá série testů zahrnovala fine-tuning transformer modelů na plném článku textu, aby zachytily jak sémantický obsah, tak

syntaktickoustrukturu. BERT, XLNet , a Flan-T5 byly testovány, s BERT dosahujícím nejvyšší F1-score 89,31% – i když článek poznamenává, že rozdíly ve výkonu nebyly statisticky významné. Na rozdíl od ručně vytvořených klasifikátorů tyto modely aktualizují všechny váhy během trénování, umožňující jim naučit se úkol-specifické reprezentace přímo z dat. Další embedding-založený metodou byl použit Tyto přístupy bénéficiovaly z širšího lingvistického kontextu – výhodného, vzhledem k tomu, že pink slime články často recyklují obsah napříč kanály. Ručně vytvořené vlastnosti, na druhé straně, spoléhají na povrchovou syntaxi samotnou, omezující jejich schopnost generalizovat napříč zdroji. fully-connected downstream klasifikátor, který fungoval lépe než ručně vytvořené modely, ale nedosáhl přesnosti plného fine-tuning.

Boosting Pink Slime with LLMs

Pro testování, zda pink slime články mohou být učiněny obtížněji detekovatelnými, výzkumníci přepsali je pomocí velkých jazykových modelů. Prompts byly navrženy tak, aby vylepšily styl psaní, rozšířily

Výkon detekce (F1) vyladěného klasifikátoru BERT, když jsou články růžového slizu přepisovány různými LLM. Nižší skóre značí úspěšnější obfuskaci. obsah, přidaly složitost vět, snížily nadužívání

adjektiv, vynutily

neutrální tón, použily více rozmanité slovní zásoby a zvýšily

skrýt povrchové rysy, na které se většina detekčních systémů spoléhá**.

počet unikátních noun frází, s cílem

Závěr

obsah, Tato řada výzkumu obsahuje některé zajímavé dilemata, z nichž nejmenší není to, že tolik lidí (podle alespoň jednoho průzkumu, zmíněného dříve) Opinion podporuje PS vědomě, že to je, že to přináší pejorativní kontext do otázky. Je to, jako by lidé věděli, že “Soylent Green is people”, ale pokrčí rameny a pokračují v jídle; nebo tak to může vypadat, z liberálního hlediska. Tento veřejný nezájem o algoritmické zprávy může evolovat a dokonce regresovat – ale prozatím se zdá, že se prohlubuje. Jinou věcí, která mě zasáhla, když jsem četl článek, byla způsob, jakým byla jednodušší próza a redukcionismus pink slime výstupu považován za nedostatek s možným technologickým řešením, když minimalismus, emocionalismus a omezená slovní zásoba jsou zřejmě všechny úmyslné. Pokud různé zájmové skupiny za PS chtějí rozšířit svůj dosah na více intelektuální nebo liberální publikum (i když by to mohlo být mimo jejich silné stránky), zdá se pravděpodobnější, že se usadí blíže ke svému cílovému publiku, než aby změnily styl jazyka a tón, který již dosahuje jejich cílů na stávajících platformách. * Due to some unfortunate formatting in the paper, the extra source of local news articles does not have a clear attribution. Please refer to the source paper and guess which of the ‘Horne’ references applies. ** Here we refer

the reader to the source paper for details of the secondary, supplementary experiments that close out the results section of the new paper.

First published Friday, 12. prosince 2025

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai