Unghiul lui Anderson

Generarea și identificarea propagandei cu ajutorul ÃŪnvățării automatizate

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Noi cercetări din Statele Unite și Qatar oferă o metodă nouă pentru identificarea știrilor false care au fost scrise ÃŪn felul ÃŪn care oamenii ÃŪntr-adevăr scriu știri false – prin ÃŪncorporarea de declarații inexacte ÃŪntr-un context ÃŪn mare parte adevărat și prin utilizarea de tehnici de propagandă populare, cum ar fi apeli la autoritate și limbaj ÃŪncărcat.

Proiectul a dus la crearea unui nou set de date de antrenament pentru detectarea știrilor false, numit PropaNews, care incorporează aceste tehnici. Autorii studiului au descoperit că detectoarele antrenate pe noul set de date sunt cu 7,3-12% mai precise ÃŪn detectarea dezinformării scrise de oameni decÃĒt abordările anterioare de ultimă generație.

Din noul studiu, exemple de 'apeli la autoritate' și 'limbaj ÃŪncărcat'. Sursă: https://arxiv.org/pdf/2203.05386.pdf

Din noul studiu, exemple de ‘apeli la autoritate’ și ‘limbaj ÃŪncărcat’. Sursă: https://arxiv.org/pdf/2203.05386.pdf

Autorii afirmă că, după cunoștința lor, proiectul este primul care incorporează tehnici de propagandă (și nu doar inexactități factuale) ÃŪn exemple de text generate de mașină destinate să alimenteze detectoarele de știri false.

Cea mai mare parte a lucrărilor recente ÃŪn acest domeniu, susțin ei, a studiat bias-ul sau a redefinit datele de “propagandă” ÃŪn contextul bias-ului (probabil pentru că bias-ul a devenit un sector foarte finanțat al ÃŪnvățării automate ÃŪn era post-Analytica).

Autorii afirmă:

‘În contrast, lucrarea noastră generează știri false prin ÃŪncorporarea de tehnici de propagandă și păstrarea majorității informațiilor corecte. Prin urmare, abordarea noastră este mai potrivită pentru studierea apărării ÃŪmpotriva știrilor false scrise de oameni.’

Ei ilustrează, de asemenea, creșterea urgenței unor tehnici de detectare a propagandei mai sofisticate*:

‘Dezinformarea scrisă de oameni, care este adesea utilizată pentru a manipula anumite populații, a avut un impact catastrofal asupra evenimentelor, cum ar fi alegerile prezidențiale din 2016, Brexit, pandemia COVID-19 și recenta agresiune a Rusiei asupra Ucrainei. Prin urmare, avem nevoie urgentă de un mecanism de apărare ÃŪmpotriva dezinformării scrise de oameni.’

Articolul studiului se intitulează Crearea de știri false pentru detectarea știrilor false reale: Generarea de date de antrenament ÃŪncărcate cu propagandă și provine de la cinci cercetători de la Universitatea Illinois Urbana-Champaign, Columbia University, Universitatea Hamad Bin Khalifa din Qatar, Universitatea Washington și Institutul Allen pentru Inteligență Artificială.

Definirea neadevărului

Provocarea de a cuantifica propaganda este ÃŪn mare parte una logistică: este foarte costisitor să angajezi oameni pentru a recunoaște și a annota materialul din lumea reală cu caracteristici de propagandă pentru a fi inclus ÃŪntr-un set de date de antrenament și, posibil, mult mai ieftin să extrageți și să utilizați caracteristici de nivel ÃŪnalt care sunt probabil să funcționeze pe date “nevăzute”, viitoare.

În serviciul unei soluții mai scalabile, cercetătorii au adunat inițial articole de dezinformare create de oameni din surse de știri considerate a fi scăzute ÃŪn acuratețe factuală, prin intermediul site-ului Media Bias Fact Check.

Ei au descoperit că 33% din articolele studiate au utilizat tehnici de propagandă nesincere, inclusiv termeni care declanșează emoții, erori logice și apeli la autorități. Un procent suplimentar de 55% din articole conțineau informații inexacte amestecate cu informații exacte.

Generarea de apeli la autoritate

Abordarea apeli la autoritate are două cazuri de utilizare: citarea de declarații inexacte și citarea de declarații complet fictive. Cercetarea se axează pe al doilea caz de utilizare.

Din noul proiect, cadrul de inferență a limbajului natural RoBERTa identifică două exemple suplimentare de apel la autoritate și limbaj ÃŪncărcat.

Din noul proiect, cadrul de inferență a limbajului natural RoBERTa identifică două exemple suplimentare de apel la autoritate și limbaj ÃŪncărcat.

Cu obiectivul de a crea propagandă generată de mașină pentru noul set de date, cercetătorii au utilizat arhitectura preantrenată seq2seq BART pentru a identifica propoziții semnificative care puteau fi alterate ulterior ÃŪn propagandă. Deoarece nu exista un set de date public disponibil legat de această sarcină, autorii au utilizat un model de rezumat sumar propus ÃŪn 2019 pentru a estima saliabilitatea propozițiilor.

Pentru un articol din fiecare publicație studiată, cercetătorii au ÃŪnlocuit aceste “propoziții marcate” cu argumente false de la “autorități” derivate atÃĒt din serviciul de interogare Wikidata, cÃĒt și de la autoritățile menționate ÃŪn articole (adică oameni și/sau organizații).

Generarea de limbaj ÃŪncărcat

Limbajul ÃŪncărcat include cuvinte, adesea adverbe și adjective sensibilizate (cum ar fi exemplul ilustrat mai sus), care conțin judecăți de valoare implicite ÃŪmpletite ÃŪn contextul furnizării unui fapt.

Pentru a deriva date cu privire la limbajul ÃŪncărcat, autorii au utilizat un set de date dintr-un studiu din 2019 care conține 2.547 limbaj ÃŪncărcat instanțe. Deoarece nu toate exemplele din datele din 2019 includeau adverbe sau adjective care declanșează emoții, cercetătorii au utilizat SpaCy pentru a efectua analiza dependenței și etichetarea părților de vorbire, păstrÃĒnd doar exemplele potrivite pentru includerea ÃŪn cadrul de lucru.

Procesul de filtrare a rezultat ÃŪn 1.017 mostre de limbaj ÃŪncărcat valabil. O altă instanță a lui BART a fost utilizată pentru a masca și a ÃŪnlocui propoziții semnificative din documentele sursă cu limbaj ÃŪncărcat.

Setul de date PropaNews

După antrenamentul modelului intermediar efectuat pe setul de date CNN/DM din 2015 de la Google Deep Mind și Universitatea Oxford, cercetătorii au generat setul de date PropaNews, transformÃĒnd articole nebanale din surse “de ÃŪncredere” cum ar fi The New York Times și The Guardian ÃŪn versiuni “modificate” care conțin propagandă algoritmică creată.

Experimentul a fost modelat după un studiu din 2013 de la Hanover, care a generat automat rezumate de cronologie ale știrilor din 17 evenimente de știri și un total de 4.535 de articole.

Dezinformarea generată a fost prezentată la 400 de lucrători unici de la Amazon Mechanical Turk (AMT), care au efectuat 2000 de sarcini de inteligență umană (HIT). Doar articolele de propagandă considerate exacte de către lucrători au fost incluse ÃŪn versiunea finală a PropaNews. Adjudicarea pe divergențe a fost notată prin metoda Worker Agreement With Aggregate (WAWA).

Versiunea finală a PropaNews conține 2.256 de articole, echilibrate ÃŪntre ieșiri false și reale, 30% dintre acestea utilizÃĒnd apeli la autoritate, iar 30% utilizÃĒnd limbaj ÃŪncărcat. Restul conține doar informații inexacte de tipul care a populat ÃŪn mare parte seturile de date anterioare ÃŪn acest domeniu de cercetare.

Datele au fost ÃŪmpărțite ÃŪn 1.256:500:500 pe distribuții de antrenament, testare și validare.

Setul de date HumanNews

Pentru a evalua eficacitatea rutinelor de detectare a propagandei antrenate, cercetătorii au compilat 200 de articole de știri scrise de oameni, inclusiv articole demontate de Politifact și publicate ÃŪntre 2015-2020.

Acest set de date a fost completat cu articole demontate suplimentare din surse de știri mass-media neverificabile și totalul a fost verificat de un student absolvent major ÃŪn științe computaționale.

Setul de date final, intitulat HumanNews, include și 100 de articole din Los Angeles Times.

Teste

Procesul de detectare a fost comparat cu cadrele anterioare ÃŪn două forme: PN-Silver, care ignoră validarea annotatorului AMT, și PN-Gold, care include validarea ca criteriu.

Cadrele concurente au inclus oferirea din 2019 Grover-GEN, Fact-GEN din 2020 și FakeEvent, ÃŪn care articolele din PN-Silver sunt ÃŪnlocuite cu documente generate de metodele mai vechi.

Variantele lui Grover și RoBERTa s-au dovedit a fi cele mai eficiente atunci cÃĒnd au fost antrenate pe noul set de date PropaNews, cercetătorii concluzionÃĒnd că ‘detectoarele antrenate pe PROPANEWS detectează mai bine dezinformarea scrisă de oameni ÃŪn comparație cu antrenarea pe alte seturi de date’.

Cercetătorii observă, de asemenea, că chiar și setul de date PN-Silver, parțial ÃŪncetinit, depășește metodele mai vechi pe alte seturi de date.

Învechit?

Autorii reiterează lipsa de cercetare pÃĒnă ÃŪn prezent cu privire la generarea și identificarea automată a știrilor false axate pe propagandă și avertizează că utilizarea modelelor antrenate pe date anterioare evenimentelor critice (cum ar fi COVID sau, probabil, situația curentă din Europa de Est) nu poate fi așteptată să funcționeze optim:

‘Aproximativ 48% din dezinformarea scrisă de oameni, clasificată greșit, este cauzată de incapacitatea de a dobÃĒndi cunoștințe dinamice din surse de știri noi. De exemplu, articolele legate de COVID sunt de obicei publicate după 2020, ÃŪn timp ce ROBERTA a fost preantrenat pe articole de știri lansate ÃŪnainte de 2019. Este foarte dificil pentru ROBERTA să detecteze dezinformarea unor astfel de subiecte, dacă detectorul nu este echipat cu capacități de a dobÃĒndi cunoștințe dinamice din articole de știri.’

Autorii notează, de asemenea, că RoBERTa obține o acuratețe de 69,0% pentru detectarea știrilor false ÃŪn cazul ÃŪn care materialul este publicat ÃŪnainte de 2019, dar scade la 51,9% acuratețe atunci cÃĒnd se aplică ÃŪmpotriva articolelor de știri publicate după această dată.

Paltă și Context

Deși studiul nu abordează direct acest subiect, este posibil ca acest fel de analiză profundă a efectului semantic să poată aborda, ÃŪn cele din urmă, o utilizare mai subtilă a limbajului, cum ar fi paltă – utilizarea ÃŪn interes propriu și selectivă a declarațiilor adevărate pentru a obține un rezultat dorit care poate fi ÃŪn contradicție cu spiritul și intenția percepută a dovezilor utilizate.

O linie de cercetare ÃŪnrudite și puțin mai dezvoltată ÃŪn NLP, viziunea computerizată și cercetarea multimodală este studiu de context ca un adjunct al ÃŪnțelesului, ÃŪn care reordonarea selectivă sau recontextualizarea faptelor adevărate devine echivalentă cu o ÃŪncercare de a provoca o reacție diferită decÃĒt cea pe care faptele ar fi putut-o provoca ÃŪn mod normal, dacă ar fi fost prezentate ÃŪntr-o manieră mai clară și mai liniară.

 

* Conversia mea a citărilor inline ale autorilor ÃŪn legături directe.

Publicat pentru prima dată pe 11 martie 2022.

Scriitor pe machine learning, specialist ÃŪn domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, pÃĒnă la dizolvarea sa ÃŪn Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]