Unghiul lui Anderson
Devalorizarea acțiunilor cu retweet-uri create adversar

O colaborare de cercetare comună între universitățile din SUA și IBM a formulat o demonstrație a unui atac adversar care este teoretic capabil să provoace pierderi pe piața bursieră, prin simpla schimbare a unui cuvânt într-un retweet al unui post de pe Twitter.

Într-un experiment, cercetătorii au reușit să împiedice modelul de predicție Stocknet cu două metode: un atac de manipulare și un atac de concatenare. Sursă: https://arxiv.org/pdf/2205.01094.pdf
Suprafața de atac pentru un atac adversar asupra sistemelor automate și de învățare a mașinilor de predicție a acțiunilor este aceea că un număr tot mai mare dintre ele se bazează pe rețelele sociale organice ca predictorii performanței; și că manipularea acestor date “în sălbăticie” este un proces care poate, în mod potențial, fi formulat în mod fiabil.
Pe lângă Twitter, sistemele de acest tip ingerează date de la Reddit, StockTwits și Yahoo News, printre altele. Diferența dintre Twitter și celelalte surse este că retweet-urile sunt editabile, chiar dacă tweet-urile originale nu sunt. Pe de altă parte, este posibil să se facă doar postări suplimentare (de exemplu, comentarii sau postări conexe) pe Reddit, sau să se comenteze și să se evalueze – acțiuni care sunt tratate în mod corect ca fiind partizane și auto-servitoare de către rutinele și practicile de curățare a datelor ale sistemelor de predicție a acțiunilor bazate pe mașini.
Într-un experiment, pe modelul de predicție Stocknet, cercetătorii au reușit să provoace scăderi semnificative ale valorii acțiunilor prin două metode, cea mai eficientă dintre ele, atacul de manipulare (adică retweet-uri editate), a fost capabilă să provoace scăderi mai severe.
Acest lucru a fost realizat, conform cercetătorilor, prin simularea unei singure substituții într-un retweet de la o sursă financiară “respectată” de pe Twitter:

Cuvintele au importanță. Aici, diferența dintre ‘umplut’ și ‘exercitat’ (nu un cuvânt în mod evident malign sau înșelător, dar aproape categorizat ca sinonim) a costat teoretic un investitor mii de dolari în devalorizarea acțiunilor.
Articolul afirmă:
‘Rezultatele noastre arată că metoda noastră de atac propusă poate obține rate de succes constante și poate provoca pierderi financiare semnificative în simulări de tranzacționare prin simpla concatenare a unui tweet perturbat, dar semantic similar.’
Cercetătorii concluzionează:
‘Această lucrare demonstrează că metoda noastră de atac adversar înșeală în mod constant diverse modele de previziune financiară, chiar și cu constrângeri fizice, astfel încât tweet-ul brut nu poate fi modificat. Adăugând un retweet cu doar un cuvânt înlocuit, atacul poate provoca o pierdere suplimentară de 32% a portofoliului nostru de investiții simulate.
‘Prin studiul vulnerabilității modelului financiar, scopul nostru este de a crește conștientizarea comunității financiare cu privire la riscurile modelului de inteligență artificială, astfel încât, în viitor, putem dezvolta o arhitectură de inteligență artificială mai robustă, cu omul în buclă.’
Articolul, intitulat Un cuvânt valorează mii de dolari: Atac adversar pe tweet-uri înșeală previziunea acțiunilor, provine de la șase cercetători, proveniți din diverse universități, printre care University of Illinois Urbana-Champaign, State University of New York at Buffalo și Michigan State University, cu trei dintre cercetători afiliați la IBM.
Cuvinte nefericite
Articolul examinează dacă domeniul bine studiat al atacurilor adversare asupra modelelor de învățare automată bazate pe text este aplicabil modelelor de predicție a acțiunilor, a căror capacitate de previziune depinde de factori “umani” care pot fi doar aproximativ deduși din sursele de social media.
După cum notează cercetătorii, potențialul manipulării social media pentru a afecta prețurile acțiunilor a fost bine demonstrat, deși nu încă prin metodele propuse în lucrare; în 2013, un tweet malign pe contul hackat al Associated Press a șters 136 miliarde de dolari de pe piața bursieră în aproximativ trei minute.
Metoda propusă în noua lucrare implementează un atac de concatenare, care lasă tweet-ul original neatins, în timp ce îl citează în mod greșit:

Din materialul suplimentar al articolului, exemple de retweet-uri care conțin sinonime înlocuite care schimbă intenția și semnificația mesajului original, fără a-l distorsiona într-un mod care ar putea fi detectat de oameni sau de filtre simple, dar care pot exploata algoritmii sistemelor de predicție a acțiunilor.
Cercetătorii au abordat crearea de retweet-uri adversare ca o problemă de optimizare combinatorie – crearea de exemple adversare capabile să înșele modelul victimă, chiar și cu un vocabular limitat.

Înlocuirea cuvintelor folosind sememe – ‘unitatea semantică minimă a limbilor umane’. Sursă: https://aclanthology.org/2020.acl-main.540.pdf
Articolul observă:
‘În cazul Twitter, adversarii pot posta tweet-uri maligne care sunt create pentru a manipula modelele din aval care le iau ca intrare.
‘Propunem să atacăm prin postarea de tweet-uri adversare semantic similare ca retweet-uri pe Twitter, astfel încât acestea să poată fi identificate ca informații relevante și colectate ca intrare pentru model.’
Pentru fiecare tweet dintr-un grup special selectat, cercetătorii au rezolvat problema selectării cuvintelor sub constrângerile bugetului de cuvinte și tweet-uri, care impun restricții severe în ceea ce privește divergența semantică de la cuvântul original și înlocuirea unui cuvânt “malign/benign”.
Tweet-urile adversare sunt formulate pe baza tweet-urilor pertinente care sunt probabil să fie permise în sistemele de predicție a acțiunilor din aval. Tweet-ul trebuie să treacă neîmpiedicat prin sistemul de moderare a conținutului Twitter și nu trebuie să pară contraintuitiv pentru un observator uman ocazional.
Urmand lucrări anterioare (de la Michigan State University, împreună cu CSAIL, MIT și MIT-IBM Watson AI Lab), cuvinte selectate din tweet-ul țintă sunt înlocuite cu sinonime dintr-un grup limitat de posibilități de sinonime, toate acestea trebuind să fie semantic foarte aproape de cuvântul original, menținând în același timp “influența coruptă”, pe baza comportamentului dedus al sistemelor de predicție a acțiunilor.
Algoritmii utilizați în experimentele ulterioare au fost solverul de optimizare comună (JO) și solverul de optimizare alternativă (AGO).
Date și experimente
Acestă abordare a fost încercată pe un set de date de predicție a acțiunilor care cuprinde 10.824 de exemple de tweet-uri pertinente și informații despre performanța pieței, pe 88 de acțiuni, între 2014-2016.
Trei “modele victime” au fost alese: Stocknet; FinGRU (o derivată a GRU); și FinLSTM (o derivată a LSTM).
Metricile de evaluare au constat în rata de succes a atacului (ASR) și o scădere a scorului F1 al modelului victimă după atacul adversar. Cercetătorii au simulat o strategie de cumpărare și vânzare pe termen lung pentru testele efectuate. Profitul și pierderea (PnL) au fost calculate și în simulări.

Rezultatele experimentelor. Vezi și primul grafic de la începutul acestui articol.
Sub JO și AGO, ASR crește cu 10%, iar scorul F1 al modelului scade cu 0,1 în medie, comparativ cu un atac aleator. Cercetătorii notează:
‘O astfel de scădere a performanței este considerată semnificativă în contextul previziunii acțiunilor, având în vedere că acuratețea de previziune a randamentului interziunar este de aproximativ 60%.’
În tranșa de profit și pierdere a (atacului virtual asupra) Stocknet, rezultatele retweet-urilor adversare au fost de asemenea remarcabile:
‘Pentru fiecare simulare, investitorul are 10.000 de dolari (100%) pentru a investi; rezultatele arată că metoda noastră de atac propusă, cu un retweet care conține doar o singură înlocuire de cuvânt, poate provoca investitorului o pierdere suplimentară de 3.200 de dolari (75%-43%) a portofoliului său după aproximativ doi ani.’
Publicat pentru prima dată pe 4 mai 2022.












