Modele și platforme AI

Algoritmul TextFooler înșeală inteligența artificială NLP

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Deși algoritmii și sistemele de procesare a limbajului natural au devenit impresionanți în ultimii ani, acestea sunt încă vulnerabile la un tip de atac cunoscut sub numele de “exemplu advers”. Exemplele adverse sunt fraze inginerite cu atenție care pot determina un sistem NLP să se comporte în moduri neașteptate și nedorite. Programele AI pot fi făcute să se comportă prost cu aceste exemple ciudate, iar ca urmare, cercetătorii AI încearcă să proiecteze modalități de a se proteja împotriva efectelor exemplarelor adverse.

Recent, o echipă de cercetători de la Universitatea din Hong Kong și Agenția pentru Știință, Tehnologie și Cercetare din Singapore au colaborat pentru a crea un algoritm care demonstrează pericolul exemplarelor adverse. Așa cum a raportat Wired, algoritmul a fost numit TextFooler de echipa de cercetare și funcționează prin modificarea subtilă a unor părți ale unei propoziții, afectând modul în care un clasificator NLP ar putea interpreta propoziția. De exemplu, algoritmul a transformat o propoziție într-o altă propoziție similară și propoziția a fost introdusă într-un clasificator proiectat pentru a determina dacă o recenzie este negativă sau pozitivă. Propoziția originală a fost:

“Personajele, distribuite în situații artificiale, sunt complet detașate de realitate.”

A fost transformată în această propoziție:

“Personajele, distribuite în situații create, sunt pe deplin detașate de realitate.”

Aceste modificări subtile au determinat clasificatorul de text să clasifice recenzia ca fiind pozitivă, în loc de negativă. Echipa de cercetare a testat aceeași abordare (înlocuind anumite cuvinte cu sinonime) pe mai multe seturi de date și algoritmi de clasificare a textului. Echipa de cercetare raportează că au reușit să scadă acuratețea unui algoritm la doar 10%, de la 90%. Acest lucru este în ciuda faptului că oamenii care citesc aceste propoziții le-ar interpreta ca având același sens.

Rezultatele sunt îngrijorătoare într-o eră în care algoritmii NLP și inteligența artificială sunt folosiți din ce în ce mai mult și pentru sarcini importante, cum ar fi evaluarea cererilor medicale sau analiza documentelor juridice. Nu se știe încă cât de mult reprezintă exemplele adverse o amenințare pentru algoritmii utilizați în prezent. Echipele de cercetare din întreaga lume încearcă încă să determine cât de multă influență pot avea. Recent, un raport publicat de grupul Stanford Human-Centered AI a sugerat că exemplele adverse ar putea înșela algoritmii AI și ar putea fi utilizate pentru a comite fraude fiscale.

Există unele limitări ale studiului recent. De exemplu, în timp ce Sameer Singh, profesor asistent de știință computerizată la UC Irvine, notează că metoda adversă utilizată a fost eficientă, aceasta se bazează pe o anumită cunoaștere a arhitecturii AI. AI trebuie să fie sondat în mod repetat până când se poate găsi un grup eficient de cuvinte, iar astfel de atacuri repetate ar putea fi detectate de programele de securitate. Singh și colegii săi au efectuat propriile cercetări pe această temă și au descoperit că sistemele avansate, cum ar fi algoritmii OpenAI, pot furniza texte rasiste, dăunătoare atunci când sunt stimulate cu anumite fraze declanșatoare.

Exemplele adverse sunt, de asemenea, o problemă potențială atunci când se lucrează cu date vizuale, cum ar fi fotografii sau videoclipuri. Un exemplu famous implică aplicarea unor transformări digitale subtile asupra unei imagini cu o pisică, determinând clasificatorul de imagini să interpreteze imaginea ca un monitor sau un computer de birou. Într-un alt exemplu, cercetările efectuate de profesoara Dawn Song de la UC Berkeley au arătat că exemplele adverse pot fi utilizate pentru a modifica modul în care semnele de circulație sunt percepute de sistemele de vedere computerizată, ceea ce ar putea fi periculos pentru vehiculele autonome.

Cercetările de acest tip, cum ar fi cele efectuate de echipa din Hong Kong-Singapore, ar putea ajuta inginerii AI să înțeleagă mai bine ce tipuri de vulnerabilități au algoritmii AI și să proiecteze modalități de a se proteja împotriva acestor vulnerabilități. De exemplu, clasificatorii de ansamblu pot fi utilizați pentru a reduce șansa ca un exemplu advers să poată înșela sistemul de vedere computerizată. Cu această tehnică, se utilizează mai mulți clasificatori și se fac transformări ușoare asupra imaginii de intrare. Majoritatea clasificatorilor vor discerne, de obicei, aspecte ale conținutului real al imaginii, care sunt apoi agregate împreună. Rezultatul este că, chiar dacă câțiva clasificatori sunt înșelați, majoritatea lor nu vor fi și imaginea va fi clasificată corect.

Blogger și programator cu specializări în Machine Learning și Deep Learning subiecte. Daniel speră să ajute pe alții să folosească puterea inteligenței artificiale pentru binele social.