Modele și platforme AI

Sistemele de inteligență artificială ar putea prefera limba umană în loc de date numerice

mm
Adaugă Unite.AI la sursele tale preferate pe Google

O nouă cercetare efectuată de către Columbia Engineering sugerează că sistemele de inteligență artificială (IA) preferă limba umană în loc de date numerice, cum ar fi 1 și 0. Studiul, condus de profesorul de inginerie mecanică Hod Lipson și studentul doctorand Boyuan Chen, a demonstrat că sistemele de IA pot atinge niveluri de performanță mai ridicate dacă sunt programate cu fișiere audio de limbaj uman.

Într-un studiu comparativ, cercetătorii au constatat că o rețea neurală antrenată cu fișiere audio a atins niveluri de performanță mai ridicate în identificarea obiectelor, comparativ cu rețeaua neurală programată cu intrări binare simple.

Lipson este profesor James și Sally Scapa de inovare și membru al Institutului de știință a datelor de la Columbia.

“Pentru a înțelege de ce această descoperire este semnificativă, este util să înțelegem cum sunt de obicei programate rețelele neurale și de ce utilizarea sunetului vocii umane este un experiment radical,” a spus el.

Utilizarea numerelor binare este compactă și precisă, în timp ce limba umană este mai complexă și non-binară atunci când este capturată într-un fișier digital. De obicei, programatorii nu se abat de la numere atunci când dezvoltă o rețea neurală, deoarece este foarte eficient.

Echipa a început această cercetare după ce a considerat că rețelele neurale nu ating întotdeauna potențialul lor maxim și au crezut că pot fi mai rapide și mai bune dacă ar fi antrenate cu vocea umană și cuvinte specifice.

Antrenarea rețelelor

Atunci când testează o nouă tehnică de învățare automată, cercetătorii în domeniul IA antrenează adesea o rețea neurală pentru a recunoaște obiecte și animale specifice într-o colecție de fotografii.

Echipa, care a inclus Chen, Lipson, Yu Li și Susan Raghupathi, a realizat un experiment controlat pentru a testa ipoteza lor și au creat două rețele neurale noi. Au încercat să le antreneze pentru a recunoaște 10 tipuri diferite de obiecte printre 50.000 de fotografii numite “imagini de antrenament”.

Unul dintre sistemele de IA a fost antrenat în mod tradițional cu valori numerice, în timp ce rețeaua neurală experimentală a fost antrenată în mod diferit. A fost alimentată cu o tabelă de date care conținea o fotografie a unui animal sau obiect în prima coloană și un fișier audio cu vocea umană care rostea cuvântul pentru animalul sau obiectul respectiv în a doua coloană. Nu au fost implicați 1 și 0 în rețeaua neurală experimentală.

Ambele sisteme de IA au fost antrenate timp de 15 ore. Rezultatele au arătat că rețeaua neurală originală a răspuns cu o serie de 1 și 0, în timp ce rețeaua neurală experimentală a produs o voce care încerca să “spună” ce era obiectul din imagine. Deși vocea nu a fost înțeleasă la început, a ajuns în cele din urmă la un punct în care a fost corectă în majoritatea cazurilor.

Cele două rețele au performant la fel de bine, identificând corect animalul sau obiectul de 92% din timp. Cercetătorii au decis apoi să ruleze experimentul pentru a doua oară, dar de data aceasta au folosit mai puține fotografii în timpul procesului.

Rețeaua neurală tradițională a performant slab din cauza datelor insuficiente, așa cum s-ar fi așteptat, scăzând la aproximativ 35% acuratețe. Cu toate acestea, rețeaua neurală experimentală a performant de două ori mai bine, cu o acuratețe de 70%, în ciuda faptului că a avut mai puține date.

https://www.youtube.com/watch?v=Iq2YjHCAPRQ

 

Rezultate surprinzătoare

Data viitoare, echipa a folosit imagini mai dificile, cum ar fi o imagine coruptă a unui câine. Chiar și cu imaginile mai greu de recunoscut, rețeaua neurală antrenată cu voce a fost corectă de aproximativ 50% din timp, în timp ce rețeaua neurală tradițională a fost corectă doar de 20% din timp.

Boyuan Chen este cercetătorul principal al studiului.

“Descoperirile noastre merg direct împotriva modului în care mulți experți au fost instruiți să gândească despre calculatoare și numere; este o presupunere comună că intrările binare sunt un mod mai eficient de a transmite informații unei mașini decât fluxurile audio de informații similare ‘bogate’,” a explicat Chen. “În fapt, atunci când am prezentat această cercetare la o mare conferință de IA, un recenzor anonim a respins articolul nostru pur și simplu pentru că a considerat că rezultatele noastre sunt prea surprinzătoare și neintuitive.”

“Dacă ne gândim la faptul că limba umană a trecut printr-un proces de optimizare timp de zeci de mii de ani, atunci are sens că vorbirea noastră a găsit un echilibru bun între zgomot și semnal,” a spus Lipson. “Prin urmare, atunci când este privită prin lentila entropiei lui Shannon, are sens că o rețea neurală antrenată cu limbaj uman ar putea depăși o rețea neurală antrenată cu simple 1 și 0.”

Studiul va fi prezentat la Conferința Internațională privind Reprezentări de Învățare pe 3 mai 2021.

“Ar trebui să ne gândim la utilizarea unor modalități noi și mai bune de antrenare a sistemelor de IA, în loc de a colecta seturi de date mai mari,” a spus Chen. “Dacă reevaluăm modul în care prezentăm datele de antrenament mașinii, am putea face o treabă mai bună ca profesori.”

“Una dintre cele mai mari mistere ale evoluției umane este modul în care strămoșii noștri au dobândit limbajul și cum copiii învață să vorbească atât de ușor,” adaugă Lipson. “Dacă copiii mici învață cel mai bine cu instrucțiuni verbale repetitive, atunci poate sistemele de IA pot face la fel.”

Alex McFarland este un jurnalist și scriitor de inteligență artificială, care explorează cele mai recente dezvoltări în domeniul inteligenței artificiale. El a colaborat cu numeroase startup-uri de inteligență artificială și publicații din întreaga lume.