Modele și platforme AI

Cercetătorii descoperă subrețele eficiente în cadrul rețelelor neuronale de învățare profundă

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Rețelele neuronale de învățare profundă sunt adesea masive și necesită cantități uriașe de putere de calcul, dar o descoperire recentă demonstrează cum această putere de calcul poate fi redusă pentru a completa sarcinile în mod mai eficient. Jonathan Frankle și echipa sa de la MIT au elaborat “ipoteza biletului de loterie”, care arată cum există subrețele mai subțiri în cadrul rețelelor neuronale mai mari. Aceste subrețele pot completa sarcina în mod mai eficient, cu mai puțină putere de calcul necesară, una dintre cele mai mari provocări fiind găsirea acestor subrețele, sau bilete de loterie câștigătoare, așa cum le numește echipa.

Echipa a descoperit aceste subrețele în cadrul BERT, tehnica de top pentru prelucrarea limbajului natural (NLP). NLP, care este un subdomeniu al inteligenței artificiale (AI), este responsabilă pentru decodificarea și analiza limbajului uman și este utilizată în aplicații precum generarea de text predictiv și chatbot-uri.

Cu toate acestea, BERT este o tehnologie masivă și necesită putere de calcul de supracalculatoare, care este inaccesibilă pentru majoritatea utilizatorilor. Cu descoperirea noilor subrețele, aceasta ar putea deschide accesul la această tehnologie, permițând mai multor utilizatori să o utilizeze pentru a dezvolta unelte NLP.

“Suntem la punctul în care trebuie să facem aceste modele mai subțiri și mai eficiente”, spune Frankle.

Conform spuselor sale, această dezvoltare ar putea “reduce barierele de intrare” pentru NLP.

BERT – “Obscen de scump” 

BERT este fundamental pentru lucruri precum motorul de căutare al Google și a primit multă atenție de la lansarea sa în 2018. Este o metodă pentru crearea de rețele neuronale și este antrenată prin încercări repetate de a completa spații libere în texte. Una dintre cele mai impresionante caracteristici ale BERT este setul său inițial de date de antrenament masiv.

Apoi, poate fi ajustat de utilizatori pentru sarcini specifice, precum chatbot-urile pentru servicii clienți, dar din nou, necesită cantități masive de putere de calcul, cu posibilitatea ca parametrii să ajungă la 1 miliard.

“Un model BERT standard – cel obișnuit – are 340 de milioane de parametri”, spune Frankle. “Acesta este obscen de scump. Acesta este mult dincolo de capacitatea noastră de calcul.”

Conform autorului principal Tianlong Chen de la Universitatea Texasului din Austin, modele precum BERT “suferă de o dimensiune a rețelei uriașă”, dar datorită noii cercetări, “ipoteza biletului de loterie pare a fi o soluție”.

Subrețele eficiente 

Chen și echipa sa au căutat un model mai mic situat în cadrul BERT și au comparat performanțele subrețelelor descoperite cu modelul original BERT. Acesta a fost testat pe o varietate de sarcini NLP diferite, incluzând răspunsuri la întrebări și completarea cuvintelor libere într-o propoziție.

Echipa a descoperit subrețele de succes care erau cu 40 până la 90% mai subțiri decât modelul original BERT, cu procentul real depinzând de sarcină. În plus, au putut identifica subrețelele înainte de ajustarea specifică a sarcinii, ceea ce a dus la costuri de calcul și mai reduse. Un alt avantaj a fost că unele dintre subrețelele selectate pentru o sarcină specifică puteau fi reutilizate pentru altă sarcină.

“Am fost puțin șocat că acest lucru a funcționat”, spune Frankle. “Nu este ceva pe care l-aș fi luat ca atare. Mă așteptam la un rezultat mult mai haotic decât am obținut.”

Conform lui Ari Morcos, un om de știință de la Facebook (META ) AI Research, această descoperire este “convingătoare” și “Aceste modele devin din ce în ce mai răspândite. Prin urmare, este important să înțelegem dacă ipoteza biletului de loterie se aplică.”

Morcos spune, de asemenea, că dacă aceste subrețele ar putea funcționa utilizând putere de calcul drastic redusă, atunci acest lucru “ar fi foarte impactant, având în vedere că aceste modele extrem de mari sunt în prezent foarte costisitoare de rulat”.

“Nu știu cât de mare putem merge utilizând aceste calcule de tip supracalculator”, adaugă Frankle. “Trebuie să reducem barierele de intrare.”

“Speranța este că acest lucru va reduce costurile, va face tehnologia mai accesibilă pentru toată lumea… pentru cei mici care au doar un laptop”, concluzionează el.

Cercetarea urmează să fie prezentată la Conferința privind sistemele de prelucrare a informațiilor neuronale.

Alex conduce operațiunile de știri alimentate de AI ale Unite.AI, combinând jurnalismul, cercetarea și automatizarea pentru a susține o acoperire rapidă și scalabilă a inteligenței artificiale. Munca sa contribuie la asigurarea că evoluțiile emergente în domeniul AI sunt evidențiate eficient, menținând în același timp standardele editoriale ale publicației.