Unghiul lui Anderson

Crearea unui model de limbaj similar cu GPT pentru o singură întrebare

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Cercetători din China au dezvoltat o metodă economică pentru crearea unor sisteme de procesare a limbajului natural de tip GPT-3, evitând totodată costurile din ce în ce mai mari ale timpului și banilor implicați în antrenarea unor seturi de date de volum mare – o tendință în creștere care amenință să relegheze în cele din urmă acest sector al inteligenței artificiale la jucătorii FAANG și investitorii de nivel înalt.

Framework-ul propus se numește Modelare lingvistică dirijată de sarcină (TLM). În loc să antreneze un model uriaș și complex pe un corpus vast de miliarde de cuvinte și mii de etichete și clase, TLM antrenează un model mult mai mic care incorporează efectiv o întrebare direct în model.

Stânga, o abordare tipică de hyperscale pentru modele de limbaj de volum mare; dreapta, metoda slimline a TLM pentru a explora un corpus de limbaj larg pe baza unei întrebări sau a unui subiect.

Stânga, o abordare tipică de hyperscale pentru modele de limbaj de volum mare; dreapta, metoda slimline a TLM pentru a explora un corpus de limbaj larg pe baza unei întrebări sau a unui subiect.

În esență, se produce un algoritm sau model de procesare a limbajului natural unic pentru a răspunde la o singură întrebare, în loc să se creeze un model de limbaj general uriaș și neîndemânatic care poate răspunde la o varietate mai largă de întrebări.

În testarea TLM, cercetătorii au descoperit că noua abordare realizează rezultate similare sau mai bune decât modelele de limbaj preantrenate, cum ar fi RoBERTa-Large, și sistemele de procesare a limbajului natural de tip hyperscale, cum ar fi GPT-3 de la OpenAI, modelul Switch Transformer cu un trilion de parametri de la Google, HyperClover din Coreea, Jurassic 1 de la AI21 Labs și Megatron-Turing NLG 530B de la Microsoft.

În teste pe opt seturi de date de clasificare din patru domenii, autorii au descoperit, de asemenea, că sistemul reduce operațiunile de punctare cu virgulă (FLOPs) necesare pentru antrenare cu două ordine de mărime. Cercetătorii speră că TLM poate “democratiza” un sector care devine din ce în ce mai elitist, cu modele de procesare a limbajului natural atât de mari încât nu pot fi instalate realist în mod local și, în schimb, stau, în cazul GPT-3, în spatele interfețelor API scumpe și cu acces limitat de la OpenAI și, acum, Microsoft Azure.

Autorii afirmă că reducerea timpului de antrenare cu două ordine de mărime reduce costul de antrenare pe 1.000 de GPU-uri timp de o zi la doar 8 GPU-uri timp de 48 de ore.

Noul raport se intitulează Procesare de limbaj de la zero fără antrenare prealabilă la scară largă: un cadru simplu și eficient și provine de la trei cercetători de la Universitatea Tsinghua din Beijing și un cercetător de la compania de dezvoltare AI Recurrent AI, Inc.

Răspunsuri inaccesibile

Costul antrenării unor modele de limbaj eficiente și generale este din ce în ce mai caracterizat ca o posibilă “limită termică” a extinderii în care procesarea de limbaj natural performantă și precisă poate deveni realmente difuzată în cultură.

Statistici privind creșterea facetelor în arhitecturile modelelor de limbaj, dintr-un raport din 2020 de la A121 Labs.

Statistici privind creșterea facetelor în arhitecturile modelelor de limbaj, dintr-un raport din 2020 de la A121 Labs.

În 2019, un cercetător a calculat că costă 61.440 de dolari americani pentru a antrena modelul XLNet (raportat la acea vreme ca fiind mai bun decât BERT în sarcinile de procesare a limbajului natural) timp de 2,5 zile pe 512 nuclee pe 64 de dispozitive, în timp ce GPT-3 este estimat a fi costat 12 milioane de dolari pentru a fi antrenat – de 200 de ori mai mult decât costul de antrenare a predecesorului său, GPT-2 (deși reestimările recente susțin că ar putea fi antrenat acum pentru doar 4.600.000 de dolari pe cele mai ieftine GPU-uri din cloud).

Subansambluri de date pe baza nevoilor de întrebări

În schimb, noua arhitectură propusă își propune să obțină clasificări precise, etichete și generalizări prin utilizarea unei întrebări ca un fel de filtru pentru a defini un subansamblu de informații dintr-un corpus de limbaj mare care va fi antrenat, împreună cu întrebarea, pentru a oferi răspunsuri pe un subiect limitat.

Autorii afirmă:

‘TLM este motivat de două idei cheie. În primul rând, oamenii stăpânesc o sarcină utilizând doar o mică parte a cunoștințelor lumii (de exemplu, studenții trebuie să revizuiască doar câteva capitole, dintre toate cărțile din lume, pentru a se pregăti pentru un examen). 

‘Ipotezăm că există o redundanță mare în corpusul mare pentru o sarcină specifică. În al doilea rând, antrenarea pe date etichetate supervizate este mult mai eficientă din punct de vedere al datelor pentru performanța în aval decât optimizarea obiectivului de modelare a limbajului pe date neetichetate.  Pe baza acestor motivații, TLM utilizează datele de sarcină ca întrebări pentru a recupera un subansamblu mic al corpusului general.  Acest lucru este urmat de optimizarea comună a unui obiectiv de sarcină supervizată și a unui obiectiv de modelare a limbajului utilizând atât datele recuperate, cât și datele de sarcină.’

Pe lângă faptul că face ca antrenarea modelelor de procesare a limbajului natural să fie accesibilă, autorii văd o serie de avantaje în utilizarea modelelor de procesare a limbajului natural dirijate de sarcină. În primul rând, cercetătorii pot avea o flexibilitate mai mare, cu strategii personalizate pentru lungimea secvenței, tokenizare, reglare a hiperparametrilor și reprezentări de date.

Cercetătorii prevăd, de asemenea, dezvoltarea unor sisteme hibride viitoare care fac schimb între o preantrenare limitată a unui PLM (care nu este altfel anticipată în implementarea curentă) și o versatilitate și generalizare mai mare împotriva timpilor de antrenare. Ei consideră sistemul un pas înainte pentru promovarea metodelor de generalizare zero-shot în domeniu.

Testare și rezultate

TLM a fost testat pe provocări de clasificare în opt sarcini din patru domenii – știință biomedicală, știri, recenzii și știință computerizată. Sarcinile au fost împărțite în categorii cu resurse ridicate și scăzute. Sarcinile cu resurse ridicate au inclus peste 5.000 de date de sarcină, cum ar fi AGNews și RCT, printre altele; sarcinile cu resurse scăzute au inclus ChemProt și ACL-ARC, precum și setul de date de detectare a știrilor hiperpartizane.

Cercetătorii au dezvoltat două seturi de antrenare intitulate Corpus-BERT și Corpus-RoBERTa, cel din urmă fiind de zece ori mai mare decât primul. Experimentele au comparat modelele de limbaj preantrenate generale BERT (de la Google) și RoBERTA (de la Facebook ) cu noua arhitectură.

Articolul observă că, deși TLM este o metodă generală și ar trebui să fie mai limitată în domeniu și aplicabilitate decât modelele de stat-of-the-art mai largi și mai voluminoase, este capabilă să performeze aproape de metodele de reglare fină adaptate la domeniu.

Rezultate din compararea performanței TLM cu seturile bazate pe BERT și RoBERTa.

Rezultate din compararea performanței TLM cu seturile bazate pe BERT și RoBERTa.

Autorii concluzionează că TLM este capabilă să obțină rezultate comparabile sau mai bune decât PLM, cu o reducere substanțială a FLOPs necesare și necesitând doar 1/16 din corpusul de antrenare. La scară medie și mare, TLM pare să poată îmbunătăți performanța cu 0,59 și 0,24 puncte în medie, reducând în același timp dimensiunea datelor de antrenare cu două ordine de mărime.

‘Aceste rezultate confirmă că TLM este foarte precisă și mult mai eficientă decât PLM. Mai mult, TLM obține avantaje mai mari în eficiență la o scară mai mare. Acest lucru indică faptul că PLM-urile mai mari ar putea fi antrenate pentru a stoca cunoștințe mai generale care nu sunt utile pentru o sarcină specifică.’

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai