Modele și platforme AI

Google face posibil să facă antrenarea inteligenței artificiale cu 28% mai rapidă, utilizând SLM-uri ca profesori

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Antrenarea modelului de limbaj mare (LLM) a devenit inaccesibil pentru majoritatea organizațiilor. Cu costuri care ajung la milioane și cerințe de calcul care ar face ca un supercomputer să transpire, dezvoltarea inteligenței artificiale a rămas închisă în spatele ușilor gigantilor tehnologici. Dar Google (GOOGL ) a răsturnat această poveste cu o abordare atât de simplă, încât te face să te întrebi de ce nimeni nu a gândit asta mai devreme: utilizarea unor modele de inteligență artificială mai mici ca profesori.

Cum funcționează SALT: O abordare nouă pentru antrenarea modelului de inteligență artificială

Într-un articol de cercetare recent, intitulat “Un mic ajutor merge departe: Antrenarea eficientă a LLM prin utilizarea unor modele de inteligență artificială mici,” Google Research și DeepMind au introdus SALT (Small model Aided Large model Training). Acesta este noul mod de abordare a antrenării LLM, care ne îndeamnă să ne gândim la modul în care funcționează.

De ce este această cercetare semnificativă? În prezent, antrenarea modelului de inteligență artificială mare este ca și cum ai încerca să înveți pe cineva tot ce are nevoie să știe despre un subiect deodată – este ineficient, scump și adesea limitat la organizații cu resurse de calcul masiv. SALT urmează o cale diferită, introducând un proces de antrenare în două etape, care este atât inovator, cât și practic.

Descompunerea modului în care SALT funcționează realmente:

Etapa 1: Distilarea cunoștințelor

  • Un model de limbaj mic (SLM) acționează ca un profesor, împărtășindu-și înțelegerea cu modelul mai mare
  • Modelul mai mic se concentrează pe transferul “cunoștințelor învățate” prin ceea ce cercetătorii numesc “etichete moi”
  • Gândiți-vă la asta ca la un asistent care se ocupă de conceptele de bază înainte ca un student să treacă la subiecte avansate
  • Această etapă este deosebit de eficientă în “regiunile ușoare” de învățare – zone în care modelul mai mic are o încredere predictivă puternică

Etapa 2: Învățarea auto-supervizată

  • Modelul mare trece la învățarea independentă
  • Se concentrează pe stăpânirea unor tipare complexe și sarcini dificile
  • Acesta este momentul în care modelul dezvoltă capacități dincolo de ceea ce ar fi putut oferi “profesorul” său mai mic
  • Tranzitia dintre etape utilizează strategii atent concepute, inclusiv decăderea liniară și decăderea raportului liniar al pierderii de distilare

În termeni neci, imaginați-vă că modelul de inteligență artificială mai mic este ca un tutore util care îl ajută pe modelul mai mare în etapele inițiale de antrenare. Acest tutore oferă informații suplimentare, alături de răspunsurile sale, indicând cât de încrezător este în fiecare răspuns. Aceste informații suplimentare, cunoscute sub numele de “etichete moi”, ajută modelul mai mare să învețe mai rapid și mai eficient.

Acum, pe măsură ce modelul de inteligență artificială mai mare devine mai capabil, are nevoie să treacă de la a se baza pe tutore la învățarea independentă. Acesta este momentul în care “decăderea liniară” și “decăderea raportului liniar” intră în joc.
Gândiți-vă la aceste tehnici ca la o reducere treptată a influenței tutorului în timp:
  • Decăderea liniară: Este ca și cum ați reduce treptat volumul vocii tutorului. Îndrumarea tutorului devine mai puțin proeminentă cu fiecare pas, permițând modelului mai mare să se concentreze mai mult pe învățarea din datele brute însele.
  • Decăderea raportului liniar: Acesta este ca și cum ați ajusta echilibrul dintre sfaturile tutorului și sarcina în sine. Pe măsură ce antrenamentul progresează, accentul se mută mai mult spre sarcina originală, în timp ce inputul tutorului devine mai puțin dominant.
Scopul ambelor tehnici este de a asigura o tranziție lină pentru modelul de inteligență artificială mai mare, prevenind orice schimbări bruște în comportamentul său de învățare.

Rezultatele sunt convingătoare. Când cercetătorii Google au testat SALT, utilizând un model de limbaj mic de 1,5 miliarde de parametri pentru a antrena un model de limbaj mare de 2,8 miliarde de parametri pe setul de date Pile, ei au observat:

  • O reducere cu 28% a timpului de antrenare în comparație cu metodele tradiționale
  • Îmbunătățiri semnificative ale performanței după ajustarea fină:
    • Precizia problemelor matematice a sărit la 34,87% (comparativ cu 31,84% în versiunea de bază)
    • Înțelegerea citirii a atins o acuratețe de 67% (față de 63,7% înainte)

Dar ceea ce face SALT cu adevărat inovator este cadru său teoretic. Cercetătorii au descoperit că chiar și un “model de profesor mai slab” poate îmbunătăți performanța modelului elev prin realizarea unui “schimb favorabil între varianță și bias”. În termeni mai simpli, modelul mai mic ajută modelul mai mare să învețe tipare fundamentale mai eficient, creând o bază mai solidă pentru învățarea avansată.

De ce SALT ar putea rescrie peisajul dezvoltării inteligenței artificiale

Amintiți-vă când computarea în cloud a transformat cine poate începe o companie tehnologică? SALT ar putea face același lucru pentru dezvoltarea inteligenței artificiale.

Am urmărit inovațiile în antrenarea inteligenței artificiale de ani de zile, și majoritatea descoperirilor au beneficiat în principal gigantii tehnologici. Dar SALT este diferit.

Iată ce ar putea însemna pentru viitor:

Pentru organizații cu resurse limitate:

  • S-ar putea să nu mai aveți nevoie de o infrastructură de calcul masiv pentru a dezvolta modele de inteligență artificială capabile
  • Laboratoarele de cercetare mai mici și companiile ar putea experimenta cu dezvoltarea de modele personalizate
  • Reducerea cu 28% a timpului de antrenare se traduce direct în costuri de calcul mai mici
  • Mai important, ați putea începe cu resurse de calcul modeste și totuși obține rezultate profesionale

Pentru peisajul dezvoltării inteligenței artificiale:

  • Mai mulți jucători ar putea intra pe piață, ducând la soluții de inteligență artificială mai diverse și specializate
  • Universitățile și instituțiile de cercetare ar putea efectua mai multe experimente cu resursele existente
  • Barierele de intrare pentru cercetarea inteligenței artificiale scad semnificativ
  • S-ar putea vedea aplicații noi în domenii care anterior nu-și permiteau dezvoltarea inteligenței artificiale

Ce înseamnă acest lucru pentru viitor

Prin utilizarea unor modele mici ca profesori, nu facem doar antrenarea inteligenței artificiale mai eficientă, ci și schimbăm fundamental cine poate participa la dezvoltarea inteligenței artificiale. Implicațiile merg mult dincolo de simple îmbunătățiri tehnice.

Puncte cheie de reținut:

  • Reducerea timpului de antrenare cu 28% este diferența dintre a începe un proiect de inteligență artificială sau a-l considera inaccesibil
  • Îmbunătățirile performanței (34,87% la matematică, 67% la sarcinile de citire) arată că accesibilitatea nu înseamnă întotdeauna compromisuri în ceea ce privește calitatea
  • Abordarea SALT demonstrează că, uneori, cele mai bune soluții vin din reevaluarea fundamentelor, și nu doar din adăugarea de putere de calcul

Ce să urmăriți:

  1. Urmați organizațiile mai mici care încep să dezvolte modele de inteligență artificială personalizate
  2. Urmați aplicațiile noi în domenii care anterior nu-și permiteau dezvoltarea inteligenței artificiale
  3. Căutați inovații în modul în care se utilizează modelele mici pentru sarcini specializate

Amintiți-vă: Valoarea reală a SALT constă în modul în care ar putea rescrie cine are voie să inoveze în inteligență artificială. Indiferent dacă conduceți un laborator de cercetare, gestionați o echipă tehnologică sau sunteți doar interesați de dezvoltarea inteligenței artificiale, această descoperire ar putea face ca următoarea dumneavoastră idee mare să devină posibilă.

Poate ar trebui să vă gândiți la acel proiect de inteligență artificială pe care l-ați considerat în afara posibilităților. S-ar putea să fie mai posibil decât ați imaginat.

Alex McFarland este un jurnalist și scriitor de inteligență artificială, care explorează cele mai recente dezvoltări în domeniul inteligenței artificiale. El a colaborat cu numeroase startup-uri de inteligență artificială și publicații din întreaga lume.