Modele și platforme AI

Avansarea alinierii inteligenței artificiale cu valorile umane prin WARM

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Alinierea sistemelor de inteligență artificială cu valorile umane

Sistemele de inteligență artificială (IA) devin din ce în ce mai capabile să asiste oamenii în sarcini complexe, de la chatbot-urile de servicii clienți la algoritmii de diagnosticare medicală. Cu toate acestea, pe măsură ce aceste sisteme IA preiau mai multe responsabilități, este crucial ca ele să rămână aliniate cu valorile și preferințele umane. O abordare pentru a realiza acest lucru este prin intermediul unei tehnici numite învățare prin întărire din feedback uman (RLHF). În RLHF, un sistem IA, cunoscut sub numele de politică, este recompensat sau penalizat pe baza judecăților umane cu privire la comportamentul său. Scopul este ca politica să învețe să maximizeze recompensele sale și, astfel, să se comporte în conformitate cu preferințele umane.

Un component de bază al RLHF este modelul de recompensă (RM). RM este responsabil pentru evaluarea acțiunilor și ieșirilor politicii și returnarea unui semnal de recompensă pentru a ghida procesul de învățare. Proiectarea unui bun RM este o provocare, deoarece preferințele umane pot fi complexe, dependente de context și chiar inconsistente între indivizi. Recent, cercetători de la Google DeepMind au propus o tehnică inovatoare numită Modele de Recompensă Mediate Ponderal (WARM) pentru a îmbunătăți proiectarea RM.

Problema cu hackingul recompensei

O problemă majoră în RLHF este hackingul recompensei. Hackingul recompensei apare atunci când politica găsește modalități de a exploata sistemul RM pentru a obține recompense ridicate fără a satisface obiectivele intenționate. De exemplu, presupunem că scopul este de a antrena un asistent de scriere IA pentru a genera rezumate de calitate superioară. RM ar putea recompensa rezumatele concise și informative. Politica ar putea învăța să exploateze acest lucru prin generarea de rezumate foarte scurte și neinformative, presărate cu cuvinte cheie care înșală RM.

Hackingul recompensei apare din două motive principale:

  1. Shift de distribuție – RM este antrenat pe un set limitat de exemple etichetate de către oameni. Atunci când este implementat, ieșirile politicii pot proveni din distribuții diferite cu care RM nu se generalizează bine.
  2. Etichete zgomotoase – Etichetarea umană este imperfectă, cu neînțelegeri între evaluatori. RM poate să se concentreze pe semnale false în loc de indicatori robusti ai calității.

Hackingul recompensei duce la sisteme inutile care nu corespund așteptărilor umane. Mai rău, poate duce la comportamente ale IA care sunt biasate sau chiar periculoase dacă sunt implementate fără grijă.

Ascensiunea fuziunii de modele

Interesul în creștere pentru strategiile de fuziune a modelelor, cum ar fi Model Ratatouille, este determinat de realizarea că modelele mai mari, deși puternice, pot fi ineficiente și impractice. Antrenarea unui model cu 1 trilion de parametri necesită cantități prohibitive de date, computațional, timp și cost. Mai important, astfel de modele tind să se supraantreneze pe distribuția de antrenare, împiedicându-le să se generalizeze la diverse scenarii din lumea reală.

Fuziunea de modele oferă o cale alternativă pentru a debloca capacități mai mari fără a crește necontrolat. Prin reutilizarea mai multor modele specializate antrenate pe distribuții, sarcini sau obiective diferite, fuziunea de modele își propune să îmbunătățească versatilitatea și robustețea în afara distribuției. Premisa este că diferitele modele capturează modele predictive distincte care se pot completa reciproc atunci când sunt fuzionate.

Rezultate recente ilustrează promisiunea acestui concept. Modelele obținute prin fuziune, în ciuda faptului că au mult mai puțini parametri, pot egala sau chiar depăși performanța giganticelor modele precum GPT-3. De exemplu, un ansamblu Model Ratatouille format din doar 7 puncte de control de dimensiuni medii atinge acuratețe de stat la nivelul datelor de implicare textuală de înaltă dimensiune, depășind GPT-3.

Simplificarea fuziunii prin mediere ponderală este un mare bonus. Antrenarea mai multor modele auxiliare necesită resurse suplimentare. Dar, în mod crucial, computația la momentul inferenței rămâne identică cu a unui singur model, deoarece greutățile sunt condensate într-una singură. Acest lucru face ca metoda să fie ușor de adaptat, fără preocupări legate de creșterea latenței sau a costurilor de memorie.

Mecanismele din spatele fuziunii de modele

Dar ce anume permite aceste creșteri de acuratețe prin fuziunea de modele? Analiza recentă oferă câteva indicii:

  • Atenuarea memorării: Fiecare model vede loturi diferite de date în timpul antrenării. Medierea diminuează orice memorare specifică a instanțelor, păstrând doar generalizări la nivel de set de date.
  • Reducerea varianței: Modelele antrenate independent au erori ne-corelate. Combinarea lor reduce zgomotul, îmbunătățind calibrarea.
  • Regularizarea prin diversitate: Sarcinile auxiliare variate forțează modelele să se concentreze pe caracteristici mai generalizabile, utile pe diferite distribuții.
  • Creșterea robusteții: Inconsistența în predicții semnalează incertitudine. Medierea moderată a judecăților extreme îmbunătățește fiabilitatea.

În esență, fuziunea de modele echilibrează slăbiciunile modelelor individuale pentru a-și amplifica punctele forte colective. Reprezentarea fuzionată capturează structurile cauzale subiacente comune, ignorând variațiile incidentale.

Acest fundament conceptual conectează fuziunea de modele cu alte tehnici populare, cum ar fi ansamblarea și învățarea multi-sarcină. Toate aceste metode exploatează diversitatea între modele sau sarcini pentru a obține sisteme versatile și conștiente de incertitudine. Simplificarea și eficiența medierii ponderale oferă fuziunii de modele o margine unică pentru avansarea implementărilor din lumea reală.

Modele de Recompensă Mediate Ponderal (WARM)

Procesul de aliniere cu WARM

Procesul de aliniere cu WARM

WARM utilizează inovativ un model de recompensă proxy (RM), care este o medie ponderală a mai multor RM individuale, fiecare ajustat din același model de limbaj preantrenat, dar cu hiperparametri diferiți. Această metodă îmbunătățește eficiența, fiabilitatea sub schimbări de distribuție și robustețea împotriva preferințelor inconsistente. Studiul arată, de asemenea, că utilizarea WARM ca model de recompensă proxy, în special cu un număr crescut de RM mediate, îmbunătățește rezultatele și întârzie apariția “hackingului de recompensă”, un fenomen în care recompensele de control se deteriorează în timp.

Iată o prezentare generală:

  1. Începeți cu un model de limbaj de bază preantrenat pe un corpus mare. Inițializați mai multe RM prin adăugarea unor straturi mici, specifice sarcinii, deasupra.
  2. Ajustați fiecare RM separat pe setul de date de preferințe umane, utilizând hiperparametri diferiți, cum ar fi rata de învățare, pentru diversitate.
  3. Mediați greutățile RM ajustate pentru a obține un singur ansamblu WARM.

Ideea cheie este că medierea ponderală păstrează doar informația invariantă care este învățată pe toate RM diverse. Acest lucru reduce dependența de semnale false, îmbunătățind robustețea. Ansamblul beneficiază, de asemenea, de reducerea varianței, îmbunătățind fiabilitatea, în ciuda schimbărilor de distribuție.

Așa cum s-a discutat anterior, diversitatea între modele antrenate independent este crucială pentru deblocarea potențialului complet al fuziunii de modele. Dar ce sunt unele tehnici concrete pentru a promova o diversitate productivă?

Articolul WARM explorează câteva idei ingenioase care ar putea fi generalizate mai larg:

Permutări de ordonare

O abordare trivială, dar cu impact, este permutarea ordinii în care punctele de date sunt văzute de fiecare model în timpul antrenării. Chiar și acest pas simplu decorelează greutățile, reducând memorarea redundantă a pattern-urilor.

Variații de hiperparametri

Reglarea hiperparametrilor, cum ar fi rata de învățare și probabilitatea de abandon, pentru fiecare execuție introduce o diversitate utilă. Modelele converg diferit, capturând proprietăți distincte ale setului de date.

Medierea punctelor de control – Baklava

Metoda Baklava inițializează modele pentru fuziune din diferite instantanee de-a lungul aceleiași traiectorii de preantrenare. Acest lucru relaxează constrângerile comparativ cu supele de modele, care cer un punct de plecare comun. În comparație cu Model Ratatouille, Baklava evită sarcinile suplimentare. În general, strikează un echilibru eficient între acuratețe și diversitate.

Procesul de ajustare a mai multor Modele de Recompensă

Procesul de ajustare a mai multor Modele de Recompensă

Analiza confirmă că adăugarea punctelor de control mai vechi prin mediere ponderală afectează negativ performanța individuală, compromițând meritele diversității. Medierea doar a reprezentărilor finale din fiecare execuție se desfășoară mai bine. În general, echilibrarea obiectivelor de diversitate cu menținerea acurateței rămâne o provocare deschisă de cercetare.

În general, fuziunea de modele se aliniază bine cu etosul general din domeniu de a recicla resursele existente în mod eficient pentru a îmbunătăți fiabilitatea, eficiența și versatilitatea. Simplificarea medierii ponderale consolidează poziția sa ca unul dintre principalii candidați pentru asamblarea de modele robuste din blocuri disponibile.

În contrast cu metodele tradiționale de ansamblare care mediează predicțiile, WARM menține o sarcină computațională minimă, păstrând doar un singur set de greutăți. Experimentele pe sarcini de rezumare a textului demonstrează eficacitatea WARM:

  • Pentru selecția best-of-N, WARM atinge o rată de câștig de 92,5% împotriva selecției aleatorii, conform etichetelor de preferință umană.
  • În RLHF, o politică WARM atinge o rată de câștig de 79,4% împotriva unei politici antrenate cu un singur RM, după același număr de pași.
  • WARM continuă să performeze bine chiar și atunci când o parte din etichetele umane sunt corupte.

Aceste rezultate ilustrează potențialul WARM ca o tehnică practică pentru dezvoltarea de asistenți AI din lumea reală care se comportă în mod fiabil. Prin netezirea incoerențelor din feedbackul uman, politicile WARM pot rămâne aliniate robust cu valorile umane, chiar și pe măsură ce continuă să învețe din experiențe noi.

Imaginea de ansamblu

WARM se află la intersecția a două tendințe cheie în cercetarea alinierii IA. Prima este studiul generalizării în afara distribuției (OOD), care își propune să îmbunătățească performanța modelului pe date noi care diferă de distribuția de antrenare. A doua este cercetarea privind robustețea algoritmică, axată pe fiabilitatea în ciuda perturbațiilor mici de intrare sau a zgomotului.

Prin stabilirea de legături între aceste domenii în jurul conceptului de invarianțe învățate, WARM ne apropie de tehnici mai bine fundamentate pentru alinierea valorilor. Înțelegerile din WARM ar putea fi generalizate chiar și dincolo de RLHF, oferind lecții pentru sisteme de învățare automată mai largi care interacționează cu lumea deschisă.

Desigur, modelarea recompensei este doar o piesă a puzzle-ului de aliniere. Încă avem nevoie de progres în alte provocări, cum ar fi specificarea recompensei, supravegherea la scară largă și explorarea în siguranță. În combinație cu tehnici complementare, WARM ar putea accelera dezvoltarea IA care promovează în mod durabil prosperitatea umană. Prin elucidarea principiilor care stau la baza alinierii robuste, cercetătorii sunt pe cale să cartografieze drumul către IA benefică și etică.

Am petrecut ultimii cinci ani scufundându-mă în lumea fascinantă a Machine Learning și Deep Learning. Pasinea și expertiza mea m-au condus să contribui la peste 50 de proiecte diverse de inginerie software, cu un focus deosebit pe AI/ML. Curiozitatea mea în continuare m-a atras și spre Natural Language Processing, un domeniu pe care sunt dornic să îl explorez mai departe.