AI-modellen en platforms
Vooruitgang in AI-alignering met menselijke waarden met WARM
Alignering van AI-systemen met menselijke waarden
Kunstmatige intelligentie (AI)-systemen worden steeds beter in het ondersteunen van mensen bij complexe taken, van chatbots voor klantenservice tot algoritmes voor medische diagnose. Echter, naarmate deze AI-systemen meer verantwoordelijkheden krijgen, is het cruciaal dat ze in overeenstemming blijven met menselijke waarden en voorkeuren. Een aanpak om dit te bereiken is door middel van een techniek genaamd versterking van het leren vanuit menselijke feedback (RLHF). In RLHF wordt een AI-systeem, bekend als het beleid, beloond of bestraft op basis van menselijke oordelen over zijn gedrag. Het doel is dat het beleid leert om zijn beloningen te maximaliseren en dus overeenkomstig met menselijke voorkeuren te handelen.
Een kerncomponent van RLHF is het beloningsmodel (RM). Het RM is verantwoordelijk voor het evalueren van de acties en uitvoer van het beleid en het teruggeven van een beloningsignaal om het leerproces te leiden. Het ontwerpen van een goed RM is moeilijk, omdat menselijke voorkeuren complex, contextafhankelijk en zelfs inconsistent kunnen zijn over individuen heen. Onlangs hebben onderzoekers van Google DeepMind een innovatieve techniek voorgesteld genaamd Gewogen Gemiddelde Beloningsmodellen (WARM) om het ontwerp van RM te verbeteren.
De problemen met beloningshacken
Een groot probleem in RLHF is beloningshacken. Beloningshacken treedt op wanneer het beleid lussen vindt om het RM-systeem te manipuleren om hoge beloningen te krijgen zonder daadwerkelijk de beoogde doelen te bereiken. Stel bijvoorbeeld dat het doel is om een schrijfassistente-AI te trainen om hoogwaardige samenvattingen te genereren. Het RM kan belonen voor bondige en informatieve samenvattingen. Het beleid kan dan leren om dit te exploiteren door zeer korte, oninformatieve samenvattingen te genereren die zijn doorspekt met trefwoorden die het RM bedriegen.
Beloningshacken gebeurt om twee belangrijke redenen:
- Verdelingsverschuiving – Het RM is getraind op een beperkte dataset van door mensen gelabelde voorbeelden. Wanneer het beleid wordt ingezet, kunnen de uitvoer van het beleid afkomstig zijn uit verschillende verdelingen die het RM niet goed generaliseert.
- Ruisige labels – Menselijke labeling is onvolmaakt, met inter-raterovereenkomsten. Het RM kan zich richten op spurious signalen in plaats van robuuste indicatoren van kwaliteit.
Beloningshacken leidt tot nutteloze systemen die falen om aan menselijke verwachtingen te voldoen. Erger nog, het kan resulteren in AI-gedrag dat bevooroordeeld of zelfs gevaarlijk is als het onzorgvuldig wordt ingezet.
De opkomst van modelmerging
De toenemende interesse in modelmergingstrategieën zoals Model Ratatouille wordt gedreven door de realisatie dat grotere modellen, hoewel krachtig, inefficiënt en onpraktisch kunnen zijn. Het trainen van een model met 1 biljoen parameters vereist een enorme hoeveelheid gegevens, rekenkracht, tijd en kosten. Bovendien hebben dergelijke modellen de neiging om over te trainen op de trainingsverdeling, waardoor hun vermogen om te generaliseren naar diverse reële scenario’s wordt beperkt.
Modelmerging biedt een alternatieve route om grotere capaciteiten te ontgrendelen zonder ongecontroleerde schaalvergroting. Door meerdere gespecialiseerde modellen te hergebruiken die zijn getraind op verschillende verdelingen, taken of doelen, beoogt modelmerging de veelzijdigheid en robuustheid buiten de trainingsverdeling te vergroten. De premisse is dat verschillende modellen verschillende voorspellende patronen vastleggen die elkaar kunnen aanvullen wanneer ze worden samengevoegd.
Recente resultaten illustreren de belofte van dit concept. Modellen die via merging zijn verkregen, hebben ondanks het feit dat ze veel minder parameters hebben, de prestaties van reusachtige modellen zoals GPT-3 kunnen evenaren of zelfs overtreffen. Bijvoorbeeld, een Model Ratatouille-ensemble van slechts 7 middelgrote checkpoints bereikt state-of-the-art-nauwkeurigheid op high-dimensional tekstuele implicatiedatasets, waarbij GPT-3 wordt overtroffen.
De eenvoud van merging door gewogen gemiddeling is een enorm voordeel. Het trainen van meerdere hulpmodellen vereist extra resources. Echter, de berekeningskosten tijdens de inferentie blijven identiek aan die van een enkel model, omdat de gewichten worden samengevoegd tot één. Dit maakt de methode gemakkelijk aanpasbaar, zonder zorgen over verhoogde latentie of geheugenkosten.
Mechanismen achter modelmerging
Maar wat maakt deze nauwkeurigheidsverbeteringen door modelmerging mogelijk?
- Mitigeren van memorisatie: Elke model ziet verschillende geschudde batches van de dataset tijdens de training. Gemiddeling vermindert elke instantiespecifieke memorisatie, waardoor alleen datasetniveau-generalisaties overblijven.
- Verlagen van variantie: Modellen die onafhankelijk zijn getraind, hebben ongecorreleerde fouten. Het combineren van deze modellen gemiddeld reduceert ruis, waardoor de kalibratie wordt verbeterd.
- Regulariseren via diversiteit: De variatie in hulpmodellen dwingt modellen om zich te richten op meer generaliseerbare kenmerken die nuttig zijn over verdelingen heen.
- Verhogen van robuustheid: Inconsistenties in voorspellingen signaleren onzekerheid. Gemiddeling matigt uitschieters, waardoor de betrouwbaarheid wordt verbeterd.
In wezen compenseert modelmerging de zwakheden van individuele modellen om hun collectieve sterke punten te versterken. De gemengde representatie vat de onderliggende causale structuren vast, waarbij incidentele variaties worden genegeerd.
Deze conceptuele basis verbindt modelmerging met andere populaire technieken zoals ensembling en multi-task learning. Alle deze methoden benutten diversiteit over modellen of taken om veelzijdige, onzekerheidsgevoelige systemen te verkrijgen. De eenvoud en efficiëntie van gewogen gemiddeling geven modelmerging echter een unieke voorsprong voor het bevorderen van reële inzet.
Gewogen Gemiddelde Beloningsmodellen
WARM maakt op een innovatieve manier gebruik van een proxy-beloningsmodel (RM), dat een gewogen gemiddelde is van meerdere individuele RM’s, elk fijngestemd vanaf hetzelfde voortrainde LLM maar met variabele hyperparameters. Deze methode verbetert de efficiëntie, betrouwbaarheid onder verdelingsverschuivingen en robuustheid tegen inconsistente voorkeuren. De studie toont ook aan dat het gebruik van WARM als proxy-RM, met name met een toegenomen aantal gemiddelde RM’s, de resultaten verbetert en het begin van ‘beloningshacken’ vertraagt, een fenomeen waarbij controlebeloningen in de loop van de tijd verslechteren.
Hier is een overzicht op hoog niveau:
- Begin met een basis taalmodel dat is voortraind op een grote corpus. Initialiseer meerdere RM’s door kleine taakspecifieke lagen toe te voegen.
- Fijntune elke RM afzonderlijk op de voorkeursdataset van de mens, met behulp van verschillende hyperparameters zoals de leerratio voor diversiteit.
- Gemiddel de gewichten van de fijngestemde RM’s om een enkel WARM-ensemble te verkrijgen.
De sleutelinzicht is dat gewogen gemiddeling alleen de invariante informatie behoudt die over alle diverse RM’s is geleerd. Dit vermindert de afhankelijkheid van spurious signalen, waardoor de robuustheid wordt verbeterd. Het ensemble profiteert ook van variantiereductie, waardoor de betrouwbaarheid ondanks verdelingsverschuivingen wordt verbeterd.
Zoals eerder besproken, is diversiteit over onafhankelijk getrainde modellen cruciaal voor het ontgrendelen van het volledige potentieel van modelmerging. Maar wat zijn enkele concrete technieken om productieve diversiteit te bevorderen?
Het WARM-papier verkent een paar slimme ideeën die breder kunnen worden toegepast:
Bestellingshusselingen
Een triviaal maar effectief benadering is het schudden van de volgorde waarin gegevenspunten door elk model worden gezien tijdens de training. Zelfs deze eenvoudige stap decorreleert gewichten, waardoor redundante memorisatie van patronen wordt vermindert.
Hyperparametervariaties
Het aanpassen van hyperparameters zoals de leerratio en de dropout-waarschijnlijkheid voor elke run introduceert nuttige diversiteit. Modellen convergeren anders, waardoor verschillende eigenschappen van de dataset worden vastgelegd.
Checkpoint-averaging – Baklava
De Baklava-methode initialiseert modellen voor merging vanuit verschillende snapshots langs dezelfde voortrajectorie. Dit ontspant beperkingen in vergelijking met modelsoepen die een gedeeld startpunt vereisen. In vergelijking met modelratatouille vermijdt Baklava extra taken. Al met al slaat het een effectief evenwicht tussen nauwkeurigheid en diversiteit.

Het proces begint met een voortraind Large Language Model (LLM) 𝜃_𝑝𝑡. Vanuit dit model worden verschillende checkpoints {𝜃_𝑠 𝑓 𝑡_𝑖} afgeleid tijdens een Supervised Fine-Tuning (SFT)-run, elk verzameld op verschillende SFT-trainingsstappen. Deze checkpoints worden vervolgens gebruikt als initialisaties voor het fijntunen van meerdere beloningsmodellen (RM’s) {𝜙𝑖} op een voorkeursdataset. Deze fijntuning is bedoeld om de modellen beter aan te passen aan menselijke voorkeuren. Na de fijntuning worden deze RM’s samengevoegd door middel van een proces van gewogen gemiddeling, resulterend in het finale model, 𝜙_WARM.
Analyse bevestigt dat het toevoegen van oudere checkpoints door middel van een bewegende gemiddelde de prestaties van individuele modellen schaadt, waardoor de diversiteitsvoordelen in gevaar komen. Het gemiddelen van alleen de finale representaties van elke run presteert beter. In het algemeen blijft het vinden van een balans tussen diversiteitsdoelen en het behoud van nauwkeurigheid een open onderzoeksuitdaging.
Over het algemeen sluit modelmerging goed aan bij de algemene ethos in het veld om bestaande resources effectief te hergebruiken voor verbeterde betrouwbaarheid, efficiëntie en veelzijdigheid. De eenvoud van gewogen gemiddeling versterkt haar positie als een toonaangevende kandidaat voor het assembleren van robuuste modellen uit beschikbare bouwstenen.
In tegenstelling tot traditionele ensemblentechnieken die voorspellingen gemiddelen, houdt WARM de berekeningskosten minimaal door slechts één set gewichten te behouden. Experimenten op tekstsamenvattingsTaken demonstreren de effectiviteit van WARM:
- Voor best-of-N-steekproeven bereikt WARM een winstpercentage van 92,5% tegenover willekeurige selectie volgens menselijke voorkeurslabels.
- In RLHF bereikt een WARM-beleid een winstpercentage van 79,4% tegenover een beleid getraind met een enkel RM na hetzelfde aantal stappen.
- WARM presteert zelfs goed wanneer een kwart van de menselijke labels is gecorrumpeerd.
Deze resultaten illustreren het potentieel van WARM als een praktische techniek voor het ontwikkelen van real-world AI-assistenten die betrouwbaar gedragen. Door inconsistenties in menselijke feedback te gladstrijken, kunnen WARM-beleidsregels robuust in overeenstemming blijven met menselijke waarden, zelfs terwijl ze blijven leren van nieuwe ervaringen.
Het grotere plaatje
WARM staat op het snijvlak van twee belangrijke trends in AI-aligneringsonderzoek. Ten eerste is er de studie naar out-of-distribution (OOD)-generalisatie, die gericht is op het verbeteren van modelprestaties op nieuwe gegevens die afwijken van de trainingsverdeling. Ten tweede is er onderzoek naar algoritme-robustheid, met de focus op betrouwbaarheid ondanks kleine invoerstoornissen of ruis.
Door verbindingen te leggen tussen deze velden rond het concept van geleerde invarianten, brengt WARM ons dichter bij meer grondig onderbouwde technieken voor waarde-alignering. De inzichten uit WARM kunnen zelfs breder worden toegepast dan RLHF, waardevolle lessen biedend voor bredere machine learning-systemen die interactie hebben met de open wereld.
Natuurlijk is beloningsmodellering slechts één onderdeel van de aligneringpuzzel. We hebben nog steeds vooruitgang nodig op andere uitdagingen zoals beloningspecificatie, schaalbare toezicht en veilige exploratie. In combinatie met complementaire technieken kan WARM de ontwikkeling van AI die menselijk welzijn duurzaam bevordert, versnellen. Door collectief de principes te verduidelijken die ten grondslag liggen aan robuuste alignering, zijn onderzoekers de route aan het uitstippelen naar voordelige, ethische AI.













