AI-modeller og platforme
Zephyr: Direkte Destillation af Alignment i Sprogmodeller
Evnen og præstationen af mindre, åbne sprogmodeller har udviklet sig betydeligt i de seneste år, og vi har set fremgangen fra de tidlige GPT-2-modeller til mere kompakte, nøjagtige og effektive LLM-rammer, der udnytter en betydelig større mængde tokens end den “compute-optimal” mængde tokens, der anbefales af Chinchilla-skaleringslove. Desuden har udviklere demonstreret, at disse mindre LLM-rammer kan trænes yderligere ved hjælp af en proprietær-model-baseret dSFT eller Destilled Supervised Fine-Tuning-tilgang, der bruger output fra en effektiv lærermodel som superviseret data til elevmodellen i et forsøg på at øge nøjagtigheden.
I denne artikel vil vi tale om Zephyr-7B-rammen, en state-of-the-art chat-benchmark for 7B-parametermodeller, der ikke kræver menneskelige annoteringer. Det primære mål for rammen er at enable udviklere til at producere mindre store sprogmodeller, der er aligneret med brugerens intention nærmere end nogensinde før. Zephyr-7B-rammen undersøger ikke kun anvendelsen af nuværende tilgange for større LLM-rammer som dSFT, men også muligheden for at bruge andre tilgange til at lære en chat-model med bedre alignment med brugerens intention. Vi vil dykke dybere i Zephyr-rammen og undersøge dens arkitektur, funktion og resultater. Så lad os komme i gang.
Zephyr-7B: En Introduktion til Direkte Destillation af Alignment i Sprogmodeller
Som nævnt tidligere har sprogmodeller udviklet sig hurtigt i de seneste år, fra de tidlige GPT-2-rammer til nuværende GPT-4 og MiniGPT-5 LLM-rammer, der selvom de er meget token-udtømme, nu er mere nøjagtige og effektive. Et større højdepunkt ved disse avancerede LLM-rammer er, at de inkorporerer en betydelig større mængde tokens end den mængde tokens, der tidligere blev betragtet som computermæssigt optimal under Chinchilla-skaleringslove. Desuden har udviklere og forskere, der arbejder med LLM-rammer, lært, at disse mindre LLM-rammer kan trænes yderligere ved hjælp af en proprietær-model-baseret dSFT eller Destilled Supervised Fine-Tuning-tilgang, der bruger output fra en effektiv lærermodel som superviseret data til elevmodellen i et forsøg på at øge nøjagtigheden. Destillationsstrategien har vist sig at være et meget effektivt og nyttigt værktøj til at maksimere potentialet og evnerne af åbne modeller på en bred vifte af opgaver, selvom det endnu ikke kan replikere præstationen opnået af lærermodellen. Desuden har brugere ofte rapporteret, at disse modeller ofte viser “intent-misalignment”, hvilket betyder, at modellerne ikke opfører sig på en måde, der er i overensstemmelse med kravene fra slutbrugerne, hvilket fører til forkerte output, der ikke giver det rigtige output eller svar på brugerinput eller forespørgsler.
Intent-alignment har altid været en stor udfordring for udviklere, og det seneste arbejde har fokuseret på udvikling af benchmarks som AlpacaEval og MT-Bench, der er designet til at måle misalignment. Motivationen for at udvikle Zephyr-rammen kan tilskrives problemet med at bruge destillation til at alignere en lille åben LLM-ramme helt, hvor det primære trin er at bruge en AIF eller Artificial Intelligence Feedback til at få præference-data fra en ensemble af lærermodellen, og derefter anvende destilled præferenceoptimering direkte som det primære læringsmål, en tilgang, der kendes som dDPO eller Denoising Diffusion Policy Optimization. Det primære højdepunkt ved dDPO-tilgangen er, at den til forskel fra dens forgængere som PPO eller Proximal Preference Optimization ikke kræver menneskeligt sampling eller annotering, og også reducerer tiden det tager at træne en sprogmodel. Desuden tillader den også udviklere at maksimere belønningerne af den endelige prøve ved at være opmærksom på sekvensen af de støjende trin lige fra starten til slut, altså hele vejen igennem.
Udviklere har udviklet Zephyr-7B-rammen for at validere denne tilgang, og på visse måder er det en aligneret version af state-of-the-art Mistral-7B-rammen. Rammen bruger først dSFT eller Destilled Supervised Fine-Tuning baseret på UltraChat-datasættet, og anvender derefter dDPO eller Denoising Diffusion Policy Optimization-tilgangen på feedback-data. Eksperimenter viser, at Zephyr-7B-rammen med 7 milliarder parametre leverer resultater, der er sammenlignelige med dem, der leveres af menneske-til-retning alignerede chat-modeller med over 70 milliarder parametre. Desuden viser eksperimenter også, at resultaterne kan forbedres både i forhold til benchmarks, der tager konversationsfærdigheder med i betragtning, samt standard akademiske benchmarks, og brugen af præference-læring er afgørende for at opnå de ønskede resultater.

Figuren ovenfor viser præstationen af forskellige sprogmodeller på MT-bench-benchmarket. Zephyr-7B-rammen, der er trænet ved hjælp af dDPO-tilgangen, er sammenlignet med proprietære samt åbne og større sprogmodeller som GPT-3.5 Turbo, Llama-2-70B og mere, der er trænet ved hjælp af yderligere forstærkning af læring og også inkluderer en stor mængde menneskeligt feedback. Som det kan ses, leverer Zephyr-7B-rammen sammenlignelige resultater mod de fleste af dem og overgår flere rammer i forskellige domæner.
Zephyr-7B: Metode, Funktion og Arkitektur
Det primære mål for Zephyr-7B-rammen er at hjælpe en åben kilde-sprogmodel med at alignere så tæt som muligt med brugerens intention, og hele vejen igennem antager Zephyr-7B-rammen adgang til en stor lærermodel, der er forespurt ved hjælp af prompt-generering. Zephyr-7B følger en tilgang, der ligner den, der bruges i InstructGPT-rammen, og sigter mod at generere en effektiv og nøjagtig elevmodel.
Figuren nedenfor viser kort de tre primære trin, der er involveret i funktionen af Zephyr-7B-rammen.
- dSFT til stor-skala datasætskonstruktion ved hjælp af en selv-instrueringsstil.
- AIF-samling ved hjælp af en ensemble af afsluttende chat-modeller efterfulgt af præference-binarisering og scoring af GPT-4.
- dPO af dSFT-modellen ved hjælp af feedback-data.

dSFT eller Destilled Supervised Fine-Tuning
Rammen starter med en rå stor sprogmodel, der først skal trænes til at reagere på brugerprompts. Traditionelt trænes disse LLM-rammer til at reagere på brugerprompts ved hjælp af SFT eller Supervised Fine Tuning på et datasæt, der består af højkvalitetsinstruktioner og deres tilsvarende svar. Da Zephyr-7B-rammen har adgang til en lærer-sprogmodel, kan rammen generere instruktioner og svar og træne modellen direkte på disse instruktioner og svar, og denne tilgang kendes som dSFT eller destilled SFT. Figuren nedenfor viser destillationen, der udføres af SFT, hvor x repræsenterer en samling af seed-prompts konstrueret med det primære formål at repræsentere en divers samling af topiske domæner, y repræsenterer den sample-svar, der afprøves ved hjælp af en ny sample-instruktion repræsenteret af x1, og C repræsenterer slutpunktet i det endelige datasæt.

AI-Feedback gennem Præferencer
Menneskeligt feedback bruges til at tildele stor sprogmodel, da de kan give de nødvendige ekstra signaler, og disse menneskelige feedbacks er traditionelt givet gennem præferencer på kvaliteten af svarene, der er genereret af LLM-rammerne. Men Zephyr-rammen bruger AI-Feedback fra lærermodellen på andre modellers genererede output i stedet for menneskeligt feedback til destillationsformål. Tilgangen, der følges af Zephyr-rammen, er påvirket af den, der bruges af UltraFeedback-rammen, der bruger lærermodellen til at give præferencer på modellens output.
Ligesom SFT eller Supervised Fine Tuning-tilgangen starter det med en samling af prompts, hvor x repræsenterer hver enkelt prompt, der derefter fødes til en samling af fire modeller som Llama, Falcon, Claude og mere, hver af dem genererer et svar af deres egen. Disse svar fødes herefter som input til lærermodellen som GPT-3 eller GPT-4, og modellen udgiver en score for input-svaret. Efter at have indsamlet output-scoren gemmer modellen svaret med den højeste score.
dDPO eller Destilled Direct Preference Optimization
dDPO er det sidste trin i Zephyr-rammen, og dets primære mål er at raffinere dSFT-lærermodellen ved at maksimere sandsynligheden for at rangere det præfererede svar i en præference-model, der bestemmes af en belønningsfunktion ved hjælp af elev-sprogmodellen. Det foregående trin, der involverer brugen af AI-Feedback, fokuserede primært på at bruge Forstærkning af Læring-metoder som PPO eller Proximal Policy Optimization for maksimal optimering i forhold til den genererede belønning. I dette trin trænes belønningen først og derefter samplet fra den aktuelle politik til at beregne opdateringerne og således maksimere optimeringen. DPO eller Direct Preference Optimization følger en lignende tilgang til at optimere præference-modellen direkte ved hjælp af statisk data. Målet efter at indsætte belønningsfunktionen i præference-modellen kan skrives som

Zephyr-7B: Eksperimenter, Benchmarks og Resultater
Zephyr-rammen udfører sine finjusterings-eksperimenter på den nuværende state-of-the-art Mistral-7B-ramme, der leverer sammenlignelige resultater med meget større sprogmodeller på en bred vifte af naturlige sprogbehandlingsopgaver eller NLP-opgaver.
Datasæt
Zephyr-rammen bruger to dialog-datasæt, der er destilleret fra en blanding af proprietære og åbne modeller, der tidligere har vist sig at være effektive til at producere effektive chat-modeller.
UltraChat
UltraChat er en selv-forbedring-datasæt, der består af næsten 1,5 millioner multi-turn dialoger fordelt over 30 emner og 20 tekstmaterialer genereret af GPT-3.5-Turbo-rammen. For at tackle det forkerte kapitaliseringsspørgsmål, der er forbundet med UltraChat-datasættet, anvender rammen en truecasing-heuristik-tilgang til at fjerne grammatiske fejl.
UltraFeedback
UltraFeedback er et prompt-datasæt med over 64.000 prompts, hvor hver af disse prompts har fire enkeltstående LLM-svar. Zephyr-rammen bruger den højeste gennemsnitscore, der er opnået fra UltraFeedback-datasættet, til at konstruere binære præferencer, og ét af de tre tilbageværende LLM-svar afvistes som tilfældigt.
Evaluering
For at evaluere præstationen af Zephyr-rammen har udviklerne valgt to chat-benchmarks, en enkelt-vendt og en multi-vendt, i et forsøg på at evaluere evnen til at følge brugerinstruktioner og svare derefter.
MT-Bench
MT-Bench-evalueringen består af 160 spørgsmål fordelt over 8 unikke videnområder, og under MT-Bench-benchmarket skal modellen svare på et initialt spørgsmål og give et svar på opfølgningsspørgsmålet.
AlpacaEval
AlpacaEval er en enkelt-vendt benchmark, under hvilken modellen eller rammen genererer brugersvar til over 800 spørgsmål fordelt over forskellige emner med primært fokus på hjælpsomhed.
Ud over disse to primære benchmarks evalueres Zephyr-7B-rammen også på Open LLM Leaderboard for multiklassifikationsopgaver, ARC, HellaSwag, MMLU og mere. Desuden uanset hvilken benchmark Zephyr-7B-rammen evalueres på, sammenlignes den med en række proprietære og åbne modeller, hvor deres aligneringsprocedurer er den eneste differentierende faktor.
Resultater
Lad os nu se, hvordan Zephyr-7B-rammen præsterer og sammenlignes med nuværende state-of-the-art sprogmodeller.
Implementering af dDPO-tilgangen Forbedrer Chat-kapaciteter
Den følgende tabel sammenligner præstationen af Zephyr-7B-rammen med state-of-the-art sprogmodeller på AlpacaEval- og MT-Bench-benchmarkene.

Som det kan ses, når den sammenlignes med åbne 7B-modeller, overgår Zephyr-7B-rammen ikke kun betydeligt dSFT-modellerne på tværs af de to benchmarks, men sætter også nye state-of-the-art-standarder. Desuden overgår Zephyr-7B-rammen også XWIN-LM-7B-rammen, der er en af de få modeller, der er trænet på dPPO eller destilled PPO-tilgangen. Desuden er præstationen leveret af Zephyr-7B-rammen sammenlignelig med resultaterne leveret af meget større sprogmodeller som Llama2-Chat med over 70 milliarder parametre.
dDPO Forbedrer Akademisk Opgradering
Den følgende figur sammenligner præstationen af Zephyr-7B-rammen med en bred vifte af åbne og proprietære LLM-rammer.

Som det kan ses, overgår Zephyr-7B-rammen betydeligt LLM-rammer med 7 milliarder parametre, og forskellen mellem dens præstation og den, der leveres af de bedst præsterende dSFT-modeller, er også bemærkelsesværdig. Da antallet af parametre øges, falder Zephyr-7B-rammen dog kort, selvom den matcher præstationen leveret af rammer med 40 milliarder parametre.
Præferenceoptimering
I den følgende figur evaluerer vi, hvordan de forskellige trin, der følges i aligneringsprocessen, påvirker præstationen. Som det kan ses, øger dDPO-tilgangen, når den kombineres med dSFT, betydeligt præstationen på både MT-Bench- og AlpacaEval-datasættene.

Til sidst i den følgende figur kan vi se test- og træningsnøjagtigheder under DPO-implementeringen. Som det kan ses, påvirker DPO-tilgangen ikke præstationen af modellen på downstream-opgaver.

Konklusion
I denne artikel har vi talt om Zephyr-7B-rammen baseret på den nuværende state-of-the-art Mistral-7B-ramme, der sigter mod at løse den nuværende udfordring med alignment-destillation fra en stor sprogmodel til en meget mindre forudtrænet ramme. Det primære mål for rammen er at enable udviklere til at producere mindre store sprogmodeller, der er aligneret med brugerens intention nærmere end nogensinde før. Zephyr-7B-rammen undersøger ikke kun anvendelsen af nuværende tilgange for større LLM-rammer som dSFT, men også muligheden for at bruge andre tilgange til at lære en chat-model med bedre alignment med brugerens intention.
Men selvom resultaterne er lovende, er Zephyr-7B-rammen ikke perfekt, og der er stadig arbejde, der skal gøres. En af de åbenlyse begrænsninger er brugen af GPT-4-rammen til at evaluere MT-Bench- og AlpacaEval-benchmarkene, der ofte har været forvrængede mod modellerne, de selv destillerer. Men Zephyr-7B-rammen håber at bana vejen for at udforske evnerne af mindre åbne modeller, der er i stand til at alignere med brugerens intention og interaktioner.












