AI-modeller og plattformer
Zephyr: Direkte destillasjon av LLM-justering
Evnen og ytelsen til mindre, åpne store språkmodeller har fremmet betydelig de siste årene, og vi har vært vitne til fremgangen fra tidlige GPT-2-modeller til mer kompakte, nøyaktige og effektive LLM-rammeverk som utnytter en betraktelig større mengde token enn den “compute-optimal” mengde token anbefalt av Chinchilla-skaleringslovene. Videre har utviklere demonstrert at disse mindre LLM-rammeverk kan trenes videre ved hjelp av en proprietærmodellbasert dSFT eller Distilled Supervised Fine-Tuning-tilnærming, som bruker utgangen fra en effektiv lærermodell som overvåket data for elevmodellen i et forsøk på å øke nøyaktigheten.
I denne artikkelen vil vi snakke om Zephyr-7B-rammeverket, et state-of-the-art chat-benchmark for 7B parametermodeller som ikke krever menneskelige annotasjoner. Det primære målet med rammeverket er å enable utviklere å produsere mindre store språkmodeller som er justert til brukerens intensjoner nærmere enn noen gang før. Zephyr-7B-rammeverket ikke bare undersøker bruken av nåværende tilnærminger for større LLM-rammeverk som dSFT, men også utforsker muligheten for å bruke andre tilnærminger for å lære en chat-modell med bedre justering med brukerens intensjoner. Vi vil ta en dyptere dykk i Zephyr-rammeverket og utforske dens arkitektur, virkemåte og resultater. Så la oss begynne.
Zephyr-7B : En introduksjon til direkte destillasjon av justering i språkmodeller
Som nevnt tidligere, har språkmodellene fremmet raskt de siste årene, fra tidligere GPT-2-rammeverk til nåværende GPT-4 og MiniGPT-5 LLM-rammeverk som selv om de er svært token-utførende, nå er mer nøyaktige og mye mer effektive. En stor høydepunkt av disse avanserte LLM-rammeverkene er at de inkorporerer en betraktelig større mengde token enn den mengde token som tidligere ble ansett å være komputasjons-optimal under Chinchilla-skaleringslovene. Videre har utviklere og forskere som arbeider med LLM-rammeverk lært at disse mindre LLM-rammeverk kan trenes videre ved hjelp av en proprietærmodellbasert dSFT-tilnærming, som bruker utgangen fra en effektiv lærermodell som overvåket data for elevmodellen i et forsøk på å øke nøyaktigheten. Destillasjonsstrategien har vist seg å være et svært effektivt og nyttig verktøy for å maksimere potensialet og evnene til åpne modeller på en bred rekke av oppgaver, selv om det ennå ikke kan replikere ytelsen oppnådd av lærermodellen. Videre har brukerne ofte rapportert at disse modellene ofte viser “intensjonsmisjustering”, det vil si at modellene ikke oppfører seg på en måte som er i samsvar med kravene til sluttbrukerne, noe som fører til feilaktige utgangsdata som ikke gir riktige svar eller respons på brukerens innputt eller spørsmål.
Intensjonsjustering har alltid vært en stor utfordring for utviklere, med nyere arbeid som fokuserer på utvikling av benchmark-verktøy som AlpacaEval og MT-Bench utviklet for å måle misjusteringen. Motivasjonen for å utvikle Zephyr-rammeverket kan tilskrives problemet med å bruke destillasjon for å justere en liten åpen LLM-modell helt, der det primære steget er å bruke AIF eller kunstig intelligens-tilbakemelding for å hente preferansedata fra en ensemble av lærermodellen, og deretter anvende destillert preferanseoptimering direkte som det primære læringsmål, en tilnærming som kalles dDPO eller Denoising Diffusion Policy Optimization. Hovedhøydepunktet med dDPO-tilnærmingen er at, i motsetning til forgjengerne som PPO eller Proximal Preference Optimization, krever den ikke menneskelig sampling eller annotasjoner, og reduserer også tiden det tar å trene en språkmodell. Videre tillater den også utviklere å maksimere belønningene til den endelige prøven ved å fokusere på sekvensen av denoising-stegene helt fra begynnelsen til slutten, det vil si gjennom hele dens omfang.
Utviklere har utviklet Zephyr-7B-rammeverket for å validere denne tilnærmingen, og på noen måter er det en justert versjon av state-of-the-art Mistral-7B-rammeverket. Rammeverket bruker først dSFT eller Distilled Supervised Fine-Tuning basert på UltraChat-datasettet, og anvender deretter dDPO eller Denoising Diffusion Policy Optimization-tilnærmingen på tilbakemeldingsdataene. Eksperimenter indikerer at Zephyr-7B-rammeverket med 7 milliarder parametre leverer resultater som er sammenlignbare med de som leveres av menneske-tilbakemeldte justerte chat-modeller med over 70 milliarder parametre. Videre indikerer eksperimenter også at resultater kan forbedres både i terms av benchmark som tar conversasjons-evner i betraktning, samt standard akademiske benchmark, og at bruk av preferanse-læring er kritisk for å oppnå de ønskede resultater.

Figuen over demonstrerer ytelsen til ulike språkmodeller på MT-Bench-benchmarken. Zephyr-7B-rammeverket som er trenet ved hjelp av dDPO-tilnærmingen er satt opp mot proprietære samt åpne, større språkmodeller som GPT-3.5 Turbo, Llama-2-70B og mer som ble trenet ved hjelp av ekstra forsterkingslæring, og inkluderte også en stor mengde menneskelig tilbakemelding. Som det kan ses, leverer Zephyr-7B-rammeverket sammenlignbare resultater mot de fleste av dem, og overgår flere rammeverk i ulike domener.
Zephyr-7B : Metode, virkemåte og arkitektur
Det primære målet med Zephyr-7B-rammeverket er å hjelpe en åpen kilde-språkmodell å justere så nært som mulig til brukerens intensjoner, og gjennom hele dens omfang, antar Zephyr-7B-rammeverket tilgang til en stor lærermodell som spørres ved hjelp av prompt-generering. Zephyr-7B følger en tilnærming som ligner den som brukes i InstructGPT-rammeverket, og har som mål å generere en effektiv og nøyaktig elevmodell.
Følgende figur demonstrerer kort de tre primære stegene involvert i virkemåten til Zephyr-7B-rammeverket.
- dSFT for stor-skala datasett-konstruksjon ved hjelp av en selv-instruksjons-stil.
- AIF-samling ved hjelp av en ensemble av komplettende chat-modeller, etterfulgt av preferanse-binarisering og scoring ved GPT-4.
- dPO av dSFT-modellen ved hjelp av tilbakemeldingsdataene.

dSFT eller Distilled Supervised Fine-Tuning
Rammeverket starter med en rå stor språkmodell som først må trenes for å svare på bruker-prompter. Tradisjonelt blir disse LLM-rammeverkene trenet for å svare på bruker-prompter ved hjelp av SFT eller Supervised Fine Tuning på et datasett som består av høykvalitets-instruksjoner og deres tilhørende svar. Ettersom Zephyr-7B-rammeverket har tilgang til en lærermodell, kan rammeverket generere instruksjoner og svar, og trene modellen direkte på disse instruksjonene og svarene, og denne tilnærmingen kalles dSFT eller destillert SFT. Følgende figur demonstrerer destillasjonen utført av SFT hvor x representerer en mengde seed-prompter konstruert med hovedformålet å representere en divers mengde topiske domener, y representerer sampel-svaret som er raffinert ved hjelp av en ny sampel-instruksjon representert av x1 og C representerer endepunktet i det endelige datasettet.

AI-tilbakemelding gjennom preferanser
Menneskelig tilbakemelding brukes for å tildele store språkmodeller ettersom de kan gi de nødvendige ekstra signalene, og disse menneskelige tilbakemeldingene er tradisjonelt gitt gjennom preferanser på kvaliteten av svarene generert av LLM-rammeverkene. Imidlertid bruker Zephyr-rammeverket AI-tilbakemelding fra lærermodellen på andre modellers genererte utgangsdata i stedet for menneskelig tilbakemelding for destillasjonsformål. Tilnærmingen som følges av Zephyr-rammeverket er influert av den som brukes av UltraFeedback-rammeverket som bruker lærermodellen for å gi preferanser på utgangsdataene til modellen.
Lignende til SFT eller Supervised Fine Tuning-tilnærmingen, starter den med en mengde prompter, hvor x representerer hver enkelt prompt som deretter mates til en samling av fire modeller som Llama, Falcon, Claude og mer, hver av dem genererer et svar av sine egne. Disse svarene mates deretter som inndata til lærermodellen som GPT-3 eller GPT-4, og modellen utgangsdata et poengsum for inndata-svaret. Etter å ha samlet inn utgangsdataene, saver modellen svaret med den høyeste poengsummen.
dDPO eller Distilled Direct Preference Optimization
dDPO er det siste steget i Zephyr-rammeverket, og det primære målet er å raffinere dSFT-lærermodellen ved å maksimere sannsynligheten for å rangere det foretrukne svaret i en preferansemodell som bestemmes av en belønning-funksjon ved å bruke elev-språkmodellen. Det foregående steget som involverte bruk av AI-tilbakemelding fokuserte primært på å bruke forsterkingslæring-metoder som PPO eller Proximal Policy Optimization for maksimal optimering med hensyn til belønningen generert. I dette steget trenes belønningen først, og deretter samplet fra den nåværende politikken for å beregne oppdateringene, og dermed maksimere optimeringen. DPO eller Direct Preference Optimization følger en lignende tilnærming for å optimalisere preferansemodellen direkte ved hjelp av statiske data. Målet etter å ha plugget inn belønning-funksjonen i preferansemodellen kan skrives som

Zephyr-7B : Eksperimenter, benchmark og resultater
Zephyr-rammeverket gjennomfører sine fin-justerings-eksperimenter på nåværende state-of-the-art Mistral-7B-rammeverket som leverer sammenlignbare resultater med mye større språkmodeller på en bred rekke av naturlige språkbehandlings- eller NLP-oppdrag.
Datasett
Zephyr-rammeverket bruker to dialog-datasett som er destillert fra en blanding av proprietære og åpne modeller, som tidligere har vist seg å være effektive i å produsere effektive chat-modeller.
UltraChat
UltraChat er et selv-raffinerings-datasett som består av nærmere 1,5 millioner multi-turn dialoger spredt over 30 emner og 20 tekst-materiell generert av GPT-3.5-Turbo-rammeverket. For å takle det feilaktige kapitalisering-problemet som UltraChat-datasettet møter, anvender rammeverket en truecasing-heuristikk-tilnærming for å fjerne grammatikalske feil.
UltraFeedback
UltraFeedback er et prompt-datasett med over 64k prompter, hvor hver av disse promptene har fire individuelle LLM-svar. Zephyr-rammeverket bruker den høyeste gjennomsnittlige poengsummen fra UltraFeedback-datasettet for å konstruere binære preferanser, og ett av de gjenværende tre LLM-svarene forkastes som tilfeldig.
Evaluering
For å evaluere ytelsen til Zephyr-rammeverket, har utviklerne valgt to chat-benchmark, en enkelt-turn og en multi-turn, i et forsøk på å evaluere evnen til modellen til å følge bruker-instruksjoner og svare deretter.
MT-Bench
MT-Bench-evaluering-benchmark består av 160 spørsmål spredt over 8 unike kunnskapsområder, og under MT-Bench-benchmark må modellen svare på et initialt spørsmål og gi et svar på oppfølgings-spørsmålet.
AlpacaEval
AlpacaEval er en enkelt-turn-benchmark under hvilken modellen eller rammeverket genererer bruker-svar til over 800 spørsmål spredt over ulike emner med hovedfokus på nyttighet.
I tillegg til disse to primære benchmark, blir Zephyr-7B-rammeverket også evaluert på Open LLM Leaderboard for multiklassifikasjons-oppdrag, ARC, HellaSwag, MMLU og mer. Videre, uansett hvilken benchmark Zephyr-7B-rammeverket blir evaluert på, blir det sammenlignet med en rekke proprietære og åpne modeller, med deres justerings-prosedyrer som den eneste differensierende faktoren.
Resultater
La oss nå se hvordan Zephyr-7B-rammeverket performer og sammenlignes med nåværende state-of-the-art språkmodeller.
Implementering av dDPO-tilnærming booster chat-evner
Følgende tabell sammenligner ytelsen til Zephyr-7B-rammeverket mot state-of-the-art språkmodeller på AlpacaEval- og MT-Bench-benchmark.

Som det kan ses, når det blir sammenlignet med åpne 7B-modeller, performer Zephyr-7B-rammeverket ikke bare betydelig bedre enn dSFT-modeller over de to benchmark, men setter også nye state-of-the-art-standarder. Videre performer Zephyr-7B-rammeverket også bedre enn XWIN-LM-7B-rammeverket, som er ett av de sjeldne modellene trenet på dPPO eller destillert PPO-tilnærming. Videre er ytelsen levert av Zephyr-7B-rammeverket sammenlignbar med resultater levert av mye større språkmodeller som Llama2-Chat med over 70 milliarder parametre.
dDPO booster akademisk oppgave-ytelse
Følgende figur sammenligner ytelsen til Zephyr-7B-rammeverket mot en bred rekke av åpne og proprietære LLM-rammeverk.

Som det kan ses, performer Zephyr-7B-rammeverket betydelig bedre enn LLM-rammeverk med 7 milliarder parametre, og gapet mellom dens ytelse og den som leveres av de beste dSFT-modellene er også merkbart. Ettersom antallet parametre øker, faller Zephyr-7B-rammeverket kort, selv om det matcher ytelsen levert av rammeverk med 40 milliarder parametre.
Preferanseoptimering
I følgende figur evaluerer vi hvordan de ulike stegene i justerings-prosessen påvirker ytelsen. Som det kan ses, booster dDPO-tilnærmingen når den kombineres med dSFT betydelig ytelsen på både MT-Bench og AlpacaEval-datasettene.

Til slutt, i følgende figur kan vi se test- og trening-nøyaktigheten under DPO-implementeringen. Som det kan ses, påvirker DPO-tilnærmingen ikke ytelsen til modellen på nedstrøms-oppdrag.

Konklusjon
I denne artikkelen har vi snakket om Zephyr-7B-rammeverket basert på nåværende state-of-the-art Mistral-7B-rammeverket som har som mål å løse den nåværende utfordringen med justerings-destillasjon fra en stor språkmodell til en mye mindre forhånds-trent rammeverk. Det primære målet med rammeverket er å enable utviklere å produsere mindre store språkmodeller som er justert til brukerens intensjoner nærmere enn noen gang før. Zephyr-7B-rammeverket ikke bare undersøker bruken av nåværende tilnærminger for større LLM-rammeverk som dSFT, men også utforsker muligheten for å bruke andre tilnærminger for å lære en chat-modell med bedre justering med brukerens intensjoner.
Imidlertid, til tross for de lovende resultater, er Zephyr-7B-rammeverket ikke perfekt, og noen arbeid må ennå gjøres. En av de åpenbare begrensningene er å bruke GPT-4-rammeverket for å evaluere MT-Bench og AlpacaEval-benchmark, som ofte har vært bias mot modellene det destillerer selv. Imidlertid håper Zephyr-7B-rammeverket å åpne en vei for å utforske evnene til mindre åpne modeller som er i stand til å justere seg til brukerens intensjoner og interaksjoner.












