AI-modeller og platforme

Zephyr-7B: Hugging Faces hyperoptimerede LLM bygget på toppen af Mistral 7B

mm
Føj Unite.AI til dine foretrukne kilder på Google

Introduktion

Udviklingen af åbne store sprogmodeller (LLM’er) har haft en betydelig indvirkning på AI-forskningsfællesskabet, især i udviklingen af chatbots og lignende anvendelser. Efter udgivelsen af modeller som LLaMA har der været en opblomstring i forskningen i effektiv finjustering, udvidet prompt-håndtering, retrieval-augmenteret generation (RAG) og kvantificering.

LLaMA-modellen, for eksempel, markerede en ny æra i finjustering og prompt-kontekstualisering, og banede vejen for efterfølgende modeller som MosaicML’s MPT, Together AI’s RedPajama-INCITE, TII’s Falcon og Meta’s Llama 2. Hver af disse modeller bidrager med unikke funktioner, der forbedrer den samlede funktionalitet og omfang af LLM’er.

Mistral AI, en startup fra Paris og grundlagt af tidligere Google DeepMind- og Meta-ansatte, har gjort sig bemærket med sin første tilbud: Mistral 7B.

Mistral 7B’s fordel ligger i dets effektivitet, da det leverer lignende eller forbedrede funktioner i forhold til peers som Llama 2, men med mindre computermæssig krav.

Specifikt tilpasset til instruktionsopgaver, skinner Mistral 7B Instruct på platforme som Hugging Face, hvor det overgår andre modeller af samme størrelse og konkurrerer tæt med dem, der har næsten dobbelt så mange parametre.

Bygget på dette, introducerede Hugging Face Zephyr 7B Alpha, der viser, at en finjusteret Mistral 7B kan overgå evnerne hos betydeligt større chatmodeller og, i nogle opgaver, sogar rivalisere med GPT-4. “Alpha” var kun begyndelsen, da Zephyr 7B Beta fulgte kort efter.

Denne artikel vil udforske, hvordan Zephyr 7B udnytter kraften fra større modeller til at forfine sin evne til at svare og tilpasse sig menneskelig instruktion, en proces, der er muliggjort gennem teknikken med vidensoverføring. Denne metode indebærer træning af mindre modeller på komplekse mønstre lært af større modeller, reducerer træningskravene uden at ofre sprogmodelleringsevner. Vi vil dykke ned i detaljerne om Hugging Faces vidensoverføringstilgang.

Vidensoverføring

En nøgleinnovation i udviklingen af modeller som Zephyr-7B er destilleret overvåget finjustering (dSFT). Denne metode indebærer brug af output fra en større, mere kapabel “lærer”-model til at træne en mindre “elev”-model, hvilket forbedrer dens nøjagtighed. Selvom destillering forbedrer åbne modeller på forskellige opgaver, findes der stadig en præstationsforskel i forhold til lærermodeller.

Vidensoverføring er en metode i maskinlæring, hvor en kompakt model, kaldet “elev“, læres at replikere præstationen af en større, mere kompleks “lærer“-model. Denne teknik giver elevmulighed for at udføre opgaver, der tidligere var ud over dens kapacitet, ved at overføre de komplekse mønstre, der er lært af læreren.

Vidensoverføring, | Lærer-Elev-Model

Vidensoverføring | Lærer-Elev-Model

Elevmodellen trænes på output-sandsynligheder eller funktioner genereret af lærermodellen, fokuserer på at matche disse outputs snarere end kun de endelige forudsigelser. Dette giver elevmulighed for at lære lærerens nuancerede beslutningsprocesser, hvilket ofte resulterer i forbedret præstation over træning med kun grundsandhedsdata.

Historisk set er vidensoverføring blevet anvendt i modeller som Hinton’s originale destillationsnetværk og mere nyligt i NLP med modeller som DistilBERT, der destillerer BERT-modellen til en mindre, hurtigere version, der beholder de fleste af den originale sprogforståelsesevner. Et andet eksempel er TinyBERT, der går videre i optimering af størrelse og hastighed til mobile eller kantede enheder.

I tilfældet med Zephyr-7B anvendes vidensoverføring til at indynde en mindre 7B-parametermodel med evnerne fra dens større modeller. Ved at gøre dette opnår Zephyr-7B en balance mellem præstation og effektivitet, hvilket gør den egnet til miljøer, hvor computermæssige ressourcer er begrænsede, uden at ofre kvaliteten af interaktion og forståelse.

Ved udviklingen af Zephyr-7B tog forskerne udfordringen med at tilpasse en lille åben LLM helt gennem destillering. De introducerede en tilgang kaldet destilleret direkte præferenceoptimering (dDPO), der anvender AI-feedback fra en ensemble af lærermodeller som præference-data. Denne metode, der kræver ingen menneskelig annotation, reducerer betydeligt tiden og ressourcerne nødvendige for modeltræning.

Opbygning af ZEPHYR-7B

For at validere dDPO konstruerede forskerne ZEPHYR-7B, en tilpasset version af Mistral-7B-modellen. Processen involverede tre trin:

  1. dSFT ved hjælp af UltraChat-datasættet: Destilleret overvåget finjustering (dSFT) er en avanceret metode til at træne store sprogmodeller (LLM’er) ved at udnytte output fra større, mere kapable “lærer”-modeller. Det begynder med en rå LLM, der trænes til at svare på brugerprompts. I modsætning til traditionel overvåget finjustering (SFT), der anvender en fast datasæt, anvender dSFT en dynamisk tilgang, hvor modellen selv genererer instruktioner og svar. Denne metode, kendt som selv-instrukt, indebærer at anvende lærermodellen til både at svare og til at refinere instruktioner baseret på svar.
  2. Inklusion af AI-feedback-data fra UltraFeedback: Disse data var afgørende for at finjustere modellens svar. I dette trin genererer modellen svar på forskellige prompts (som at beskrive, hvordan man laver chokoladebrunie), der derefter rangeres af en mere avanceret model som GPT-4. Det højeste scorende svar (yw) og et tilfældigt valgt lavere scorende svar (yl) danner en feedback-datasæt D.
  3. Anvendelse af dDPO: Det sidste trin, destilleret direkte præferenceoptimering (dDPO), indebærer at finjustere dSFT-modellen ved at maksimere sandsynligheden for at rangere de foretrukne svar højere. Dette opnås ved at anvende en belønningsfunktion rθ(x, y) i præference-modellen, der er baseret på den optimale LLM-politik π* og den originale politik πdSFT. Optimeringsmålet formuleres som πθ = max π E (x, yw, yl) ∼ D log σ (β log π(yw|x)/πdSFT(yw|x) − β log π(yl|x)/πdSFT(yl|x)), hvilket forenkler træningsprocessen ved at starte med dSFT-versionen af modellen og iterere gennem hver AIF-triple.
Metoden anvendt i Zephyr-7B spejler processerne anvendt i InstructGPT.

Metoden anvendt i Zephyr-7B spejler processerne anvendt i InstructGPT.

Forbløffende opnår Zephyr-7B en præstation, der er sammenlignelig med meget større 70B-parametermodeller, der er tilpasset med menneskelig feedback. Det excellerer i både akademiske benchmarks og konversationsfunktioner, hvilket understreger effektiviteten af præference-læring i modeludvikling. For yderligere udforskning er modeller, kode og instruktioner tilgængelige på Hugging Faces GitHub-Repository.

Tilpasning af udfordringen med hensigtsalignering

En bemærkelsesværdig bekymring med LLM’er har været deres tilpasning til menneskelig hensigt. Tidligere modeller svigtede ofte i at producere svar, der matchede brugerpræferencer, hvilket resulterede i ukorrekte eller irrelevante svar. Dog har nyere benchmarks som MT-Bench og AlpacaEval leveret værktøjer til at kvantificere og forbedre denne aspekt, hvilket understreger den overlegne præstation af proprietære modeller trænet med menneskelig feedback over dem, der er trænet kun via destillering.

Evaluationsmetoder

Evalueringen af Zephyr 7B involverede rigorøs testning på tværs af benchmarks, der vurderer en models konversationsfunktioner i både enkelt- og multi-turn-kontekster:

  • MT-Bench: Denne multi-turn-benchmark kræver, at en model besvarer 160 spørgsmål, der spænder over otte domæner. Hvert svar vurderes af GPT-4, og modellens endelige score reflekterer gennemsnittet over to runder af spørgsmål.
  • AlpacaEval: I denne enkelt-turn-benchmark præsenteres modellen for 805 spørgsmål på tværs af forskellige emner. Fokus her er på modellens nyttighed, og GPT-4 scorer svarene for at bestemme en komparativ sejrsrate.

Derudover blev Zephyr 7B testet på Open LLM Leaderboard, der, selvom det ikke er en direkte vurdering af konversationsfunktioner, giver indsigt i modellens resonnering og sandhed efter finjustering.

Zephyr 7B blev sammenlignet med en række åbne og proprietære modeller, herunder modeller af forskellige størrelser og tilpasningsmetoder. Det etablerede nye benchmarks for 7B-modeller på MT-Bench og AlpacaEval og viste konkurrerende præstation over for større modeller, hvilket validerer effektiviteten af direkte præferenceoptimering (dDPO) i træning.

SFT- og DPO-træningsfaserne blev nøje konfigureret, der spændte over flere epocher og finjusteringslæringsrater og batch-størrelser for optimal præstation. Den endelige Zephyr-model opstod ikke kun resistent over for overfitning, men også forbedret i håndtering af praktiske opgaver og akademiske benchmarks.

Datasæt og resultater

Datasæt, der er anvendt

I udviklingen af Zephyr-7B blev to nøgle-datasæt anvendt til at træne og finjustere modellen, hver adresserende forskellige aspekter af dialoggenerering:

UltraChat Datasæt

  • Kilde: Udviklet fra dialoger genereret af GPT-3.5-TURBO.
  • Indhold: Indeholder 1,47 millioner multi-turn-dialoger på tværs af 30 emner og 20 typer tekstmaterialer.
  • Finjustering: Datasættet undergik en truecasing-heuristik til at korrigere grammatiske problemer, og filtre blev anvendt for at øge nyttigheden af svarene og eliminere uproduktive forspilsfraser.

UltraFeedback Datasæt

  • Kilde: Består af prompts vurderet af GPT-4, der vurderede svarene baseret på instruktionsfølging, ærlighed og nyttighed.
  • Indhold: Indeholder 64.000 prompts med fire svar hver, vurderet af GPT-4.
  • Binære præferencer: Genereret ved at vælge svaret med den højeste gennemsnitscore som “valgt” og et tilfældigt fra de resterende som “afvist” for at øge diversitet og udfordre den direkte præferenceoptimeringsproces (DPO).

Begge datasæt er afgørende for at træne Zephyr-7B til at forstå og generere menneskelignende dialog, der er instruktionsfølgende, ærlig og nyttig. Disse datasæt er tilgængelige på Hugging Face Hub, som kan tilgås her.

Præstation og resultater

Den nedenstående graf illustrerer Zephyr 7B’s præstation på tværs af forskellige opgavekategorier i forhold til andre modeller som GPT-3.5-turbo, Claude 1, GPT-4 og Llama-2-70b-chat. Kategorier kan omfatte Skrivning, Humaniora, Rollespil, Resonnering, STEM, Ekstraktion, Kodning og Matematik.

Fra grafen kan vi slutte, hvilke domæner Zephyr 7B excellerer i og hvilke domæner, der måske kræver yderligere forbedring. For eksempel, hvis Zephyr’s linje strækker sig længere ud på Skrivningsaksen i forhold til andre, antyder det, at Zephyr er særligt stærk i generering af skriftligt indhold. Omvendt, hvis linjen er tættere på centrum på Matematikaksen, kan det indikere en relativ svaghed i løsning af matematikproblemer.

Radar-grafen hjælper med at identificere Zephyr 7B’s styrker og svagheder, og giver en visuel repræsentation af, hvor det står i forhold til større modeller som GPT-4 og specialiserede modeller som Llama-2-70b-chat.

 

Model Performance Radar Chart

Model Performance Radar Chart

Sammenligning af forskellige sprogmodeller på to benchmarks: MT-Bench og AlpacaEval. Modellerne vurderes baseret på deres størrelse, tilpasningsmetode (såsom dSFT for destilleret overvåget finjustering eller dDPO for destilleret direkte præferenceoptimering) og præstationskorer. Zephyr står ud med høje korer i begge benchmarks, hvilket indikerer dets effektivitet i generering af tilpassede svar.

MT-Bench og AlpacaEval

MT-Bench og AlpacaEval

Konklusion

I konklusion demonstrerer udviklingen af Zephyr-7B, at tilpasning og destillering af konversationsfunktioner fra en stor sprogmodel (LLM) til en mindre model kan opnås uden afhængighed af sampling-baserede metoder. Ved at anvende direkte præferenceoptimering (DPO) med AI-feedback, udnytter Zephyr-7B den solide grundlag af Mistral-7B til at sætte en ny standard for 7B-parameter-chatmodeller, og viser evnen hos mindre, åbne modeller til at forstå og svare på brugerhensigt effektivt.

Dog er denne studie ikke uden begrænsninger. Afhængigheden af GPT-4 som evaluator for benchmarks introducerer en bias mod modeller, der er destilleret fra det, hvilket potentielt favoriserer overpræcise svar. Derudover forbliver skalerbarheden af denne metode til større modeller, såsom LLAMA2-70B, og dens indvirkning på præstationsgevinster som områder for yderligere forskning. Disse begrænsninger understreger behovet for kontinuerlig innovation og udvikling af upartiske vurderingsmetoder i AI-fællesskabet.

Set i perspektiv er det tydeligt, at potentialet for mindre modeller til at yde på niveau med større modeller kan demokratisere AI, og give mulighed for mere tilgængelig og effektiv brug i forskellige anvendelser. Succesen med Zephyr-7B opmuntrer til yderligere udforskning af åbne modeller, der kan accelerere fremskridt i AI ved at fremme samarbejdende forskning og udvikling.

Jeg har brugt de sidste fem år på at dykke ned i den fascinerende verden af Machine Learning og Deep Learning. Min passion og ekspertise har ført mig til at bidrage til over 50 forskellige software-ingeniørprojekter, med en særlig fokus på AI/ML. Min fortsatte nysgerrighed har også ført mig mod Natural Language Processing, et felt jeg er ivrig efter at udforske yderligere.