AI-modellen en platforms
Zephyr-7B: Hugging Face’s Hyper-Optimized LLM Built on Top of Mistral 7B
Inleiding
De evolutie van open large language models (LLM’s) heeft een significante impact gehad op de AI-onderzoekscommunity, met name bij de ontwikkeling van chatbots en soortgelijke toepassingen. Na de release van modellen zoals LLaMA, is er een golf van onderzoek naar efficiënte fine-tuning, uitgebreide prompt-handling, retrieval-augmented generatie (RAG) en kwantificatie.
Het LLaMA-model, bijvoorbeeld, markeerde een nieuwe era in fine-tuning en prompt-contextualisatie, waardoor de weg werd geplaveid voor latere modellen zoals MosaicML’s MPT, Together AI’s RedPajama-INCITE, TII’s Falcon en Meta’s Llama 2. Elk van deze modellen draagt unieke capaciteiten bij, waardoor de algehele functionaliteit en reikwijdte van LLM’s worden verbeterd.
Mistral AI, een startup uit Parijs en opgericht door voormalige Google DeepMind- en Meta-medewerkers, heeft zichzelf een naam gemaakt met zijn eerste aanbod: Mistral 7B.
Mistral 7B’s voordeel ligt in zijn efficiëntie, waardoor hij vergelijkbare of verbeterde capaciteiten levert in vergelijking met zijn peers, zoals Llama 2, maar met minder computationele vraag.
Specifiek afgestemd op instructietaken, blinkt Mistral 7B Instruct uit op platforms zoals Hugging Face, waar het andere modellen van dezelfde grootte overtreft en nauw samenwerkt met modellen die bijna tweemaal zoveel parameters hebben.
Op basis hiervan introduceerde Hugging Face Zephyr 7B Alpha, waaruit bleek dat een gefine-tune Mistral 7B inderdaad de capaciteiten van veel grotere chatmodellen kan overtreffen en in sommige taken zelfs kan rivaliseren met GPT-4. De “Alpha” was slechts het begin, aangezien Zephyr 7B Beta kort daarna volgde.
Dit artikel zal onderzoeken hoe Zephyr 7B de kracht van grotere modellen gebruikt om zijn vermogen om te reageren en zich aan te passen aan menselijke instructies te verfijnen, een proces dat mogelijk wordt gemaakt door de techniek van kennisdistillatie. Deze methode omvat het trainen van kleinere modellen op de complexe patronen die zijn geleerd door grotere modellen, waardoor de trainingsvereisten worden verminderd zonder de taalmodellering-capaciteiten te offers.
Kennisdistillatie
Een sleutelinnovatie bij de ontwikkeling van modellen zoals Zephyr-7B is gedistilleerde begeleide fine-tuning (dSFT). Deze methode omvat het gebruik van de output van een groter, meer capabel ‘leraar’-model om een kleiner ‘leerling’-model te trainen, waardoor de nauwkeurigheid wordt verbeterd. Hoewel distillatie de prestaties van open modellen op verschillende taken verbetert, bestaat er nog steeds een prestatieverschil met lerarenmodellen.
Kennisdistillatie is een methode in machine learning waarbij een compact model, het “leerling”-model, wordt onderwezen om de prestaties van een groter, complexer “leraar”-model te repliceren. Deze techniek stelt het leerling-model in staat om taken uit te voeren die eerder buiten zijn capaciteit lagen door de ingewikkelde patronen die door de leraar zijn geleerd over te dragen.
Het leerling-model traint op de outputwaarschijnlijkheden of functies gegenereerd door het leraar-model, waarbij de focus ligt op het matchen van deze outputs in plaats van alleen de eindvoorspellingen. Dit stelt het leerling-model in staat om de nuances van het beslissingsproces van de leraar te leren, wat vaak resulteert in een verbeterde prestatie bij het trainen met alleen de grondwaarheidgegevens.
Historisch gezien is kennisdistillatie gebruikt in modellen zoals Hinton’s oorspronkelijke distillatienetwerken en onlangs in NLP met modellen zoals DistilBERT, die het BERT-model distilleerde in een kleinere, snellere versie die de meeste van de oorspronkelijke taalbegripscapaciteiten behoudt. Een ander voorbeeld is TinyBERT, die nog verder gaat in het optimaliseren van de grootte en snelheid voor mobiele of randapparaten.
In het geval van Zephyr-7B wordt kennisdistillatie gebruikt om een klein 7B-parametermodel te voorzien van de capaciteiten van zijn grotere tegenhangers. Door dit te doen, bereikt Zephyr-7B een balans tussen prestaties en efficiëntie, waardoor het geschikt is voor omgevingen waar computationele middelen beperkt zijn, zonder de kwaliteit van de interactie en het begrip te offers.
Bij de ontwikkeling van Zephyr-7B hebben onderzoekers de uitdaging aangepakt van het volledig aanpassen van een klein open LLM door middel van distillatie. Zij introduceerden een benadering genaamd gedistilleerde directe voorkeursoptimalisatie (dDPO), die AI-feedback van een ensemble van leraarmodellen als voorkeursgegevens gebruikt. Deze methode, die geen menselijke annotatie vereist, vermindert aanzienlijk de tijd en middelen die nodig zijn voor modeltraining.
Constructie van ZEPHYR-7B
Om dDPO te valideren, hebben onderzoekers ZEPHYR-7B gebouwd, een aangepaste versie van het Mistral-7B-model. Het proces omvatte drie stappen:
- dSFT met het UltraChat-dataset: Gedistilleerde begeleide fine-tuning (dSFT) is een geavanceerde methode om grote taalmodellen (LLM’s) te trainen door de output van grotere, meer capabele “leraar”-modellen te gebruiken. Het begint met een ruw LLM dat wordt getraind om te reageren op gebruikersprompts. In tegenstelling tot traditionele begeleide fine-tuning (SFT) die een vast dataset gebruikt, gebruikt dSFT een dynamische benadering waarbij het model zelf instructies en antwoorden genereert. Deze methode, bekend als self-instruct, omvat het gebruik van het leraarmodel om zowel vragen te beantwoorden als instructies te verfijnen op basis van antwoorden.
- Opname van AI-feedbackgegevens van UltraFeedback: Deze gegevens waren cruciaal voor het verfijnen van de reacties van het model. In deze stap genereert het model antwoorden op verschillende prompts (zoals het beschrijven van hoe je chocoladebruine koekjes maakt) die vervolgens worden gerangschikt door een meer geavanceerd model zoals GPT-4. Het hoogst scorende antwoord (yw) en een willekeurig gekozen lager scorend antwoord (yl) vormen een feedbackdataset D.
- Toepassen van dDPO: De laatste fase, gedistilleerde directe voorkeurs optimalisatie (dDPO), omvat het verfijnen van het dSFT-model door de waarschijnlijkheid van het rangschikken van de voorkeursantwoorden hoger te maximaliseren. Dit wordt bereikt door het gebruik van een beloningsfunctie rθ(x, y) in het voorkeursmodel, dat is gebaseerd op het optimale LLM-beleid π* en het oorspronkelijke beleid πdSFT. Het optimalisatie-doel is geformuleerd als πθ = max π E (x, yw, yl) ∼ D log σ (β log π(yw|x)/πdSFT(yw|x) − β log π(yl|x)/πdSFT(yl|x)), wat het trainingsproces vereenvoudigt door te beginnen met de dSFT-versie van het model en door elk AIF-drieluik te itereren.

De methode die in Zephyr-7B wordt gebruikt, spiegelt de processen die in InstructGPT worden gebruikt.
Opmerkelijk is dat Zephyr-7B prestaties bereikt die vergelijkbaar zijn met die van veel grotere 70B-parametermodellen die zijn aangepast met menselijke feedback. Het excelleert zowel in academische benchmarks als in conversatiecapaciteiten, waardoor de effectiviteit van voorkeursleren in modelontwikkeling wordt aangetoond. Voor verdere exploratie zijn modellen, code en instructies beschikbaar op Hugging Face’s GitHub Repository.
Het aanpakken van de uitdaging van intentie-alignering
Een opvallende zorg bij LLM’s is hun alignering met menselijke intentie. Eerdere modellen faalden vaak om antwoorden te produceren die overeenkwamen met gebruikersvoorkeuren, wat leidde tot onnauwkeurige of irrelevante antwoorden. Recentelijk hebben benchmarks zoals MT-Bench en AlpacaEval tools geboden om deze aspecten te kwantificeren en te verbeteren, waarbij de superieure prestaties van propriëtaire modellen die zijn getraind met menselijke feedback boven die die uitsluitend via distillatie zijn getraind, worden benadrukt.
Evaluatiemethoden
De evaluatie van Zephyr 7B omvatte rigoureuze testen over benchmarks die de conversatiecapaciteiten van een model in zowel enkele als meervoudige contexten beoordelen:
- MT-Bench: Deze meervoudige benchmark vereist dat een model 160 vragen beantwoordt die 8 domeinen bestrijken. Elk antwoord wordt beoordeeld door GPT-4, waarbij de eind-score van het model de gemiddelde score over twee rondes vragen weerspiegelt.
- AlpacaEval: In deze enkele benchmark wordt het model gepresenteerd met 805 vragen over verschillende onderwerpen. De focus ligt hier op de bruikbaarheid van het model, waarbij GPT-4 de antwoorden beoordeelt om een vergelijkbare winstpercentage te bepalen.
Bovendien werd Zephyr 7B getest op de Open LLM Leaderboard, die, hoewel het geen directe beoordeling van conversatievaardigheden is, inzicht biedt in de redeneer- en waarheidsbeoordelingscapaciteiten van het model na fine-tuning.
Zephyr 7B werd vergeleken met een verscheidenheid aan open en propriëtaire modellen, waaronder modellen met verschillende groottes en aligneringmethoden. Het vestigde nieuwe benchmarks voor 7B-modellen op MT-Bench en AlpacaEval en toonde concurrerende prestaties tegenover grotere modellen, waardoor de effectiviteit van directe voorkeurs optimalisatie (dDPO) in training werd bevestigd.
De SFT- en DPO-trainingsfasen werden zorgvuldig geconfigureerd, waarbij meerdere epochs en fine-tuning leerlingen en batchgroottes werden aangepast voor optimale prestaties. Het definitieve Zephyr-model bleek niet alleen resistent tegen overfitting, maar ook verbeterd in het omgaan met praktische taken en academische benchmarks.
Datasets en resultaten
Gebruikte datasets
Prestaties en resultaten
Het onderstaande diagram illustreert de prestaties van Zephyr 7B over verschillende taakcategorieën tegenover andere modellen zoals GPT-3.5-turbo, Claude 1, GPT-4 en Llama-2-70b-chat. Categorieën kunnen schrijven, geesteswetenschappen, rolspel, redeneren, STEM, extractie, coderen en wiskunde omvatten.
Uit het diagram kan worden afgeleid in welke domeinen Zephyr 7B uitblinkt en in welke domeinen verdere verbetering nodig is. Als de lijn van Zephyr bijvoorbeeld verder uitstrekt op de as van schrijven in vergelijking met anderen, suggereert dit dat Zephyr bijzonder sterk is in het genereren van geschreven inhoud. Aan de andere kant, als de lijn dichter bij het centrum ligt op de as van wiskunde, kan dit een relatieve zwakte in het oplossen van wiskundeproblemen aangeven.
Het radardiagram helpt bij het identificeren van de sterktes en zwaktes van Zephyr 7B, waarbij een visuele weergave wordt geboden van hoe het model presteert in vergelijking met grotere modellen zoals GPT-4 en gespecialiseerde modellen zoals Llama-2-70b-chat.
Het vergelijken van verschillende taalmodellen op twee benchmarks: MT-Bench en AlpacaEval. De modellen worden beoordeeld op basis van hun grootte, aligneringmethode (zoals dSFT voor gedistilleerde begeleide fine-tuning of dDPO voor gedistilleerde directe voorkeurs optimalisatie) en prestatiescores. Zephyr blinkt uit met hoge scores in beide benchmarks, wat aangeeft dat het effectief is in het genereren van aangepaste antwoorden.
Conclusie
In conclusie toont de ontwikkeling van Zephyr-7B aan dat de alignering en distillatie van conversatiecapaciteiten van een groot taalmodel (LLM) naar een kleiner model kunnen worden bereikt zonder afhankelijkheid van steekproef-gebaseerde methoden. Door directe voorkeurs optimalisatie (DPO) met AI-feedback te gebruiken, benut Zephyr-7B de sterke basis van Mistral-7B om een nieuwe benchmark te stellen voor 7B-parameterchatmodellen, waarbij wordt aangetoond dat kleinere, open-sourcemodellen effectief kunnen begrijpen en reageren op gebruikersintenties.
Hoewel, deze studie is niet zonder beperkingen. De afhankelijkheid van GPT-4 als evaluator voor benchmarks introduceert een voorkeur voor modellen die zijn gedistilleerd uit GPT-4, waardoor mogelijk een voorkeur ontstaat voor accurate antwoorden. Bovendien blijven de schaalbaarheid van deze methode naar grotere modellen, zoals LLAMA2-70B, en de impact op prestatieverbeteringen gebieden voor verder onderzoek. Deze beperkingen benadrukken de noodzaak voor continue innovatie en de ontwikkeling van onbevooroordeelde evaluatiemethoden in de AI-gemeenschap.
Kijkend naar de toekomst, is het duidelijk dat het potentieel voor kleinere modellen om te presteren op het niveau van grotere tegenhangers de democratisering van AI kan bevorderen, waardoor het gebruik in verschillende toepassingen toegankelijker en efficiënter wordt. Het succes van Zephyr-7B moedigt verder onderzoek aan naar open-sourcemodellen, wat de vooruitgang in AI kan versnellen door samenwerkend onderzoek en ontwikkeling te stimuleren.















