AI-modeller och plattformar

Zephyr: Direkt destillering av LLM-justering

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Förmågan och prestandan hos mindre, öppna stora språkmodeller har förbättrats avsevärt under de senaste åren, och vi har sett framstegen från de tidiga GPT-2-modellerna till mer kompakta, exakta och effektiva LLM-ramverk som använder en betydligt större mängd token än den “beräkningsoptimala” mängden token som rekommenderas av Chinchilla-skalförlagen. Dessutom har utvecklare visat att dessa mindre LLM-ramverk kan tränas ytterligare med hjälp av en proprietärmodellbaserad dSFT eller Destillerad Tillsynsfinjustering, som använder utdata från en effektiv lärarmodell som tillsynsdata för elevmodellen i ett försök att förbättra noggrannheten.

I den här artikeln kommer vi att prata om Zephyr-7B-ramverket, ett state-of-the-art-chatbenchmark för 7B-parametrarmodeller som inte kräver mänskliga annoteringar. Det primära målet med ramverket är att möjliggöra för utvecklare att producera mindre stora språkmodeller som är justerade till användaravsikten närmare än någonsin tidigare. Zephyr-7B-ramverket undersöker inte bara tillämpningen av nuvarande metoder för större LLM-ramverk som dSFT, utan utforskar också möjligheten att använda andra metoder för att lära en chattmodell med bättre justering med användaravsikten. Vi kommer att dyka djupare i Zephyr-ramverket och undersöka dess arkitektur, funktion och resultat. Så låt oss komma igång.

Zephyr-7B: En introduktion till direkt destillering av justering i språkmodeller

Som nämnts tidigare har språkmodellerna utvecklats snabbt under de senaste åren, från de tidiga GPT-2-ramverken till nuvarande GPT-4 och MiniGPT-5 LLM-ramverk som, även om de är mycket token-utmattande, nu är mer exakta och effektiva. En viktig aspekt av dessa avancerade LLM-ramverk är att de inkorporerar en betydligt större mängd token än den tidigare ansedda beräkningsoptimala mängden token enligt Chinchilla-skalförlagen. Dessutom har utvecklare och forskare som arbetar med LLM-ramverk lärt sig att dessa mindre LLM-ramverk kan tränas ytterligare med hjälp av en proprietärmodellbaserad dSFT eller Destillerad Tillsynsfinjustering, som använder utdata från en effektiv lärarmodell som tillsynsdata för elevmodellen i ett försök att förbättra noggrannheten. Destillationsstrategin har visat sig vara ett mycket effektivt och användbart verktyg för att maximera potentialen och förmågan hos öppna modeller i en mängd olika uppgifter, även om den ännu inte kan replikera prestandan som uppnås av lärarmodellen. Dessutom har användare ofta rapporterat att dessa modeller ofta visar “avvikande avsikt”, vilket innebär att modellerna inte beter sig på ett sätt som är i linje med kraven från slutanvändarna, vilket leder till felaktiga utdata som inte ger rätt utdata eller svar på användarindata eller frågor.

Avsiktsjustering har alltid varit en stor utmaning för utvecklare, med senaste arbeten som fokuserar på utveckling av benchmark som AlpacaEval och MT-Bench, som har utvecklats för att rikta sig mot avvikelsen. Motivationen för att utveckla Zephyr-ramverket kan tillskrivas problemet med att använda destillering för att justera en liten öppen LLM-modell helt, där den primära steget är att använda en AIF eller Artificiell Intelligens-återkoppling för att erhålla preferensdata från en ensemble av lärarmodellen, och sedan tillämpa destillerad preferensoptimering direkt som det primära lärandemålet, en metod som kallas dDPO eller Destillerad Direkt Preferensoptimering. Den viktigaste aspekten av dDPO-metoden är att den, till skillnad från dess föregångare som PPO eller Proximal Preferensoptimering, inte kräver mänsklig sampling eller annotering, och också minskar den tid det tar att träna en språkmodell. Dessutom möjliggör den också för utvecklare att maximera belöningarna för den slutliga provningen genom att fokusera på sekvensen av de rensningsstegen från början till slut, med andra ord, under hela dess längd.

Utvecklare har utvecklat Zephyr-7B-ramverket för att validera denna metod, och på vissa sätt är det en justerad version av det state-of-the-art Mistral-7B-ramverket. Ramverket använder först dSFT eller Destillerad Tillsynsfinjustering baserat på UltraChat-databasen, och tillämpar dDPO eller Destillerad Direkt Preferensoptimering på återkopplingsdata. Experiment visar att Zephyr-7B-ramverket med 7 miljarder parametrar levererar resultat som är jämförbara med dem som levereras av mänskligt återkopplade chattmodeller med över 70 miljarder parametrar. Dessutom visar experiment också att resultaten kan förbättras både i termer av benchmark som tar konversationsförmåga med i beräkningen, samt standardakademiska benchmark, och att användningen av preferenslärande är avgörande för att uppnå önskade resultat.

Figuren ovan visar prestandan för olika språkmodeller på MT-bench-benchmarken. Zephyr-7B-ramverket, som tränats med dDPO-metoden, jämförs med proprietära och öppna stora språkmodeller som GPT-3.5 Turbo, Llama-2-70B och fler som tränats med ytterligare förstärkt inlärning och inkluderar en stor mängd mänsklig återkoppling. Som det tydligt kan ses, trots den enorma skillnaden i antalet parametrar som dessa ramverk använder, levererar Zephyr-7B-ramverket jämförbara resultat mot de flesta av dem och överträffar flera ramverk i olika domäner.

Zephyr-7B: Metod, funktion och arkitektur

Det primära målet med Zephyr-7B-ramverket är att hjälpa en öppen källkod till en stor språkmodell att justeras så nära som möjligt till användaravsikten, och under hela dess längd antar Zephyr-7B-ramverket tillgång till en stor lärarmodell som frågas med hjälp av promptgenerering. Zephyr-7B följer en metod som liknar den som används i InstructGPT-ramverket, och syftar till att generera en effektiv och exakt elevmodell.

Följande figur visar de tre primära stegen som är involverade i Zephyr-7B-ramverkets funktion.

  1. dSFT för stor skala dataset-konstruktion med hjälp av en själv-instruerande stil.
  2. AIF-samling med hjälp av en ensemble av chattmodeller som följs av preferensbinarisering och poängsättning med GPT-4.
  3. dPO av dSFT-modellen med hjälp av återkopplingsdata.

dSFT eller Destillerad Tillsynsfinjustering

Ramverket börjar med en rå stor språkmodell som först behöver tränas för att svara på användarprompt. Traditionellt tränas dessa LLM-ramverk för att svara på användarprompt med hjälp av SFT eller Tillsynsfinjustering på en dataset som består av högkvalitativa instruktioner och deras motsvarande svar. Eftersom Zephyr-7B-ramverket har tillgång till en lärar-språkmodell, kan ramverket generera instruktioner och svar, och träna modellen direkt på dessa instruktioner och svar, och denna metod kallas dSFT eller destillerad SFT. Följande figur visar destilleringen som utförs av SFT, där x representerar en uppsättning seed-prompt konstruerade med det primära syftet att representera en diversifierad uppsättning av topiska domäner, y representerar provsvaret som raffineras med hjälp av en ny sampel-instruktion representerad av x1 och C representerar slutpunkten i den slutliga dataseten.

AI-återkoppling genom preferenser

Mänsklig återkoppling används för att tilldela stora språkmodeller eftersom de kan ge de nödvändiga ytterligare signalerna, och dessa mänskliga återkopplingar tillhandahålls traditionellt genom preferenser på kvaliteten på svaren som genereras av LLM-ramverken. Men Zephyr-ramverket använder AI-återkoppling från lärarmodellen på andra modellers genererade utdata i stället för mänsklig återkoppling för destilleringssyften. Metoden som följs av Zephyr-ramverket påverkas av den som används av UltraFeedback-ramverket som använder lärarmodellen för att ge preferenser på modellens utdata.

Liknande SFT eller Tillsynsfinjustering, börjar det med en uppsättning prompt, där x representerar varje enskild prompt som sedan matas in i en samling av fyra modeller som Llama, Falcon, Claude och fler, var och en som genererar ett svar av sin egen. Dessa svar matas sedan in som indata till lärarmodellen som GPT-3 eller GPT-4, och modellen ger ut en poäng för indatasvaret. Efter att ha samlat in utdatapoängen sparar modellen svaret med den högsta poängen.

dDPO eller Destillerad Direkt Preferensoptimering

dDPO är det sista steget i Zephyr-ramverket, och dess primära mål är att raffinera dSFT-lärarmodellen genom att maximera sannolikheten för att rangordna det föredragna svaret i en preferensmodell som bestäms av en belöningsfunktion genom att använda elevspråkmodellen. Det föregående steget som involverade användning av AI-återkoppling fokuserade primärt på att använda förstärkt inlärning metoder som PPO eller Proximal Policy Optimering för maximal optimering med avseende på belöningen som genereras. I detta steg tränas belöningen först och sedan sampas från den aktuella policyn för att beräkna uppdateringarna, och därmed maximera optimeringen. DPO eller Direkt Preferensoptimering följer en liknande metod för att optimera preferensmodellen direkt med hjälp av statiska data. Målet efter att ha anslutit belöningsfunktionen till preferensmodellen kan skrivas som

Zephyr-7B: Experiment, benchmark och resultat

Zephyr-ramverket genomför sina finjusteringsexperiment på det nuvarande state-of-the-art Mistral-7B-ramverket som levererar jämförbara prestanda med mycket större språkmodeller på en mängd olika naturliga språkbehandling eller NLP-uppgifter.

Dataset

Zephyr-ramverket använder två dialogdataset som har destillerats från en blandning av proprietära och öppna modeller, som tidigare har visat sig vara effektiva för att producera effektiva chattmodeller.

UltraChat

UltraChat är en självraffineringsdataset som består av nästan 1,5 miljoner multi-turn dialoger spridda över 30 ämnen och 20 textmaterial genererade av GPT-3.5-Turbo-ramverket. För att hantera det felaktiga kapitaliseringsproblemet som UltraChat-datasetet står inför, tillämpar ramverket en truecasing-heuristik för att bli av med grammatiska fel.

UltraFeedback

UltraFeedback är en prompt-dataset med över 64 000 prompt, med var och en av dessa prompt som har fyra enskilda LLM-svar. Zephyr-ramverket använder den högsta medelvärdet som erhållits från UltraFeedback-datasetet för att konstruera binära preferenser, och ett av de återstående tre LLM-svaren avvisas som slumpmässigt.

Utvardering

För att utvärdera prestandan hos Zephyr-ramverket har utvecklare valt två chatt-benchmark, en single-turn och en multi-turn, i ett försök att utvärdera modellens förmåga att följa användarinstruktioner och svara därefter.

MT-Bench

MT-Bench-utvärderingsbenchmarken består av 160 frågor spridda över 8 unika kunskapsområden, och under MT-Bench-benchmarken måste modellen svara på en initial fråga och ge ett svar på uppföljningsfrågan.

AlpacaEval

AlpacaEval är en single-turn-benchmark under vilken modellen eller ramverket genererar användarsvar till över 800 frågor spridda över olika ämnen med primärt fokus på hjälpsamhet.

Utöver dessa två primära benchmark, utvärderas Zephyr-7B-ramverket också på Open LLM Leaderboard för multiklassklassificeringsuppgifter, ARC, HellaSwag, MMLU och fler. Dessutom, oavsett vilken benchmark Zephyr-7B-ramverket utvärderas på, jämförs det mot en mängd proprietära och öppna modeller, med deras justeringsförfaranden som den enda differentierande faktorn.

Resultat

Låt oss nu se hur Zephyr-7B-ramverket presterar och jämför med nuvarande state-of-the-art språkmodeller.

Implementering av dDPO-metoden förbättrar chattförmåga

Följande tabell jämför prestandan hos Zephyr-7B-ramverket mot state-of-the-art språkmodeller på AlpacaEval- och MT-Bench-benchmark.

Som det kan ses, när det jämförs med öppna 7B-modeller, överträffar Zephyr-7B-ramverket inte bara avsevärt dSFT-modeller över de två benchmark, utan sätter också nya state-of-the-art-standarder. Dessutom överträffar Zephyr-7B-ramverket också XWIN-LM-7B-ramverket, som är ett av de få modellerna som tränats med dPPO eller destillerad PPO-metod. Dessutom är prestandan som Zephyr-7B-ramverket levererar jämförbar med resultaten som levereras av mycket större språkmodeller som Llama2-Chat med över 70 miljarder parametrar.

dDPO förbättrar akademisk uppgiftsprestanda

Följande figur jämför prestandan hos Zephyr-7B-ramverket mot en mängd öppna och proprietära LLM-ramverk.

Som det kan ses, överträffar Zephyr-7B-ramverket avsevärt LLM-ramverk med 7 miljarder parametrar, och gapet mellan dess prestanda och den som levereras av de bäst presterande dSFT-modellerna är också märkbart. När antalet parametrar ökar, faller Zephyr-7B-ramverket dock kort, även om det matchar prestandan som levereras av ramverk med 40 miljarder parametrar.

Preferensoptimering

I följande figur utvärderar vi hur de olika stegen i justeringsprocessen påverkar prestandan. Som det kan observeras, förbättrar dDPO-metoden, när den kombineras med dSFT, avsevärt prestandan på både MT-Bench- och AlpacaEval-dataset.

Slutligen, i följande figur kan vi se test- och träningsnoggrannhet under DPO-implementeringen. Som det kan ses, påverkar DPO-metoden inte prestandan hos modellen på nedströmsuppgifter.

Slutsats

I den här artikeln har vi pratat om Zephyr-7B-ramverket baserat på det nuvarande state-of-the-art Mistral-7B-ramverket som syftar till att lösa den nuvarande utmaningen med justeringsdestillering från en stor språkmodell till en mycket mindre förtränad ram. Det primära målet med ramverket är att möjliggöra för utvecklare att producera mindre stora språkmodeller som är justerade till användaravsikten närmare än någonsin tidigare. Zephyr-7B-ramverket undersöker inte bara tillämpningen av nuvarande metoder för större LLM-ramverk som dSFT, utan utforskar också möjligheten att använda andra metoder för att lära en chattmodell med bättre justering med användaravsikten.

Men trots de lovande resultaten är Zephyr-7B-ramverket inte perfekt, och något arbete behöver fortfarande göras. En av de uppenbara begränsningarna är att använda GPT-4-ramverket för att utvärdera MT-Bench- och AlpacaEval-benchmark, som ofta har varit fördomsfullt mot de modeller som det destillerar själv. Men Zephyr-7B-ramverket hoppas på att bana väg för att utforska förmågan hos mindre öppna modeller som kan justeras till användaravsikten och interaktioner.

En ingenjör till yrket, en författare av hjärtat. Kunal är en teknisk skribent med ett djupt kärlek och förståelse för AI och ML, dedikerad till att förenkla komplexa begrepp inom dessa områden genom sin engagerande och informativa dokumentation.