AI-modeller och plattformar
Zephyr-7B: Hugging Faces hyperoptimerade LLM byggd ovanpå Mistral 7B
Introduktion
Utvecklingen av öppna stora språkmodeller (LLM) har haft en betydande inverkan på AI-forskningsgemenskapen, särskilt när det gäller att utveckla chatbots och liknande applikationer. Efter utgivningen av modeller som LLaMA har det funnits en ökning av forskning om effektiv finjustering, utökad promptbehandling, återvinning av generering (RAG) och kvantifiering.
LLaMA-modellen, till exempel, markerade en ny era i finjustering och promptkontextualisering, vilket banade väg för efterföljande modeller som MosaicML:s MPT, Together AI:s RedPajama-INCITE, TII:s Falcon och Metas Llama 2. Var och en av dessa modeller bidrar med unika funktioner, vilket förbättrar den övergripande funktionaliteten och omfattningen av LLM.
Mistral AI, ett startup-företag från Paris och grundat av tidigare anställda på Google DeepMind och Meta, har gjort sig ett namn med sin första erbjudande: Mistral 7B.
Mistral 7B:s fördel ligger i dess effektivitet, som erbjuder liknande eller förbättrade funktioner jämfört med liknande modeller som Llama 2, men med mindre beräkningskrav.
Specifikt anpassad för instruktionsuppgifter, Mistral 7B Instruct utmärker sig på plattformar som Hugging Face, där den överträffar andra modeller av samma storlek och konkurrerar nära med dem som har nästan dubbla parametrar.
Byggande på detta introducerade Hugging Face Zephyr 7B Alpha, som visar att en finjusterad Mistral 7B kan överträffa förmågan hos betydligt större chattmodeller och, i vissa uppgifter, till och med rivalisera GPT-4. “Alfa” var bara början, eftersom Zephyr 7B Beta följde strax efter.
Den här artikeln kommer att undersöka hur Zephyr 7B utnyttjar kraften från större modeller för att förbättra sin förmåga att svara och anpassa sig till mänskliga instruktioner, en process som möjliggörs genom tekniken för kunskapsdestillering. Denna metod innebär att mindre modeller tränas på de komplexa mönster som lärs av större modeller, vilket minskar träningskraven utan att offra språkmodellens förmåga. Vi kommer att dyka djupare i detaljerna om Hugging Faces tillvägagångssätt för kunskapsdestillering.
Kunskapsdestillering
En viktig innovation i utvecklingen av modeller som Zephyr-7B är destillerad övervakad finjustering (dSFT). Denna metod innebär att man använder utdata från en större, mer kapabel “lärar”-modell för att träna en mindre “elev”-modell, vilket förbättrar dess noggrannhet. Medan destillering förbättrar öppna modeller på olika uppgifter, finns fortfarande en prestandagap jämfört med lärarmodeller.
Kunskapsdestillering är en metod inom maskinlärning där en kompakt modell, som kallas “elev“, lärs att replikera prestandan hos en större, mer komplex “lärare“-modell. Denna teknik möjliggör för eleven att utföra uppgifter som tidigare låg utom dess förmåga genom att överföra de intrikata mönster som läraren har lärt sig.
Eleven tränar på utdata-sannolikheterna eller funktionerna som genereras av lärar-modellen, med fokus på att matcha dessa utdata snarare än bara de slutliga förutsägelserna. Detta tillåter eleven att lära sig lärarens nyanserade beslutsprocesser, vilket ofta resulterar i förbättrad prestanda jämfört med träningsdata som endast består av grundvärdet.
Historiskt har kunskapsdestillering använts i modeller som Hintons ursprungliga destillationsnätverk och, mer nyligen, i NLP med modeller som DistilBERT, som destillerade BERT-modellen till en mindre, snabbare version som behåller de flesta av den ursprungliga språkförståelsen. Ett annat exempel är TinyBERT, som går längre i att optimera storlek och hastighet för mobila eller gränsenheter.
I fallet med Zephyr-7B används kunskapsdestillering för att ge en mindre 7B-parametrarsmodell de förmågor som dess större motsvarigheter har. Genom att göra detta uppnår Zephyr-7B en balans mellan prestanda och effektivitet, vilket gör den lämplig för miljöer där beräkningsresurser är begränsade, utan att offra interaktionens och förståelsens kvalitet.
Vid utvecklingen av Zephyr-7B angrep forskare utmaningen att anpassa en liten öppen LLM helt genom destillering. De introducerade ett tillvägagångssätt som kallas destillerad direkt preferensoptimering (dDPO), som använder AI-återkoppling från en ensemble av lärar-modeller som preferensdata. Denna metod, som kräver ingen mänsklig annotering, minskar betydligt den tid och resurser som behövs för modellträning.
Konstruktion av ZEPHYR-7B
För att validera dDPO konstruerade forskare ZEPHYR-7B, en anpassad version av Mistral-7B-modellen. Processen bestod av tre steg:
- dSFT med UltraChat-datasetet: Destillerad övervakad finjustering (dSFT) är en avancerad metod för att träna stora språkmodeller (LLM) genom att utnyttja utdata från större, mer kapabla “lärar”-modeller. Det börjar med en rå LLM som tränas för att svara på användarprompt. Till skillnad från traditionell övervakad finjustering (SFT) som använder en fast dataset, använder dSFT en dynamisk approach där modellen själv genererar instruktioner och svar. Denna metod, som kallas själv-instruktionsmetod, innebär att man använder lärar-modellen för att både besvara och förbättra instruktioner baserat på svar.
- Inkludering av AI-återkopplingsdata från UltraFeedback: Denna data var avgörande för att förbättra modellens svar. I detta steg genererar modellen svar på olika prompt (som att beskriva hur man gör chokladbruna kakor), som sedan rankas av en mer avancerad modell som GPT-4. Det högst rankade svaret (yw) och ett slumpmässigt valt lägre rankat svar (yl) bildar en återkopplingsdataset D.
- Tillämpning av dDPO: Den sista fasen, destillerad direkt preferensoptimering (dDPO), innebär att förbättra dSFT-modellen genom att maximera sannolikheten för att rangordna de föredragna svaren högre. Detta uppnås genom att använda en belöningsfunktion rθ(x, y) i preferensmodellen, som baseras på den optimala LLM-policyn π* och den ursprungliga policyn πdSFT. Optimeringsmålet formuleras som πθ = max π E (x, yw, yl) ∼ D log σ (β log π(yw|x)/πdSFT(yw|x) − β log π(yl|x)/πdSFT(yl|x)), vilket förenklar träningsprocessen genom att börja med dSFT-versionen av modellen och iterera genom varje AIF-trippel.
Anmärkningsvärt är att Zephyr-7B uppnår en prestanda som är jämförbar med mycket större 70B-parametrarsmodeller som anpassats med mänsklig återkoppling. Den utmärker sig i både akademiska benchmark och konversationsförmåga, vilket belyser effektiviteten av preferensinlärning i modellutveckling. För ytterligare utforskning finns modeller, kod och instruktioner tillgängliga på Hugging Faces GitHub-repo.
Att hantera utmaningen med avsiktlig anpassning
En anmärkningsvärd oro med LLM har varit deras anpassning till mänsklig avsikt. Tidigare modeller misslyckades ofta med att producera svar som matchade användarpreferenser, vilket ledde till felaktiga eller irrelevanta svar. Men nyliga benchmark som MT-Bench och AlpacaEval har tillhandahållit verktyg för att kvantifiera och förbättra denna aspekt, vilket belyser den överlägsna prestandan hos proprietära modeller som tränats med mänsklig återkoppling jämfört med de som tränats enbart via destillering.
Utvarderingsmetoder
Utvarderingen av Zephyr 7B innefattade rigorös testning över benchmark som utvärderar en modells konversationsförmåga i både enkla och multi-turnkontext:
- MT-Bench: Denna multi-turn-benchmark kräver att en modell besvarar 160 frågor som omfattar åtta domäner. Varje svar bedöms av GPT-4, och modellens slutliga poäng reflekterar genomsnittet över två omgångar av frågor.
- AlpacaEval: I denna enkel-turn-benchmark presenteras modellen med 805 frågor över olika ämnen. Fokus ligger här på modellens användbarhet, med GPT-4 som bedömer svaren för att bestämma en jämförbar vinstfrekvens.
Dessutom testades Zephyr 7B på Open LLM Leaderboard, som, även om det inte är en direkt utvärdering av konversationsförmåga, erbjuder insikt i modellens resonemang och sanning efter finjustering.
Zephyr 7B jämfördes med en mängd olika öppna och proprietära modeller, inklusive de med olika storlekar och anpassningsmetoder. Den etablerade nya benchmark för 7B-modeller på MT-Bench och AlpacaEval och visade konkurrenskraftig prestanda mot större modeller, vilket validerar effektiviteten av direkt preferensoptimering (dDPO) i träning.
SFT- och DPO-träningsfaserna konfigurerades noggrant, omfattande flera epoker och finjusteringslärningshastigheter och batchstorlekar för optimal prestanda. Den slutliga Zephyr-modellen framträdde inte bara som motståndskraftig mot överanpassning, utan också förbättrad i att hantera praktiska uppgifter och akademiska benchmark.
Datasets och resultat
Datasets som användes
Prestanda och resultat
Den nedanstående grafen visar prestandan hos Zephyr 7B över olika uppgiftskategorier jämfört med andra modeller som GPT-3.5-turbo, Claude 1, GPT-4 och Llama-2-70b-chat. Kategorier kan inkludera skrivning, humaniora, rollspel, resonemang, STEM, extrahering, kodning och matematik.
Från grafen kan vi sluta oss till vilka domäner Zephyr 7B utmärker sig i och vilka domäner som kan kräva ytterligare förbättring. Till exempel, om Zephyrs linje sträcker sig längre ut på skrivningsaxeln jämfört med andra, tyder det på att Zephyr är särskilt stark i att generera skriven innehåll. Omvänt, om linjen är närmare centrum på matematikaxeln, kan det indikera en relativ svaghet i att lösa matematikproblem.
Radar-diagrammet hjälper till att identifiera styrkor och svagheter hos Zephyr 7B, vilket ger en visuell representation av var den står i jämförelse med större modeller som GPT-4 och specialiserade modeller som Llama-2-70b-chat.
Jämförelse av olika språkmodeller på två benchmark: MT-Bench och AlpacaEval. Modellerna utvärderas baserat på deras storlek, anpassningsmetod (såsom dSFT för destillerad övervakad finjustering eller dDPO för destillerad direkt preferensoptimering) och prestandapoäng. Zephyr utmärker sig med höga poäng i båda benchmark, vilket indikerar dess effektivitet i att generera anpassade svar.
Slutsats
I slutsatsen visar utvecklingen av Zephyr-7B att anpassning och destillering av konversationsförmåga från en stor språkmodell (LLM) till en mindre modell kan uppnås utan att förlita sig på baserade metoder. Genom att använda direkt preferensoptimering (DPO) med AI-återkoppling, utnyttjar Zephyr-7B den starka grunden av Mistral-7B för att sätta en ny benchmark för 7B-parametrarschattmodeller, vilket visar förmågan hos mindre, öppna modeller att förstå och svara på användaravsikt effektivt.
Men denna studie är inte utan begränsningar. Beroendet av GPT-4 som utvärderare för benchmark introducerar en bias mot modeller som destillerats från den, vilket potentiellt gynnar precisa svar. Dessutom kvarstår skalbarheten av denna metod till större modeller, såsom LLAMA2-70B, och dess påverkan på prestandavinster som områden för ytterligare forskning. Dessa begränsningar betonar behovet av kontinuerlig innovation och utveckling av obefläckade utvärderingsmetoder inom AI-gemenskapen.
Att titta bortom studien är det uppenbart att potentialen för mindre modeller att prestera på samma nivå som större motsvarigheter kan demokratisera AI, vilket möjliggör mer tillgänglig och effektiv användning i olika applikationer. Framgången med Zephyr-7B uppmuntrar till ytterligare utforskning av öppna modeller, vilket kan accelerera framsteg inom AI genom att främja samarbetsforskning och utveckling.
















