Modely a platformy AI
Zephyr-7B: Hugging Faceova hyperoptimalizovaná LLM postavená na Mistralu 7B
Úvod
Evolve otevřených velkých jazykových modelů (LLM) měla významný dopad na komunitu výzkumu umělé inteligence, zejména při vývoji chatbotů a podobných aplikací. Po vydání modelů jako LLaMA došlo k vzrůstu výzkumu v oblasti efektivní jemné úpravy, rozšířené zpracování příkazů, generace s podporou vyhledávání (RAG) a kvantizace.
Model LLaMA, například, zahájil novou éru jemné úpravy a kontextualizace příkazů, připravující cestu pro následující modely, jako je MosaicML’s MPT, Together AI’s RedPajama-INCITE, TII’s Falcon a Meta’s Llama 2. Každý z těchto modelů přispívá jedinečnými schopnostmi, zvyšujícími celkovou funkčnost a rozsah LLM.
Mistral AI, startup z Paříže založený bývalými zaměstnanci Google DeepMind a Meta, si získal jméno svou první nabídkou: Mistral 7B.
Předností Mistralu 7B je jeho efektivita, poskytující podobné nebo vylepšené schopnosti ve srovnání s jeho vrstevníky, jako je Llama 2, ale s nižšími výpočetními nároky.
Specificky upravený pro instruktážní úkoly, Mistral 7B Instruct vyniká na platformách, jako je Hugging Face, kde překonává ostatní modely stejné velikosti a soutěží úzce s těmi, které mají téměř dvojnásobek parametrů.
Vydáním Zephyr 7B Alpha Hugging Face ukázal, že jemně upravený Mistral 7B může skutečně překonat schopnosti mnohem větších chatových modelů a v některých úkolech dokonce soupeřit s GPT-4. “Alpha” byla pouze začátek, jelikož následovala Zephyr 7B Beta.
Tento článek prozkoumá, jak Zephyr 7B využívá sílu větších modelů ke zlepšení své schopnosti reagovat a sladit se s lidskými instrukcemi, proces umožněný technikou znalostní destilace. Tato metoda zahrnuje školení menších modelů na složitých vzorcích naučených většími modely, snižující požadavky na školení bez obětuje schopností jazykového modelování. Prozkoumáme specifika přístupu Hugging Face ke znalostní destilaci.
Znalostní destilace
Klíčovou inovací při vývoji modelů, jako je Zephyr-7B, je destilovaná dohlížená jemná úprava (dSFT). Tato metoda zahrnuje použití výstupu z většího, schopnějšího “učitele” modelu pro školení menších “žáků” modelů, zvyšující jejich přesnost. Zatímco destilace vylepšuje otevřené modely v různých úkolech, stále existuje mezera ve výkonu ve srovnání s učitelskými modely.
Znalostní destilace je metoda strojového učení, při které kompaktní model, nazývaný “žák”, se učí replikovat výkon většího, složitějšího “učitele” modelu. Tato technika umožňuje žákovi provádět úkoly, které byly dříve za jeho kapacitou, přenosem složitých vzorců naučených učitelem.
Žák model se učí na výstupních pravděpodobnostech nebo funkcích generovaných učitelem modelem, zaměřujícím se na shodu s těmito výstupy spíše než pouze na konečné předpovědi. To umožňuje žákovi naučit se nuancované rozhodovací procesy učitele, často vedoucí k vylepšenému výkonu oproti školení pouze s použitím grund truth dat.
Historicky byla znalostní destilace využita v modelech, jako je Hintonův původní destilační síť, a nedávno v NLP s modely, jako je DistilBERT, který destiloval model BERT do menšího, rychlejšího modelu, který si zachovává většinu původních jazykových pochopení. Další příklad je TinyBERT, který jde dále v optimalizaci velikosti a rychlosti pro mobilní nebo okrajové zařízení.
V případě Zephyr-7B se znalostní destilace používá k vdechnutí menšímu 7B parametrům modelu schopností jeho větších protějšků. Tímto způsobem Zephyr-7B dosahuje rovnováhy mezi výkonem a efektivitou, což z něj činí vhodný pro prostředí, kde jsou výpočetní zdroje omezené, bez oběti kvality interakce a porozumění.
Při vývoji Zephyr-7B výzkumníci řešili výzvu úplného sladění malého otevřeného LLM pouze prostřednictvím destilace. Představili přístup nazvaný destilovaná přímá optimalizace preferencí (dDPO), který využívá AI zpětnou vazbu z ensemble učitele modelů jako preferenčních dat. Tato metoda, nevyžadující žádnou lidskou anotaci, významně snižuje čas a zdroje potřebné pro školení modelu.
Konstrukce ZEPHYR-7B
Pro ověření dDPO výzkumníci konstruovali ZEPHYR-7B, sladěnou verzi modelu Mistral-7B. Proces zahrnoval tři kroky:
- dSFT pomocí sady UltraChat: Destilovaná dohlížená jemná úprava (dSFT) je pokročilá metoda pro školení velkých jazykových modelů (LLM) využívající výstup větších, schopnějších “učitel” modelů. Začíná s hrubým LLM, který se učí reagovat na uživatelské příkazy. Na rozdíl od tradiční dohlížené jemné úpravy (SFT), která používá pevnou sadu dat, dSFT využívá dynamický přístup, kde model sám generuje instrukce a odpovědi. Tato metoda, nazývaná self-instruct, zahrnuje použití učitele modelu pro odpovědi i pro jemnou úpravu instrukcí na základě odpovědí. Proces začíná souborem počátečních příkazů (x₀₁, x₀₂, …, x₀_J) reprezentujících rozmanité téma. Každý příkaz je iterativně upraven: pro daný příkaz x₀ je vygenerována odpověď y₀ učitelem modelem, a poté je vybrán nový příkaz x₁ na základě x₀ a y₀. Konečná sada dat C = {(x₁, y₁), …, (x_J, y_J)} se používá pro jemnou úpravu modelu.
- Integrace dat AI zpětné vazby z UltraFeedback: Tyto údaje byly zásadní pro jemnou úpravu odpovědí modelu. V tomto kroku model generuje odpovědi na různé příkazy (jako popis, jak vyrobit čokoládové brownie), které jsou poté hodnoceny pokročilejším modelem, jako je GPT-4. Nejvyšší skóre odpověď (yw) a náhodně vybraná nižší skóre odpověď (yl) tvoří sadu zpětné vazby D.
- Aplikace dDPO: Poslední fáze, destilovaná přímá optimalizace preferencí (dDPO), zahrnuje jemnou úpravu dSFT modelu tak, aby maximalizoval pravděpodobnost hodnocení preferovaných odpovědí výše. To je dosaženo pomocí odměňovací funkce rθ(x, y) v preferenčním modelu, která je založena na optimálním LLM politice π* a původní politice πdSFT. Optimalizační cíl je formulován jako πθ = max π E (x, yw, yl) ∼ D log σ (β log π(yw|x)/πdSFT(yw|x) − β log π(yl|x)/πdSFT(yl|x)), což zjednodušuje proces školení začínající s dSFT verzí modelu a iterující přes každé AIF triple.
Značně, Zephyr-7B dosahuje výkonu srovnatelného s mnohem většími 70B-parametrickými modely sladěnými s lidskou zpětnou vazbou. Vyniká v akademických benchmarcích a konverzačních schopnostech, zdůrazňujících účinnost preferenčního učení ve vývoji modelu. Pro další prozkoumání jsou modely, kód a instrukce k dispozici na Hugging Face GitHub Repository.
Řešení výzvy sladění záměru
Značnou starostí s LLM bylo jejich sladění se záměrem člověka. Předchozí modely často selhávaly ve vývoji odpovědí, které odpovídaly uživatelským preferencím, vedoucí k nesprávným nebo irelevantním odpovědím. Nicméně, nedávné benchmarky, jako MT-Bench a AlpacaEval, poskytly nástroje pro kvantifikaci a zlepšení tohoto aspektu, zdůrazňující lepší výkon proprietárních modelů školených s lidskou zpětnou vazbou oproti těm, které byly školeny pouze prostřednictvím destilace.
Metody hodnocení
Hodnocení Zephyr 7B zahrnovalo důkladné testování napříč benchmarchy, které hodnotí konverzační schopnosti modelu v obou jednoduchých a víceuživatelských kontextech:
- MT-Bench: Tento víceuživatelský benchmark vyžaduje, aby model zodpověděl 160 otázek pokrývajících osm domén. Každá odpověď je hodnocena GPT-4, s konečným skóre modelu odrážejícím průměr dvou kol otázek.
- AlpacaEval: V tomto jednoduchém benchmarku je model prezentován 805 otázkami napříč různými tématy. Záměrem je modelova užitečnost, s GPT-4 skórující odpovědi pro určení srovnávacího vítězného poměru.
Navíc byl Zephyr 7B testován na Open LLM Leaderboard, který, ačkoli není přímým hodnocením konverzačních schopností, nabízí pohledy do modelova rozumu a pravdivosti po jemné úpravě.
Zephyr 7B byl porovnán s různými otevřenými a proprietárními modely, včetně těch s rozdílnými velikostmi a metodami sladění. Založil nové benchmarky pro 7B modely na MT-Bench a AlpacaEval a ukázal konkurenceschopný výkon proti větším modelům, potvrzující účinnost přímé optimalizace preferencí (dDPO) ve školení.
Fáze SFT a DPO školení byly pečlivě nakonfigurovány, pokrývající několik epoch a jemnou úpravu učících se rychlostí a velikostí dávek pro optimální výkon. Konečný Zephyr model se ukázal nejen odolný proti přeučení, ale také vylepšený v řešení praktických úkolů a akademických benchmarcích.
Sady dat a výsledky
Sady dat
Výkon a výsledky
Níže uvedený graf ilustruje výkon Zephyr 7B napříč různými kategoriemi úkolů proti jiným modelům, jako je GPT-3.5-turbo, Claude 1, GPT-4 a Llama-2-70b-chat. Kategorie mohou zahrnovat psaní, humanitní vědy, roleplay, rozumnost, STEM, extrakce, kódování a matematiku.
Z grafu lze vyvodit, ve kterých doménách Zephyr 7B vyniká a ve kterých doménách by mohl potřebovat další zlepšení. Například, pokud Zephyrova linie sahá dále na ose psaní ve srovnání s ostatními, naznačuje to, že Zephyr je zvláště silný v generování psaného obsahu. Naopak, pokud je linie blíže středu na ose matematiky, může to naznačovat relativní slabost v řešení matematických problémů.
Radarový graf pomáhá identifikovat silné a slabé stránky Zephyr-7B, poskytující vizuální reprezentaci, kde stojí proti větším modelům, jako je GPT-4, a specializovaným modelům, jako je Llama-2-70b-chat.
Porovnání různých jazykových modelů na dvou benchmarcích: MT-Bench a AlpacaEval. Modely jsou hodnoceny na základě jejich velikosti, metody sladění (jako dSFT pro destilovanou dohlíženou jemnou úpravu nebo dDPO pro destilovanou přímou optimalizaci preferencí) a výkonových skórů. Zephyr vyniká s vysokými skóre v obou benchmarcích, ukazujících jeho účinnost v generování sladěných odpovědí.
Závěr
V závěru, vývoj Zephyr-7B demonstruje, že sladění a destilace konverzačních schopností z většího jazykového modelu (LLM) na menší model lze dosáhnout bez závislosti na metodách založených na vzorkování. Používáním přímé optimalizace preferencí (DPO) s AI zpětnou vazbou, Zephyr-7B využívá silný základ Mistral-7B, aby nastavil nový benchmark pro 7B parametr chat modely, ukazující schopnost menších, otevřených modelů porozumět a reagovat na uživatelský záměr účinně.
Nicméně, tato studie není bez omezení. Závislost na GPT-4 jako hodnotiteli pro benchmarky zavedla bias směrem k modelům, které jsou destilovány z něj, potenciálně favorizujícím přesné odpovědi. Navíc, škálovatelnost této metody na větší modely, jako je LLAMA2-70B, a její dopad na výkonové zisky zůstávají oblastmi pro další výzkum. Tato omezení zdůrazňují potřebu kontinuální inovace a vývoje nezávislých metod hodnocení v komunitě umělé inteligence.
Pohledem za studii, je zřejmé, že potenciál menších modelů pro výkon na úrovni větších protějšků může demokratizovat umělou inteligenci, umožňující více přístupný a efektivní použití v různých aplikacích. Úspěch Zephyr-7B podporuje další prozkoumání otevřených modelů, které mohou urychlit pokroky v umělém inteligenci podporou spolupráce ve výzkumu a vývoji.
















