AI-mallit ja alustat

Zephyr-7B: HuggingFacen Hyper-Optimoidu LLM, joka on rakennettu Mistral 7B:n päälle

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Johdanto

Avoinen suurten kielen mallien (LLM) kehitys on vaikuttanut merkittävästi tekoälytutkimusyhteisöön, erityisesti chatbottien ja muiden sovellusten kehittämisessä. LLaMA-mallin julkaisun jälkeen on ollut nousukausi tehokkaan hienosäätelyn, laajennetun ohjelmistojen käsittelyn, hakuvahvistetun generoinnin (RAG) ja kvantisaation tutkimuksessa.

LLaMA-malli esimerkiksi merkitsi uuden aikakauden hienosäätelyssä ja ohjelmistojen kontekstualisoinnissa, luoden tien seuraaville malleille, kuten MosaicML:n MPT:lle, Together AI:n RedPajama-INCITE:lle, TII:n Falconille ja Metan Llama 2:lle. Kukin näistä malleista tuo omat ainutlaatuiset ominaisuutensa, parantaen LLM:n toimintaa ja laajuutta.

Mistral AI, Pariisissa perustettu startup, joka on perustettu entisten Google DeepMind- ja Meta-työntekijöiden toimesta, on tehnyt itsensä tunnetuksi ensimmäisellä tarjonnallaan: Mistral 7B:llä.

Mistral 7B:n etu on sen tehokkuudessa, joka tarjoaa samanlaiset tai parannetut ominaisuudet verrattuna muihin malliin, kuten Llama 2:een, mutta vähemmällä laskennalllisella vaatimuksella.

Erityisesti ohjelmistotehtäviin säätökuviin, Mistral 7B Instruct loistaa alustoilla, kuten Hugging Facessa, jossa se ylittää muita samankokoisia malleja ja kilpailee läheisesti niiden kanssa, joilla on lähes kaksinkertainen määrä parametreja.

Rakentamalla tästä, Hugging Face esitteli Zephyr 7B Alphan, osoittaen, että hienosäätelty Mistral 7B voi ylittää merkittävästi suurempien chat-mallien kyvyt ja joidenkin tehtävien osalla jopa kilpailla GPT-4:n kanssa. “Alpha” oli vain alku, kun Zephyr 7B Beta seurasi pian.

Tämä artikkeli tarkastelee, miten Zephyr 7B hyödyntää suurempien mallien voimaa jalostamaan kykyään vastata ja täsmätä ihmisen ohjeisiin, prosessi, joka on mahdollista tietojen tiivistämisen tekniikkaa käyttämällä. Tämä menetelmä käsittää pienempien mallien kouluttamista suurempien mallien oppimista kompleksisista malleista, vähentämällä koulutusvaatimuksia ilman kielen mallintamiskykyjen uhraamista. Tutkimme Hugging Facen tietojen tiivistämismenetelmän yksityiskohtia.

Tietojen tiivistäminen

Avaininnovaatio Zephyr-7B-mallin kehittämisessä on tiivistetty valvottu hienosäätö (dSFT). Tässä menetelmässä suuremman, kykykkäämmän “opettaja”-mallin tulosteita käytetään kouluttamaan pienempää “oppilas”-mallia, parantaen sen tarkkuutta. Vaikka tiivistäminen parantaa avoimia malleja useilla tehtävillä, opettaja-mallien suorituskykyyn verrattuna edelleen on eroa.

Tietojen tiivistäminen on koneoppimisen menetelmä, jossa kompakti malli, jota kutsutaan “oppilaaksi“, opetetaan jäljittelemään suuremman, monimutkaisemman “opettajan” mallin suorituskykyä. Tämä tekniikka mahdollistaa oppilaan suorittaa tehtäviä, jotka olivat aiemmin sen kykyjen ulottumattomissa, siirtämällä opettajan oppimat monimutkaiset mallit.

Tietojen tiivistäminen, | Opettaja-oppilas-malli

Tietojen tiivistäminen | Opettaja-oppilas-malli

Oppilasmalli koulutetaan opettajamallin tuottamien todennäköisyyksien tai ominaisuuksien kanssa, keskittyen näiden tulosteiden vastaamiseen, eikä pelkästään lopullisiin ennusteisiin. Tämä mahdollistaa oppilaan oppia opettajan hienostuneet päätöksentekoprosessit, usein johtuen parantuneeseen suorituskykyyn verrattuna koulutukseen, jossa käytetään vain perustodennäköisyyksiä.

Historiallisesti tietojen tiivistäminen on käytetty malleissa, kuten Hintonin alkuperäisissä tiivistämismalleissa, ja viimeaikaisemmin NLP:ssä malleissa, kuten DistilBERT, joka tiivisti BERT-mallin pienemmäksi, nopeammaksi version, joka säilyttää suurimman osan alkuperäisestä kielen ymmärtämiskyvystä. Toinen esimerkki on TinyBERT, joka menee pidemmälle optimoimalla koon ja nopeuden mobiililaitteille tai reuna-laitteille.

Zephyr-7B:n tapauksessa tietojen tiivistäminen käytetään antamaan 7B-parametrin mallille suurempien vastineidensa kyvyt. Tekemällä näin, Zephyr-7B saavuttaa tasapainon suorituskyvyn ja tehokkuuden välillä, tehden siitä soveltuvan ympäristöihin, joissa laskennalliset resurssit ovat rajallisesti saatavilla, ilman vuodetta vuorovaikutuksen ja ymmärtämisen laatua.

Zephyr-7B:n kehittämisessä tutkijat ratkaisivat haasteen, jossa pienen avoimen LLM:n täydellinen tiivistäminen ainoastaan tiivistämismenetelmällä. He esittivät lähestymistavan, jota kutsutaan tiivistetyksi suoraksi preferenssi-optimoitumiseksi (dDPO), joka käyttää AI-palautetta opettajamallien joukosta preferenssitietona. Tämä menetelmä, joka ei vaadi ihmisen annotaatiota, vähentää merkittävästi aikaa ja resursseja, joita mallin koulutukseen tarvitaan.

ZEPHYR-7B:n rakentaminen

Todistamaan dDPO:n, tutkijat rakensivat ZEPHYR-7B:n, joka on Mistral-7B-mallin kohdistettu versio. Prosessi käsitti kolme askelta:

  1. dSFT UltraChat-datasetin käytössä: Tiivistetty valvottu hienosäätö (dSFT) on edistynyt menetelmä suurten kielen mallien kouluttamiseen, hyödyntämällä suurempien, kykykkäämpien “opettaja”-mallien tulosteita. Se alkaa raakamallista, joka koulutetaan vastaamaan käyttäjän ohjelmistoihin. Toisin kuin perinteinen valvottu hienosäätö (SFT), joka käyttää kiinteää datasettiä, dSFT käyttää dynaamista lähestymistapaa, jossa malli itse luo ohjelmistot ja vastaukset. Tämä menetelmä, jota kutsutaan itseohjelmoinniksi, käyttää opettajamallia vastaamaan ja parantamaan ohjelmistojen perusteella.
  2. AI-palautetiedon sisällyttäminen UltraFeedbackista: Tämä tieto oli olennainen mallin vastausten hienosäätöön. Tässä vaiheessa malli luo vastauksia erilaisiin ohjelmistoihin (kuten kuvaileminen, miten tehdä suklaa-brownie), jotka sitten arvioidaan edistyneemmällä mallilla, kuten GPT-4. Korkeimmin arvosteltu vastaus (yw) ja satunnaisesti valittu alempiarvoinen vastaus (yl) muodostavat palautetiedon D.
  3. dDPO:n soveltaminen: Viimeinen vaihe, tiivistetty suora preferenssi-optimoituminen (dDPO), käsittää dSFT-mallin hienosäätämisen maksimoimalla suosittujen vastausten todennäköisyyttä. Tämä saavutetaan käyttämällä palkkiofunktiota rθ(x, y) preferenssimallissa, joka perustuu optimaaliseen LLM-politiikkaan π* ja alkuperäiseen dSFT-politiikkaan πdSFT. Optimointitavoite on muotoa πθ = max π E (x, yw, yl) ∼ D log σ (β log π(yw|x)/πdSFT(yw|x) − β log π(yl|x)/πdSFT(yl|x)), joka yksinkertaistaa koulutusprosessin aloittamalla dSFT-version mallista ja iteroiden jokaisen AIF-tripelin läpi.
Menetelmä, jota käytetään Zephyr-7B:ssa, heijastaa InstructGPT:ssä käytettyjä prosesseja.

Menetelmä, jota käytetään Zephyr-7B:ssa, heijastaa InstructGPT:ssä käytettyjä prosesseja.

Huomattavasti Zephyr-7B saavuttaa suorituskyvyn, joka on verrattavissa 70B-parametrin mallien suorituskykyyn, jotka on kohdistettu ihmisen palautteella. Se erottuu sekä akateemisissa mittareissa että keskustelukyvyssä, korostaen suoran preferenssioppimisen menetelmän tehokkuutta mallin kehittämisessä. Lisätietoa varten, mallit, koodi ja ohjeet ovat saatavilla Hugging Facen GitHub-arkistossa.

Haasteen ratkaiseminen: Tarkoituksen kohdistaminen

Merkittävä huolenaihe LLM-malleissa on ollut niiden kohdistuminen ihmisen tarkoituksiin. Aikaisemmat mallit usein epäonnistuivat tuottamasta vastauksia, jotka vastasivat käyttäjien mieltymyksiä, johtuen epätarkoista tai asiattomista vastauksista. Viimeaikaiset mittarit, kuten MT-Bench ja AlpacaEval, ovat kuitenkin tarjonneet työkaluja parantamaan tätä osa-aluetta, korostaen etenkin omistajamallien ylivoimaa, jotka on koulutettu ihmisen palautteella, verrattuna malleihin, jotka on koulutettu ainoastaan tiivistämismenetelmällä.

Arviointimenetelmät

Zephyr 7B:n arviointi käsitti tiukat testit mittareilla, jotka arvioivat mallin keskustelukykyjä sekä yksittäisissä että monivaiheisissa konteksteissa:

  • MT-Bench: Tämä monivaiheinen mittari vaatii mallin vastaamaan 160 kysymykseen, jotka kattavat kahdeksan aluetta. Jokainen vastaus arvioidaan GPT-4:llä, ja mallin lopullinen pisteytys heijastaa keskiarvon kahden kysymyskierroksen aikana.
  • AlpacaEval: Tässä yksivaiheisessa mittarissa malli esitetään 805 kysymykselle eri aiheista. Tässä keskitytään mallin hyödyllisyyteen, ja GPT-4 arvioi vastauksia määrittääkseen vertailukelpoisen voittoprosentin.

Lisäksi Zephyr 7B testattiin Avoin LLM Leaderboard -mittarilla, joka ei suoraan arvio keskustelukykyjä, mutta tarjoaa näkymän mallin päättely- ja totuudenmukaisuuskykyyn hienosäätöjen jälkeen.

Zephyr 7B verrattiin useisiin avoimiin ja omistajiin malleihin, mukaan lukien eri kokoiset ja kohdistusmenetelmät. Se asetti uudet mittarit 7B-malleille MT-Bench- ja AlpacaEval-mittareilla ja osoitti kilpailukykyisen suorituskyvyn suurempien mallien kanssa, vahvistaen suoran preferenssi-optimoitumisen (dDPO) tehokkuutta koulutuksessa.

SFT- ja DPO-koulutusvaiheet olivat tarkoin konfiguroituja, kattavia useita epoch-kausia ja hienosäätöoppi- ja batch-kokoja optimaalisen suorituskyvyn saavuttamiseksi. Lopullinen Zephyr-malli osoittautui kestäväksi ylioppimiselle ja parantuneeksi käytännön tehtävissä ja akateemisissa mittareissa.

Tiedot ja tulokset

Käytetyt tiedot

Zephyr-7B:n kehittämisessä käytettiin kahta tärkeää datasettiä mallin kouluttamiseen ja jalostamiseen, kumpikin käsitteli eri puolia dialogin luomista:

UltraChat Dataset

  • Lähde: Kehitetty GPT-3.5-TURBO:sta generoiduista dialogeista.
  • Sisältö: Sisältää 1,47 miljoonaa monivaiheista dialogia 30 aiheesta ja 20 tekstimateriaalin tyypistä.
  • Hiominen: Datasettiin sovellettiin oikein kirjoitettujen sanojen korjausmenetelmää, ja suodattimet sovellettiin lisätäkseen vastausten hyödyllisyyttä ja poistamaan epähyödylliset esipuheen lauseet.

UltraFeedback Dataset

  • Lähde: Koostuu GPT-4:llä arvioiduista ohjelmistoista, jotka arvioivat vastauksia ohjeiden seuraamisen, rehellisyyden ja hyödyllisyyden perusteella.
  • Sisältö: Sisältää 64 000 ohjelmistoa, joissa on neljä vastausta kussakin, arvioiduilla GPT-4:llä.
  • Binääriset preferenssit: Luotiin valitsemalla vastaus, jolla oli korkein keskiarvo, “valittu” ja satunnainen loput, “hylätty”, parantamaan monimuotoisuutta ja haastamaan suoran preferenssi-optimoitumisen (DPO) prosessia.

Molemmat datasetit ovat tärkeitä Zephyr-7B:n kouluttamiseksi ymmärtämään ja luomaan ihmismäisiä, ohjeiden mukaisia ja rehellisiä dialogeja. Nämä datasetit ovat saatavilla Hugging Face Hubissa, jonka voit käydä täällä.

Suorituskyky ja tulokset

Seuraava kaavio osoittaa Zephyr 7B:n suorituskyvyn eri tehtävien luokissa verrattuna muihin malleihin, kuten GPT-3.5-turboon, Claude 1:een, GPT-4:ään ja Llama-2-70b-chatiin. Luokat voivat sisältää kirjoittamisen, humanistiset tieteet, roolipelin, päättelyn, STEM:n, poiston, koodauksen ja matematiikan.

Kaaviosta voidaan päätellä, mitkä alueet Zephyr 7B:lla menestyvät ja mitkä alueet vaativat edelleen parantamista. Esimerkiksi, jos Zephyrin linja ulottuu kirjoittamisakselilla pidemmälle kuin muut, se viittaa siihen, että Zephyr on erityisen vahva kirjoittamisessa. Toisaalta, jos linja on lähempänä keskipistettä matematiikka-akselilla, se saattaa osoittaa suhteellista heikkoutta matematiikan ratkaisemisessa.

Radiokaavio auttaa tunnistamaan Zephyr 7B:n vahvuudet ja heikkoudet, tarjoamalla visuaalisen esityksen siitä, missä se sijoittuu suhteessa suurempiin malleihin, kuten GPT-4:ään ja erikoistuneisiin malleihin, kuten Llama-2-70b-chatiin.

 

Mallin suorituskykykaavio

Mallin suorituskykykaavio

Eri kielen malleja verrataan kahdella mittarilla: MT-Bench ja AlpacaEval. Mallit arvioidaan niiden koosta, kohdistusmenetelmästä (kuten dSFT:stä tiivistetylle valvotulle hienosäätölle tai dDPO:sta tiivistetylle suoralle preferenssi-optimoitumiselle) ja suorituskyvystä. Zephyr erottuu korkeilla pisteillä molemmilla mittareilla, osoittaen sen tehokkuuden kohdistettujen vastausten luomisessa.

MT-Bench ja AlpacaEval

MT-Bench ja AlpacaEval

Johtopäätös

Johtopäätöksessä Zephyr-7B:n kehittäminen osoittaa, että kohdistaminen ja tiivistäminen suuremman kielen mallin (LLM) keskustelukyvystä pienempään malliin voidaan saavuttaa ilman satunnaisten menetelmien käyttöä. Käyttämällä suoraa preferenssi-optimoitumista (DPO) AI-palautteen kanssa, Zephyr-7B hyödyntää vahvaa perustaa Mistral-7B:stä asettamaan uuden mittarin 7B-parametrin chat-malleille, osoittaen pienempien, avoimien mallien kyvyn ymmärtää ja vastata ihmisen tarkoituksiin tehokkaasti.

Tämä tutkimus ei kuitenkaan ole ilman rajoituksia. Riippuvuus GPT-4:stä arviointimittareina saattaa aiheuttaa vinouman malleja, jotka on tiivistetty siitä, mahdollisesti suosien tarkkoja vastauksia. Lisäksi tämän menetelmän skaalautuvuus suurempiin malleihin, kuten LLAMA2-70B:hen, ja sen vaikutus suorituskykyyn vaativat lisätutkimusta. Nämä rajoitukset korostavat jatkuvan innovaation ja puolueettomien arviointimenetelmien kehittämistarpeen tekoälyyhteisössä.

Katsoen tutkimuksen ulkopuolelle, on selvää, että pienempien mallien potentiaali toimia suurempien mallien tasolla voi demokratisoida tekoälyä, mahdollistaen sen käytön monissa sovelluksissa tehokkaammin ja kustannustehokkaammin. Zephyr-7B:n menestys rohkaisee jatkamaan avoimien mallien tutkimista, mikä voi kiihdyttää tekoälyn edistystä edistämällä yhteistyöhön perustuvaa tutkimusta ja kehittämistä.

Olen viettänyt viimeiset viisi vuotta uppoutumalla kiinnostavaan koneoppimisen ja syvän oppimisen maailmaan. Minun intohimoni ja asiantuntemukseni ovat johtaneet minun osallistumiseen yli 50:een monipuoliseen ohjelmistosuunnitteluhankkeeseen, joissa on erityisesti painottunut AI/ML. Minun jatkuva uteliaisuuteni on myös ohjannut minun luontaisen kielen prosessoinnin pariin, jota haluan tutkia tarkemmin.