AI-modeller og plattformer

Reflection 70B: LLM med selvkorrektur og ledende ytelse

mm
Legg til Unite.AI blant dine foretrukne kilder pÃĨ Google
Reflection 70B, large language models, AI self-correction, Reflection-Tuning, open-source AI, HyperWrite

Reflection 70B er en ÃĨpen kildekode stor sprÃĨkmodell (LLM) utviklet av HyperWrite. Denne nye modellen introduserer en tilnÃĶrming til AI-kognisjon som kan endre hvordan vi samhandler med og avhenger av AI-systemer i mange felt, fra sprÃĨkbehandling til avansert problemlÃļsing.

Med Reflection-Tuning, en banebrytende teknikk som tillater modellen ÃĨ selv-vurdere og korrigere sine egne feil i sanntid, har Reflection 70B raskt steget til topps, og overgÃĨtt proprietÃĶre modeller som GPT-4 og Claude 3.5 Sonnet over flere benchmark, inkludert MMLU, MATH og HumanEval.

Reflection 70B er bygget pÃĨ den robuste Llama 3.1-70B-arkitekturen, men dens selv-tilpasningsmekanisme skiller den fra andre. Gjennom iterative sykluser av refleksjon, feiloppsporing og utgangsforbedring, etterligner modellen menneskelig kognisjon pÃĨ en utenkelig mÃĨte, og presses grensene for hva AI kan oppnÃĨ. Som resultat tilbyr Reflection 70B ikke bare ubestridt nÃļyaktighet, men ogsÃĨ dypere innsikt i dens beslutningsprosess, en kritisk funksjon for applikasjoner hvor gjennomsiktighet og presisjon er avgjÃļrende.

Hva er Reflection 70B

I kjernen er Reflection 70B bygget pÃĨ Meta’s ÃĨpen kildekode Llama 3.1-70B Instruct-modell. Men det som virkelig skiller den fra andre, er dens unike evne til ÃĨ engasjere i en prosess lik menneskelig refleksjon – derav navnet. Denne evnen stammer fra en teknikk kalt “Reflection-Tuning“, som gjÃļr det mulig for modellen ÃĨ identifisere og rette opp sine egne feil i sanntid, og forbedre nÃļyaktigheten og pÃĨliteligheten.

Matt Shumer, CEO av HyperWrite, introduserte Reflection 70B med det dristige kravet at det er “verdens beste ÃĨpen kildekode AI-modell.” Men hva gjÃļr denne modellen sÃĨ spesiell, og hvordan sammenlignes den med industri-giganter som GPT-4 og Claude 3.5 Sonnet? La oss utforske.

ForstÃĨ Selective Reflection-Tuning: En paradigmeskift i AI-trening

Selektiv Reflection-Tuning introduserer en tilnÃĶrming til instruksjonstuning, hvor mÃĨlet er ÃĨ forbedre bÃĨde kvaliteten pÃĨ instruksjonsdata og dens kompatibilitet med studentmodellen som finjusteres. Tradisjonelle metoder fokuserer ofte pÃĨ ÃĨ forbedre dataene selv, men overseer hvordan de forbedrede dataene parer seg med modellens lÃĶringsmÃĨl. Selektiv Reflection-Tuning brogger denne gapen ved ÃĨ fremme en lÃĶrer-elev-samarbeid, hvor en lÃĶrermodell reflekterer over dataene og gir forbedrede instruksjons-svar-par, mens elevmodellen vurderer og velger ut kun de forbedringene som best passer med dens treningbehov.

Selektiv Reflection-Tuning-metode, som viser samarbeidet mellom en lÃĶrermodell og en elevmodell

Prosessen bestÃĨr av to nÃļkkel-faser:

  1. Selektiv instruksjonsrefleksjon: LÃĶrermodellen reflekterer over instruksjonen til en gitt eksempel og genererer et forbedret instruksjons-svar-par. Elevmodellen vurderer deretter om denne nye instruksjonen er nyttig basert pÃĨ en metode kalt InstruksjonsfÃļlgingssvÃĨrighet (IFD). IFD-poengsummen vurderer vanskelighetsgraden til eksemplet for elevmodellen, og sikrer at kun data som utfordrer modellen pÃĨ en passende mÃĨte, behandles.
  2. Selektiv svar-refleksjon: I denne fasen reflekterer lÃĶrermodellen over svarene generert i den fÃļrste fasen. Elevmodellen vurderer disse svarene ved hjelp av Reversert InstruksjonsfÃļlgingssvÃĨrighet (r-IFD), en metode som mÃĨler hvor mulig det er for elevmodellen ÃĨ dedusere instruksjonen basert pÃĨ svaret. Dette sikrer at svaret ikke bare forbedrer modellens resonnering, men ogsÃĨ passer godt med elevens eksisterende kunnskap.

Ved ÃĨ anvende bÃĨde IFD og r-IFD, produserer Selektiv Reflection-Tuning data-par som er utfordrende, men mulige, og forbedrer instruksjons-tuning-prosessen uten ÃĨ behÃļve ekstra datasett. Resultatet er en mer prÃļve-effektiv og hÃļy-ytende LLM som overgÃĨr mange stÃļrre modeller.

Tankenets arkitektur: Hvordan Reflection 70B “tenker”

Reflection 70B’s underliggende arkitektur tar AI-resonnering til et nytt nivÃĨ ved ÃĨ dele tenketanken i flere faser. Hver fase tillater modellen ÃĨ forbedre seg selv gjennom selv-refleksjon, lik menneskelig kognisjon:

  1. Initial data og svar: Modellen starter med ÃĨ generere et svar til den gitt instruksjonen. Dette innledende utgangspunkt er likt standard LLM-utgangspunkter.
  2. Selektiv instruksjonsrefleksjon: Etter ÃĨ ha generert det innledende svaret, gÃĨr modellen inn i instruksjonsrefleksjonsfasen. LÃĶrermodellen reflekterer over den opprinnelige instruksjonen og foreslÃĨr forbedringer. Disse forslagene vurderes deretter av elevmodellen ved hjelp av IFD-poengsummen for ÃĨ bestemme om det nye instruksjons-svar-paret er mer egnet for videre finjustering.
  3. Selektiv svar-refleksjon: Etter refleksjon over instruksjonen, gÃĨr modellen videre til ÃĨ forbedre svaret selv. Her genererer lÃĶrermodellen et nytt svar basert pÃĨ den oppdaterte instruksjonen. Elevmodellen, ved hjelp av r-IFD-poengsummen, vurderer om det nye svaret hjelper til ÃĨ dedusere instruksjonen mer effektivt.
  4. Final instruksjonsfinjustering: NÃĨr det beste instruksjons-svar-paret er valgt, legges det til i det endelige datasett som brukes til ÃĨ finjustere modellen. Denne fler-fase-prosessen sikrer at kun de mest effektive og sammenhengende instruksjons-svar-par inkluderes i finjusteringsdataene.

Denne strukturerte refleksjonsprosessen tillater brukerne ÃĨ se hvordan modellen itererer gjennom sin tenkeprosess, og skaper gjennomsiktighet og forbedrer nÃļyaktighet og konsistens i komplekse oppgaver.

Benchmarking glans: Reflection 70B i aksjon

Reflection 70B’s bruk av Selektiv Reflection-Tuning tilbyr ikke bare en mer sofistikert treningprosess, men ogsÃĨ en ledende ytelse over flere benchmark. Gjennom sin iterative selv-vurderingsmekanisme overgÃĨr modellen proprietÃĶre modeller som er betydelig stÃļrre i stÃļrrelse.

  1. MMLU (Massive Multitask Language Understanding): Reflection 70B scoret et imponerende 72,2%, og overgikk andre store ÃĨpen kildekode-modeller som LLaMA 2.
  2. Matematisk benchmark: I matematisk resonneringstasks overgikk modellen GPT-4 og Claude 3.5 med en betydelig margin, og viste sin styrke i ÃĨ hÃĨndtere komplekse problemlÃļsningsscenarier.
  3. IFEval og GSM8K: Reflection 70B gjorde det ogsÃĨ bra i IFEval, hvor dens instruksjons-svar-kohesjon ble evaluert, og i GSM8K, en matematisk problemlÃļsning-benchmark. Den selv-reflecterende finjusteringen tillot modellen ÃĨ hÃĨndtere intrikate og nyanserte problemer mer effektivt enn sine stÃļrre konkurrenter.

Ved ÃĨ bruke Selektiv Reflection-Tuning, viste Reflection 70B at stÃļrrelse ikke er den eneste faktoren i ÃĨ oppnÃĨ hÃļy ytelse. Evnen til ÃĨ selv-korrige og reflektere over utgangspunktene ledet til sterkere, mer sammenhengende resonnering, og gjorde det mulig for modellen ÃĨ overgÃĨ modeller med flere parametre.

Graf som sammenligner ytelsen til sRecycled WizardLM 7B mot andre modeller som Zephyr 7B Beta, Vicuna 13B v1.3 og LLaMA2 Chat 7B. Grafen viser sRecycled WizardLM 7B's sterke ytelse, med en detaljert nedbryting av seire, uavgjorte og tap over forskjellige modeller

sRecycled WizardLM 7B vs. andre modeller ytelse-sammenligning

Reelle verden-applikasjoner: Utnytting Reflection 70B’s potensiale

Reflection 70B’s sanntids-feil-korreksjon og gjennomsiktige beslutningsprosess ÃĨpner nye dÃļrer over forskjellige felt. Under er noen reelle verden-applikasjoner:

Komplekse problemlÃļsning

Reflection 70B’s styrke ligger i ÃĨ hÃĨndtere komplekse problemer. Overveur en utfordrende matematisk spÃļrsmÃĨl:


<p>Bruker: &quot;LÃļs ligningen: 2x^2 + 5x - 3 = 0&quot;
Reflection 70B:</p>

<p>&lt;thinking&gt; Bruker den kvadratiske formelen...&lt;/thinking&gt;
&lt;reflection&gt; En korreksjon i beregningen...&lt;/reflection&gt;
&lt;output&gt; LÃļsningene er x = 1/2 og x = -3.&lt;/output&gt;

SprÃĨk-oversettelse med kulturell sensitivitet

I motsetning til typiske oversettelsesmodeller, tilpasser Reflection 70B sprÃĨk-oversettelser til kulturelle kontekster:

Bruker: &quot;Oversett 'It's raining cats and dogs' til fransk, med kulturell kontekst.&quot;
Reflection 70B:

<p>thinking: Den bokstavelige oversettelsen ville vÃĶre &quot;Il pleut des chats et des chiens&quot;...thinking;
reflection: En kulturelt passende oversettelse ville vÃĶre &quot;Il pleut des cordes.&quot;reflection;
output: Oversettelse levert.

Forbedring av kode-feilsÃļking og -optimering

Reflection 70B’s feil-korreksjons-evner gjÃļr den ideell for feilsÃļking og optimering av kode:

Bruker: &quot;FeilsÃļk denne Python-koden...&quot;
Reflection 70B: &lt;thinking&gt; Analyserer trinnvis...&lt;/thinking&gt;
&lt;reflection&gt; Identifisert uendelig rekursjon.&lt;/reflection&gt;
&lt;output&gt; Korrigert kodeversjon med riktig rekursjon.&lt;/output&gt;

Utvidelse av den konkurranse-drevne landskapet for 70B-modeller

Mens Reflection 70B skaper bÃļlger, er den del av et stÃļrre Ãļkosystem av 70 milliarder parameter-modeller. Her er hvordan den sammenlignes med andre:

  • Meta’s Llama 3.1-70B: Sterk grunnmodell kjent for generelle formÃĨl-applikasjoner.
  • Claude 2 70B (Anthropic): Etisk AI-fokusert, dyktig i resonnering og lang-form-innholdsgenerering.
  • GPT-3.5 70B (OpenAI): En letter versjon av GPT-4, som excellerer i ytelse-til-effisiens-balansen.
  • BLOOM 70B: FlersprÃĨklig kraftpakke trent pÃĨ naturlige og programmeringssprÃĨk.
  • Falcon 70B: Merket for sin trening- og inferens-effisiens.

KjÃļr 70B-modeller effektivt: Siste teknikker

KjÃļring av modeller av denne stÃļrrelsen effektivt er ingen liten oppgave. For ÃĨ maksimere ytelse, her er de siste strategiene:

1. Kvantifisering

Redusering av modell-vekt-presisjon hjelper med ÃĨ senke minnebruk og inferenstid. 4-bit kvantifisering-teknikker med BitsAndBytes tillater Reflection 70B ÃĨ kjÃļre effektivt pÃĨ mindre GPU-er.

Eksempel:

from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-2-70b-hf", load_in_4bit=True)

2. Modell-delning

Splitt modellen over flere GPU-er (f.eks. ved hjelp av DeepSpeed Zero) tillater hÃĨndtering av stÃļrre modeller uten ÃĨ overskride GPU-minne.

from xformers.ops import memory_efficient_attention
model.attention = memory_efficient_attention

3. Blandet presisjon og effektiv oppmerksomhet

FlashAttention og xformers reduserer oppmerksomhets-overhead, og forbedrer prosesseringstid for store inndata-sekvenser.

from xformers.ops import memory_efficient_attention
model.attention = memory_efficient_attention

4. CPU-avlasting og beskjÃĶring

CPU-avlasting og beskjÃĶring av mindre kritiske vekter hjelper med ÃĨ kjÃļre modeller pÃĨ mer beskjedne maskinvare mens man beholder ytelse.

from accelerate import cpu_offload
model = cpu_offload(model)

Se fremover: Fremtiden med Reflection 405B

Neste grense for HyperWrite er utviklingen av Reflection 405B, en modell som forventes ÃĨ overgÃĨ Reflection 70B i bÃĨde skala og ytelse. Denne modellen har som mÃĨl ÃĨ presse grensene for ÃĨpen kildekode AI, og plassere seg selv til ÃĨ utfordre selv de mest avanserte proprietÃĶre modellene som GPT-5.

Konklusjon

Gjennom Reflection-Tuning har Reflection 70B oppnÃĨdd ledende ytelse i nÃļkkel-benchmark, samtidig som den opprettholder en nivÃĨ av gjennomsiktighet og nÃļyaktighet sjelden sett i ÃĨpen kildekode AI. Evnen til selv-korreksjon gir den en distinkt fordel, spesielt i felt som krever hÃļy nÃļyaktighet, som kode, sprÃĨk-oversettelse og kompleks problemlÃļsning.

Jeg har brukt de siste fem ÃĨrene pÃĨ ÃĨ dykke ned i den fasiniserende verden av MaskinlÃĶring og Dypt LÃĶring. Min lidenskap og ekspertise har ledet meg til ÃĨ bidra til over 50 ulike programvareprosjekter, med sÃĶrlig fokus pÃĨ AI/ML. Min pÃĨgÃĨende nysgjÃļrhet har ogsÃĨ trukket meg mot Naturlig SprÃĨkbehandling, et felt jeg er ivrig etter ÃĨ utforske videre.