AI-modeller og platforme

Reflection 70B: LLM med selvkorrektur og førende præstation

mm
Føj Unite.AI til dine foretrukne kilder på Google
Reflection 70B, large language models, AI self-correction, Reflection-Tuning, open-source AI, HyperWrite

Reflection 70B er en open-source stor sprogmodel (LLM) udviklet af HyperWrite. Denne nye model introducerer en tilgang til AI-kognition, der kan forme, hvordan vi interagerer med og afhænger af AI-systemer i mange områder, fra sprogbehandling til avanceret problem løsning.

Med Reflection-Tuning, en banebrydende teknik, der giver modellen mulighed for at selv-vurdere og korrigere sine egne fejl i realtid, har Reflection 70B hurtigt nået toppen og overgået proprietære modeller som GPT-4 og Claude 3.5 Sonnet på tværs af multiple benchmarks, herunder MMLU, MATH og HumanEval.

Reflection 70B er bygget på den solide Llama 3.1-70B-arkitektur, men dens selv-forbedrende mekanisme adskiller den. Gennem iterative cykler af refleksion, fejldetektion og output-forbedring, efterligner modellen menneskelig kognition på en hidtil uset måde, og udvider grænserne for, hvad AI kan opnå. Som resultat tilbyder Reflection 70B ikke kun ubesvarede nøjagtighed, men også dybere indsigt i dens beslutningsproces, en kritisk funktion for anvendelser, hvor gennemsigtighed og præcision er afgørende.

Hvad er Reflection 70B

I sin kerne er Reflection 70B bygget på Meta’s open-source Llama 3.1-70B Instruct model. Men det, der virkelig adskiller den, er dens unikke evne til at engagere i en proces, der ligner menneskelig refleksion – hvorfor dens navn. Denne evne stammer fra en teknik kaldet “Reflection-Tuning“, der giver modellen mulighed for at identificere og rette sine egne fejl i realtid, og dermed forbedre sin nøjagtighed og pålidelighed.

Matt Shumer, CEO af HyperWrite, introducerede Reflection 70B med den dristige påstand, at det er “verdens bedste open-source AI-model.” Men hvad er det, der gør denne model så speciel, og hvordan klarer den sig i forhold til industrikæmper som GPT-4 og Claude 3.5 Sonnet? Lad os udforske.

Forståelse af Selektiv Reflection-Tuning: En Paradigmeskift i AI-Træning

Selektiv Reflection-Tuning introducerer en tilgang til instruktionsafstemning, hvor målet er at forbedre både kvaliteten af instruktionsdata og dens kompatibilitet med elevenmodellen, der afstemmes. Traditionelle metoder fokuserer ofte på at forbedre dataene selv, men overseer, hvor godt de forbedrede data-par passer til modellens læringsmål. Selektiv Reflection-Tuning bropper denne lacune ved at fremme en lærer-elev-samarbejde, hvor en <strong:lærermodel reflekterer over dataene og giver forbedrede instruktions-svar-par, mens elevenmodellen vurderer og vælger kun de forbedringer, der bedst passer til dens træningsbehov.

Selektiv Reflection-Tuning-metode, der viser samarbejdet mellem en lærermodel og en elevmodel

Processen består af to nøglefaser:

  1. Selektiv Instruktionsrefleksion: Lærermodellen reflekterer over instruktionen af en given prøve og genererer et forbedret instruktions-svar-par. Elevenmodellen vurderer derefter, om denne nye instruktion er gavnlig baseret på en metode kaldet Instruktionsfølge-Sværhedsgrad (IFD). IFD-scoren vurderer sværhedsgraden af prøven for elevenmodellen, og sikrer, at kun data, der udfordrer modellen passende, behandles.
  2. Selektiv Svarrefleksion: I denne fase reflekterer lærermodellen over svarene, der er genereret i den første fase. Elevenmodellen vurderer disse svar ved hjælp af Omvrendet Instruktionsfølge-Sværhedsgrad (r-IFD), en metode, der måler, hvor gennemførligt det er for eleven at slutte instruktionen ud fra svaret. Dette sikrer, at svaret ikke kun forbedrer modellens resonnering, men også passer godt med elevens eksisterende viden.

Ved at anvende både IFD og r-IFD, producerer Selektiv Reflection-Tuning data-par, der er udfordrende, men gennemførlige, og forbedrer instruktionsafstemningsprocessen uden behov for yderligere datasæt. Resultatet er en mere prøveeffektiv og højtydende LLM, der overgår mange større modeller.

Tankearkitekturen: Hvordan Reflection 70B “tænker”

Reflection 70B’s underliggende arkitektur tager AI-resonnering til et nyt niveau ved at opdele tænkeprocessen i flere faser. Hver fase giver modellen mulighed for at forbedre sig selv gennem selv-refleksion, ligesom menneskelig kognition:

  1. Initial Data og Svar: Modellen starter med at generere et svar på den givne instruktion. Dette første output er ligesom standard LLM-outputs.
  2. Selektiv Instruktionsrefleksion: Efter generering af det første svar, går modellen ind i instruktionsrefleksionsfasen. Lærermodellen reflekterer over den oprindelige instruktion og foreslår forbedringer. Disse forslag vurderes derefter af elevenmodellen ved hjælp af IFD-scoren for at bestemme, om det nye instruktions-svar-par er mere egnet til yderligere afstemning.
  3. Selektiv Svarrefleksion: Efter refleksion over instruktionen, går modellen videre til at forbedre svaret selv. Her genererer lærermodellen et nyt svar baseret på den opdaterede instruktion. Elevenmodellen, ved hjælp af r-IFD-scoren, vurderer, om det nye svar hjælper med at slutte instruktionen mere effektivt.
  4. Endelig Instruktionsafstemning: Når det bedste instruktions-svar-par er valgt, tilføjes det til det endelige datasæt, der bruges til at afstemme modellen. Denne fler-fasede proces sikrer, at kun de mest effektive og koherente instruktions-svar-par inkluderes i afstemningsdataene.

Denne strukturerede refleksionsproces giver brugerne mulighed for at se, hvordan modellen itererer gennem sin tænkeproces, og skaber gennemsigtighed og forbedrer nøjagtighed og konsistens i komplekse opgaver.

Benchmarking Brilliance: Reflection 70B i Aktion

Reflection 70B’s brug af Selektiv Reflection-Tuning tilbyder ikke kun en mere sofistikeret træningsproces, men opnår også industriel førende præstation på tværs af multiple benchmarks. Gennem sin iterative selv-vurderingsmekanisme overgår modellen proprietære modeller, der er betydeligt større i størrelse.

  1. MMLU (Massive Multitask Language Understanding): Reflection 70B opnåede en imponerende 72,2%, og overgik andre store open-source-modeller som LLaMA 2.
  2. MatematikBenchmark: I matematisk resonneringstasks overgik modellen GPT-4 og Claude 3.5 med en betydelig margin, og viste sin styrke i at håndtere komplekse problem-løsningsscenarier.
  3. IFEval og GSM8K: Reflection 70B klarede sig også godt i IFEval, hvor dens instruktions-svar-kohærens blev vurderet, og i GSM8K, en matematisk problem-løsning benchmark. Den selv-reflekterende afstemning gav modellen mulighed for at håndtere intrikate og nuancerede problemer mere effektivt end dens større konkurrenter.

Ved at anvende Selektiv Reflection-Tuning, demonstrerede Reflection 70B, at størrelse ikke er den eneste faktor i at opnå høj præstation. Evnen til at selv-korrigere og reflektere over dens outputs ledte til stærkere, mere koherent resonnering, og gjorde det muligt for modellen at overgå modeller med flere parametre.

Diagram, der sammenligner præstationen af sRecycled WizardLM 7B med andre modeller som Zephyr 7B Beta, Vicuna 13B v1.3 og LLaMA2 Chat 7B. Diagrammet fremhæver sRecycled WizardLM 7B's stærke præstation med en detaljeret opdeling af sejre, uafgjorte og nederlag på tværs af forskellige modeller

sRecycled WizardLM 7B vs. andre modeller – præstationsammenligning

Reale Anvendelser: Udvinding af Reflection 70B’s Potential

Reflection 70B’s realtids-fejlkorrektion og gennemsigtige beslutningsproces åbner nye døre på tværs af forskellige områder. Her er nogle reale anvendelser:

Komplekse Problemløsning

Reflection 70B’s styrke ligger i at håndtere komplekse problemer. Overvej en udfordrende matematisk forespørgsel:


<p>Bruger: &quot;Løs ligningen: 2x^2 + 5x - 3 = 0&quot;
Reflection 70B:</p>

<p>&lt;thinking&gt; Anvender den kvadratiske formel...&lt;/thinking&gt;
&lt;reflection&gt; En korrektion i beregning...&lt;/reflection&gt;
&lt;output&gt; Løsningerne er x = 1/2 og x = -3.&lt;/output&gt;

Sprogoversættelse med Kulturel Følsomhed

I modsætning til typiske oversættelsesmodeller, tilpasser Reflection 70B sprogoversættelser til kulturelle kontekster:

Bruger: &quot;Oversæt 'It's raining cats and dogs' til fransk, med hensyn til kulturel kontekst.&quot;
Reflection 70B:

<p>thinking: Den litterære oversættelse ville være &quot;Il pleut des chats et des chiens&quot;...thinking;
reflection: En kulturelt passende oversættelse ville være &quot;Il pleut des cordes.&quot;reflection;
output: Oversættelse leveret.

Forbedring af Kodefejlfinding og -optimering

Reflection 70B’s fejlkorrektions-evner gør den ideel til fejlfinding og optimering af kode:

Bruger: &quot;Fejlfind denne Python-kode...&quot;
Reflection 70B: &lt;thinking&gt; Analyserer trin for trin...&lt;/thinking&gt;
&lt;reflection&gt; Identificeret uendelig rekursion.&lt;/reflection&gt;
&lt;output&gt; Korrekt kodeversion med korrekt rekursion.&lt;/output&gt;

Udvidelse af det Konkurrerende Landskab for 70B-modeller

Mens Reflection 70B skaber bølger, er det en del af et bredere økosystem af 70 milliarder parameter-modeller. Her er, hvordan det sammenlignes med andre:

  • Meta’s Llama 3.1-70B: Stærk grundmodel kendt for generelle formål.
  • Claude 2 70B (Anthropic): Etisk AI-fokuseret, dygtig til resonnering og lang-form-indholdsgenerering.
  • GPT-3.5 70B (OpenAI): En lettere version af GPT-4, der excellerer i præstations-til-effektivitetsbalance.
  • BLOOM 70B: Multisproglig kraftværk trænet på naturlige og programmeringssprog.
  • Falcon 70B: Kendt for sin trænings- og inferens-effektivitet.

Kørsel af 70B-modeller Effektivt: Seneste Teknikker

Kørsel af modeller af denne størrelse effektivt er ingen lille opgave. For at maksimere præstation, her er de seneste strategier:

1. Kvantificering

Reduktion af modelvægtspræcision hjælper med at reducere hukommelsesbrug og inferenstider. 4-bit kvantificeringsteknikker med BitsAndBytes giver Reflection 70B mulighed for at køre effektivt på mindre GPU’er.

Eksempel:

from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-2-70b-hf", load_in_4bit=True)

2. Model Sharding

Opdeling af modellen på tværs af multiple GPU’er (f.eks. ved hjælp af DeepSpeed Zero) giver mulighed for at håndtere større modeller uden at overskride GPU-hukommelse.

from xformers.ops import memory_efficient_attention
model.attention = memory_efficient_attention

3. Blandet Præcision og Effektiv Opmerksomhed

FlashAttention og xformers reducerer opmærksomheds-overhead, og forbedrer behandlingstider for store input-sekvenser.

from xformers.ops import memory_efficient_attention
model.attention = memory_efficient_attention

4. CPU Offloading og Pruning

CPU Offloading og pruning af mindre kritiske vægte giver mulighed for at køre modeller på mere beskedne hardware, mens præstationen opretholdes.

from accelerate import cpu_offload
model = cpu_offload(model)

Udsigt Fremad: Fremtiden med Reflection 405B

Næste front for HyperWrite er udviklingen af Reflection 405B, en model, der forventes at overgå Reflection 70B i både størrelse og præstation. Denne model sigter mod at udvide grænserne for open-source AI, og positionere sig til at udfordre selv de mest avancerede proprietære modeller som GPT-5.

Konklusion

Med Reflection-Tuning har Reflection 70B opnået industriel førende præstation på nøgle-benchmarks, samtidig med at den opretholder en niveau af gennemsigtighed og nøjagtighed, der sjældent ses i open-source AI. Dens evne til selv-korrekture giver den en distinkt fordel, især i områder, der kræver høje niveauer af præcision, som kodning, sprogoversættelse og kompleks problem-løsning.

Jeg har brugt de sidste fem år på at dykke ned i den fascinerende verden af Machine Learning og Deep Learning. Min passion og ekspertise har ført mig til at bidrage til over 50 forskellige software-ingeniørprojekter, med en særlig fokus på AI/ML. Min fortsatte nysgerrighed har også ført mig mod Natural Language Processing, et felt jeg er ivrig efter at udforske yderligere.