AI-modeller og plattformer
Reflection 70B: LLM med selvkorrektur og ledende ytelse

Reflection 70B er en åpen kildekode stor språkmodell (LLM) utviklet av HyperWrite. Denne nye modellen introduserer en tilnærming til AI-kognisjon som kan endre hvordan vi samhandler med og avhenger av AI-systemer i mange felt, fra språkbehandling til avansert problemløsing.
Med Reflection-Tuning, en banebrytende teknikk som tillater modellen å selv-vurdere og korrigere sine egne feil i sanntid, har Reflection 70B raskt steget til topps, og overgått proprietære modeller som GPT-4 og Claude 3.5 Sonnet over flere benchmark, inkludert MMLU, MATH og HumanEval.
Reflection 70B er bygget på den robuste Llama 3.1-70B-arkitekturen, men dens selv-tilpasningsmekanisme skiller den fra andre. Gjennom iterative sykluser av refleksjon, feiloppsporing og utgangsforbedring, etterligner modellen menneskelig kognisjon på en utenkelig måte, og presses grensene for hva AI kan oppnå. Som resultat tilbyr Reflection 70B ikke bare ubestridt nøyaktighet, men også dypere innsikt i dens beslutningsprosess, en kritisk funksjon for applikasjoner hvor gjennomsiktighet og presisjon er avgjørende.
Hva er Reflection 70B
I kjernen er Reflection 70B bygget på Meta’s åpen kildekode Llama 3.1-70B Instruct-modell. Men det som virkelig skiller den fra andre, er dens unike evne til å engasjere i en prosess lik menneskelig refleksjon – derav navnet. Denne evnen stammer fra en teknikk kalt “Reflection-Tuning“, som gjør det mulig for modellen å identifisere og rette opp sine egne feil i sanntid, og forbedre nøyaktigheten og påliteligheten.
Matt Shumer, CEO av HyperWrite, introduserte Reflection 70B med det dristige kravet at det er “verdens beste åpen kildekode AI-modell.” Men hva gjør denne modellen så spesiell, og hvordan sammenlignes den med industri-giganter som GPT-4 og Claude 3.5 Sonnet? La oss utforske.
Forstå Selective Reflection-Tuning: En paradigmeskift i AI-trening
Selektiv Reflection-Tuning introduserer en tilnærming til instruksjonstuning, hvor målet er å forbedre både kvaliteten på instruksjonsdata og dens kompatibilitet med studentmodellen som finjusteres. Tradisjonelle metoder fokuserer ofte på å forbedre dataene selv, men overseer hvordan de forbedrede dataene parer seg med modellens læringsmål. Selektiv Reflection-Tuning brogger denne gapen ved å fremme en lærer-elev-samarbeid, hvor en lærermodell reflekterer over dataene og gir forbedrede instruksjons-svar-par, mens elevmodellen vurderer og velger ut kun de forbedringene som best passer med dens treningbehov.
Prosessen består av to nøkkel-faser:
- Selektiv instruksjonsrefleksjon: Lærermodellen reflekterer over instruksjonen til en gitt eksempel og genererer et forbedret instruksjons-svar-par. Elevmodellen vurderer deretter om denne nye instruksjonen er nyttig basert på en metode kalt Instruksjonsfølgingssvårighet (IFD). IFD-poengsummen vurderer vanskelighetsgraden til eksemplet for elevmodellen, og sikrer at kun data som utfordrer modellen på en passende måte, behandles.
- Selektiv svar-refleksjon: I denne fasen reflekterer lærermodellen over svarene generert i den første fasen. Elevmodellen vurderer disse svarene ved hjelp av Reversert Instruksjonsfølgingssvårighet (r-IFD), en metode som måler hvor mulig det er for elevmodellen å dedusere instruksjonen basert på svaret. Dette sikrer at svaret ikke bare forbedrer modellens resonnering, men også passer godt med elevens eksisterende kunnskap.
Ved å anvende både IFD og r-IFD, produserer Selektiv Reflection-Tuning data-par som er utfordrende, men mulige, og forbedrer instruksjons-tuning-prosessen uten å behøve ekstra datasett. Resultatet er en mer prøve-effektiv og høy-ytende LLM som overgår mange større modeller.
Tankenets arkitektur: Hvordan Reflection 70B “tenker”
Reflection 70B’s underliggende arkitektur tar AI-resonnering til et nytt nivå ved å dele tenketanken i flere faser. Hver fase tillater modellen å forbedre seg selv gjennom selv-refleksjon, lik menneskelig kognisjon:
- Initial data og svar: Modellen starter med å generere et svar til den gitt instruksjonen. Dette innledende utgangspunkt er likt standard LLM-utgangspunkter.
- Selektiv instruksjonsrefleksjon: Etter å ha generert det innledende svaret, går modellen inn i instruksjonsrefleksjonsfasen. Lærermodellen reflekterer over den opprinnelige instruksjonen og foreslår forbedringer. Disse forslagene vurderes deretter av elevmodellen ved hjelp av IFD-poengsummen for å bestemme om det nye instruksjons-svar-paret er mer egnet for videre finjustering.
- Selektiv svar-refleksjon: Etter refleksjon over instruksjonen, går modellen videre til å forbedre svaret selv. Her genererer lærermodellen et nytt svar basert på den oppdaterte instruksjonen. Elevmodellen, ved hjelp av r-IFD-poengsummen, vurderer om det nye svaret hjelper til å dedusere instruksjonen mer effektivt.
- Final instruksjonsfinjustering: Når det beste instruksjons-svar-paret er valgt, legges det til i det endelige datasett som brukes til å finjustere modellen. Denne fler-fase-prosessen sikrer at kun de mest effektive og sammenhengende instruksjons-svar-par inkluderes i finjusteringsdataene.
Denne strukturerte refleksjonsprosessen tillater brukerne å se hvordan modellen itererer gjennom sin tenkeprosess, og skaper gjennomsiktighet og forbedrer nøyaktighet og konsistens i komplekse oppgaver.
Benchmarking glans: Reflection 70B i aksjon
Reflection 70B’s bruk av Selektiv Reflection-Tuning tilbyr ikke bare en mer sofistikert treningprosess, men også en ledende ytelse over flere benchmark. Gjennom sin iterative selv-vurderingsmekanisme overgår modellen proprietære modeller som er betydelig større i størrelse.
- MMLU (Massive Multitask Language Understanding): Reflection 70B scoret et imponerende 72,2%, og overgikk andre store åpen kildekode-modeller som LLaMA 2.
- Matematisk benchmark: I matematisk resonneringstasks overgikk modellen GPT-4 og Claude 3.5 med en betydelig margin, og viste sin styrke i å håndtere komplekse problemløsningsscenarier.
- IFEval og GSM8K: Reflection 70B gjorde det også bra i IFEval, hvor dens instruksjons-svar-kohesjon ble evaluert, og i GSM8K, en matematisk problemløsning-benchmark. Den selv-reflecterende finjusteringen tillot modellen å håndtere intrikate og nyanserte problemer mer effektivt enn sine større konkurrenter.
Ved å bruke Selektiv Reflection-Tuning, viste Reflection 70B at størrelse ikke er den eneste faktoren i å oppnå høy ytelse. Evnen til å selv-korrige og reflektere over utgangspunktene ledet til sterkere, mer sammenhengende resonnering, og gjorde det mulig for modellen å overgå modeller med flere parametre.
Reelle verden-applikasjoner: Utnytting Reflection 70B’s potensiale
Reflection 70B’s sanntids-feil-korreksjon og gjennomsiktige beslutningsprosess åpner nye dører over forskjellige felt. Under er noen reelle verden-applikasjoner:
Komplekse problemløsning
Reflection 70B’s styrke ligger i å håndtere komplekse problemer. Overveur en utfordrende matematisk spørsmål:
<p>Bruker: "Løs ligningen: 2x^2 + 5x - 3 = 0" Reflection 70B:</p> <p><thinking> Bruker den kvadratiske formelen...</thinking> <reflection> En korreksjon i beregningen...</reflection> <output> Løsningene er x = 1/2 og x = -3.</output>
Språk-oversettelse med kulturell sensitivitet
I motsetning til typiske oversettelsesmodeller, tilpasser Reflection 70B språk-oversettelser til kulturelle kontekster:
Bruker: "Oversett 'It's raining cats and dogs' til fransk, med kulturell kontekst." Reflection 70B: <p>thinking: Den bokstavelige oversettelsen ville være "Il pleut des chats et des chiens"...thinking; reflection: En kulturelt passende oversettelse ville være "Il pleut des cordes."reflection; output: Oversettelse levert.
Forbedring av kode-feilsøking og -optimering
Reflection 70B’s feil-korreksjons-evner gjør den ideell for feilsøking og optimering av kode:
Bruker: "Feilsøk denne Python-koden..." Reflection 70B: <thinking> Analyserer trinnvis...</thinking> <reflection> Identifisert uendelig rekursjon.</reflection> <output> Korrigert kodeversjon med riktig rekursjon.</output>
Utvidelse av den konkurranse-drevne landskapet for 70B-modeller
Mens Reflection 70B skaper bølger, er den del av et større økosystem av 70 milliarder parameter-modeller. Her er hvordan den sammenlignes med andre:
- Meta’s Llama 3.1-70B: Sterk grunnmodell kjent for generelle formål-applikasjoner.
- Claude 2 70B (Anthropic): Etisk AI-fokusert, dyktig i resonnering og lang-form-innholdsgenerering.
- GPT-3.5 70B (OpenAI): En letter versjon av GPT-4, som excellerer i ytelse-til-effisiens-balansen.
- BLOOM 70B: Flerspråklig kraftpakke trent på naturlige og programmeringsspråk.
- Falcon 70B: Merket for sin trening- og inferens-effisiens.
Kjør 70B-modeller effektivt: Siste teknikker
Kjøring av modeller av denne størrelsen effektivt er ingen liten oppgave. For å maksimere ytelse, her er de siste strategiene:
1. Kvantifisering
Redusering av modell-vekt-presisjon hjelper med å senke minnebruk og inferenstid. 4-bit kvantifisering-teknikker med BitsAndBytes tillater Reflection 70B å kjøre effektivt på mindre GPU-er.
Eksempel:
from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-2-70b-hf", load_in_4bit=True)
2. Modell-delning
Splitt modellen over flere GPU-er (f.eks. ved hjelp av DeepSpeed Zero) tillater håndtering av større modeller uten å overskride GPU-minne.
from xformers.ops import memory_efficient_attention model.attention = memory_efficient_attention
3. Blandet presisjon og effektiv oppmerksomhet
FlashAttention og xformers reduserer oppmerksomhets-overhead, og forbedrer prosesseringstid for store inndata-sekvenser.
from xformers.ops import memory_efficient_attention model.attention = memory_efficient_attention
4. CPU-avlasting og beskjæring
CPU-avlasting og beskjæring av mindre kritiske vekter hjelper med å kjøre modeller på mer beskjedne maskinvare mens man beholder ytelse.
from accelerate import cpu_offload model = cpu_offload(model)
Se fremover: Fremtiden med Reflection 405B
Neste grense for HyperWrite er utviklingen av Reflection 405B, en modell som forventes å overgå Reflection 70B i både skala og ytelse. Denne modellen har som mål å presse grensene for åpen kildekode AI, og plassere seg selv til å utfordre selv de mest avanserte proprietære modellene som GPT-5.














