AI-modeller och plattformar

Reflection 70B: LLM med självrättande kognition och ledande prestanda

mm
Lägg till Unite.AI bland dina föredragna källor på Google
Reflection 70B, large language models, AI self-correction, Reflection-Tuning, open-source AI, HyperWrite

Reflection 70B är en öppen källkodsstor språkmodell (LLM) utvecklad av HyperWrite. Denna nya modell introducerar en tillvägagångssätt för AI-kognition som kan omdefiniera hur vi interagerar med och förlitar oss på AI-system inom många områden, från språkbehandling till avancerat problemlösning.

Genom att utnyttja Reflection-Tuning, en banbrytande teknik som tillåter modellen att självbedöma och korrigera sina egna misstag i realtid, har Reflection 70B snabbt stigit till toppen och överträffat proprietära modeller som GPT-4 och Claude 3.5 Sonnet över flera benchmark, inklusive MMLU, MATH och HumanEval.

Reflection 70B är byggd på den robusta Llama 3.1-70B-arkitekturen, men dess självkorrektionsmekanism särskiljer den. Genom iterativa cykler av reflektion, felupptäckt och utmatningsförbättring, imiterar modellen mänsklig kognition på ett tidigare osedd sätt, vilket flyttar gränserna för vad AI kan uppnå. Som ett resultat erbjuder Reflection 70B inte bara obesegrade noggrannhet utan också djupare insikt i dess beslutsprocess, en kritisk funktion för tillämpningar där transparens och precision är av yttersta vikt.

Vad är Reflection 70B

I sin kärna är Reflection 70B byggd på Metas öppna Llama 3.1-70B Instruct-modell. Men vad som verkligen särskiljer den är dess unika förmåga att engagera sig i en process som liknar mänsklig reflektion – därav dess namn. Denna förmåga härrör från en teknik som kallas “Reflection-Tuning“, som möjliggör för modellen att identifiera och rätta till sina egna fel i realtid, vilket förbättrar dess noggrannhet och tillförlitlighet.

Matt Shumer, VD för HyperWrite, introducerade Reflection 70B med det djärva påståendet att det är “världens bästa öppna källkods-AI-modell.” Men vad är det som gör denna modell så speciell, och hur står den sig mot branschjättar som GPT-4 och Claude 3.5 Sonnet? Låt oss utforska.

Förstå Selektiv Reflection-Tuning: En Paradigmskift i AI-träning

Selektiv Reflection-Tuning introducerar ett tillvägagångssätt för instruktionsfinjustering, där målet är att förbättra både instruktionsdatakvalitet och dess kompatibilitet med studentmodellen som finjusteras. Traditionella metoder fokuserar ofta på att förbättra data i sig, men försummar hur väl de förbättrade dataparen stämmer överens med modellens inlärningsmål. Selektiv Reflection-Tuning brottar detta gap genom att främja en lärar-elev-samarbete, där en lärarmodell reflekterar över data och tillhandahåller raffinerade instruktions-svarpar, medan studentmodellen utvärderar och väljer endast de förbättringar som bäst passar dess utbildningsbehov.

Selektiv Reflection-Tuning-metod, som visar samarbetet mellan en lärarmodell och en studentmodell

Processen består av två nyckelfaser:

  1. Selektiv Instruktionsreflektion: Lärarmodellen reflekterar över instruktionen för ett visst exempel och genererar ett raffinerat instruktions-svarpar. Studentmodellen utvärderar sedan om denna nya instruktion är fördelaktig baserat på en metric som kallas Instruktionsföljande Svårighetsgrad (IFD). IFD-poängen bedömer svårighetsgraden för exemplet för studentmodellen, vilket säkerställer att endast data som utmanar modellen på lämpligt sätt behålls.
  2. Selektiv Svarsreflektion: I denna fas reflekterar lärarmodellen över svaren som genererades i den första fasen. Studentmodellen utvärderar dessa svar med hjälp av Omvd Instruktionsföljande Svårighetsgrad (r-IFD), en metric som mäter hur möjligt det är för studenten att dra slutsatsen baserat på svaret. Detta säkerställer att svaret inte bara förbättrar modellens resonemang utan också stämmer väl överens med studentens befintliga kunskap.

Genom att tillämpa både IFD och r-IFD producerar Selektiv Reflection-Tuning datapar som är utmanande men genomförbara, vilket förbättrar instruktionsfinjusteringsprocessen utan behov av ytterligare datamängder. Resultatet är en mer exempel-effektiv och högpresterande LLM som överträffar många större modeller.

Tankens Arkitektur: Hur Reflection 70B “tänker”

Reflection 70B:s underliggande arkitektur tar AI-resonemang till en ny nivå genom att dela upp tänkprocessen i flera stadier. Varje stadium tillåter modellen att förbättras iterativt genom självreflektion, liknande mänsklig kognition:

  1. Initial Data och Svar: Modellen börjar med att generera ett svar på den givna instruktionen. Detta initiala utmatning är liknande standard LLM-utmatning.
  2. Selektiv Instruktionsreflektion: Efter att ha genererat det initiala svaret går modellen in i instruktionsreflektionsfasen. Lärarmodellen reflekterar över den ursprungliga instruktionen och föreslår förbättringar. Dessa förslag utvärderas sedan av studentmodellen med hjälp av IFD-poängen för att bestämma om det nya instruktions-svarparet är mer lämpligt för ytterligare finjustering.
  3. Selektiv Svarsreflektion: Efter reflektionen över instruktionen går modellen vidare för att förbättra svaret i sig. Här genererar lärarmodellen ett nytt svar baserat på den uppdaterade instruktionen. Studentmodellen, med hjälp av r-IFD-poängen, utvärderar om det nya svaret hjälper till att dra slutsatsen mer effektivt.
  4. Slutlig Instruktionsfinjustering: När det bästa instruktions-svarparet har valts läggs det till i den slutliga datamängden som används för att finjustera modellen. Denna flerstegsprocess säkerställer att endast de mest effektiva och sammanhängande instruktions-svarparen ingår i finjusteringsdata.

Denna strukturerade reflektion process tillåter användare att se hur modellen itererar genom sin tankeprocess, skapar transparens och förbättrar avsevärt noggrannhet och konsekvens i komplexa uppgifter.

Benchmarking Brilliance: Reflection 70B i Aktivitet

Reflection 70B:s användning av Selektiv Reflection-Tuning erbjuder inte bara en mer sofistikerad träningsprocess utan uppnår också branschledande prestanda över flera benchmark. Genom sin iterativa självbedömningsmekanism överträffar modellen proprietära modeller som är betydligt större i storlek.

  1. MMLU (Massiv Multitask Language Understanding): Reflection 70B uppnådde en imponerande 72,2%, överträffande andra stora öppna källkodsmodeller som LLaMA 2.
  2. Matematik Benchmark: I matematiska resonemangsuppgifter överträffade modellen GPT-4 och Claude 3.5 med en betydande marginal, visande sin styrka i att hantera komplexa problemlösnings-scenarier.
  3. IFEval och GSM8K: Reflection 70B utmärkte sig också i IFEval, där dess instruktions-svars-konsekvens utvärderades, och i GSM8K, en matematisk problemlösningsbenchmark. Den självreflekterande finjusteringen tillät modellen att hantera invecklade och nyanserade problem mer effektivt än dess större konkurrenter.

Genom att utnyttja Selektiv Reflection-Tuning visade Reflection 70B att storlek inte är den enda faktorn för att uppnå hög prestanda. Förmågan att självkorrigera och reflektera över dess utmatningar ledde till starkare, mer sammanhängande resonemang, vilket möjliggjorde för den att överträffa modeller med fler parametrar.

Diagram som jämför prestandan för sRecycled WizardLM 7B mot andra modeller som Zephyr 7B Beta, Vicuna 13B v1.3 och LLaMA2 Chat 7B. Diagrammet visar sRecycled WizardLM 7B:s starka prestanda, med en detaljerad nedbrytning av vinster, oavgjorda och förluster över olika modeller

sRecycled WizardLM 7B vs. Andra Modeller Prestandajämförelse

Verkliga Tillämpningar: Uttnyttjande av Reflection 70B:s Potential

Reflection 70B:s förmåga till realtidsfelkorrigering och transparent beslutsfattande öppnar nya dörrar inom olika områden. Här är några verkliga tillämpningar:

Komplex Problemlösning

Reflection 70B:s styrka ligger i att hantera komplexa problem. Överväg ett utmanande matematiskt problem:


<p>Användare: "Lös ekvationen: 2x^2 + 5x - 3 = 0"
Reflection 70B:</p>

<p>&lt;thinking&gt; Tillämpar den kvadratiska formeln...&lt;/thinking&gt;
&lt;reflection&gt; En korrektion i beräkningen...&lt;/reflection&gt;
&lt;output&gt; Lösningarna är x = 1/2 och x = -3.&lt;/output&gt;

SpråkÖversättning med Kulturell Känslighet

Till skillnad från vanliga översättningsmodeller anpassar Reflection 70B språköversättningar till kulturella sammanhang:

Användare: "Översätt 'It's raining cats and dogs' till franska, med hänsyn till kulturell kontext."
Reflection 70B:

<p>thinking: Den bokstavliga översättningen skulle vara "Il pleut des chats et des chiens"...thinking;
reflection: En kulturellt lämplig översättning skulle vara "Il pleut des cordes."reflection;
output: Översättning tillhandahållen.

Förbättring av Kodfelsökning och Optimering

Reflection 70B:s felkorrektionsförmåga gör den idealisk för felsökning och optimering av kod:

Användare: "Felsök denna Python-kod..."
Reflection 70B: &lt;thinking&gt; Analyserar steg för steg...&lt;/thinking&gt;
&lt;reflection&gt; Identifierade oändlig rekursion.&lt;/reflection&gt;
&lt;output&gt; Korrekt kodversion med korrekt rekursion.&lt;/output&gt;

Utvidgning av den konkurrensutsatta Landskapet för 70B-Modeller

Medan Reflection 70B skapar rubriker är den en del av en större ekosystem av 70 miljarders parametrar-modeller. Här är hur den jämför med andra:

  • Metas Llama 3.1-70B: Stark grundmodell känd för allmänna tillämpningar.
  • Claude 2 70B (Anthropic): Etisk AI-fokuserad, skicklig på resonemang och långformigt innehållsskapande.
  • GPT-3.5 70B (OpenAI): En lättare version av GPT-4, utmärkande sig i prestanda-till-effektivitetsbalans.
  • BLOOM 70B: Flerspråkig kraftverk tränad på naturliga och programmeringsspråk.
  • Falcon 70B: Noterad för sin tränings- och inferens-effektivitet.

Körning av 70B-Modeller Effektivt: Senaste Tekniker

Att köra modeller av denna storlek effektivt är ingen liten uppgift. För att maximera prestanda, här är de senaste strategierna:

1. Kvantisering

Att minska modellens viktsprecision hjälper till att sänka minnesanvändning och inferenstider. 4-bitars kvantisering tekniker med BitsAndBytes tillåter Reflection 70B att köras effektivt på mindre GPU:er.

Exempel:

from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-2-70b-hf", load_in_4bit=True)

2. Modelluppdelning

Att dela upp modellen över flera GPU:er (t.ex. med DeepSpeed Zero) tillåter hantering av större modeller utan att överskrida GPU-minne.

from xformers.ops import memory_efficient_attention
model.attention = memory_efficient_attention

3. Blandad Precision och Effektiv Uppmärksamhet

FlashAttention och xformers minskar uppmärksamhetsbelastningen, vilket förbättrar bearbetningstider för stora inmatningssekvenser.

from xformers.ops import memory_efficient_attention
model.attention = memory_efficient_attention

4. CPU-Offloading och Borttagning

CPU-Offloading och borttagning av mindre kritiska vikter hjälper till att köra modeller på mer modest hårdvara samtidigt som prestandan behålls.

from accelerate import cpu_offload
model = cpu_offload(model)

Blickar Framåt: Framtiden med Reflection 405B

Nästa front för HyperWrite är utvecklingen av Reflection 405B, en modell som förväntas överträffa Reflection 70B i både skala och prestanda. Denna modell syftar till att flytta gränserna för öppen källkods-AI, positionerar sig för att utmana till och med de mest avancerade proprietära modellerna som GPT-5.

Slutsats

Genom Reflection-Tuning har Reflection 70B uppnått branschledande prestanda i viktiga benchmark, allt medan den upprätthåller en nivå av transparens och noggrannhet som sällan ses i öppen källkods-AI. Dess förmåga att självkorrigera ger den en distinkt fördel, särskilt inom områden som kräver höga nivåer av precision, som kodning, språköversättning och komplex problemlösning.

Jag har tillbringat de senaste fem åren med att dyka djupt in i den fascinerande världen av Maskinlärning och Djupinlärning. Min passion och expertis har lett mig till att bidra till över 50 olika mjukvaruprojekt, med särskild fokus på AI/ML. Min pågående nyfikenhet har också lett mig mot Naturlig Språkbehandling, ett område som jag är angelägen om att utforska vidare.