AI-modeller og plattformer

Snowflake Arctic: En revolusjonerende LLM for bedrifts-AI

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
div]:bg-bg-300 [&_pre]:-mr-4 md:[&_pre]:-mr-9″>

Bedrifter utforsker i økende grad måter å utnytte store språkmodeller (LLM) for å øke produktiviteten og skape intelligente applikasjoner. Imidlertid er mange av de tilgjengelige LLM-tilbudene generiske modeller som ikke er tilpasset spesialiserte bedriftsbehov som dataanalyse, kode og oppgaveautomatisering. Enter Snowflake Arctic – en revolusjonerende LLM som er spesifikt designet og optimalisert for kjernebedriftsbruk.

Utviklet av Snowflakes AI-forskningsgruppe, Arctic utvider grensene for hva som er mulig med effektiv trening, kostnadseffektivitet og et utenfor sammenligning åpent nivå. Denne revolusjonerende modellen utmerker seg på nøkkelbedriftsbenchmarks mens den krever langt mindre beregningskraft sammenlignet med eksisterende LLM-er. La oss dykke ned i hva som gjør Arctic til en spillendrer for bedrifts-AI.

Bedriftsintelligens omdefinert I kjernen er Arctic laserfokusert på å levere eksepsjonell ytelse på metrikker som virkelig betyr noe for bedrifter – kode, SQL-spørring, kompleks instruksjonsfølging og produksjon av grunnede, faktabaserte utdata. Snowflake har kombinerert disse kritiske evnene i en ny “bedriftsintelligens“-metrikk.

Resultatene taler for seg selv. Arctic møter eller overgår modeller som LLAMA 7B og LLAMA 70B på bedriftsintelligensbenchmarks mens den bruker mindre enn halvparten av beregningsbudgettet for trening. Merkelig nok, til tross for å bruke 17 ganger færre beregningsressurser enn LLAMA 70B, oppnår Arctic likhet på spesialiserte tester som kode (HumanEval+, MBPP+), SQL-generering (Spider) og instruksjonsfølging (IFEval).

Men Arctics dyktighet går langt utenfor å bare bestå bedriftsbenchmarks. Den opprettholder sterk ytelse på generell språkforståelse, resonnering og matematisk evne sammenlignet med modeller trent med eksponentielt høyere beregningsbudgetter som DBRX. Denne holistiske evnen gjør Arctic til et ubestridt valg for å takle de mangfoldige AI-behovene til en bedrift.

Innovasjonen

Dense-MoE Hybrid Transformer Hvordan bygde Snowflakes team en så usedvanlig dyktig og effektiv LLM? Svaret ligger i Arctics revolusjonerende Dense Mixture-of-Experts (MoE) Hybrid Transformer-arkitektur.

Tradisjonelle tetthets-transformator-modeller blir stadig mer kostbare å trene når størrelsen øker, med beregningskrav som øker lineært. MoE-designet hjelper med å omgå dette ved å bruke flere parallele feed-forward-nettverk (eksperter) og bare aktivere en undergruppe for hver inndata-token.

Men å bare bruke en MoE-arkitektur er ikke nok – Arctic kombinerer styrkene til både tetthets- og MoE-komponenter på en genial måte. Den parer en 10 milliarder parameter tetthets-transformator-encoder med en 128-ekspert residual MoE multi-lag perceptron (MLP)-lag. Denne tetthets-MoE-hybridmodellen totalt 480 milliarder parametre, men bare 17 milliarder er aktive på et gitt tidspunkt ved å bruke top-2-gating.

Konsekvensene er dyptgående – Arctic oppnår utenfor sammenligning modellkvalitet og kapasitet samtidig som den forblir merkelig beregnings-effektiv under trening og inferens. For eksempel har Arctic 50% færre aktive parametre enn modeller som DBRX under inferens.

Men modellarkitektur er bare en del av historien. Arctics fremragende er kulminasjonen av flere banebrytende tekniker og innsikter utviklet av Snowflakes forskningsgruppe:

  1. Bedrifts-fokusert treningdata-kurriculum Gjennom omfattende eksperimentering, oppdaget teamet at generiske ferdigheter som sunn fornuft burde læres tidlig, mens mer komplekse spesialiseringer som kode og SQL er best tilegnet senere i treningsprosessen. Arctics data-kurriculum følger en tre-stegs-tilnærming som ligner menneskelig læringsfrekvens.

De første teratokene fokuserer på å bygge en bred generell base. De neste 1,5 teratokene konsentrerer seg om å utvikle bedriftsferdigheter gjennom data tilpasset SQL, kodeoppgaver og mer. De siste teratokene refinerer Arctics spesialiseringer ved å bruke raffinerte datasamlinger.

  1. Optimale arkitekturvalg Mens MoE-er lover bedre kvalitet per beregning, er det å velge riktige konfigurasjoner avgjørende, men dårlig forstått. Gjennom detaljert forskning, landet Snowflake på en arkitektur som anvender 128 eksperter med top-2-gating hver lag etter å ha evaluert kvalitet-effektivitet-forhandlinger.

Å øke antallet eksperter gir flere kombinasjoner, og forbedrer modellkapasiteten. Imidlertid øker dette også kommunikasjonskostnadene, så Snowflake landet på 128 nøye designet “kondenserte” eksperter aktiverer via top-2-gating som det optimale balansen.

  1. System-sammen-designing Men selv en optimal modellarkitektur kan undermineres av system-bottlenecks. Så Snowflakes team innoverte her også – sam-designet modellarkitekturen hånd-i-hånd med de underliggende trenings- og inferens-systemene.

For effektiv trening ble de tetthets- og MoE-komponentene strukturert for å muliggjøre overlappende kommunikasjon og beregning, skjulte betydelige kommunikasjons-overhodene. På inferens-siden, utnyttet teamet NVIDIAs innovasjoner for å muliggjøre høyt effektive utrullinger til tross for Arctics skala.

Teknikker som FP8-kvantifisering tillater å plassere hele modellen på en enkelt GPU-node for interaktiv inferens. Større batcher engasjerer Arctics parallellkapasiteter på flere noder samtidig som de forblir imponerende beregnings-effektive takket være deres kompakte 17B aktive parametre.

Med en Apache 2.0-lisens, er Arctics vekter og kode tilgjengelig uten portforbud for enhver personlig, forsknings- eller kommersiell bruk. Men Snowflake har gått langt videre, åpnet kilden for deres komplette data-resepter, modell-implementeringer, tips og de dype forskningsinnsiktene som driver Arctic.

Arctic Cookbook” er en omfattende kunnskapsbase som dekker hver eneste aspekt av å bygge og optimalisere en stor MoE-modell som Arctic. Den destillerer nøkkel-lærdommer på tvers av data-kilder, modell-arkitektur-design, system-sammen-design, optimaliserte trenings-/inferens-scheme og mer.

Fra å identifisere optimale data-kurriculum til å arkitektere MoE-er samtidig som kompilatorer, planleggere og maskinvare sam-optimiseres – denne omfattende kunnskapsbasen demokratiserer ferdigheter tidligere begrenset til elite-AI-laboratorier. Arctic Cookbook akselererer læringskurver og befaler bedrifter, forskere og utviklere globalt til å skape deres egne kostnadseffektive, tilpassede LLM-er for nesten enhver brukstilfelle.

Komme i gang med Arctic

For bedrifter som ønsker å utnytte Arctic, tilbyr Snowflake flere veier for å komme i gang raskt:

Serverless Inferens: Snowflake-kunder kan få tilgang til Arctic-modellen gratis på Snowflake Cortex, selskapets fullstendig ledet AI-plattform. Forbi det, er Arctic tilgjengelig på alle større modell-kataloger som AWS, Microsoft Azure, NVIDIA (NVDA ) og mer.

Start fra Scratch: De åpne kilde-modell-vektorene og -implementeringene tillater utviklere å integrere Arctic direkte i deres apper og tjenester. Arctic-repoen tilbyr kode-eksempler, utrullings-tutorier, finjusterings-resepter og mer.

Bygg Tilpassede Modeller: Takket være Arctic Cookbooks uttømmelige guider, kan utviklere bygge deres egne tilpassede MoE-modeller fra scratch optimalisert for enhver spesialisert brukstilfelle ved å bruke lærdommer fra Arctics utvikling.

En ny æra av åpen bedrifts-AI Arctic er mer enn bare en annen kraftig språkmodell – den innleder en ny æra av åpen, kostnadseffektiv og spesialisert AI-kapasitet designet for bedrifter.

Fra å revolusjonere data-analyse og kode-produktivitet til å drive oppgave-automatisering og smartere applikasjoner, gjør Arctics bedrifts-først-DNA den til et ubestridt valg over generiske LLM-er. Og ved å åpne kildekoden ikke bare modellen, men hele FoU-prosessen bak den, fremmer Snowflake en kultur av samarbeid som vil heve hele AI-økosystemet.

Etterhvert som bedrifter stadig mer omfavner generativ AI, tilbyr Arctic en dristig blåkopi for å utvikle modeller som er objektivt overlegne for produksjonsarbeid og bedriftsmiljøer. Dens sammenstøt av banebrytende forskning, ubestridt effektivitet og et fast åpent etos setter en ny standard for å demokratisere AI-s potensielle transformasjon.

Her er en seksjon med kode-eksempler på hvordan du kan bruke Snowflake Arctic-modellen:

Hånd-i-hånd med Arctic

Nå som vi har dekket hva som gjør Arctic virkelig banebrytende, la oss dykke ned i hvordan utviklere og data-vitenskapsmenn kan begynne å bruke denne kraftige modellen.
Utenfor boksen er Arctic tilgjengelig forhåndstrengt og klar til utrulling gjennom større modell-hubber som Hugging Face og partner-AI-plattformer. Men dens sanne kraft kommer frem når den tilpasses og finjusteres for dine spesifikke brukstilfeller.

Arctics Apache 2.0-lisens gir full frihet til å integrere den i dine apper, tjenester eller tilpassede AI-arbeidsflyter. La oss gå gjennom noen kode-eksempler som bruker transformers-biblioteket for å komme i gang:

Grunnleggende Inferens med Arctic

For rask tekst-generering-brukstilfeller, kan vi laste Arctic og kjøre grunnleggende inferens svært enkelt:


<p>from transformers import AutoTokenizer, AutoModelForCausalLM</p>

<p># Last tokenizer og modell
tokenizer = AutoTokenizer.from_pretrained("Snowflake/snowflake-arctic-instruct")
model = AutoModelForCausalLM.from_pretrained("Snowflake/snowflake-arctic-instruct")</p>

<p># Opprett en enkel inndata og generer tekst
input_text = "Her er et grundig spørsmål: Hva er hovedstaden i Frankrike?"
input_ids = tokenizer.encode(input_text, return_tensors="pt")</p>

<p># Generer respons med Arctic
output = model.generate(input_ids, max_length=150, do_sample=True, top_k=50, top_p=0.95, num_return_sequences=1)
generated_text = tokenizer.decode(output[0], skip_special_tokens=True)</p>

print(generated_text)

Dette burde utskrive noe som:

“Hovedstaden i Frankrike er Paris. Paris er den største byen i Frankrike og landets økonomiske, politiske og kulturelle senter. Det er hjem til berømte landemerker som Eiffel-tårnet, Louvre-museet og Notre-Dame-katedralen.”

Som du kan se, forstår Arctic søknaden og gir en detaljert, grunnlagt respons som utnytter dens robuste språkforståelsesevner.

Finjustering for spesialiserte oppgaver

Selv om den er imponerende utenfor boksen, skinner Arctic virkelig når den tilpasses og finjusteres på dine egne datasamlinger for spesialiserte oppgaver. Snowflake har gitt omfattende resepter som dekker:

  • Kuratering av høykvalitets treningdata tilpasset ditt brukstilfelle
  • Implementering av tilpassede multi-stegs-trening-kurriculum
  • Utnytting av effektive LoRA, P-Tuning eller FactorizedFusion finjusterings-tilnærminger
  • Optimaliseringer for å skille SQL, kode eller andre nøkkel-bedriftsferdigheter

Her er et eksempel på hvordan du kan finjustere Arctic på dine egne kode-datasamlinger ved å bruke LoRA og Snowflakes resepter:


<p>from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import LoraConfig, get_peft_model, prepare_model_for_int8_training</p>

<p># Last base Arctic-modell
tokenizer = AutoTokenizer.from_pretrained("Snowflake/snowflake-arctic-instruct")
model = AutoModelForCausalLM.from_pretrained("Snowflake/snowflake-arctic-instruct", load_in_8bit=True)</p>

<p># Initialiser LoRA-konfigurasjoner
lora_config = LoraConfig(
r=8,
lora_alpha=16,
target_modules=["query_key_value"],
lora_dropout=0.05,
bias="none",
task_type="CAUSAL_LM"
)</p>

<p># Forbered modell for LoRA-finjustering
model = prepare_model_for_int8_training(model)
model = get_peft_model(model, lora_config)</p>

<p># Dine kode-datasamlinger
data = load_coding_datasets()</p>

<p># Finjuster med Snowflakes resepter
train(model, data, ...)</p>

Dette kode-eksempelet illustrerer hvordan du kan laste Arctic, initialisere en LoRA-konfigurasjon tilpasset kode-generering og deretter finjustere modellen på dine egne kode-datasamlinger ved å bruke Snowflakes veiledning.

Tilpasset og finjustert, blir Arctic en privat kraft som leverer ubestridt ytelse på dine kjerne-bedrifts-arbeidsflyter og stakeholder-behov.

Arctics raske innovasjons-syklus

En av de mest imponerende aspektene ved Arctic er den brå pace som Snowflakes AI-forskningsgruppe konseptualiserte, utviklet og slapp denne revolusjonerende modellen til verden. Fra opphav til åpne kilde-utgivelse, tok hele Arctic-prosjektet mindre enn tre måneder og utnyttet bare om lag en åttendel av beregningsbudgettet typisk for å trene lignende store språkmodeller.

Denne evnen til å raskt iterere, innovere og produktisere banebrytende AI-forskning er virkelig bemerkelsesverdig. Den demonstrerer Snowflakes dype tekniske evner og posisjonerer selskapet til å kontinuerlig drive grensene for å utvikle nye, bedrifts-optimerte AI-kapasiteter.

Arctic-familien og innlejring

Arctic er bare begynnelsen på Snowflakes ambisjoner i bedrifts-LLM-rommet. Selskapet har allerede åpnet kildekoden for Snowflake Arctic Embed-familien av bransje-ledende tekst-innlejnings-modeller optimalisert for innhenting-ytelse på tvers av flere størrelse-profiler.

Som vist nedenfor, oppnår Arctic Embed-modellene stat-of-the-art innhenting-nøyaktighet på den respekterte MTEB (tekst-innhenting)-benchmark, overgående andre ledende innlejnings-modeller inkludert lukkede tilbud fra større teknologiselskaper.

[Insert bilde som viser MTEB-innhenting-benchmark-resultater for Arctic Embed-modeller]

Disse innlejnings-modellene komplementerer Arctic LLM og muliggjør bedrifter å bygge kraftfulle spørsmål-svar og innhenting-forsterket genereringsløsninger fra en integrert åpen kilde-stakk.

Men Snowflakes veikart går langt utenfor bare Arctic og innlejring. Selskapets AI-forskere arbeider hardt med å utvide Arctic-familien med nye modeller tilpasset multi-modale oppgaver, tale, video og mer frontier-kapasiteter – alle bygget ved å bruke samme prinsipper som spesialisering, effektivitet og åpenhet.

Samarbeid for åpne AI-økosystem Snowflake forstår at å realisere det fulle potensialet av åpen, bedrifts-grad AI krever å dyrke et rikt økosystem av samarbeid på tvers av AI-samfunnet. Arctics utgivelse har allerede galvanisert samarbeid med større plattformer og leverandører:

NVIDIA har tett samarbeidet med Snowflake for å optimere Arctic for effektiv utrulling ved å bruke NVIDIAs banebrytende AI-inferens-stakk inkludert TensorRT, Triton og mer. Dette tillater bedrifter å betjene Arctic i skala kostnadseffektivt.

Hugging Face, den ledende åpne kilde-modell-hubben, har ønsket Arctic velkommen i sine biblioteker og modell-repositorier. Dette tillater sømløs integrering av Arctic i eksisterende Hugging Face-baserte AI-arbeidsflyter og applikasjoner.

Plattformer som Replicate, SageMaker og mer har flyttet raskt for å tilby vertede demonstrasjoner, API-er og flytende integreringsveier for Arctic, akselererende dens adopsjon.

Åpne kilde-styrte utviklingen av Arctic, og åpne økosystemer forblir sentrale for dens evolusjon. Snowflake er dedikert til å fremme rikt samarbeid med forskere, utviklere, partnere og bedrifter globalt for å drive grensene for hva som er mulig med åpen, spesialisert AI-modeller.

Akselererende dens adopsjon. Åpne kilde-styrte utviklingen av Arctic, og åpne økosystemer forblir sentrale for dens evolusjon. Snowflake er dedikert til å fremme rikt samarbeid med forskere, utviklere, partnere og bedrifter globalt for å drive grensene for hva som er mulig med åpen, spesialisert AI-modeller.

Jeg har brukt de siste fem årene på å dykke ned i den fasiniserende verden av Maskinlæring og Dypt Læring. Min lidenskap og ekspertise har ledet meg til å bidra til over 50 ulike programvareprosjekter, med særlig fokus på AI/ML. Min pågående nysgjørhet har også trukket meg mot Naturlig Språkbehandling, et felt jeg er ivrig etter å utforske videre.