AI-modeller og plattformer
Inn i DBRX: Databricks slipper løs en kraftfull åpen kildekode LLM

Av
Aayush Mittal Mittal
I det raskt utviklende feltet av store språkmodeller (LLM), har en ny kraftfull modell dukket opp – DBRX, en åpen kildekode-modell skapt av Databricks. Denne LLM gjør bølger med sin toppmoderne ytelse over en rekke benchmarks, og rivaliserer selv med evnene til industrikjempene som OpenAI’s GPT-4.
DBRX representerer en betydelig milepæl i demokratiseringen av kunstig intelligens, og gir forskere, utviklere og bedrifter åpen tilgang til en toppmodell for språk. Men hva er DBRX egentlig, og hva gjør den så spesiell? I denne tekniske dykketuren vil vi utforske den innovative arkitekturen, treningsprosessen og nøkkelkapasitetene som har skytet DBRX til fronten av det åpne LLM-landskapet.
Fødselen av DBRX Skapelsen av DBRX ble drevet av Databricks’ misjon om å gjøre dataintelligens tilgjengelig for alle bedrifter. Som en leder i dataanalyseplattformer, erkjente Databricks det enorme potensialet i LLM og satte ut til å utvikle en modell som kunne matche eller sogar overgå ytelsen til proprietære tilbud.
Etter måneder med intensiv forskning, utvikling og en multimillioninvestering, oppnådde Databricks-teamet et gjennombrudd med DBRX. Modellens imponerende ytelse på en rekke benchmarks, inkludert språkforståelse, programmering og matematikk, etablerte den som en ny toppmoderne standard for åpne LLM.
Innovativ Arkitektur
Kraften av Mixture-of-Experts I hjertet av DBRX’ unike ytelse ligger dens innovative mixture-of-experts (MoE) arkitektur. Denne banebrytende designen representerer en avvik fra tradisjonelle tette modeller, og tar i stedet en sparsom tilnærming som forbedrer både forhåndstrenings-effektivitet og inferenshastighet.
I MoE-rammeverket aktiveres bare en valgt gruppe komponenter, kalt “eksperter”, for hver inndata. Denne spesialiseringen tillater modellen å håndtere en bredere rekke av oppgaver med større dyktighet, samtidig som den optimaliserer beregningsressursene.
DBRX tar dette konseptet videre med sin finekornede MoE-arkitektur. I motsetning til noen andre MoE-modeller som bruker færre, større eksperter, bruker DBRX 16 eksperter, med fire eksperter aktive for hver gitt inndata. Denne designen gir en overveldende 65 ganger flere mulige ekspertkombinasjoner, som direkte bidrar til DBRX’ overlegne ytelse.
DBRX skiller seg ut med flere innovative funksjoner:
- Rotary Position Encodings (RoPE): Forbedrer forståelsen av tokenposisjoner, avgjørende for å generere kontekstuell nøyaktig tekst.
- Gated Linear Units (GLU): Innfører en portmekanisme som forbedrer modellens evne til å lære komplekse mønster mer effektivt.
- Grouped Query Attention (GQA): Forbedrer modellens effektivitet ved å optimalisere oppmerksomhetsmekanismen.
- Advanced Tokenization: Utnytter GPT-4’s tokenizer til å prosessere inndata mer effektivt.
MoE-arkitekturen er spesielt godt egnet for store språkmodeller, da den tillater mer effektiv skalerbarhet og bedre utnyttelse av beregningsressursene. Ved å distribuere læreprosessen over flere spesialiserte undernettverk, kan DBRX effektivt tildele data og beregningskraft for hver oppgave, sikrer både høykvalitetsutgang og optimal effektivitet.
Omfattende treningsdata og effektiv optimering Mens DBRX’ arkitektur uten tvil er imponerende, ligger dens sanne kraft i den omhyggelige treningsprosessen og den enorme mengden data den ble utsatt for. DBRX ble forhåndstrent på en overveldende 12 billioner tokens av tekst- og kode-data, nøye kuratert for å sikre høy kvalitet og mangfold.
Treningsdataene ble prosessert ved hjelp av Databricks’ suite av verktøy, inkludert Apache Spark for dataprosessering, Unity Catalog for datamanagement og styring, og MLflow for eksperimentssporing. Denne omfattende verktøyssuiten tillot Databricks-teamet å effektivt håndtere, utforske og finjustere den massive datamengden, og la grunnlaget for DBRX’ unike ytelse.
For å ytterligere forbedre modellens kapasiteter, brukte Databricks en dynamisk forhåndstreningsplan, innovativt varierte datamengden under treningsprosessen. Denne strategien tillot hver token å bli effektivt prosessert ved hjelp av de 36 milliarder aktive parameterne, resulterende i en mer avrundet og tilpasningsdyktig modell.
I tillegg var DBRX’ treningsprosess optimerert for effektivitet, ved hjelp av Databricks’ egenutviklede verktøy og biblioteker, inkludert Composer, LLM Foundry, MegaBlocks og Streaming. Ved å bruke teknikker som kurrikulumlæring og optimaliserte optimeringsstrategier, oppnådde teamet en nesten firedobling av beregnings-effektiviteten sammenlignet med deres tidligere modeller.
Training og Arkitektur
DBRX ble trenet ved hjelp av en next-token prediksjonsmodell på en kolossal datasett på 12 billioner tokens, med vekt på både tekst og kode. Denne treningssettet antas å være betydelig mer effektivt enn de som ble brukt i tidligere modeller, og sikrer en rik forståelse og responskapasitet over varierende prompter.
DBRX’ arkitektur er ikke bare et vitnesbyrd om Databricks’ tekniske dyktighet, men også en påminnelse om dens anvendelse over flere sektorer. Fra å forbedre chatbot-interaksjoner til å drive komplekse dataanalyseoppgaver, kan DBRX integreres i ulike felt som krever nuansert språkforståelse.
Merkelig nok, DBRX Instruct rivaliserer selv noen av de mest avanserte lukkede modellene på markedet. Ifølge Databricks’ målinger, overgår den GPT-3.5 og er konkurransedyktig med Gemini 1.0 Pro og Mistral Medium over ulike benchmarks, inkludert generell kunnskap, commonsense resonnering, programmering og matematisk resonnering.
For eksempel, på MMLU-benchmarket, som måler språkforståelse, oppnådde DBRX Instruct en score på 73,7%, og overgikk GPT-3.5’s rapporterte score på 70,0%. På HellaSwag commonsense resonnering benchmark, scoret DBRX Instruct en imponerende 89,0%, og overgikk GPT-3.5’s 85,5%.
DBRX Instruct skinner virkelig, og oppnår en bemerkelsesverdig nøyaktighet på 70,1% på HumanEval-benchmarket, og overgår ikke bare GPT-3.5 (48,1%) men også den spesialiserte CodeLLaMA-70B Instruct-modellen (67,8%).
Disse eksepsjonelle resultater understreker DBRX’ mangfoldighet og dens evne til å utmerke seg over en rekke av oppgaver, fra naturlig språkforståelse til kompleks programmering og matematisk problemløsning.
Effektiv inferens og skalerbarhet En av de viktigste fordelene med DBRX’ MoE-arkitektur er dens effektivitet under inferens. Takket være den sparsomme aktiveringen av parametre, kan DBRX oppnå inferens-gjennomstrømming som er opptil to til tre ganger raskere enn tette modeller med samme antall parametre.
I sammenligning med LLaMA2-70B, en populær åpen kildekode LLM, demonstrerer DBRX ikke bare høyere kvalitet, men også omtrent dobbelt så rask inferenshastighet, til tross for å ha omtrent halvparten så mange aktive parametre. Denne effektiviteten gjør DBRX til et attraktivt valg for deployering i en rekke av applikasjoner, fra innholdsskapelse til dataanalyse og utover.
I tillegg har Databricks utviklet en robust treningsstakk som tillater bedrifter å trenere sine egne DBRX-klasse modeller fra scratch eller fortsette å trenere på toppen av de tilgjengelige checkpointene. Denne kapasiteten befaler bedrifter å utnytte det fulle potensialet i DBRX og tilpasse den til deres spesifikke behov, og demokratiserer tilgangen til banebrytende LLM-teknologi ytterligere.
Tilgjengelighet og Integrasjoner
I tråd med sin misjon om å fremme åpen tilgang til AI, har Databricks gjort DBRX tilgjengelig gjennom flere kanaler. Vekten til både basismodellen (DBRX Base) og finjusteringsmodellen (DBRX Instruct) er verts på den populære Hugging Face-plattformen, og tillater forskere og utviklere å enkelt laste ned og arbeide med modellen.
I tillegg er DBRX-modell-repositoriet tilgjengelig på GitHub, og gir transparens og mulighet for videre utforskning og tilpasning av modellens kode.
For Databricks-kunder er DBRX Base og DBRX Instruct tilgjengelig via Databricks Foundation Model APIs, og muliggjør enkel integrasjon i eksisterende arbeidsflyter og applikasjoner. Dette forenkler ikke bare deployeringsprosessen, men sikrer også datastyring og sikkerhet for sensitive brukstilfeller.
I tillegg har DBRX allerede blitt integrert i flere tredjepartsplattformer og tjenester, som You.com og Perplexity Labs, og utvider dens rekkevidde og potensielle applikasjoner. Disse integrasjonene demonstrerer den økende interessen for DBRX og dens kapasiteter, samt den økende tilgangen til åpne LLM over ulike industrier og brukstilfeller.
Langkontekst-kapasiteter og Retrieval Augmented Generation En av de mest fremtredende funksjonene i DBRX er dens evne til å håndtere langkontekst-inndata, med en maksimal kontekstlengde på 32 768 tokens. Denne kapasiteten tillater modellen å prosessere og generere tekst basert på omfattende kontekstuell informasjon, og gjør den velegnet til oppgaver som dokumentoppsummering, spørsmålssvar og informasjonsgjenfinning.
I benchmarks som vurderer langkontekst-ytelse, som KV-Pairs og HotpotQAXL, overgikk DBRX Instruct GPT-3.5 Turbo over ulike sekvenslengder og kontekstposisjoner.

DBRX overgår etablerte åpne kildekode-modeller på språkforståelse (MMLU), programmering (HumanEval) og matematikk (GSM8K).
Begrensninger og Fremtidig Arbeid
Selv om DBRX representerer en betydelig prestasjon i feltet av åpne LLM, er det essensielt å erkjenne dens begrensninger og områder for fremtidig forbedring. Som alle AI-modeller, kan DBRX produsere uakkurate eller forvrengte responser, avhengig av kvaliteten og mangfoldet i dens treningsdata.
I tillegg, mens DBRX utmerker seg i generelle oppgaver, kan visse domenespesifikke applikasjoner kreve ytterligere finjustering eller spesialisert trenings for å oppnå optimal ytelse. For eksempel, i scenarier hvor nøyaktighet og trofasthet er av størst betydning, anbefaler Databricks å bruke retrieval augmented generation (RAG) teknikker for å forbedre modellens utgang.
I tillegg består DBRX’ nåværende treningsdataset hovedsakelig av engelsk språkinnhold, og kan potensielt begrense dens ytelse på ikke-engelske oppgaver. Fremtidige iterasjoner av modellen kan innebære å utvide treningsdataene til å inkludere et mer mangfoldig utvalg av språk og kulturelle kontekster.
Databricks er dedikert til å kontinuerlig forbedre DBRX’ kapasiteter og adresse dens begrensninger. Fremtidig arbeid vil fokusere på å forbedre modellens ytelse, skalerbarhet og brukervennlighet over ulike applikasjoner og brukstilfeller, samt utforske teknikker for å mildne potensielle forvrengninger og fremme etisk AI-bruk.
I tillegg planlegger selskapet å videreutvikle treningsprosessen, ved å bruke avanserte teknikker som federert læring og privatlivsbeskyttende metoder for å sikre dataintegritet og sikkerhet.
Vegen Framover
DBRX representerer en betydelig fremgang i demokratiseringen av AI-utvikling. Den ser for seg en fremtid hvor hver bedrift har mulighet til å kontrollere sine data og sin skjebne i den fremvoksende verden av generativ AI.
Ved å åpne DBRX og gi tilgang til de samme verktøyene og infrastrukturen som ble brukt til å bygge den, befaler Databricks bedrifter og forskere til å utvikle sine egne banebrytende Databricks tilpasset deres spesifikke behov.
Gjennom Databricks-plattformen kan kunder utnytte selskapets suite av dataprosesseringsverktøy, inkludert Apache Spark, Unity Catalog og MLflow, til å kuratere og håndtere sine treningsdata. De kan deretter bruke Databricks’ optimerte treningsbiblioteker, som Composer, LLM Foundry, MegaBlocks og Streaming, til å trenere sine egne DBRX-klasse modeller effektivt og i skala.
Denne demokratiseringen av AI-utvikling har potensialet til å låse opp en ny bølge av innovasjon, da bedrifter får mulighet til å utnytte kraften av store språkmodeller for en rekke av applikasjoner, fra innholdsskapelse og dataanalyse til beslutningsstøtte og utover.
I tillegg søker Databricks å akselerere fremdriften av forskning og utvikling i feltet av store språkmodeller, ved å fremme en åpen og samarbeidende økosystem rundt DBRX. Ettersom flere organisasjoner og individer bidrar med sin ekspertise og innsikt, vil den kollektive kunnskapen og forståelsen av disse kraftfulle AI-systemene fortsette å vokse, og åpne vei for enda mer avanserte og kapable modeller i fremtiden.
Konklusjon
DBRX er en game-changer i verden av åpne kildekode store språkmodeller. Med sin innovative mixture-of-experts arkitektur, omfattende treningsdata og toppmoderne ytelse, har den satt en ny standard for hva som er mulig med åpne LLM.
Ved å demokratisere tilgangen til banebrytende AI-teknologi, befaler DBRX forskere, utviklere og bedrifter til å utforske nye grenser i naturlig språkprosessering, innholdsskapelse, dataanalyse og utover. Ettersom Databricks fortsetter å forbedre og forbedre DBRX, er potensialet for denne kraftfulle modellens applikasjoner og påvirkning virkelig ubegrenset.
Jeg har brukt de siste fem årene på å dykke ned i den fasiniserende verden av Maskinlæring og Dypt Læring. Min lidenskap og ekspertise har ledet meg til å bidra til over 50 ulike programvareprosjekter, med særlig fokus på AI/ML. Min pågående nysgjørhet har også trukket meg mot Naturlig Språkbehandling, et felt jeg er ivrig etter å utforske videre.
Oppdag mer


OpenAI introduserer Data‑agent i ChatGPT Work for å analysere selskapsdata


Mistral henter €3 milliarder i Serie D for å utvide suveren AI


Mistral og HUMAIN‑teamet om suveren AI for Saudi-Arabia og regionen


Microsoft utvider Mistral-avtalen for å tiltrekke seg regulerte AI-kunder


Det europeiske parlament bygger sin egen AI-plattform for lovgivere


Hvorfor de fleste moderne apper vil være nytteløse i AI-alderen
