I det hurtigt udviklende felt for store sprogmodeller (LLM’er) er der opstået en ny kraftfuld model – DBRX, en open source-model skabt af Databricks. Denne LLM skaber bølger med sin state-of-the-art-præstation på tværs af et bredt spektrum af benchmarks, selv om den kan matche eller endda overgå evnerne hos industrigiganter som OpenAI’s GPT-4.
DBRX repræsenterer en betydelig milepæl i demokratiseringen af kunstig intelligens, hvor forskere, udviklere og virksomheder får åben adgang til en top-kvalitets sprogmodel. Men hvad er DBRX egentlig, og hvad gør den så speciel? I denne tekniske dykning vil vi udforske den innovative arkitektur, træningsprocessen og de nøglefærdigheder, der har ført DBRX til frontlinjen for åbne LLM-landskabet.
DBRX’s fødsel Den skabelse af DBRX blev drevet af Databricks’ mission om at gøre dataintelligens tilgængelig for alle virksomheder. Som en leder i dataanalyseplatforme erkendte Databricks det enorme potentiale i LLM’er og satte sig for at udvikle en model, der kunne matche eller endda overgå præstationen hos proprietære tilbud.
Efter måneder med intensiv forskning, udvikling og en multi-million dollar investering opnåede Databricks-holdet et gennembrud med DBRX. Modellens imponerende præstation på en bred vifte af benchmarks, herunder sprogforståelse, programmering og matematik, fastslog den som en ny state-of-the-art i åbne LLM’er.
Innovativ Arkitektur
Kraften fra Mixture-of-Experts I hjertet af DBRX’s exceptionelle præstation ligger dens innovative mixture-of-experts (MoE) arkitektur. Denne avantgarde-design repræsenterer en afvigelse fra traditionelle tætte modeller, hvor en sparsom tilgang forbedrer både pre-træningseffektivitet og inferenshastighed.
I MoE-rammen er kun en selektiv gruppe af komponenter, kaldet “eksperter”, aktiveret for hver indgang. Denne specialisering tillader modellen at tackle en bred vifte af opgaver med større dygtighed, samtidig med at den optimerer computermæssige ressourcer.
DBRX tager dette koncept endnu længere med sin finekornede MoE-arkitektur. I modsætning til andre MoE-modeller, der bruger færre, men større eksperter, anvender DBRX 16 eksperter, hvoraf fire eksperter er aktive for enhver given indgang. Denne design giver en overvældende 65 gange flere mulige ekspertkombinationer, hvilket direkte bidrager til DBRX’s overlegne præstation.
DBRX adskiller sig med flere innovative funktioner:
Rotary Position Encodings (RoPE): Forbedrer forståelsen af tokenpositioner, afgørende for at generere kontekstligt nøjagtigt tekst.
Gated Linear Units (GLU): Indfører en gating-mekanisme, der forbedrer modellens evne til at lære komplekse mønstre mere effektivt.
Grouped Query Attention (GQA): Forbedrer modellens effektivitet ved at optimere opmærksomhedsmechanismen.
Advanced Tokenization: Anvender GPT-4’s tokenizer til at behandle indgange mere effektivt.
MoE-arkitekturen er særligt velegnet til store sprogmodeller, da den tillader en mere effektiv skalering og bedre udnyttelse af computermæssige ressourcer. Ved at distribuere læreprocessen over flere specialiserede undernetværk kan DBRX effektivt allokerer data og computermæssige ressourcer til hver opgave, sikrer både højkvalitetsoutput og optimal effektivitet.
Omhyggelig træningsdata og effektiv optimering Mens DBRX’s arkitektur uden tvivl er imponerende, ligger dens sande kraft i den omhyggelige træningsproces og den enorme mængde data, den blev udsat for. DBRX blev fortrænet på en overvældende 12 billioner tokens af tekst- og kode-data, omhyggeligt udvalgt til at sikre høj kvalitet og diversitet.
Træningsdataene blev behandlet ved hjælp af Databricks’ suite af værktøjer, herunder Apache Spark til databehandling, Unity Catalog til datastyring og -regering samt MLflow til eksperimentssporing. Denne omfattende værktøjskasse tillod Databricks-holdet at effektivt styre, udforske og forfine den massive datamængde, hvilket lagde grundlaget for DBRX’s exceptionelle præstation.
For at yderligere forbedre modellens evner anvendte Databricks en dynamisk fortræningskur, hvor data-mixen blev ændret under træningen. Denne strategi tillod, at hver token blev effektivt behandlet ved hjælp af de 36 milliarder aktive parametre, hvilket resulterede i en mere velafbalanceret og tilpasningsdygtig model.
Desuden var DBRX’s træningsproces optimeret til effektivitet, hvor Databricks’ suite af proprietære værktøjer og biblioteker, herunder Composer, LLM Foundry, MegaBlocks og Streaming, blev anvendt. Ved at anvende teknikker som kurværlæring og optimerede optimeringsstrategier opnåede holdet en næsten firedobling af beregnings-effektivitet i forhold til deres tidligere modeller.
Træning og Arkitektur
DBRX blev trænet ved hjælp af en next-token-prædiktionsmodel på en kolossal datamængde på 12 billioner tokens, med fokus på både tekst og kode. Denne træningsmængde anses for at være betydeligt mere effektiv end dem, der blev anvendt i tidligere modeller, hvilket sikrer en rig forståelse og responsfærdighed på tværs af varierede prompter.
DBRX’s arkitektur er ikke kun en bekræftelse på Databricks’ tekniske dygtighed, men understreger også dens anvendelse på tværs af multiple sektorer. Fra at forbedre chatbot-interaktioner til at drive komplekse dataanalyseopgaver kan DBRX integreres i diverse felter, der kræver nuanceret sprogforståelse.
Forbløffende nok kan DBRX Instruct endda overgå nogle af de mest avancerede lukkede modeller på markedet. Ifølge Databricks’ målinger overgår den GPT-3.5 og er konkurrencedygtig med Gemini 1.0 Pro og Mistral Medium på tværs af varierende benchmarks, herunder generel viden, fællesskabsforståelse, programmering og matematisk forståelse.
For eksempel opnåede DBRX Instruct en score på 73,7% på MMLU-benchmarket, der måler sprogforståelse, og overgik dermed GPT-3.5’s rapporterede score på 70,0%. På HellaSwag-benchmarket for fællesskabsforståelse opnåede DBRX Instruct en imponerende score på 89,0% og overgik GPT-3.5’s 85,5%.
DBRX Instruct skinner virkelig, da den opnår en bemærkelsesværdig nøjagtighed på 70,1% på HumanEval-benchmarket, og overgår ikke kun GPT-3.5 (48,1%), men også den specialiserede CodeLLaMA-70B Instruct-model (67,8%).
Disse exceptionelle resultater understreger DBRX’s fleksibilitet og dens evne til at udmærke sig på tværs af en bred vifte af opgaver, fra naturlig sprogforståelse til kompleks programmering og matematisk problemløsning.
Effektiv inferens og skalering En af de vigtigste fordele ved DBRX’s MoE-arkitektur er dens effektivitet under inferens. Takket være den sparsomme aktivering af parametre kan DBRX opnå inferens-gennemløb, der er op til to til tre gange hurtigere end tætte modeller med samme antal parametre.
I sammenligning med LLaMA2-70B, en populær open source LLM, demonstrerer DBRX ikke kun højere kvalitet, men også en næsten dobbelt så hurtig inferenshastighed, på trods af at den har omkring halvt så mange aktive parametre. Denne effektivitet gør DBRX til et attraktivt valg for implementering i en bred vifte af anvendelser, fra indholdsskabelse til dataanalyse og videre.
Desuden har Databricks udviklet en robust træningsstak, der tillader virksomheder at træne deres egne DBRX-klasser fra scratch eller fortsætte træningen på toppen af de leverede checkpoints. Denne kapacitet giver virksomheder mulighed for at udnytte det fulde potentiale i DBRX og tilpasse den til deres specifikke behov, hvilket yderligere demokratiserer adgangen til avanceret LLM-teknologi.
Tilgængelighed og Integrationer
I overensstemmelse med sin mission om at fremme åben adgang til AI har Databricks gjort DBRX tilgængelig via multiple kanaler. Vægtene af både grundmodellen (DBRX Base) og finjusteringsmodellen (DBRX Instruct) er placeret på Hugging Face-platformen, hvilket giver forskere og udviklere mulighed for at downloade og arbejde med modellen.
Derudover er DBRX-modellens repository tilgængelig på GitHub, hvilket giver gennemsigtighed og mulighed for yderligere udforskning og tilpasning af modellens kode.
For Databricks-kunder er DBRX Base og DBRX Instruct lettilgængelige via Databricks Foundation Model API’er, hvilket muliggør en problemfri integration i eksisterende arbejdsgange og applikationer. Dette ikke kun forenkler implementeringsprocessen, men sikrer også datastyring og -sikkerhed for følsomme brugstilfælde.
Desuden er DBRX allerede integreret i flere tredjepartsplatforme og -tjenester, såsom You.com og Perplexity Labs, hvilket udvider dens rækkevidde og mulige anvendelser. Disse integrationer demonstrerer den voksende interesse for DBRX og dens evner, samt den øgede anvendelse af åbne LLM’er på tværs af multiple brancher og brugstilfælde.
Lang-kontekstfærdigheder og Retrieval Augmented Generation En af DBRX’s fremragende funktioner er dens evne til at håndtere lang-kontekstindgange, med en maksimal kontekstlængde på 32.768 tokens. Denne funktion giver modellen mulighed for at behandle og generere tekst baseret på omfattende kontekstinformation, hvilket gør den velegnet til opgaver som dokumentresumé, spørgsmålssvar og informationshenting.
I benchmarks, der vurderer lang-kontekstpræstation, såsom KV-Pairs og HotpotQAXL, overgik DBRX Instruct GPT-3.5 Turbo på tværs af varierende sekvenslængder og kontekstpositioner.
DBRX overgår etablerede åbne modeller på sprogforståelse (MMLU), programmering (HumanEval) og matematik (GSM8K).
Begrænsninger og Fremtidigt Arbejde
Selvom DBRX repræsenterer en betydelig præstation i feltet for åbne LLM’er, er det vigtigt at anerkende dens begrænsninger og områder for fremtidig forbedring. Ligesom enhver AI-model kan DBRX producere ukorrekte eller fordomsfulde svar, afhængigt af kvaliteten og diversiteten af dens træningsdata.
Derudover, selvom DBRX udmærker sig i generelle formål, kan visse domænespecifikke anvendelser kræve yderligere finjustering eller specialiseret træning for at opnå optimal præstation. For eksempel, i situationer hvor nøjagtighed og troværdighed er af største betydning, anbefaler Databricks at anvende teknikker til at forbedre modellens output, såsom retrieval augmented generation (RAG).
Desuden består DBRX’s aktuelle træningsdataset primært af engelsk sprogindhold, hvilket potentielt kan begrænse dens præstation på ikke-engelske opgaver. Fremtidige iterationer af modellen kan omfatte udvidelse af træningsdata til at inkludere en mere diversificeret vifte af sprog og kulturelle kontekster.
Databricks er dedikeret til at fortsætte med at forbedre DBRX’s evner og adresse dens begrænsninger. Fremtidigt arbejde vil fokusere på at forbedre modellens præstation, skalering og brugervenlighed på tværs af varierende anvendelser og brugstilfælde, samt udforske teknikker til at minimere potentielle fordomme og fremme etisk AI-anvendelse.
Desuden planlægger virksomheden at yderligere forfine træningsprocessen, hvoravancerede teknikker såsom federeret læring og privat-preserverende metoder vil blive anvendt til at sikre dataintegritet og -sikkerhed.
Vejen Fremad
DBRX repræsenterer en betydelig skridt fremad i demokratiseringen af AI-udvikling. Den forestiller sig en fremtid, hvor hver virksomhed har mulighed for at kontrollere sin egen data og skæbne i den opblomstrende verden af generativ AI.
Ved at åbne DBRX og give adgang til de samme værktøjer og infrastruktur, der blev anvendt til at bygge den, giver Databricks virksomheder og forskere mulighed for at udvikle deres egne avancerede Databricks tilpasset til deres specifikke behov.
Gennem Databricks-platformen kan kunderne udnytte virksomhedens suite af databehandlingsværktøjer, herunder Apache Spark, Unity Catalog og MLflow, til at kurere og styre deres træningsdata. De kan derefter anvende Databricks’ optimerede træningsbiblioteker, såsom Composer, LLM Foundry, MegaBlocks og Streaming, til at træne deres egne DBRX-klasser effektivt og i stor målestok.
Denne demokratisering af AI-udvikling har potentialet til at låse op for en ny bølge af innovation, da virksomheder får mulighed for at udnytte kraften af store sprogmodeller til en bred vifte af anvendelser, fra indholdsskabelse og dataanalyse til beslutningsstøtte og videre.
Desuden, ved at fremme en åben og samarbejdende økosystem omkring DBRX, sigter Databricks på at accelerere tempoet af forskning og udvikling i feltet for store sprogmodeller. Da flere organisationer og individer bidrager med deres ekspertise og indsigt, vil den kollektive viden og forståelse af disse kraftfulde AI-systemer fortsætte med at vokse, og åbne vejen for endnu mere avancerede og kapable modeller i fremtiden.
Konklusion
DBRX er en game-changer i verden af åbne sprogmodeller. Med sin innovative mixture-of-experts-arkitektur, omfattende træningsdata og state-of-the-art-præstation har den sat en ny standard for, hvad der er muligt med åbne LLM’er.
Ved at demokratisere adgangen til avanceret AI-teknologi giver DBRX forskere, udviklere og virksomheder mulighed for at udforske nye grænser i naturlig sprogbehandling, indholdsskabelse, dataanalyse og videre. Da Databricks fortsætter med at forbedre og forfine DBRX, er de potentielle anvendelser og impakter af denne kraftfulde model virkelig ubegrænsede.
Jeg har brugt de sidste fem år på at dykke ned i den fascinerende verden af Machine Learning og Deep Learning. Min passion og ekspertise har ført mig til at bidrage til over 50 forskellige software-ingeniørprojekter, med en særlig fokus på AI/ML. Min fortsatte nysgerrighed har også ført mig mod Natural Language Processing, et felt jeg er ivrig efter at udforske yderligere.