Inom det snabbt framskridande området för stora språkmodeller (LLM) har en ny kraftfull modell dykt upp – DBRX, en öppen källkodsmodell skapad av Databricks. Denna LLM gör vågor med sin toppmoderna prestanda över ett brett spektrum av benchmark-tester, även om den kan mäta sig med företag som OpenAI:s GPT-4.
DBRX representerar en betydande milstolpe i demokratiseringen av artificiell intelligens, vilket ger forskare, utvecklare och företag öppen tillgång till en toppmodell för språk. Men vad är DBRX egentligen, och vad gör den så speciell? I denna tekniska djupdykning kommer vi att utforska den innovativa arkitekturen, utbildningsprocessen och nyckelfunktionerna som har drivit DBRX till främsta rummet i den öppna LLM-landskapet.
Födelsen av DBRX Skapandet av DBRX drevs av Databricks uppdrag att göra dataintelligens tillgänglig för alla företag. Som ledare inom dataanalysplattformar insåg Databricks den enorma potentialen hos LLM och satte upp ett mål att utveckla en modell som kunde matcha eller till och med överträffa prestandan hos proprietära erbjudanden.
Efter månader av intensiv forskning, utveckling och en multi-miljon dollar investering nådde Databricks-teamet ett genombrott med DBRX. Modellens imponerande prestanda på ett brett spektrum av benchmark-tester, inklusive språkförståelse, programmering och matematik, etablerade den som en ny toppmodell inom öppna LLM.
Innovativ Arkitektur
Kraften i Mixture-of-Experts I hjärtat av DBRX:s exceptionella prestanda ligger dess innovativa mixture-of-experts (MoE) arkitektur. Denna banbrytande design representerar en avvikelse från traditionella täta modeller, med en gles approach som förbättrar både förutbildningseffektivitet och inferenshastighet.
I MoE-ramverket aktiveras endast en selekt grupp av komponenter, kallade “experter”, för varje indata. Denna specialisering tillåter modellen att hantera en bredare uppsättning av uppgifter med större skicklighet, samtidigt som den optimerar beräkningsresurser.
DBRX tar detta koncept ett steg längre med sin finmaskiga MoE-arkitektur. Till skillnad från vissa andra MoE-modeller som använder färre och större experter, använder DBRX 16 experter, med fyra experter aktiva för varje given indata. Denna design ger en förbluffande 65 gånger fler möjliga expertkombinationer, vilket direkt bidrar till DBRX:s överlägsna prestanda.
DBRX differentierar sig med flera innovativa funktioner:
Rotary Position Encodings (RoPE): Förbättrar förståelsen av tokenpositioner, avgörande för att generera kontextuellt korrekt text.
Gated Linear Units (GLU): Inför en grindmekanism som förbättrar modellens förmåga att lära sig komplexa mönster mer effektivt.
Grouped Query Attention (GQA): Förbättrar modellens effektivitet genom att optimera uppmärksamhetsmekanismen.
Avancerad Tokenisering: Använder GPT-4:s tokenisator för att bearbeta indata mer effektivt.
MoE-arkitekturen är särskilt lämplig för stora språkmodeller, eftersom den tillåter mer effektiv skalning och bättre utnyttjande av beräkningsresurser. Genom att distribuera inlärningsprocessen över flera specialiserade subnätverk kan DBRX effektivt allokera data och beräkningskraft för varje uppgift, säkerställande både högkvalitativ utdata och optimal effektivitet.
Omfattande Träningsdata och Effektiv Optimering Medan DBRX:s arkitektur utan tvekan är imponerande, ligger dess sanna kraft i den noggranna utbildningsprocessen och den väldiga mängden data den har exponerats för. DBRX förutbildades på en förbluffande 12 biljoner token av text- och koddata, noggrant kuraterad för att säkerställa hög kvalitet och mångfald.
Träningsdata bearbetades med hjälp av Databricks verktygssvit, inklusive Apache Spark för data bearbetning, Unity Catalog för datahantering och styrning, och MLflow för experimentsspårning. Denna omfattande verktygssvit möjliggjorde för Databricks-teamet att effektivt hantera, utforska och förbättra den massiva datamängden, vilket lade grunden för DBRX:s exceptionella prestanda.
För att ytterligare förbättra modellens förmågor använde Databricks en dynamisk förutbildningsplan, innovativt varierande datamixen under utbildning. Denna strategi tillät varje token att effektivt bearbetas med de 36 miljarder aktiva parametrarna, vilket resulterade i en mer välavvägd och anpassningsbar modell.
Dessutom var DBRX:s utbildningsprocess optimerad för effektivitet, med hjälp av Databricks egna verktyg och bibliotek, inklusive Composer, LLM Foundry, MegaBlocks och Streaming. Genom att använda tekniker som curriculum learning och optimerade optimeringsstrategier uppnådde teamet en nästan fyrfaldig förbättring av beräknings-effektivitet jämfört med deras tidigare modeller.
Utbildning och Arkitektur
DBRX tränades med hjälp av en next-token-prediktionmodell på en kolossal dataset om 12 biljoner token, med betoning på både text och kod. Denna träningsuppsättning anses vara betydligt mer effektiv än de som användes i tidigare modeller, vilket säkerställer en rik förståelse och svarsförmåga över varierande uppmaningar.
DBRX:s arkitektur är inte bara ett vittnesbörd om Databricks tekniska skicklighet, utan också en demonstration av dess tillämpning inom flera sektorer. Från att förbättra chattbot-interaktioner till att driva komplexa dataanalysuppgifter kan DBRX integreras i olika områden som kräver nyanserad språkförståelse.
Anmärkningsvärt, DBRX Instruct kan till och med överträffa vissa av de mest avancerade stängda modellerna på marknaden. Enligt Databricks mätningar överträffar den GPT-3.5 och är konkurrenskraftig med Gemini 1.0 Pro och Mistral Medium över olika benchmark-tester, inklusive allmän kunskap, sunt förnuft, programmering och matematiskt resonemang.
Till exempel, på MMLU-benchmarken, som mäter språkförståelse, uppnådde DBRX Instruct en poäng på 73,7%, vilket överträffar GPT-3.5:s rapporterade poäng på 70,0%. På HellaSwag-benchmarken för sunt förnuft överträffade DBRX Instruct GPT-3.5:s 85,5% med en imponerande 89,0%.
DBRX Instruct verkligen lyser, med en anmärkningsvärd noggrannhet på 70,1% på HumanEval-benchmarken, vilket inte bara överträffar GPT-3.5 (48,1%) utan också den specialiserade CodeLLaMA-70B Instruct-modellen (67,8%).
Dessa exceptionella resultat understryker DBRX:s mångsidighet och dess förmåga att excellera över en bred uppsättning av uppgifter, från naturlig språkförståelse till komplex programmering och matematiskt problemlösning.
Effektiv Inferens och Skalbarhet En av de viktigaste fördelarna med DBRX:s MoE-arkitektur är dess effektivitet under inferens. Tack vare den glesa aktiveringen av parametrar kan DBRX uppnå inferenstakt som är upp till två till tre gånger snabbare än täta modeller med samma totala antal parametrar.
Jämfört med LLaMA2-70B, en populär öppen källkods-LLM, demonstrerar DBRX inte bara högre kvalitet utan också nästan dubbelt så snabb inferenstakt, trots att den har ungefär hälften så många aktiva parametrar. Denna effektivitet gör DBRX till ett attraktivt val för distribution i en mängd olika tillämpningar, från innehållsskapande till dataanalys och bortom.
Dessutom har Databricks utvecklat en robust utbildningsstack som tillåter företag att utbilda sina egna DBRX-klassmodeller från scratch eller fortsätta utbilda på toppen av de tillhandahållna kontrollpunkterna. Denna funktion ger företag möjlighet att utnyttja den fulla potentialen hos DBRX och anpassa den till sina specifika behov, vilket ytterligare demokratiserar tillgången till toppmoderna LLM-teknik.
Tillgänglighet och Integreringar
I linje med sitt uppdrag att främja öppen tillgång till AI har Databricks gjort DBRX tillgänglig via flera kanaler. Vikterna för både basmodellen (DBRX Base) och den finjusterade modellen (DBRX Instruct) finns på den populära Hugging Face-plattformen, vilket möjliggör för forskare och utvecklare att enkelt ladda ner och arbeta med modellen.
Dessutom är DBRX-modellens repository tillgänglig på GitHub, vilket ger transparens och möjliggör ytterligare utforskning och anpassning av modellens kod.
För Databricks-kunder är DBRX Base och DBRX Instruct bekvämt tillgängliga via Databricks Foundation Model APIs, vilket möjliggör enkel integration i befintliga arbetsflöden och tillämpningar. Detta inte bara förenklar distributionsprocessen utan säkerställer också datastyrning och säkerhet för känsliga användningsfall.
Dessutom har DBRX redan integrerats i flera tredjepartsplattformar och tjänster, såsom You.com och Perplexity Labs, vilket utökar dess räckvidd och potentiala tillämpningar. Dessa integreringar visar det växande intresset för DBRX och dess förmågor, samt den ökande antagandet av öppna LLM i olika branscher och användningsfall.
Långkontextförmågor och Retrieval Augmented Generation En av de mest utmärkande funktionerna hos DBRX är dess förmåga att hantera långkontextindata, med en maximal kontextlängd på 32 768 token. Denna funktion möjliggör för modellen att bearbeta och generera text baserat på omfattande kontextuell information, vilket gör den väl lämpad för uppgifter som dokument sammanfattning, frågesvar och informationsåtervinning.
I benchmark-tester som utvärderar långkontextprestanda, såsom KV-Pairs och HotpotQAXL, överträffade DBRX Instruct GPT-3.5 Turbo över olika sekvenslängder och kontextpositioner.
DBRX överträffar etablerade öppna källkodsmodeller för språkförståelse (MMLU), programmering (HumanEval) och matematik (GSM8K).
Begränsningar och Framtida Arbete
Medan DBRX representerar en betydande prestation inom området för öppna LLM, är det viktigt att erkänna dess begränsningar och områden för framtida förbättring. Liksom alla AI-modeller kan DBRX producera felaktiga eller partiska svar, beroende på kvaliteten och mångfalden av dess träningsdata.
Dessutom, medan DBRX excellerar inom allmänna uppgifter, kan vissa specifika tillämpningar kräva ytterligare finjustering eller specialiserad utbildning för att uppnå optimal prestanda. Till exempel, i scenarier där noggrannhet och trohet är av yttersta vikt, rekommenderar Databricks att använda tekniker för retrieval-augmented generation (RAG) för att förbättra modellens utdata.
Dessutom består DBRX:s nuvarande träningsdataset huvudsakligen av engelskspråkigt innehåll, vilket potentiellt kan begränsa dess prestanda på icke-engelska uppgifter. Framtida iterationer av modellen kan innefatta en utvidgning av träningsdata till att omfatta en mer varierad uppsättning av språk och kulturella sammanhang.
Databricks är engagerat i att kontinuerligt förbättra DBRX:s förmågor och adressera dess begränsningar. Framtida arbete kommer att fokusera på att förbättra modellens prestanda, skalbarhet och användbarhet över olika tillämpningar och användningsfall, samt utforska tekniker för att mildra potentiella partiskheter och främja etisk AI-användning.
Dessutom planerar företaget att ytterligare förfinna utbildningsprocessen, med hjälp av avancerade tekniker som federerad inlärning och integritetsbevarande metoder för att säkerställa dataintegritet och säkerhet.
Vägen Framåt
DBRX representerar ett betydande steg framåt i demokratiseringen av AI-utveckling. Det ser en framtid där varje företag har möjlighet att kontrollera sin data och sin framtid i den framväxande världen av generativ AI.
Genom att öppna källkoden för DBRX och tillhandahålla tillgång till samma verktyg och infrastruktur som användes för att bygga den, ger Databricks företag och forskare möjlighet att utveckla sina egna toppmoderna Databricks-anpassade till sina specifika behov.
Genom Databricks-plattformen kan kunder utnyttja företagets svit av data bearbetningsverktyg, inklusive Apache Spark, Unity Catalog och MLflow, för att kurera och hantera sin träningsdata. De kan sedan använda Databricks optimerade utbildningsbibliotek, såsom Composer, LLM Foundry, MegaBlocks och Streaming, för att utbilda sina egna DBRX-klassmodeller effektivt och i stor skala.
Denna demokratisering av AI-utveckling har potentialen att låsa upp en ny våg av innovation, eftersom företag får möjlighet att utnyttja kraften hos stora språkmodeller för en mängd olika tillämpningar, från innehållsskapande och dataanalys till beslutsstöd och bortom.
Dessutom, genom att främja ett öppet och samarbetsinriktat ekosystem kring DBRX, syftar Databricks till att påskynda takten för forskning och utveckling inom området för stora språkmodeller. När fler organisationer och individer bidrar med sin expertis och insikter kommer den kollektiva kunskapen och förståelsen av dessa kraftfulla AI-system att fortsätta växa, vilket banar väg för ännu mer avancerade och kapabla modeller i framtiden.
Slutsats
DBRX är en spelväxlare i världen av öppna källkods-stora språkmodeller. Med sin innovativa mixture-of-experts-arkitektur, omfattande träningsdata och toppmoderna prestanda har den satt en ny standard för vad som är möjligt med öppna LLM.
Genom att demokratisera tillgången till toppmoderna AI-teknik ger DBRX forskare, utvecklare och företag möjlighet att utforska nya gränser inom naturlig språkförståelse, innehållsskapande, dataanalys och bortom. När Databricks fortsätter att förbättra och förfinna DBRX är de potentiella tillämpningarna och påverkan av denna kraftfulla modell verkligen obegränsade.
Jag har tillbringat de senaste fem åren med att dyka djupt in i den fascinerande världen av Maskinlärning och Djupinlärning. Min passion och expertis har lett mig till att bidra till över 50 olika mjukvaruprojekt, med särskild fokus på AI/ML. Min pågående nyfikenhet har också lett mig mot Naturlig Språkbehandling, ett område som jag är angelägen om att utforska vidare.