AI-mallit ja alustat

DBRX:n sisällä: Databricks julkaisee voimakkaan avoimen lähdekoodin LLM:n

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Laajasti kehittyvällä suurten kielen mallien (LLM) alalla on nyt ilmestynyt uusi voimakas malli – DBRX, Databricksin kehittämä avoimen lähdekoodin malli. Tämä LLM on saavuttanut valtavan suosion erinomaisen suorituskyvyn ansiosta laajalla skaalalla, jopa haastaen teollisuuden jättiläisten kuten OpenAI:n GPT-4:n ominaisuudet.

DBRX edustaa merkittävää merkkipaaluja tekoälytekniikan demokratisoimisessa, tarjoamalla tutkijoille, kehittäjille ja yrityksille avoimen pääsyn huipputason kielimalliin. Mutta mitä DBRX on, ja mikä tekee siitä niin erityisen? Tässä teknisessä syväanalyysissä tutkimme DBRX:n innovatiivisen arkkitehtuurin, koulutusprosessin ja avainominaisuudet, jotka ovat nostaneet DBRX:n avoimien LLM-mallien eturintamaan.

DBRX:n syntymä Databricksin tehtävänä oli tehdä data älykkyydestä kaikille yrityksille saatavissa. Johtavana data-analytiikka-alustana Databricks tunnisti LLM-mallien valtavan potentiaalin ja päätti kehittää mallin, joka voisi vastata tai jopa ylittää omistettujen tarjoajien suorituskyvyn.

Kuukausien mittaisen intensiivisen tutkimuksen, kehityksen ja useiden miljoonien dollarien sijoituksen jälkeen Databricksin tiimi saavutti läpimurron DBRX:llä. Mallin vaikuttava suorituskyky laajalla skaalalla, mukaan lukien kielen ymmärtäminen, ohjelmointi ja matematiikka, vakiinnutti sen uutena tilanhuipulla avoimissa LLM-malleissa.

Innovatiivinen arkkitehtuuri

Asiantuntijoiden voima DBRX:n poikkeuksellisen suorituskyvyn ydin on sen innovatiivinen asiantuntijoiden sekoitus (MoE) -arkkitehtuuri. Tämä uraauurtava suunnittelu edustaa poikkeusta perinteisistä tiheistä malleista, omaksuen harsomman lähestymistavan, joka parantaa sekä esikoulutuksen tehokkuutta että johtopäätöksen nopeutta.

MoE-kehyksessä vain valittu ryhmä komponentteja, kutsutaan “asiantuntijoiksi”, on aktiivisia kunkin syötteen kohdalla. Tämä erikoistuminen mahdollistaa mallille laajemman tehtävien kirjon hallitsemisen suuremmalla taituruudella, samalla optimoiden laskennalliset resurssit.

DBRX vie tämän konseptin vielä pidemmälle fine-grained MoE-arkkitehtuurilla. Toisin kuin jotkut muut MoE-mallit, jotka käyttävät pienempää määrää suurempia asiantuntijoita, DBRX käyttää 16 asiantuntijaa, joista neljä on aktiivisia kullakin syötteellä. Tämä suunnittelu tarjoaa hämmästyttävät 65 kertaa enemmän mahdollisia asiantuntijayhdistelmiä, jotka vaikuttavat suoraan DBRX:n erinomaiseen suorituskykyyn.

DBRX erottuu useilla innovatiivisilla ominaisuuksilla:

  • Pyörivät sijaintikoodaukset (RoPE): Parantaa sijaintitietojen ymmärtämistä, mikä on tärkeää kontekstuaalisesti tarkalle tekstin generoimiselle.
  • Portaattomat lineaariset yksiköt (GLU): Esittelee portti-mekanismin, joka parantaa mallin kykyä oppia monimutkaisia malleja tehokkaammin.
  • Ryhmän kyselyhuomio (GQA): Parantaa mallin tehokkuutta optimoimalla huomio-mekanismin.
  • Edistynyt tokenisointi: Käyttää GPT-4:n tokenoijaa syötteiden prosessointiin tehokkaammin.

MoE-arkkitehtuuri on erityisen sopiva suurten kielen mallien koulutukseen, koska se mahdollistaa tehokkaamman skaalautumisen ja paremman laskennallisten resurssien hyödyntämisen. Jakamalla oppimisprosessin useiden erikoistuneiden aliverkkojen ympärille DBRX voi tehokkaasti jakaa dataa ja laskentaresursseja kullekin tehtävälle, varmistamalla sekä korkealaatuisen tulosteen että optimaalisen tehokkuuden.

Laaja koulutusdata ja tehokas optimointi Vaikka DBRX:n arkkitehtuuri on epäilemättä vaikuttava, sen todellinen voima piilee huolellisessa koulutusprosessissa ja valtavassa määrässä dataa, jolle se on altistunut. DBRX on esikoulutettu hämmästyttävällä 12 biljoonalla tokenilla teksti- ja koodidataa, joka on huolellisesti kuratoitu varmistamaan korkea laatu ja monimuotoisuus.

Koulutusdata on prosessoidaan Databricksin työkalujen avulla, mukaan lukien Apache Spark datakäsittelyyn, Unity Catalog datahallintaan ja MLflow kokeiden seurantaan. Tämä kattava työkalupakki mahdollisti Databricksin tiimille dataan ja sen hallinnan, tutkimisen ja jalostamisen tehokkaasti, luoden perustan DBRX:n erinomaiselle suorituskyvylle.

Lisäksi Databricks on kehittänyt dynaamisen esikoulutusohjelman, jossa data-seos vaihdellaan koulutuksen aikana. Tämä strategia mahdollisti kunkin tokenin tehokkaan prosessoinnin 36 miljardin aktiivisen parametrin avulla, tuloksena oli kokonaisvaltaisempi ja sopeutuvampi malli.

Lisäksi DBRX:n koulutusprosessi on optimoitu tehokkuuden kannalta, hyödyntäen Databricksin omia työkaluja ja kirjastoja, kuten Composer, LLM Foundry, MegaBlocks ja Streaming. Käyttämällä tekniikoita kuten koulutusohjelmaa ja optimoiduista optimointistrategioita, tiimi saavutti lähes neljänkertaisen laskennan tehokkuuden edellisiin malleihin verrattuna.

Harjoittelu ja arkkitehtuuri

DBRX on koulutettu seuraavan tokenin ennustusmallilla valtavalla 12 biljoonan tokenin datasetilla, korostamalla sekä tekstiä että koodia. Tämä koulutusjoukko uskotaan olevan merkittävästi tehokkaampi kuin aiemmissa malleissa, varmistamalla rikkaan ymmärryksen ja vastauskyvyn erilaisissa ärsykkeissä.

DBRX:n arkkitehtuuri ei ole vain Databricksin teknisen osaamisen todistus, vaan myös sen soveltamisen useilla aloilla. Chatbot-viestintää parantamisesta monimutkaisiin data-analyysiin, DBRX voidaan integroida moniin eri aloihin, joissa vaaditaan hienostunut kielen ymmärtäminen.

Hämmästyttävästi DBRX Instruct jopa haastaa joitakin markkinoiden edistyneimpiä suljettuja malleja. Databricksin mittausten mukaan se ylittää GPT-3.5:n ja on kilpailukykyinen Gemini 1.0 Pro ja Mistral Medium -mallien kanssa eri mittareilla, mukaan lukien yleinen tietämys, arkisen järjen päättely, ohjelmointi ja matemaattinen päättely.

Esimerkiksi MMLU-mittauksessa, joka mitata kielen ymmärtämistä, DBRX Instruct saavutti 73,7 prosentin tuloksen, ylittäen GPT-3.5:n ilmoitetun 70,0 prosentin tuloksen. HellaSwag-arkisen järjen päättelymittauksessa DBRX Instruct saavutti vaikuttavan 89,0 prosentin tuloksen, ylittäen GPT-3.5:n 85,5 prosentin tuloksen.

DBRX Instruct loistaa todella, saavuttaen 70,1 prosentin tarkin tuloksen HumanEval-mittauksessa, ylittäen sekä GPT-3.5:n (48,1 prosenttia) että erikoistuneen CodeLLaMA-70B Instruct -mallin (67,8 prosenttia).

Nämä poikkeukselliset tulokset korostavat DBRX:n monipuolisuutta ja sen kykyä menestyä laajalla skaalalla tehtävissä, luonnollisen kielen ymmärtämisestä monimutkaiseen ohjelmointiin ja matemaattiseen ongelmanratkaisuun.

Tehokas johtopäätös ja skaalautuvuus Yksi DBRX:n MoE-arkkitehtuurin tärkeimmistä etuoikeuksista on sen tehokkuus johtopäätöksessä. Kiitoksena harsomalle parametrin aktivaatiolle DBRX voi saavuttaa johtopäätöksen, joka on jopa kaksi tai kolme kertaa nopeampi kuin tiheiden mallien johtopäätös samalla yhteisparametrin määrällä.

Vertailussa LLaMA2-70B:hen, suosittuun avoimen lähdekoodin LLM:ään, DBRX osoittaa korkeamman laadun ja lähes kaksinkertaisen johtopäätöksen nopeuden, vaikka sillä on noin puolet vähemmän aktiivisia parametreja. Tämä tehokkuus tekee DBRX:stä houkuttelevan valinnan laajalle soveltamisalueelle, aineiston luomisesta data-analyysiin ja siitä eteenpäin.

Lisäksi Databricks on kehittänyt vankkaan koulutuspinon, joka mahdollistaa yrityksille kouluttaa omat DBRX-luokan mallit alusta alkaen tai jatkaa koulutusta tarjotuilla checkpointeilla. Tämä mahdollisuus valtuuttaa yrityksiä hyödyntämään DBRX:n täydellistä potentiaalia ja räätälöidä sitä omiin tarpeisiinsa, edelleen demokratisoiden pääsyn edistyksellisiin LLM-tekniikoihin.

Saavutettavuus ja integraatiot

Linjassa avoimen pääsyn edistämiseen tekoälyyn, Databricks on julkaissut DBRX:n useiden kanavien kautta. Molempien mallien (DBRX Base ja DBRX Instruct) painot on tallennettu suositulle Hugging Face -alustalle, jotta tutkijat ja kehittäjät voivat helposti ladata ja työskennellä mallin kanssa.

Lisäksi DBRX-mallin varasto on saatavilla GitHubissa, tarjoamalla avoimuuden ja mahdollistaen mallin koodin edelleen tutkimisen ja mukauttamisen.

johtopäätöksen nopeus eri mallikonfiguraatioille optimoidulla palveluinfrastruktuurilla NVIDIA TensorRT-LLM 16-bittisen tarkin optimointilippujen kanssa.

Databricksin asiakkaille DBRX Base ja DBRX Instruct ovat kätevästi saatavilla Databricks Foundation Model API:n kautta, mahdollistaen helpon integroinnin olemassa oleviin työvirtoihin ja sovelluksiin. Tämä yksinkertaistaa käyttöönoton ja varmistaa datan hallinnan ja turvallisuuden herkillä käyttötarkoituksilla.

Lisäksi DBRX on jo integroitu useisiin kolmannen osapuolen alustoihin ja palveluihin, kuten You.com ja Perplexity Labs, laajentamalla sen ulottuvuutta ja soveltamismahdollisuuksia. Nämä integraatiot osoittavat kasvavaa kiinnostusta DBRX:ää ja sen kykyjä sekä avoimien LLM-mallien kasvavaa omaksumista eri aloilla ja sovelluksissa.

Pitkien kontekstien käsittely ja hakijan parantaminen Yksi DBRX:n erottuvista ominaisuuksista on sen kyky käsitellä pitkiä konteksteja, joilla on enimmillään 32 768 tokenia. Tämä ominaisuus mahdollistaa mallille prosessoida ja generoida tekstiä laajan kontekstin perusteella, tehden siitä soveltuvan tehtäviin kuten asiakirjojen tiivistäminen, kysymyksen vastaaminen ja tietojen hakeminen.

Mittauksissa, jotka arvioivat pitkien kontekstien suorituskykyä, kuten KV-Pairs ja HotpotQAXL, DBRX Instruct ylitti GPT-3.5 Turbon useilla sekvenssipituuksilla ja kontekstiasennoilla.

Rajoitukset ja tuleva työ

Vaikka DBRX edustaa merkittävää saavutusta avoimien LLM-mallien alalla, on tärkeää tunnustaa sen rajoitukset ja kehittämistarpeet. Kuten mikä tahansa AI-malli, DBRX voi tuottaa epätarkkoja tai harhaanjohtavia vastauksia, riippuen koulutusdatan laadusta ja monimuotoisuudesta.

Lisäksi, vaikka DBRX menestyy yleispurposetehtävissä, tietyt alakohtaiset sovellukset saattavat vaatia lisäksi hienostuneita tai erikoistuneita koulutuksia saavuttaakseen optimaalisen suorituskyvyn. Esimerkiksi tilanteissa, joissa tarkkuus ja uskottavuus ovat ensisijaisia, Databricks suosittelee hakijan parantamisen (RAG) tekniikoiden käyttämistä mallin tulosteen parantamiseksi.

Lisäksi DBRX:n nykyinen koulutusdata koostuu pääasiassa englanninkielisestä sisällöstä, mikä saattaa rajoittaa sen suorituskykyä ei-englanninkielisissä tehtävissä. Tulevaisuuden iteroinneissa mallia voidaan laajentaa kattamaan monipuolisemman kielen ja kulttuurisen kontekstin.

Databricks on sitoutunut jatkuvasti parantamaan DBRX:n kykyjä, suorituskykyä ja käytettävyyttä eri sovelluksissa ja käyttötarkoituksissa sekä tutkimaan menetelmiä, joilla voidaan lieventää mahdollisia harhaanjohtavia tekijöitä ja edistää eettistä tekoälykäyttäytymistä.

Lisäksi yritys aikoo jalostaa koulutusprosessia hyödyntämällä edistyneitä tekniikoita, kuten hajautettua koulutusta ja tietosuojaa turvaavia menetelmiä, varmistaakseen datan turvallisuuden ja yksityisyyden.

Tie eteenpäin

DBRX edustaa merkittävää askelta tekoälykehityksen demokratisoimisessa. Se näkee tulevaisuuden, jossa jokainen yritys pystyy hallitsemaan omat datansa ja kohtalonsa generatiivisen tekoälyn maailmassa.

Julkaisemalla DBRX:n avoimena lähdekoodina ja tarjoamalla pääsyn samaan infrastruktuuriin, jota käytettiin sen kehittämiseen, Databricks valtuuttaa yrityksiä ja tutkijoita kehittämään omat Databricks-mallinsa, jotka on räätälöity heidän tarpeisiinsa.

Databricksin alustan kautta asiakkaat voivat hyödyntää yrityksen datakäsittelytyökaluja, mukaan lukien Apache Spark, Unity Catalog ja MLflow, kuratoidakseen ja hallitakseen koulutusdataa. Sitten he voivat käyttää Databricksin optimoituja koulutuskirjastoja, kuten Composer, LLM Foundry, MegaBlocks ja Streaming, kouluttaakseen omat DBRX-luokan mallinsa tehokkaasti ja skaalautuvasti.

Tämä tekoälykehityksen demokratisointi voi avata uuden innovaation aallon, kun yritykset saavat mahdollisuuden hyödyntää suurten kielen mallien voimaa laajalla soveltamisalueella, sisältäen sisällön luomisen, data-analytiikan, päätöksenteon tukemisen ja sen ympärillä olevat sovellukset.

Lisäksi luomalla avoimen ja yhteisöllisen ekosysteemin DBRX:n ympärille, Databricks pyrkii kiihdyttämään tutkimuksen ja kehityksen vauhtia suurten kielen mallien alalla. Kun useat organisaatiot ja yksilöt osallistuvat asiantuntemukseensa ja näkemyksiinsä, yhteinen tietämys ja ymmärrys näistä voimakkaista tekoälyjärjestelmistä jatkuu kasvamassa, avaamalla tien vielä edistyneimmille ja kykyisimmille malleille tulevaisuudessa.

Johtopäätös

DBRX on pelinmuuttaja avoimien suurten kielen mallien maailmassa. Sen innovatiivisen asiantuntijoiden sekoitusarkkitehtuurin, laajan koulutusdatan ja tilanhuipulla olevan suorituskyvyn ansiosta, se on asettanut uuden standardin siitä, mitä on mahdollista avoimilla LLM-malleilla.

Demokratisoimalla pääsyn edistyksellisiin tekoälytekniikoihin, DBRX valtuuttaa tutkijoita, kehittäjää ja yrityksiä tutkimaan uusia rajoja luonnollisen kielen prosessoinnissa, sisällön luomisessa, data-analytiikassa ja siitä eteenpäin. Kun Databricks jatkaa DBRX:n parantamista, tämän voimakkaan mallin soveltamismahdollisuudet ja vaikutus ovat todella rajattomat.

Olen viettänyt viimeiset viisi vuotta uppoutumalla kiinnostavaan koneoppimisen ja syvän oppimisen maailmaan. Minun intohimoni ja asiantuntemukseni ovat johtaneet minun osallistumiseen yli 50:een monipuoliseen ohjelmistosuunnitteluhankkeeseen, joissa on erityisesti painottunut AI/ML. Minun jatkuva uteliaisuuteni on myös ohjannut minun luontaisen kielen prosessoinnin pariin, jota haluan tutkia tarkemmin.