AI-modeller og platforme

Mistral AI: SÃĶtter nye standarder udover Llama2 i open-source-rummet

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

Large Language Models (LLM’er) har for nylig taget center-scenen, takket vÃĶre fremragende prÃĶstationer som ChatGPT. Da Meta introducerede deres Llama-modeller, fik det fornyet interesse for open-source LLM’er. FormÃĨlet? At skabe billigere, open-source LLM’er, der er lige sÃĨ gode som topmodeller som GPT-4, men uden den hÃļje pris eller kompleksitet.

Dette mix af billigere og effektivere ÃĨbner ikke kun nye veje for forskere og udviklere, men sÃĶtter ogsÃĨ scenen for en ny ÃĶra af teknologiske fremskridt i naturlig sprogbehandling.

For nylig har generative AI-startups vÃĶret pÃĨ rulle med finansiering. Together hÃĶvede $20 millioner, med mÃĨlet at forme open-source AI. Anthropic hÃĶvede ogsÃĨ en imponerende $450 millioner, og Cohere, i partnerskab med Google Cloud, sikrede $270 millioner i juni i ÃĨr.

Introduktion til Mistral 7B: StÃļrrelse og TilgÃĶngelighed

mistral AI

Mistral AI, der er baseret i Paris og co-founded af tidligere ansatte fra Google’s DeepMind og Meta, annoncerede deres fÃļrste store sprogmodel: Mistral 7B. Denne model kan let downloades af alle fra GitHub og endda via en 13,4-gigabyte torrent.

Dette startup lykkedes med at sikre rekordbrydende seed-finansiering, selv fÃļr de havde et produkt ud. Mistral AI’s fÃļrste model med 7 milliarder parametre overgÃĨr Llama 2 13B i alle tests og slÃĨr Llama 1 34B i mange metrikker.

I sammenligning med andre modeller som Llama 2, tilbyder Mistral 7B lignende eller bedre funktioner, men med mindre beregningsmÃĶssig overhead. Mens grundlÃĶggende modeller som GPT-4 kan opnÃĨ mere, kommer de til en hÃļjere pris og er ikke sÃĨ brugervenlige, da de primÃĶrt er tilgÃĶngelige via API’er.

NÃĨr det kommer til kodningstasks, giver Mistral 7B CodeLlama 7B en chance for sin penge. Plus, det er kompakt nok til at kÃļre pÃĨ standardmaskiner.

Dertil kommer, at Mistral 7B Instruct, der er finjusteret specifikt for instruktionsdata pÃĨ Hugging Face, har vist god prÃĶstation. Det overgÃĨr andre 7B-modeller pÃĨ MT-Bench og stÃĨr skulder til skulder med 13B-chat-modeller.

PrÃĶstationsbenchmarking

I en detaljeret prÃĶstationsanalyse blev Mistral 7B mÃĨlt op imod Llama 2-familien. Resultaterne var klare: Mistral 7B overgik betydeligt Llama 2 13B pÃĨ alle benchmarks. Faktisk matcher det prÃĶstationen af Llama 34B, isÃĶr i kode- og resonemementsbenchmarks.

Benchmarkene var organiseret i flere kategorier, sÃĨsom Commonsense Reasoning, World Knowledge, Reading Comprehension, Math og Code, blandt andre. En sÃĶrlig vÃĶrdig bemÃĶrkning var Mistral 7B’s omkostningsprÃĶstationsmetrik, kaldet “ÃĶkvivalent modelstÃļrrelse”. I omrÃĨder som resonemement og forstÃĨelse viste Mistral 7B en prÃĶstation lignende en Llama 2-model tre gange sin stÃļrrelse, hvilket betyder potentielle besparelser i hukommelse og en Ãļgning i gennemlÃļbstid. Men i videnbenchmarks ligner Mistral 7B tÃĶt Llama 2 13B, hvilket sandsynligvis skyldes dens parameterbegrÃĶnsninger, der pÃĨvirker videnkomprimering.

Hvad gÃļr egentlig Mistral 7B-modellen bedre end de fleste andre sprogmodeller?

Forenkling af opmÃĶrksomhedsmekanismer

Mens detaljerne i opmÃĶrksomhedsmekanismer er tekniske, er den grundlÃĶggende idÃĐ relativt enkel. Forestil dig, at du lÃĶser en bog og markerer vigtige sÃĶtninger; dette er analogt med, hvordan opmÃĶrksomhedsmekanismer “markerer” eller giver vigtighed til bestemte data punkter i en sekvens.

I sammenhÃĶng med sprogmodeller muliggÃļr disse mekanismer, at modellen kan fokusere pÃĨ de mest relevante dele af inputdata, sÃĨ outputtet er koherent og kontekstligt prÃĶcist.

I standardtransformatorer beregnes opmÃĶrksomheds-score med formlen:

Transformers attention Formula

Transformers Attention Formula

Formlen for disse score involverer et afgÃļrende trin – matrixmultiplikation af Q og K. Udfordringen her er, at nÃĨr sekvenslÃĶngden vokser, udvides bÃĨde matricer derefter, hvilket fÃļrer til en beregningsintensiv proces. Dette skalbarhedsproblem er en af de stÃļrste ÃĨrsager til, at standardtransformatorer kan vÃĶre langsomme, isÃĶr nÃĨr de har med lange sekvenser at gÃļre.

transformerOpmÃĶrksomheds-mekanismer hjÃĶlper modellerne med at fokusere pÃĨ bestemte dele af inputdata. Typisk bruger disse mekanismer “hoveder” til at styre denne opmÃĶrksomhed. Jo flere hoveder, du har, jo mere specifik opmÃĶrksomheden er, men det bliver ogsÃĨ mere komplekst og langsommere. Dyk dybere ned i transformers og opmÃĶrksomheds-mekanismer her.

Multi-query opmÃĶrksomhed (MQA) accelererer processen ved at bruge ÃĐt sÃĶt ‘nÃļgle-vÃĶrdi’-hoveder, men ofrer iblandt kvaliteten. Nu kan du undre dig over, hvorfor ikke kombinere MQA’s hastighed med multi-hoved opmÃĶrksomheds kvalitet? Det er her, hvor Grupperet-opmÃĶrksomhed (GQA) kommer ind.

Grupperet-opmÃĶrksomhed (GQA)

Grupperet-opmÃĶrksomhed

Grupperet-opmÃĶrksomhed

GQA er en midtergrundslÃļsning. I stedet for at bruge kun ÃĐt eller flere ‘nÃļgle-vÃĶrdi’-hoveder, grupperer det dem. PÃĨ denne mÃĨde opnÃĨr GQA en prÃĶstation tÃĶt pÃĨ den detaljerede multi-hoved opmÃĶrksomhed, men med MQA’s hastighed. For modeller som Mistral betyder dette effektiv prÃĶstation uden at gÃĨ for meget pÃĨ kompromis med kvaliteten.

Glidende Vindue OpmÃĶrksomhed (SWA)

longformer transformers sliding window

Den glidende vindue er en anden metode, der bruges til at behandle opmÃĶrksomhedssekvenser. Denne metode bruger et faststÃļrrelses opmÃĶrksomheds-vindue omkring hvert token i sekvensen. Med flere lag, der stablede denne vindue-opmÃĶrksomhed, fÃĨr de Ãļverste lag til sidst en bredere perspektiv, der omfatter information fra hele input. Denne mekanisme er analog til de receptive felter, der ses i Convolutional Neural Networks (CNN’er).

PÃĨ den anden side beregner “dilated sliding window attention” i Longformer-modellen, der konceptuelt ligner glidende vindue-metoden, kun nogle diagonaler af matricen. Denne ÃĶndring resulterer i, at hukommelsesforbruget Ãļger lineÃĶrt i stedet for kvadratisk, hvilket gÃļr det til en mere effektiv metode for lÃĶngere sekvenser.

Mistral AI’s Gennemsigtighed vs. Sikkerhedsbekymringer i Decentralisering

I deres annoncering understregede Mistral AI ogsÃĨ gennemsigtighed med udtalelsen: “Ingen tricks, ingen proprietÃĶr data.” Men pÃĨ samme tid er deres eneste tilgÃĶngelige model pÃĨ nuvÃĶrende tidspunkt ‘Mistral-7B-v0.1’, der er en pretrained base-model, og derfor kan generere en respons til enhver forespÃļrgsel uden moderation, hvilket rejser potentielle sikkerhedsbekymringer. Mens modeller som GPT og Llama har mekanismer til at afgÃļre, hvornÃĨr de skal svare, kan Mistral’s fuldt decentraliserede natur udnyttes af dÃĨrlige aktÃļrer.

Men decentraliseringen af Large Language Models har sine fortjenester. Mens nogle kan misbruge det, kan mennesker udnytte dets kraft til sociale formÃĨl og gÃļre intelligens tilgÃĶngelig for alle.

Implementeringsflexibilitet

En af hÃļjdepunkterne er, at Mistral 7B er tilgÃĶngelig under Apache 2.0-licensen. Dette betyder, at der ikke er nogen virkelige barrierer for at bruge det – uanset om du bruger det til personlige formÃĨl, et stort firma eller endda en regeringsenhed. Du har bare brug for det rette system til at kÃļre det, eller du mÃĨske skal investere i cloud-resourcer.

Mens der er andre licenser, sÃĨsom den enklere MIT-licens og den kooperative CC BY-SA-4.0, der krÃĶver kredit og lignende licensering for afledte vÃĶrker, giver Apache 2.0 en solid grundlag for store foretagender.

Afsluttende tanker

Opkomsten af open-source Large Language Models som Mistral 7B markerer en afgÃļrende skift i AI-industrien, hvor hÃļjkvalitets sprogmodeller bliver tilgÃĶngelige for et bredere publikum. Mistral AI’s innovative tilgange, sÃĨsom Grupperet-opmÃĶrksomhed og Glidende Vindue OpmÃĶrksomhed, lover effektiv prÃĶstation uden at gÃĨ for meget pÃĨ kompromis med kvaliteten.

Mens den decentraliserede natur af Mistral stiller visse udfordringer, understreger dens fleksibilitet og open-source-licens potentialet for at demokratisere AI. Da landskabet udvikler sig, vil fokus uundgÃĨeligt vÃĶre pÃĨ at balancere disse modellers kraft med etiske overvejelser og sikkerhedsforanstaltninger.

Hvad er nÃĶste skridt for Mistral? 7B-modellen var kun begyndelsen. Holdet har til hensigt at lancerer endnu stÃļrre modeller snart. Hvis disse nye modeller matcher 7B’s prÃĶstation, kan Mistral hurtigt stige som en top-spiller i industrien, alt inden for deres fÃļrste ÃĨr.

Jeg har brugt de sidste fem ÃĨr pÃĨ at dykke ned i den fascinerende verden af Machine Learning og Deep Learning. Min passion og ekspertise har fÃļrt mig til at bidrage til over 50 forskellige software-ingeniÃļrprojekter, med en sÃĶrlig fokus pÃĨ AI/ML. Min fortsatte nysgerrighed har ogsÃĨ fÃļrt mig mod Natural Language Processing, et felt jeg er ivrig efter at udforske yderligere.