AI-modeller och plattformar
Mistral AI: Sätter nya benchmark för öppen källkod i språkmodellerna
Stora språkmodeller (LLM) har nyligen hamnat i centrum, tack vare framstående prestationer som ChatGPT. När Meta introducerade sina Llama-modeller, väckte det ett förnyat intresse för öppen källkod i LLM. Målet? Att skapa prisvärda, öppen källkod för LLM som är lika bra som toppmodellerna som GPT-4, men utan den höga prislappen eller komplexiteten.
Denna kombination av prisvärdhet och effektivitet inte bara öppnade nya möjligheter för forskare och utvecklare, utan satte också scenen för en ny era av tekniska framsteg inom naturligt språkbehandling.
Nyligen har generativa AI-startups varit på en rulle med finansiering. Tillsammans höjde $20 miljoner, i syfte att forma öppen källkod för AI. Anthropic höjde också en imponerande $450 miljoner, och Cohere, i samarbete med Google Cloud, höjde $270 miljoner i juni i år.
Introduktion till Mistral 7B: Storlek och tillgänglighet
Mistral AI, med säte i Paris och grundat av tidigare anställda från Google’s DeepMind och Meta, meddelade sin första stora språkmodell: Mistral 7B. Denna modell kan enkelt laddas ner av vem som helst från GitHub och även via en 13,4-gigabyte torrent.
Denna startup lyckades säkra rekordbrytande seedfinansiering innan de ens hade en produkt ute. Mistral AI:s första modell med 7 miljarder parametrar överträffar prestandan hos Llama 2 13B i alla tester och slår Llama 1 34B i många mått.
I jämförelse med andra modeller som Llama 2, erbjuder Mistral 7B liknande eller bättre funktioner men med mindre beräkningsbörda. Medan grundläggande modeller som GPT-4 kan uppnå mer, kommer de till en högre kostnad och är inte lika användarvänliga eftersom de främst är tillgängliga via API:er.
När det gäller koduppgifter ger Mistral 7B CodeLlama 7B en match. Dessutom är den tillräckligt kompakt vid 13,4 GB för att kunna köras på standardmaskiner.
Dessutom har Mistral 7B Instruct, som är anpassad specifikt för instruktionsdata på Hugging Face, visat stor prestanda. Den överträffar andra 7B-modeller på MT-Bench och står axel mot axel med 13B-chattmodeller.

Hugging Face Mistral 7B Exempel
Prestandamätning
I en detaljerad prestandaanalys mättes Mistral 7B mot Llama 2-familjens modeller. Resultaten var tydliga: Mistral 7B överträffade avsevärt Llama 2 13B i alla prestandamätningar. I själva verket matchade den prestandan hos Llama 34B, särskilt i kod- och resonemangstester.
Prestandamätningarna delades in i flera kategorier, såsom sunt förnuft, världskunskap, läsförståelse, matematik och kod, bland annat. En särskilt anmärkningsvärd observation var Mistral 7B:s kostnad-prestanda-mått, som kallas “ekvivalenta modellstorlekar”. I områden som resonemang och förståelse visade Mistral 7B en prestanda liknande en Llama 2-modell som var tre gånger större, vilket innebär potentiella besparingar i minne och en ökning av genomströmning. Men i kunskapstester stod Mistral 7B i linje med Llama 2 13B, vilket troligen beror på dess parameterbegränsningar som påverkar kunskapskomprimering.
Vad gör egentligen Mistral 7B-modellen bättre än de flesta andra språkmodeller?
Förenkling av uppmärksamhetsmekanismer
Medan subtiliteterna i uppmärksamhetsmekanismer är tekniska, är deras grundläggande idé relativt enkel. Tänk dig att läsa en bok och markera viktiga meningar; detta är analogt med hur uppmärksamhetsmekanismer “markerar” eller ger vikt till specifika datapunkter i en sekvens.
I sammanhanget med språkmodeller möjliggör dessa mekanismer att modellen fokuserar på de mest relevanta delarna av indata, vilket säkerställer att utdata är sammanhängande och kontextuellt korrekt.
I standardtransformatorer beräknas uppmärksamhetspoäng med formeln:
Formeln för dessa poäng innefattar ett kritiskt steg – matrismultiplikationen av Q och K. Utmaningen här är att när sekvenslängden växer, expanderar båda matriserna enligt, vilket leder till en beräkningsintensiv process. Denna skalbarhetsfråga är en av de stora anledningarna till varför standardtransformatorer kan vara långsamma, särskilt när de hanterar långa sekvenser.

Multi-frågeuppmärksamhet (MQA) accelererar saker genom att använda en uppsättning “nyckel-värde”-huvuden men offrar ibland kvalitet. Nu undrar du kanske varför man inte kan kombinera MQA:s hastighet med multi-huvuduppmärksamhetens kvalitet? Det är där Grupperad frågeuppmärksamhet (GQA) kommer in.
Grupperad frågeuppmärksamhet (GQA)
GQA är en mittpunkt. Istället för att använda bara ett eller flera “nyckel-värde”-huvuden grupperar den dem. På detta sätt uppnår GQA en prestanda nära den detaljerade multi-huvuduppmärksamheten men med MQA:s hastighet. För modeller som Mistral innebär detta effektiv prestanda utan att kompromissa för mycket med kvalitet.
Kalkyluppmärksamhet med glidande fönster (SWA)
Glidande fönster är en annan metod som används vid bearbetning av uppmärksamhetssekvenser. Denna metod använder ett faststorleksuppmärksamhetsfönster runt varje token i sekvensen. Med flera lager som staplar detta fönsteruppmärksamhet får de översta lagren så småningom en bredare vy, som omfattar information från hela indata. Denna mekanism är analog med de mottagande fält som ses i konvolutionsneuronnät (CNN).
Å andra sidan beräknar “dilaterad glidande fönsteruppmärksamhet” i Longformer-modellen, som konceptuellt liknar glidande fönstermetoden, bara några diagonaler av matrisen. Denna förändring resulterar i att minnesanvändningen ökar linjärt snarare än kvadratiskt, vilket gör det till en mer effektiv metod för längre sekvenser.
Mistral AI:s transparens mot säkerhetsproblem i decentralisering
I sitt meddelande betonade Mistral AI också transparens med uttalandet: “Inga trick, inga proprietära data.” Men samtidigt är deras enda tillgängliga modell för tillfället ‘Mistral-7B-v0.1’ en förtränad basmodell, vilket innebär att den kan generera ett svar på alla frågor utan moderering, vilket väcker potentiella säkerhetsproblem. Medan modeller som GPT och Llama har mekanismer för att avgöra när de ska svara, kan Mistral’s fullständigt decentraliserade natur utnyttjas av illvilliga aktörer.
Men decentraliseringen av stora språkmodeller har sina fördelar. Medan vissa kan missbruka den, kan människor utnyttja dess kraft för samhällets bästa och göra intelligens tillgänglig för alla.
Flexibilitet vid distribution
En av höjdpunkterna är att Mistral 7B är tillgänglig under Apache 2.0-licensen. Detta innebär att det inte finns några riktiga hinder för att använda den – vare sig du använder den för personliga ändamål, ett stort företag eller till och med en statlig enhet. Du behöver bara rätt system för att köra den, eller så måste du investera i molnresurser.
Medan det finns andra licenser, såsom den enklare MIT-licensen och den samarbetsinriktade CC BY-SA-4.0, som kräver kreditering och liknande licensiering för derivat, ger Apache 2.0 en robust grund för stora företag.
Slutliga tankar
Uppkomsten av öppen källkod för stora språkmodeller som Mistral 7B markerar en viktig skiftning i AI-branschen, vilket gör det möjligt för högkvalitativa språkmodeller att nå en bredare publik. Mistral AI:s innovativa tillvägagångssätt, som Grupperad frågeuppmärksamhet och Kalkyluppmärksamhet med glidande fönster, lovar effektiv prestanda utan att kompromissa för mycket med kvalitet.
Medan den decentraliserade naturen hos Mistral utgör vissa utmaningar, understryker dess flexibilitet och öppen källkodslicensiering potentialen för att demokratisera AI. När landskapet utvecklas kommer fokus oundvikligen att ligga på att balansera kraften i dessa modeller med etiska överväganden och säkerhetsmekanismer.
Vad kommer härnäst för Mistral? 7B-modellen var bara början. Teamet siktar på att lansera ännu större modeller snart. Om dessa nya modeller matchar 7B:s prestanda, kan Mistral snabbt stiga som en toppspelare i branschen, allt inom sitt första år.

















