AI-modellen en platforms
Mistral AI: Nieuwe Benchmarks Binnen de Open-Source Ruimte
Grote Taalmodellen (LLM’s) hebben onlangs het centrum van de aandacht getrokken, dankzij opvallende prestaties zoals ChatGPT. Toen Meta hun Llama-modellen introduceerde, ontstond er een hernieuwde interesse in open-source LLM’s. Het doel? Het creëren van betaalbare, open-source LLM’s die even goed zijn als topmodellen zoals GPT-4, maar zonder de hoge prijs of complexiteit.
Deze combinatie van betaalbaarheid en efficiëntie heeft niet alleen nieuwe wegen geopend voor onderzoekers en ontwikkelaars, maar ook het toneel gezet voor een nieuwe era van technologische vooruitgang in natuurlijke taalverwerking.
Onlangs hebben generatieve AI-startups een rol gespeeld in de financiering. Together heeft 20 miljoen dollar opgehaald, met als doel open-source AI te ontwikkelen. Anthropic heeft ook een indrukwekkende 450 miljoen dollar opgehaald, en Cohere, in samenwerking met Google Cloud, heeft 270 miljoen dollar opgehaald in juni van dit jaar.
Introductie tot Mistral 7B: Grootte & Beschikbaarheid
Mistral AI, gevestigd in Parijs en mede-opgericht door alumni van Google’s DeepMind en Meta, heeft hun eerste grote taalmodel aangekondigd: Mistral 7B. Dit model kan gemakkelijk worden gedownload door iedereen van GitHub en zelfs via een 13,4-gigabyte torrent.
Dit startup is erin geslaagd om recordbrekend startkapitaal te verkrijgen voordat ze een product hadden. Mistral AI’s eerste model met 7 miljard parameters overschrijdt de prestaties van Llama 2 13B in alle tests en verslaat Llama 1 34B in veel metrics.
In vergelijking met andere modellen zoals Llama 2, biedt Mistral 7B vergelijkbare of betere mogelijkheden, maar met minder computationele overhead. Terwijl fundamentale modellen zoals GPT-4 meer kunnen bereiken, komen ze met een hogere prijs en zijn ze niet zo gebruikersvriendelijk omdat ze voornamelijk toegankelijk zijn via API’s.
Wanneer het gaat om codetaak, geeft Mistral 7B CodeLlama 7B een goede kans. Bovendien is het compact genoeg bij 13,4 GB om te draaien op standaardmachines.
Bovendien heeft Mistral 7B Instruct, specifiek afgestemd op instructiedatasets op Hugging Face, een geweldige prestatie getoond. Het overtreft andere 7B-modellen op MT-Bench en staat schouder aan schouder met 13B-chatmodellen.

Hugging Face Mistral 7B Example
Prestatiebenchmarking
In een gedetailleerde prestatieanalyse werd Mistral 7B gemeten tegen de Llama 2-familie modellen. De resultaten waren duidelijk: Mistral 7B overschrijdt de Llama 2 13B aanzienlijk in alle benchmarks. In feite komt het overeen met de prestaties van Llama 34B, vooral uitblinkend in code- en redeneerbewijsbenchmarks.
De benchmarks werden georganiseerd in verschillende categorieën, zoals Commonsense Reasoning, World Knowledge, Reading Comprehension, Math en Code, onder andere. Een opvallende observatie was de kost-prestatie-metric van Mistral 7B, genaamd “equivalent model sizes”. In gebieden zoals redenering en begrip, toonde Mistral 7B prestaties die vergelijkbaar zijn met een Llama 2-model dat driemaal zo groot is, wat wijst op potentiële besparingen in geheugen en een toename in doorvoer. Echter, in kennisbenchmarks, kwam Mistral 7B overeen met Llama 2 13B, wat waarschijnlijk te wijten is aan de parameterbeperkingen die de kenniscompressie beïnvloeden.
Wat maakt het Mistral 7B-model beter dan de meeste andere taalmodellen?
Vereenvoudiging van aandachtmecanismen
Terwijl de nuances van aandachtmecanismen technisch zijn, is het fundamentale idee relatief eenvoudig. Stel je voor dat je een boek leest en belangrijke zinnen markeert; dit is analoog aan hoe aandachtmecanismen “markeren” of belang geven aan specifieke datapunten in een sequentie.
In de context van taalmodellen, maken deze mechanismen het mogelijk voor het model om te focussen op de meest relevante delen van de invoergegevens, waardoor de uitvoer coherent en contextueel accuraat is.
In standaardtransformatoren worden aandachtscores berekend met de formule:
De formule voor deze scores omvat een cruciale stap – de matrixvermenigvuldiging van Q en K. De uitdaging hier is dat als de sequentielengte toeneemt, beide matrices dienovereenkomstig uitbreiden, wat leidt tot een computationeel intensief proces. Deze schaalbaarheidszorg is een van de belangrijkste redenen waarom standaardtransformatoren langzaam kunnen zijn, vooral bij het omgaan met lange sequenties.

Multi-query aandacht (MQA) versnelt dingen door één set ‘key-value’ heads te gebruiken, maar offreert soms kwaliteit. Nu vraag je je misschien af, waarom niet combineren van de snelheid van MQA met de kwaliteit van multi-head aandacht? Dat is waar Grouped-query aandacht (GQA) binnenkomt.
Grouped-query Aandacht (GQA)
GQA is een tussenoplossing. In plaats van het gebruik van slechts één of meerdere ‘key-value’ heads, groepeert het ze. Op deze manier bereikt GQA een prestatie die dichtbij de gedetailleerde multi-head aandacht ligt, maar met de snelheid van MQA. Voor modellen zoals Mistral betekent dit efficiënte prestaties zonder te veel in te boeten op kwaliteit.
Sliding Window Aandacht (SWA)
De sliding window is een andere methode die wordt gebruikt bij het verwerken van aandachtsequenties. Deze methode gebruikt een vaste aandachtsvenster rond elk token in de sequentie. Met meerdere lagen die deze vensterde aandacht stapelen, krijgen de bovenste lagen uiteindelijk een bredere perspectief, waardoor ze informatie uit de hele invoer kunnen omvatten. Deze mechanisme is analoog aan de receptieve velden die worden gezien in Convolutional Neural Networks (CNN’s).
Aan de andere kant computeert de “dilated sliding window attention” van het Longformer-model, dat conceptueel vergelijkbaar is met de sliding window-methode, slechts een paar diagonalen van de matrix. Deze verandering resulteert in een lineaire toename van het geheugengebruik in plaats van een kwadratische, waardoor het een efficiëntere methode is voor langere sequenties.
Mistral AI’s Transparantie vs. Veiligheidszorgen in Decentralisatie
In hun aankondiging benadrukte Mistral AI ook transparantie met de verklaring: “Geen trucs, geen propriëtaire gegevens.” Maar tegelijkertijd is hun enige beschikbare model op dit moment ‘Mistral-7B-v0.1’ een pretrained base model, waardoor het een antwoord kan genereren op elke query zonder moderatie, wat potentiële veiligheidszorgen oproept. Terwijl modellen zoals GPT en Llama mechanismen hebben om te bepalen wanneer ze moeten reageren, kan de volledig gedecentraliseerde aard van Mistral worden uitgebuit door slechte actoren.
Echter, de decentralisatie van Large Language Models heeft zijn verdiensten. Terwijl sommigen het zullen misbruiken, kunnen mensen de kracht ervan gebruiken voor het algemeen welzijn en om intelligentie toegankelijk te maken voor iedereen.
Implementatieflexibiliteit
Een van de highlights is dat Mistral 7B beschikbaar is onder de Apache 2.0-licentie. Dit betekent dat er geen echte barrières zijn om het te gebruiken – of je het nu gebruikt voor persoonlijke doeleinden, een groot bedrijf of zelfs een overheidsinstantie. Je hebt alleen het juiste systeem nodig om het te draaien, of je moet investeren in cloudresources.
Terwijl er andere licenties zijn, zoals de eenvoudige MIT-licentie en de coöperatieve CC BY-SA-4.0, die krediet en vergelijkbare licentie voor afgeleiden vereist, biedt Apache 2.0 een solide basis voor grootschalige ondernemingen.
Slotgedachten
De opkomst van open-source Large Language Models zoals Mistral 7B markeert een belangrijke verschuiving in de AI-industrie, waardoor hoge kwaliteit taalmodellen toegankelijk worden voor een bredere doelgroep. Mistral AI’s innovatieve benaderingen, zoals Grouped-query aandacht en Sliding Window Aandacht, beloven efficiënte prestaties zonder te veel in te boeten op kwaliteit.
Terwijl de gedecentraliseerde aard van Mistral bepaalde uitdagingen met zich meebrengt, onderstreept de flexibiliteit en open-source licentie het potentieel voor het democratiseren van AI. Naarmate het landschap evolueert, zal de focus onvermijdelijk liggen op het vinden van een balans tussen de kracht van deze modellen en ethische overwegingen en veiligheidsmechanismen.
Wat is de volgende stap voor Mistral? Het 7B-model was slechts het begin. Het team heeft als doel om nog grotere modellen te lanceren. Als deze nieuwe modellen de prestaties van het 7B-model evenaren, kan Mistral snel opklimmen als een topspeler in de industrie, allemaal binnen hun eerste jaar.

















