KI-Modelle und Plattformen

Mistral AI: Neue Benchmarks im Open-Source-Bereich

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufÞgen

Große Sprachmodelle (LLMs) haben kÞrzlich im Mittelpunkt gestanden, dank hervorragender Leistungen wie ChatGPT. Als Meta ihre Llama-Modelle vorstellte, wurde das Interesse an Open-Source-LLMs neu entfacht. Das Ziel? Erschwingliche, Open-Source-LLMs zu erstellen, die so gut sind wie Top-Modelle wie GPT-4, aber ohne den hohen Preis oder die KomplexitÃĪt.

Diese Kombination aus Erschwinglichkeit und Effizienz hat nicht nur neue Wege fÞr Forscher und Entwickler erÃķffnet, sondern auch den Grundstein fÞr eine neue Ära technologischer Fortschritte in der Verarbeitung natÞrlicher Sprache gelegt.

KÞrzlich haben Start-ups im Bereich generativer KI eine beachtliche Finanzierung erhalten. Zusammen haben sie 20 Millionen Dollar aufgebracht, um Open-Source-KI-Modelle zu entwickeln. Anthropic hat ebenfalls 450 Millionen Dollar erhalten, und Cohere, das mit Google Cloud zusammenarbeitet, hat 270 Millionen Dollar gesichert.

EinfÞhrung in Mistral 7B: GrÃķße und VerfÞgbarkeit

Mistral AI

Mistral AI, mit Sitz in Paris und gegrÞndet von ehemaligen Mitarbeitern von Google’s DeepMind und Meta, hat sein erstes großes Sprachmodell vorgestellt: Mistral 7B. Dieses Modell kann von jedem heruntergeladen werden und ist auf GitHub und als 13,4-Gigabyte-Torrent verfÞgbar.

Dieses Start-up hat es geschafft, eine Rekordfinanzierung zu sichern, bevor es ein Produkt auf den Markt gebracht hat. Mistral AI hat ein Modell mit 7 Milliarden Parametern entwickelt, das die Leistung von Llama 2 13B in allen Tests Þbertrifft und Llama 1 34B in vielen Metriken schlÃĪgt.

Im Vergleich zu anderen Modellen wie Llama 2 bietet Mistral 7B ÃĪhnliche oder bessere FÃĪhigkeiten, aber mit geringerem Rechenaufwand. WÃĪhrend grundlegende Modelle wie GPT-4 bessere Ergebnisse erzielen kÃķnnen, sind sie teurer und weniger benutzerfreundlich, da sie hauptsÃĪchlich Þber APIs zugÃĪnglich sind.

Bei Codierungsaufgaben kann Mistral 7B es mit CodeLlama 7B aufnehmen. Außerdem ist es kompakt genug, um auf Standardmaschinen mit 13,4 GB zu laufen.

ZusÃĪtzlich hat Mistral 7B Instruct, das speziell fÞr AnweisungsdatensÃĪtze auf Hugging Face trainiert wurde, eine großartige Leistung gezeigt. Es Þbertrifft andere 7B-Modelle auf MT-Bench und steht auf gleicher HÃķhe mit 13B-Chat-Modellen.

Hugging Face Mistral AI Beispiel

Hugging Face Mistral 7B Beispiel

Leistungsvergleich

In einer detaillierten Leistungsanalyse wurde Mistral 7B mit den Llama-2-Modellen verglichen. Die Ergebnisse waren eindeutig: Mistral 7B Þbertrifft Llama 2 13B in allen Benchmarks. TatsÃĪchlich entspricht es der Leistung von Llama 34B, insbesondere in Code- und Reasoning-Benchmarks.

Die Benchmarks wurden in verschiedene Kategorien unterteilt, wie z.B. Allgemeines Wissen, Weltwissen, LeseverstÃĪndnis, Mathematik und Code. Eine bemerkenswerte Beobachtung war die Leistung von Mistral 7B in Bezug auf die Kosten-Leistungs-Metrik, die als “ÃĪquivalente ModellgrÃķßen” bezeichnet wird. In Bereichen wie Reasoning und VerstÃĪndnis zeigte Mistral 7B eine Leistung, die der eines Llama-2-Modells mit dreimal grÃķßerer GrÃķße entspricht, was auf potenzielle Einsparungen bei der Speicherung und eine Steigerung der Durchsatzrate hindeutet. Allerdings entsprach Mistral 7B in Wissensbenchmarks Llama 2 13B, was wahrscheinlich auf die Parameterbegrenzungen zurÞckzufÞhren ist, die die Wissenskomprimierung beeinflussen.

Was macht das Mistral-7B-Modell besser als die meisten anderen Sprachmodelle?

Vereinfachung der Aufmerksamkeitsmechanismen

Die Feinheiten der Aufmerksamkeitsmechanismen sind technisch, aber die grundlegende Idee ist relativ einfach. Stellen Sie sich vor, Sie lesen ein Buch und unterstreichen wichtige SÃĪtze; das ist analog zu dem, wie Aufmerksamkeitsmechanismen “unterstreichen” oder wichtige Datenpunkte in einer Sequenz hervorheben.

Im Kontext von Sprachmodellen ermÃķglichen diese Mechanismen es dem Modell, sich auf die relevantesten Teile der Eingabedaten zu konzentrieren, um sicherzustellen, dass die Ausgabe kohÃĪrent und kontextuell genau ist.

In Standard-Transformern werden Aufmerksamkeitswerte mit der Formel berechnet:

Transformers-Aufmerksamkeitsformel

Transformers-Aufmerksamkeitsformel

Die Formel fÞr diese Werte umfasst einen entscheidenden Schritt – die Matrixmultiplikation von Q und K. Die Herausforderung besteht darin, dass mit zunehmender SequenzlÃĪnge beide Matrizen entsprechend wachsen, was zu einem rechenintensiven Prozess fÞhrt. Diese Skalierbarkeitsprobleme sind einer der HauptgrÞnde, warum Standard-Transformers langsam sein kÃķnnen, insbesondere bei der Verarbeitung langer Sequenzen.

TransformerAufmerksamkeitsmechanismen helfen Modellen, sich auf bestimmte Teile der Eingabedaten zu konzentrieren. Typischerweise verwenden diese Mechanismen “KÃķpfe”, um diese Aufmerksamkeit zu verwalten. Je mehr KÃķpfe Sie haben, desto spezifischer die Aufmerksamkeit, aber es wird auch komplexer und langsamer. Tauchen Sie tiefer in die Transformers und Aufmerksamkeitsmechanismen ein hier.

Multi-Query-Aufmerksamkeit (MQA) beschleunigt den Prozess, indem sie einen Satz von “SchlÞssel-Wert”-KÃķpfen verwendet, aber manchmal auf Kosten der QualitÃĪt. Nun fragen Sie sich vielleicht, warum man nicht die Geschwindigkeit von MQA mit der QualitÃĪt der Multi-Head-Aufmerksamkeit kombinieren kann? Das ist der Punkt, an dem die Gruppen-Abfrage-Aufmerksamkeit (GQA) eintritt.

Gruppen-Abfrage-Aufmerksamkeit (GQA)

Gruppen-Abfrage-Aufmerksamkeit

Gruppen-Abfrage-Aufmerksamkeit

GQA ist eine MittellÃķsung. Anstatt nur einen oder mehrere “SchlÞssel-Wert”-KÃķpfe zu verwenden, gruppiert sie diese. Auf diese Weise erreicht GQA eine Leistung, die der detaillierten Multi-Head-Aufmerksamkeit nahe kommt, aber mit der Geschwindigkeit von MQA. FÞr Modelle wie Mistral bedeutet dies eine effiziente Leistung ohne zu große Kompromisse bei der QualitÃĪt.

Sliding-Window-Aufmerksamkeit (SWA)

Longformer-Transformer-Sliding-Window

Die Sliding-Window-Methode ist eine weitere Methode, die bei der Verarbeitung von Aufmerksamkeitssequenzen verwendet wird. Diese Methode verwendet ein festes Aufmerksamkeitsfenster um jeden Token in der Sequenz. Mit mehreren Schichten, die dieses fensterbasierte Aufmerksamkeit stapeln, gewinnen die oberen Schichten schließlich eine breitere Perspektive, die Informationen aus der gesamten Eingabe umfasst. Dieser Mechanismus ist analog zu den Rezeptivfeldern, die in Convolutional Neural Networks (CNNs) zu finden sind.

Andererseits berechnet die “dilatierte Sliding-Window-Aufmerksamkeit” des Longformer-Modells, die konzeptionell ÃĪhnlich zur Sliding-Window-Methode ist, nur einige Diagonalen der QKT-Matrix. Diese Änderung fÞhrt dazu, dass der Speicherbedarf linear anstelle von quadratisch anwÃĪchst, was es zu einer effizienteren Methode fÞr lÃĪngere Sequenzen macht.

Mistral AI-Transparenz vs. Sicherheitsbedenken bei der Dezentralisierung

In ihrer AnkÞndigung betonte Mistral AI auch die Transparenz mit der Aussage: “Keine Tricks, keine proprietÃĪren Daten.” Gleichzeitig ist ihr aktuell einzig verfÞgbares Modell, “Mistral-7B-v0.1”, ein vorgefertigtes Basismodell, das daher auf jede Anfrage ohne Moderation antworten kann, was potenzielle Sicherheitsbedenken aufwirft. WÃĪhrend Modelle wie GPT und Llama Mechanismen haben, um zu erkennen, wann sie antworten sollten, kÃķnnte die vollstÃĪndig dezentralisierte Natur von Mistral von bÃķswilligen Akteuren ausgenutzt werden.

Allerdings hat die Dezentralisierung von Large Language Models auch ihre VorzÞge. WÃĪhrend einige sie missbrauchen kÃķnnten, kÃķnnen Menschen ihre Macht fÞr das Gemeinwohl nutzen und Intelligenz fÞr alle zugÃĪnglich machen.

BereitstellungsflexibilitÃĪt

Ein Highlight ist, dass Mistral 7B unter der Apache-2.0-Lizenz verfÞgbar ist. Das bedeutet, dass es keine echten Barrieren fÞr die Verwendung gibt – egal, ob Sie es fÞr persÃķnliche Zwecke, ein großes Unternehmen oder sogar eine RegierungsbehÃķrde verwenden. Sie benÃķtigen nur das richtige System, um es auszufÞhren, oder mÞssen mÃķglicherweise in Cloud-Ressourcen investieren.

Es gibt auch andere Lizenzen wie die einfache MIT-Lizenz und die kooperative CC-BY-SA-4.0-Lizenz, die eine Namensnennung und eine ÃĪhnliche Lizenz fÞr Ableitungen erfordert. Die Apache-2.0-Lizenz bietet jedoch eine solide Grundlage fÞr groß angelegte Unternehmungen.

Schlussgedanken

Der Aufstieg von Open-Source-Large-Language-Modellen wie Mistral 7B markiert einen wichtigen Wendepunkt in der KI-Industrie, indem hochwertige Sprachmodelle einer breiteren Öffentlichkeit zugÃĪnglich gemacht werden. Mistral AI-Neuerungen wie Gruppen-Abfrage-Aufmerksamkeit und Sliding-Window-Aufmerksamkeit versprechen eine effiziente Leistung ohne Kompromisse bei der QualitÃĪt.

WÃĪhrend die dezentralisierte Natur von Mistral bestimmte Herausforderungen mit sich bringt, unterstreicht ihre FlexibilitÃĪt und Open-Source-Lizenzierung das Potenzial fÞr die Demokratisierung von KI. Wenn sich das Landschaftsbild weiterentwickelt, wird der Fokus unweigerlich auf die Balance zwischen der Macht dieser Modelle und ethischen Überlegungen sowie Sicherheitsmechanismen liegen.

Was kommt als NÃĪchstes fÞr Mistral? Das 7B-Modell war nur der Anfang. Das Team plant, noch grÃķßere Modelle bald zu verÃķffentlichen. Wenn diese neuen Modelle die Leistung von 7B erreichen, kÃķnnte Mistral schnell zu einem Top-Spieler in der Branche aufsteigen, und all dies innerhalb ihres ersten Jahres.

Ich habe die letzten fÞnf Jahre damit verbracht, mich in die faszinierende Welt des Machine Learning und Deep Learning zu vertiefen. Mein Engagement und meine Expertise haben mich dazu gefÞhrt, an Þber 50 verschiedenen Software-Entwicklungsprojekten mit einem besonderen Fokus auf AI/ML beizutragen. Meine anhaltende Neugier hat mich auch zum Bereich der Natural Language Processing hingezogen, einem Feld, das ich weiter erforschen mÃķchte.