KI-Modelle und Plattformen
Mistral AI: Neue Benchmarks im Open-Source-Bereich
GroÃe Sprachmodelle (LLMs) haben kÞrzlich im Mittelpunkt gestanden, dank hervorragender Leistungen wie ChatGPT. Als Meta ihre Llama-Modelle vorstellte, wurde das Interesse an Open-Source-LLMs neu entfacht. Das Ziel? Erschwingliche, Open-Source-LLMs zu erstellen, die so gut sind wie Top-Modelle wie GPT-4, aber ohne den hohen Preis oder die KomplexitÃĪt.
Diese Kombination aus Erschwinglichkeit und Effizienz hat nicht nur neue Wege fÞr Forscher und Entwickler erÃķffnet, sondern auch den Grundstein fÞr eine neue Ãra technologischer Fortschritte in der Verarbeitung natÞrlicher Sprache gelegt.
KÞrzlich haben Start-ups im Bereich generativer KI eine beachtliche Finanzierung erhalten. Zusammen haben sie 20 Millionen Dollar aufgebracht, um Open-Source-KI-Modelle zu entwickeln. Anthropic hat ebenfalls 450 Millionen Dollar erhalten, und Cohere, das mit Google Cloud zusammenarbeitet, hat 270 Millionen Dollar gesichert.
EinfÞhrung in Mistral 7B: GrÃķÃe und VerfÞgbarkeit
Mistral AI, mit Sitz in Paris und gegrÞndet von ehemaligen Mitarbeitern von Googleâs DeepMind und Meta, hat sein erstes groÃes Sprachmodell vorgestellt: Mistral 7B. Dieses Modell kann von jedem heruntergeladen werden und ist auf GitHub und als 13,4-Gigabyte-Torrent verfÞgbar.
Dieses Start-up hat es geschafft, eine Rekordfinanzierung zu sichern, bevor es ein Produkt auf den Markt gebracht hat. Mistral AI hat ein Modell mit 7 Milliarden Parametern entwickelt, das die Leistung von Llama 2 13B in allen Tests Þbertrifft und Llama 1 34B in vielen Metriken schlÃĪgt.
Im Vergleich zu anderen Modellen wie Llama 2 bietet Mistral 7B ÃĪhnliche oder bessere FÃĪhigkeiten, aber mit geringerem Rechenaufwand. WÃĪhrend grundlegende Modelle wie GPT-4 bessere Ergebnisse erzielen kÃķnnen, sind sie teurer und weniger benutzerfreundlich, da sie hauptsÃĪchlich Þber APIs zugÃĪnglich sind.
Bei Codierungsaufgaben kann Mistral 7B es mit CodeLlama 7B aufnehmen. AuÃerdem ist es kompakt genug, um auf Standardmaschinen mit 13,4 GB zu laufen.
ZusÃĪtzlich hat Mistral 7B Instruct, das speziell fÞr AnweisungsdatensÃĪtze auf Hugging Face trainiert wurde, eine groÃartige Leistung gezeigt. Es Þbertrifft andere 7B-Modelle auf MT-Bench und steht auf gleicher HÃķhe mit 13B-Chat-Modellen.
Leistungsvergleich
In einer detaillierten Leistungsanalyse wurde Mistral 7B mit den Llama-2-Modellen verglichen. Die Ergebnisse waren eindeutig: Mistral 7B Þbertrifft Llama 2 13B in allen Benchmarks. TatsÃĪchlich entspricht es der Leistung von Llama 34B, insbesondere in Code- und Reasoning-Benchmarks.
Die Benchmarks wurden in verschiedene Kategorien unterteilt, wie z.B. Allgemeines Wissen, Weltwissen, LeseverstÃĪndnis, Mathematik und Code. Eine bemerkenswerte Beobachtung war die Leistung von Mistral 7B in Bezug auf die Kosten-Leistungs-Metrik, die als âÃĪquivalente ModellgrÃķÃenâ bezeichnet wird. In Bereichen wie Reasoning und VerstÃĪndnis zeigte Mistral 7B eine Leistung, die der eines Llama-2-Modells mit dreimal grÃķÃerer GrÃķÃe entspricht, was auf potenzielle Einsparungen bei der Speicherung und eine Steigerung der Durchsatzrate hindeutet. Allerdings entsprach Mistral 7B in Wissensbenchmarks Llama 2 13B, was wahrscheinlich auf die Parameterbegrenzungen zurÞckzufÞhren ist, die die Wissenskomprimierung beeinflussen.
Was macht das Mistral-7B-Modell besser als die meisten anderen Sprachmodelle?
Vereinfachung der Aufmerksamkeitsmechanismen
Die Feinheiten der Aufmerksamkeitsmechanismen sind technisch, aber die grundlegende Idee ist relativ einfach. Stellen Sie sich vor, Sie lesen ein Buch und unterstreichen wichtige SÃĪtze; das ist analog zu dem, wie Aufmerksamkeitsmechanismen âunterstreichenâ oder wichtige Datenpunkte in einer Sequenz hervorheben.
Im Kontext von Sprachmodellen ermÃķglichen diese Mechanismen es dem Modell, sich auf die relevantesten Teile der Eingabedaten zu konzentrieren, um sicherzustellen, dass die Ausgabe kohÃĪrent und kontextuell genau ist.
In Standard-Transformern werden Aufmerksamkeitswerte mit der Formel berechnet:
Die Formel fÞr diese Werte umfasst einen entscheidenden Schritt â die Matrixmultiplikation von Q und K. Die Herausforderung besteht darin, dass mit zunehmender SequenzlÃĪnge beide Matrizen entsprechend wachsen, was zu einem rechenintensiven Prozess fÞhrt. Diese Skalierbarkeitsprobleme sind einer der HauptgrÞnde, warum Standard-Transformers langsam sein kÃķnnen, insbesondere bei der Verarbeitung langer Sequenzen.

Multi-Query-Aufmerksamkeit (MQA) beschleunigt den Prozess, indem sie einen Satz von âSchlÞssel-Wertâ-KÃķpfen verwendet, aber manchmal auf Kosten der QualitÃĪt. Nun fragen Sie sich vielleicht, warum man nicht die Geschwindigkeit von MQA mit der QualitÃĪt der Multi-Head-Aufmerksamkeit kombinieren kann? Das ist der Punkt, an dem die Gruppen-Abfrage-Aufmerksamkeit (GQA) eintritt.
Gruppen-Abfrage-Aufmerksamkeit (GQA)
GQA ist eine MittellÃķsung. Anstatt nur einen oder mehrere âSchlÞssel-Wertâ-KÃķpfe zu verwenden, gruppiert sie diese. Auf diese Weise erreicht GQA eine Leistung, die der detaillierten Multi-Head-Aufmerksamkeit nahe kommt, aber mit der Geschwindigkeit von MQA. FÞr Modelle wie Mistral bedeutet dies eine effiziente Leistung ohne zu groÃe Kompromisse bei der QualitÃĪt.
Sliding-Window-Aufmerksamkeit (SWA)
Die Sliding-Window-Methode ist eine weitere Methode, die bei der Verarbeitung von Aufmerksamkeitssequenzen verwendet wird. Diese Methode verwendet ein festes Aufmerksamkeitsfenster um jeden Token in der Sequenz. Mit mehreren Schichten, die dieses fensterbasierte Aufmerksamkeit stapeln, gewinnen die oberen Schichten schlieÃlich eine breitere Perspektive, die Informationen aus der gesamten Eingabe umfasst. Dieser Mechanismus ist analog zu den Rezeptivfeldern, die in Convolutional Neural Networks (CNNs) zu finden sind.
Andererseits berechnet die âdilatierte Sliding-Window-Aufmerksamkeitâ des Longformer-Modells, die konzeptionell ÃĪhnlich zur Sliding-Window-Methode ist, nur einige Diagonalen der QKT-Matrix. Diese Ãnderung fÞhrt dazu, dass der Speicherbedarf linear anstelle von quadratisch anwÃĪchst, was es zu einer effizienteren Methode fÞr lÃĪngere Sequenzen macht.
Mistral AI-Transparenz vs. Sicherheitsbedenken bei der Dezentralisierung
In ihrer AnkÞndigung betonte Mistral AI auch die Transparenz mit der Aussage: âKeine Tricks, keine proprietÃĪren Daten.â Gleichzeitig ist ihr aktuell einzig verfÞgbares Modell, âMistral-7B-v0.1â, ein vorgefertigtes Basismodell, das daher auf jede Anfrage ohne Moderation antworten kann, was potenzielle Sicherheitsbedenken aufwirft. WÃĪhrend Modelle wie GPT und Llama Mechanismen haben, um zu erkennen, wann sie antworten sollten, kÃķnnte die vollstÃĪndig dezentralisierte Natur von Mistral von bÃķswilligen Akteuren ausgenutzt werden.
Allerdings hat die Dezentralisierung von Large Language Models auch ihre VorzÞge. WÃĪhrend einige sie missbrauchen kÃķnnten, kÃķnnen Menschen ihre Macht fÞr das Gemeinwohl nutzen und Intelligenz fÞr alle zugÃĪnglich machen.
BereitstellungsflexibilitÃĪt
Ein Highlight ist, dass Mistral 7B unter der Apache-2.0-Lizenz verfÞgbar ist. Das bedeutet, dass es keine echten Barrieren fÞr die Verwendung gibt â egal, ob Sie es fÞr persÃķnliche Zwecke, ein groÃes Unternehmen oder sogar eine RegierungsbehÃķrde verwenden. Sie benÃķtigen nur das richtige System, um es auszufÞhren, oder mÞssen mÃķglicherweise in Cloud-Ressourcen investieren.
Es gibt auch andere Lizenzen wie die einfache MIT-Lizenz und die kooperative CC-BY-SA-4.0-Lizenz, die eine Namensnennung und eine ÃĪhnliche Lizenz fÞr Ableitungen erfordert. Die Apache-2.0-Lizenz bietet jedoch eine solide Grundlage fÞr groà angelegte Unternehmungen.
Schlussgedanken
Der Aufstieg von Open-Source-Large-Language-Modellen wie Mistral 7B markiert einen wichtigen Wendepunkt in der KI-Industrie, indem hochwertige Sprachmodelle einer breiteren Ãffentlichkeit zugÃĪnglich gemacht werden. Mistral AI-Neuerungen wie Gruppen-Abfrage-Aufmerksamkeit und Sliding-Window-Aufmerksamkeit versprechen eine effiziente Leistung ohne Kompromisse bei der QualitÃĪt.
WÃĪhrend die dezentralisierte Natur von Mistral bestimmte Herausforderungen mit sich bringt, unterstreicht ihre FlexibilitÃĪt und Open-Source-Lizenzierung das Potenzial fÞr die Demokratisierung von KI. Wenn sich das Landschaftsbild weiterentwickelt, wird der Fokus unweigerlich auf die Balance zwischen der Macht dieser Modelle und ethischen Ãberlegungen sowie Sicherheitsmechanismen liegen.
Was kommt als NÃĪchstes fÞr Mistral? Das 7B-Modell war nur der Anfang. Das Team plant, noch grÃķÃere Modelle bald zu verÃķffentlichen. Wenn diese neuen Modelle die Leistung von 7B erreichen, kÃķnnte Mistral schnell zu einem Top-Spieler in der Branche aufsteigen, und all dies innerhalb ihres ersten Jahres.


















