KI-Modelle und Plattformen
MPT-30B: MosaicML übertrifft GPT-3 mit einem neuen LLM, um die Grenzen der NLP zu erweitern
MosaicML ist ein generatives AI-Unternehmen, das AI-Deployments und Skalierbarkeitslösungen anbietet. Ihr neuestes großes Sprachmodell (LLM) MPT-30B macht Wellen in der AI-Gemeinschaft.
MosaicMLs LLM-Reise begann mit der Veröffentlichung von MPT-7B (Mosaic Pretrained Transformer) im Mai 2023, das mit drei Varianten kam:
- MPT-7B-StoryWriter-65k+ (für die Erstellung von Langform-Geschichten)
- MPT-7B-Instruct (für die Befolgung von Anweisungen in Kurzform)
- MPT-7B-Chat (für die Generierung von Dialogen)
Die Modelle wurden in der ML-Gemeinschaft aufgrund ihrer Open-Source-Natur, kommerziellen Nutzbarkeit und außergewöhnlichen Fähigkeit, erweiterte Kontextfenster zu verarbeiten, sehr erfolgreich.
Am wichtigsten ist, dass das Modell auf gleicher Höhe mit anderen vergleichbaren Modellen war und in einigen Fällen sogar besser abschnitt, wie z.B. LLaMA-7B und StableLM 7B. Bis Juni wurden die MPT-7B-Serie über 3 Millionen Mal heruntergeladen. Am 22. Juni veröffentlichte MosaicML MPT-30B, das den Standard für offene Grundmodell-Modelle noch weiter erhöhte.
Das MPT-30B: Ein leistungsstarkes LLM, das GPT-3 übertrifft
MPT-30B ist ein offenes und kommerziell lizenziertes Decoder-basiertes LLM, das leistungsstärker ist als GPT-3-175B mit nur 17% der GPT-3-Parameter, d.h. 30B. Es übertrifft GPT-3 in mehreren Aufgaben. Hier ist ein Vergleich zwischen MPT-30B und GPT-3.
MPT-30B basiert auf dem vorherigen MPT-7B-Modell. Es ist rechenintensiv effizienter zu trainieren im Vergleich zu Modellen ähnlicher Größe. Zum Beispiel verwendete LLaMA-30B etwa 1,44-mal mehr FLOPs-Budget als MPT-30B, während Falcon-40B ein 1,27-mal höheres FLOPs-Budget als MPT-30B hatte. Hier ist eine Abbildung der Verbesserung von MPT-30B bei verschiedenen Aufgaben im Vergleich zu seinem Vorgänger.
Einige besondere Funktionen von MPT-30B sind wie folgt:
8k Token-Kontextfenster
Das Kontextfenster in LLMs bezieht sich auf den Bereich von Token, den das Modell vor der Generierung der Ausgabe berücksichtigen kann. MPT-30B hatte ein Kontextfenster von 8000 Token während des Trainings. Es wurde zunächst auf 1T Token mit 2k Token-Sequenzen trainiert und dann auf zusätzliche 50B Token mit 8k Token-Sequenzen (etwa 6000 Wörter).
ALiBi-Unterstützung
Um diese Funktion zu erklären, betrachten wir eine Frage:
Wie kann MPT-30B längere Sequenzen verstehen und Vorhersagen treffen, als es während des Trainings gesehen hat?
MPT-30B verwendet eine Attention with Linear Biases (ALiBi)-Technik, um längere Sequenzen zu verstehen und das Kontextfenster über 8k Token hinaus zu erweitern während des Feintrainings oder der Inferenz.
Anstatt Positionseingaben zu berechnen, bei denen jedem Wort in der Sequenz ein Vektor zugewiesen wird, berechnet ALiBi Aufmerksamkeitsscores zwischen Schlüssel- und Abfrage-Token. Wenn die Schlüssel- und Abfrage-Token nah beieinander liegen, ist die Strafe niedrig, aber höher sonst. Als Ergebnis kann die zugrunde liegende Transformer-Architektur auf Langform-Eingaben extrapolieren.
Effiziente Inferenz- und Trainingsleistung via FlashAttention
Aufmerksamkeit, d.h. die Konzentration auf relevante Teile der Eingabesequenz, ist ein kritischer Bestandteil von Transformern, kann aber langsam und speicherintensiv sein, insbesondere bei der Verarbeitung langer Textsequenzen.
FlashAttention ist ein von Forschern der Cornell-Universität vorgeschlagener Ansatz, der dieses Problem für MPT-30B löst. Mit einer Technik namens Tiling reduziert FlashAttention die Anzahl der Male, die das Modell aus oder in den Speicher lesen oder schreiben muss, was die Verarbeitung beschleunigt. Daher verwendet das Modell die state-of-the-art-FlashAttention-Technik und die NVIDIA-FasterTransformer-Optimierungsbibliothek für effizientes Training und Inferenz.
Einfachheit beim Training und der Bereitstellung
Entwickler können MPT-30B von Grund auf trainieren oder MosaicMLs Checkpoints für schnellere Bereitstellungen verwenden. Außerdem kann es für domänen-spezifische Anwendungsfälle auf einem bestimmten Datensatz feinjustiert werden.
Die Größe des Modells wurde so gewählt, dass es problemlos auf einer einzelnen GPU bereitgestellt werden kann, insbesondere 1xA100-80GB in 16-Bit-Genauigkeit oder 1xA100-40GB in 8-Bit-Genauigkeit. Das bedeutet, dass das Modell so konzipiert wurde, dass es innerhalb der Speicherbeschränkungen dieser GPUs passt.
Codierfähigkeiten
MPT-30B bietet außergewöhnliche Codierfähigkeiten. HumanEval ist ein von OpenAI veröffentlichtes Dataset, das 164 handgefertigte Programmierprobleme enthält. Im HumanEval-Dataset übertrifft das Modell speziell entwickelte LLM-Modelle wie die StarCoder-Serie.
Feinjustierte Varianten: MPT-30B-Instruct und MPT-30B-Chat
MPT-30B-Instruct
LLMs werden hauptsächlich für Anweisungen wie Fragenbeantwortung, Textzusammenfassung, Sprachübersetzung usw. verwendet. MPT-30B-Instruct ist eine kommerziell nutzbare (unter der CC-By-SA-3.0-Lizenz) Variante von MPT-30B, die speziell für die Befolgung von Anweisungen feinjustiert wurde. Für die Feinjustierung wurden die folgenden Datensätze verwendet:
- FLAN
- P3
- Alpaca
- Dolly-15k
Der Dolly-Datensatz wurde zusätzlich mit Anthropics Helpful and Harmless-Datensatz für die Feinjustierung von Anweisungen ergänzt. Außerdem wurden eine Vielzahl von Datensätzen für die Datenvergrößerung verwendet, darunter:
- CompetitionMath
- GradeSchoolMath
- DialogSum
- DuoRC
- QASPER
- QuALITY
- SummScreen
- Spider
MPT-30B-Chat
MPT-30B-Chat ist eine feinjustierte Version von MPT-30B für die Generierung von Dialogen. Es ist ein Forschungsartefakt, der unter der CC-By-NC-SA-4.0-Lizenz veröffentlicht wird, die nur nicht-kommerzielle Nutzung erlaubt. Das Modell wurde mit verschiedenen Sprachdatensätzen feinjustiert, darunter:
- Airoboros/GPT4-1.2
- Baize
- Camel
- GPTeacher
- Guanaco
- LongCoversations
- ShareGPT
- WizardLM
LLMs teilen sich einen großen Anteil des mehrere Milliarden Dollar schweren generativen AI-Marktes, der nach der Revolutionierung des Landschaftsbildes durch ChatGPT im letzten Jahr enorm gewachsen ist. Die MPT-Familie ist ein grundlegender Teil dieser Revolution. In naher Zukunft können wir kommerziell verfügbare offene Modelle erwarten, die leistungsstärker und effizienter sind als die MPT-Familie.
Für die neuesten AI-Nachrichten besuchen Sie unite.ai.















