KI-Modelle und Plattformen
Enthüllung von Meta Llama 3: Ein großer Sprung im Bereich der großen Sprachmodelle
Im Bereich der generativen KI setzt Meta mit seinem Engagement für Open-Source-Verfügbarkeit und der globalen Verteilung seiner fortschrittlichen Large Language Model Meta AI (Llama)-Serie an Entwickler und Forscher Maßstäbe. Als Fortsetzung seiner progressiven Initiativen hat Meta kürzlich die dritte Iteration dieser Serie, Llama 3, vorgestellt. Diese neue Edition verbessert sich erheblich gegenüber Llama 2 und bietet zahlreiche Verbesserungen, die Branchenkonkurrenten wie Google (GOOGL ), Mistral und Anthropic herausfordern. Dieser Artikel erforscht die bedeutenden Fortschritte von Llama 3 und wie es im Vergleich zu seinem Vorgänger, Llama 2, abschneidet.
Meta’s Llama-Serie: Von Exklusivität zu Open Access und verbesserter Leistung
Meta startete seine Llama-Serie im Jahr 2022 mit dem Launch von Llama 1, einem Modell, das auf nichtkommerzielle Nutzung beschränkt und nur ausgewählten Forschungseinrichtungen aufgrund der enormen Rechenanforderungen und des proprietären Charakters, der zu diesem Zeitpunkt cutting-edge-LLMs auszeichnete, zugänglich war. Im Jahr 2023 änderte Meta AI mit der Einführung von Llama 2 seine Strategie und bot das Modell kostenlos für Forschung und kommerzielle Zwecke an. Diese Maßnahme sollte den Zugang zu fortschrittlicher generativer KI-Technologie demokratisieren und es einer breiteren Nutzergruppe, einschließlich Start-ups und kleinerer Forschungsteams, ermöglichen, innovative Anwendungen ohne die typischerweise mit großen Modellen verbundenen hohen Kosten zu entwickeln. Meta hat mit der Einführung von Llama 3 diesen Trend zur Offenheit fortgesetzt und konzentriert sich auf die Verbesserung der Leistung kleinerer Modelle in verschiedenen industriellen Benchmarks.
Vorstellung von Llama 3
Llama 3 ist die zweite Generation von Meta’s Open-Source-Large-Language-Modellen (LLMs), die sowohl vorgefertigte als auch anweisungsfeinabgestimmte Modelle mit 8B- und 70B-Parametern umfasst. Wie seine Vorgänger verwendet Llama 3 eine decoder-only–Transformer-Architektur und setzt die Praxis der autoregressiven, selbstüberwachten Ausbildung fort, um aufeinanderfolgende Token in Textsequenzen vorherzusagen. Llama 3 wurde auf einem Datensatz trainiert, der siebenmal größer ist als der für Llama 2, mit über 15 Billionen Token, die aus einem neu kuratierten Mix öffentlich verfügbarer Online-Daten stammen. Dieser umfangreiche Datensatz wird mit zwei Clustern verarbeitet, die mit 24.000 GPUs ausgestattet sind. Um die hohe Qualität dieses Trainingsdatensatzes zu gewährleisten, wurden verschiedene data-centric-AI-Techniken eingesetzt, darunter heuristische und NSFW-Filter, semantische Deduplizierung und Textqualitätsklassifizierung. Speziell für Dialoganwendungen wurde das Llama-3-Instruct-Modell erheblich verbessert und umfasst über 10 Millionen von Menschen annotierte Datenproben und nutzt eine Vielzahl von Trainingsmethoden wie überwachtes Feintuning (SFT), Rejection-Sampling, proximale Policy-Optimierung (PPO) und direkte Policy-Optimierung (DPO).
Llama 3 vs. Llama 2: Schlüsselverbesserungen
Llama 3 bringt mehrere Verbesserungen gegenüber Llama 2 mit sich, die seine Funktionalität und Leistung erheblich steigern:
- Erweitertes Vokabular: Llama 3 verfügt über ein Vokabular von 128.256 Token, im Vergleich zu Llama 2 mit 32.000 Token. Diese Verbesserung unterstützt eine effizientere Textcodierung für sowohl Eingaben als auch Ausgaben und stärkt seine multilinguale Fähigkeiten.
- Verlängerte Kontextlänge: Llama-3-Modelle bieten eine Kontextlänge von 8.000 Token, was doppelt so viel ist wie die 4.090 Token, die Llama 2 unterstützt. Diese Erhöhung ermöglicht die Bearbeitung umfangreicheren Inhalts, der sowohl Benutzereingaben als auch Modellantworten umfasst.
- Verbesserte Trainingsdaten: Der Trainingsdatensatz für Llama 3 ist siebenmal größer als der für Llama 2 und umfasst viermal mehr Code. Er enthält über 5 % hochwertige, nicht-englische Daten, die mehr als 30 Sprachen abdecken, was für die Unterstützung multilingualer Anwendungen von entscheidender Bedeutung ist. Diese Daten unterliegen einer strengen Qualitätskontrolle mithilfe fortschrittlicher Techniken wie heuristischen und NSFW-Filtern, semantischer Deduplizierung und Textklassifizierungen.
- Verfeinertes Anweisungsfeintuning und -bewertung: Im Gegensatz zu Llama 2 verwendet Llama 3 fortschrittliche Anweisungsfeintechniken, darunter überwachtes Feintuning (SFT), Rejection-Sampling, proximale Policy-Optimierung (PPO) und direkte Policy-Optimierung (DPO). Um diesen Prozess zu ergänzen, wurde ein neuer hochwertiger menschlicher Bewertungssatz eingeführt, der 1.800 Prompts abdeckt, die verschiedene Anwendungsfälle wie Beratung, Brainstorming, Klassifizierung, Codierung und mehr umfassen, um eine umfassende Bewertung und Feinabstimmung der Modellfähigkeiten zu gewährleisten.
- Erweiterte KI-Sicherheit: Llama 3, wie auch Llama 2, integriert strenge Sicherheitsmaßnahmen wie Anweisungsfeintuning und umfassendes Red-Teaming, um Risiken, insbesondere in kritischen Bereichen wie Cybersicherheit und biologischen Bedrohungen, zu mindern. Zur Unterstützung dieser Bemühungen hat Meta auch Llama Guard 2 eingeführt, das auf der 8B-Version von Llama 3 feinabgestimmt wurde. Dieses neue Modell erweitert die Llama-Guard-Serie durch die Klassifizierung von LLM-Eingaben und -Antworten, um potenziell unsichere Inhalte zu identifizieren, was es ideal für Produktionsumgebungen macht.
Verfügbarkeit von Llama 3
Llama-3-Modelle sind nun in das Hugging-Face-Ökosystem integriert, was die Zugänglichkeit für Entwickler verbessert. Die Modelle sind auch über Model-as-a-Service-Plattformen wie Perplexity Labs und Fireworks.ai sowie auf Cloud-Plattformen wie AWS SageMaker, Azure ML und Vertex AI verfügbar. Meta plant, die Verfügbarkeit von Llama 3 weiter zu erweitern, einschließlich Plattformen wie Google Cloud, Kaggle, IBM WatsonX, NVIDIA NIM und Snowflake. Zusätzlich wird die Hardware-Unterstützung für Llama 3 auf Plattformen von AMD, AWS, Dell, Intel (INTC ), NVIDIA und Qualcomm (QCOM ) erweitert.
Kommende Verbesserungen in Llama 3
Meta hat bekannt gegeben, dass die aktuelle Veröffentlichung von Llama 3 nur die erste Phase in ihrem umfassenderen Vision für die vollständige Version von Llama 3 darstellt. Sie entwickeln ein fortschrittliches Modell mit über 400 Milliarden Parametern, das neue Funktionen wie Multimodalität und die Fähigkeit, mehrere Sprachen zu verarbeiten, einführen wird. Diese erweiterte Version wird auch eine signifikant verlängerte Kontextfenster und verbesserte Gesamtleistungsmerkmale aufweisen.
Das Fazit
Meta’s Llama 3 markiert eine bedeutende Evolution im Bereich der großen Sprachmodelle, indem es die Serie nicht nur in Richtung größerer Open-Source-Verfügbarkeit, sondern auch erheblich verbesserter Leistungsfähigkeit vorantreibt. Mit einem Trainingsdatensatz, der siebenmal größer ist als der seines Vorgängers, und Funktionen wie erweitertem Vokabular und verlängerter Kontextlänge setzt Llama 3 neue Maßstäbe, die sogar die stärksten Branchenkonkurrenten herausfordern.
Diese dritte Iteration setzt nicht nur die Demokratisierung der KI-Technologie fort, indem sie hochentwickelte Fähigkeiten einer breiteren Entwicklergruppe zur Verfügung stellt, sondern führt auch bedeutende Fortschritte in Sicherheit und Trainingspräzision ein. Durch die Integration dieser Modelle in Plattformen wie Hugging Face und die Erweiterung der Verfügbarkeit durch große Cloud-Dienste stellt Meta sicher, dass Llama 3 nicht nur allgegenwärtig, sondern auch leistungsstark ist.
Aufblickend verspricht Metas laufende Entwicklung noch robustere Fähigkeiten, einschließlich Multimodalität und erweiterter Sprachunterstützung, und bereitet den Boden für Llama 3, um nicht nur mit anderen großen KI-Modellen im Markt zu konkurrieren, sondern diese möglicherweise zu übertreffen. Llama 3 ist ein Zeichen von Metas Engagement, die KI-Revolution anzuführen und Werkzeuge bereitzustellen, die nicht nur zugänglicher, sondern auch erheblich fortschrittlicher und sicherer für eine globale Nutzerbasis sind.










