KI-Modelle und Plattformen

Snowflake Arctic: Das Cutting-Edge-LLM für Enterprise-AI

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen
div]:bg-bg-300 [&_pre]:-mr-4 md:[&_pre]:-mr-9″>

Unternehmen erkunden heute zunehmend Möglichkeiten, um Large Language Models (LLMs) zu nutzen, um die Produktivität zu steigern und intelligente Anwendungen zu erstellen. Allerdings sind viele der verfügbaren LLM-Optionen generische Modelle, die nicht auf spezielle Unternehmensbedürfnisse wie Datenanalyse, Codierung und Aufgabenautomatisierung zugeschnitten sind. Hier kommt Snowflake Arctic ins Spiel – ein state-of-the-art-LLM, das speziell für Kernunternehmensanwendungsfälle entwickelt und optimiert wurde.

Das von dem AI-Forschungsteam bei Snowflake entwickelte Arctic schiebt die Grenzen dessen, was mit effizientem Training, Kosteneffizienz und einem beispielloser Level an Offenheit möglich ist. Dieses revolutionäre Modell übertrifft Schlüsselunternehmensbenchmarks, während es im Vergleich zu bestehenden LLMs deutlich weniger Rechenleistung benötigt. Lassen Sie uns einen Blick darauf werfen, was Arctic zu einem Game-Changer für Enterprise-AI macht.

Unternehmensintelligenz neu definiert Im Kern ist Arctic darauf fokussiert, außergewöhnliche Leistungen auf Metriken zu erzielen, die wirklich für Unternehmen zählen – Codierung, SQL-Abfragen, komplexe Anweisungen und die Erstellung von fundierten, faktengestützten Ausgaben. Snowflake hat diese kritischen Fähigkeiten in einer neuen “Unternehmensintelligenz”-Metrik kombiniert.

Die Ergebnisse sprechen für sich. Arctic erreicht oder übertrifft Modelle wie LLAMA 7B und LLAMA 70B auf Unternehmensintelligenz-Benchmarks, während es weniger als die Hälfte des Rechenbudgets für das Training benötigt. Bemerkenswerterweise erreicht Arctic trotz der Nutzung von 17-mal weniger Rechenressourcen als LLAMA 70B eine Parität auf spezialisierten Tests wie Codierung (HumanEval+, MBPP+), SQL-Generierung (Spider) und Anweisungsfolge (IFEval).

Aber Arctics Fähigkeiten gehen über die bloße Überwindung von Unternehmensbenchmarks hinaus. Es hält eine starke Leistung bei allgemeinem Sprachverständnis, Argumentation und mathematischer Begabung im Vergleich zu Modellen, die mit exponentiell höheren Rechenbudgets trainiert wurden, wie DBRX. Diese umfassende Fähigkeit macht Arctic zu einer unübertroffenen Wahl für die Bewältigung der vielfältigen AI-Bedürfnisse eines Unternehmens.

Die Innovation

Dense-MoE-Hybrid-Transformer Wie hat das Snowflake-Team ein so unglaublich leistungsfähiges und effizientes LLM aufgebaut? Die Antwort liegt in Arctics cutting-edge-Dense-Mixture-of-Experts-(MoE)-Hybrid-Transformer-Architektur.

Traditionelle dichte Transformer-Modelle werden immer teurer im Training, wenn ihre Größe zunimmt, wobei die Rechenanforderungen linear ansteigen. Die MoE-Konstruktion hilft, dies zu umgehen, indem sie mehrere parallele Feed-Forward-Netzwerke (Experten) nutzt und nur eine Teilmenge für jedes Eingabetoken aktiviert.

Allerdings reicht es nicht aus, einfach eine MoE-Architektur zu verwenden – Arctic kombiniert die Stärken von dichten und MoE-Komponenten genial. Es kombiniert einen 10-Milliarden-Parameter-dichten-Transformer-Encoder mit einer 128-Experten-Residual-MoE-Multi-Layer-Perceptron-(MLP)-Schicht. Dieses dichte-MoE-Hybridmodell umfasst 480 Milliarden Parameter, aber nur 17 Milliarden sind zu jedem gegebenen Zeitpunkt aktiv, wenn man top-2-Gating verwendet.

Die Auswirkungen sind tiefgreifend – Arctic erreicht beispielloser Modellqualität und -kapazität, während es während des Trainings und der Inferenz bemerkenswert recheneffizient bleibt. Zum Beispiel hat Arctic 50 % weniger aktive Parameter als Modelle wie DBRX während der Inferenz.

Aber die Modellarchitektur ist nur ein Teil der Geschichte. Arctics Exzellenz ist das Ergebnis mehrerer bahnbrechender Techniken und Erkenntnisse, die von dem Snowflake-Forschungsteam entwickelt wurden:

  1. Unternehmensspezifische Trainingsdaten-Curriculum Durch umfangreiche Experimente entdeckte das Team, dass generische Fähigkeiten wie Common-Sense-Argumentation frühzeitig erlernt werden sollten, während komplexere Spezialisierungen wie Codierung und SQL später im Trainingsprozess erworben werden sollten. Arctics Daten-Curriculum folgt einem dreistufigen Ansatz, der menschliche Lernfortschritte nachahmt.

Die ersten Teratoken konzentrieren sich auf den Aufbau einer breiten allgemeinen Basis. Die nächsten 1,5 Teratoken konzentrieren sich auf die Entwicklung von Unternehmensfähigkeiten durch Daten, die für SQL, Codierungsaufgaben und mehr entwickelt wurden. Die letzten Teratoken verfeinern Arctics Spezialisierungen mithilfe verfeinerter Datensätze.

  1. Optimale architektonische Entscheidungen Während MoEs bessere Qualität pro Rechenleistung versprechen, ist die Wahl der richtigen Konfigurationen entscheidend, aber schlecht verstanden. Durch detaillierte Forschung landete Snowflake auf einer Architektur, die 128 Experten mit top-2-Gating in jeder Schicht nach der Bewertung von Qualität-Effizienz-Trade-offs verwendet.

Die Erhöhung der Anzahl der Experten bietet mehr Kombinationen, was die Modellkapazität erhöht. Allerdings erhöht dies auch die Kommunikationskosten, so dass Snowflake auf 128 sorgfältig entwickelte “kondensierte” Experten aktiviert über top-2-Gating als optimale Balance landete.

  1. System-Co-Design Aber selbst eine optimale Modellarchitektur kann durch System-Engpässe untergraben werden. Das Snowflake-Team innovierte auch hier – es entwarf die Modellarchitektur Hand in Hand mit den zugrunde liegenden Trainings- und Inferenzsystemen.

Für effizientes Training wurden die dichten und MoE-Komponenten so strukturiert, dass sie die Überlappung von Kommunikation und Berechnung ermöglichen, was erhebliche Kommunikationsüberhead-Verluste versteckt. Auf der Inferenzseite nutzte das Team NVIDIAs Innovationen, um eine hoch effiziente Bereitstellung trotz Arctics Größe zu ermöglichen.

Techniken wie FP8-Quantifizierung ermöglichen es, das vollständige Modell auf einem einzelnen GPU-Node für interaktive Inferenz zu platzieren. Größere Batch-Größen nutzen Arctics Parallelisierungsfähigkeiten über mehrere Knoten hinweg, während sie dank seiner kompakten 17 Milliarden aktiven Parameter beeindruckend recheneffizient bleiben.

Mit einer Apache-2.0-Lizenz sind Arctics Gewichte und Code unbeschränkt für jede persönliche, Forschungs- oder kommerzielle Verwendung verfügbar. Aber Snowflake ist noch viel weiter gegangen und hat seine vollständigen Datenrezepte, Modellimplementierungen, Tipps und die tiefen Forschungserkenntnisse, die Arctic antreiben, open-source gemacht.

Das “Arctic-Cookbook” ist eine umfassende Wissensbasis, die jeden Aspekt des Aufbaus und Optimierens eines großen MoE-Modells wie Arctic abdeckt. Es destilliert Schlüsselerkenntnisse über Datenquellen, Modellarchitektur-Design, System-Co-Design, optimierte Trainings-/Inferenzschemata und mehr.

Von der Identifizierung optimaler Daten-Curricula bis zur Architektur von MoEs unter Co-Optimierung von Compilern, Planern und Hardware – diese umfassende Wissensbasis demokratisiert Fähigkeiten, die zuvor auf Elite-AI-Labore beschränkt waren. Das Arctic-Cookbook beschleunigt Lernkurven und ermöglicht es Unternehmen, Forschern und Entwicklern auf der ganzen Welt, ihre eigenen kosteneffizienten, maßgeschneiderten LLMs für fast jeden Anwendungsfall zu erstellen.

Loslegen mit Arctic

Für Unternehmen, die Arctic nutzen möchten, bietet Snowflake mehrere Wege, um schnell loszulegen:

Serverless-Inferenz: Snowflake-Kunden können das Arctic-Modell kostenlos auf Snowflake Cortex, der vollständig verwalteten AI-Plattform des Unternehmens, zugreifen. Darüber hinaus ist Arctic in allen großen Modellkatalogen wie AWS, Microsoft Azure, NVIDIA (NVDA ) und mehr verfügbar.

Von Grund auf neu beginnen: Die open-source-Modellgewichte und -Implementierungen ermöglichen es Entwicklern, Arctic direkt in ihre Apps und Dienste zu integrieren. Das Arctic-Repo bietet Code-Beispiele, Bereitstellungstutorials, Feinabstimmungsrezepte und mehr.

Benutzerdefinierte Modelle erstellen: Dank der umfassenden Anleitungen im Arctic-Cookbook können Entwickler ihre eigenen benutzerdefinierten MoE-Modelle von Grund auf neu erstellen, die für jeden spezialisierten Anwendungsfall optimiert sind, indem sie Erkenntnisse aus der Entwicklung von Arctic nutzen.

Eine neue Ära der offenen Unternehmens-AI Arctic ist mehr als nur ein weiteres leistungsfähiges Sprachmodell – es markiert den Beginn einer neuen Ära der offenen, kosteneffizienten und spezialisierten AI-Fähigkeiten, die speziell für das Unternehmen entwickelt wurden.

Von der Revolution der Datenanalyse und der Codierungsproduktivität bis zur Steuerung von Aufgabenautomatisierung und intelligenteren Anwendungen – Arctics unternehmensspezifische DNA macht es zu einer unübertroffenen Wahl gegenüber generischen LLMs. Und indem Snowflake nicht nur das Modell, sondern den gesamten Forschungs- und Entwicklungsprozess dahinter open-source macht, fördert das Unternehmen eine Kultur der Zusammenarbeit, die das gesamte AI-Ökosystem erhöhen wird.

Da Unternehmen zunehmend generative AI nutzen, bietet Arctic ein mutiges Blueprint für die Entwicklung von Modellen, die objektiv für Produktionsworkloads und Unternehmensumgebungen überlegen sind. Die Kombination aus bahnbrechender Forschung, unübertroffener Effizienz und einem unerschütterlichen offenen Ethos setzt einen neuen Standard für die Demokratisierung des transformierenden Potenzials von AI.

Hier ist ein Abschnitt mit Code-Beispielen, wie man das Snowflake-Arctic-Modell nutzen kann:

Hands-On mit Arctic

Jetzt, da wir gesehen haben, was Arctic wirklich bahnbrechend macht, lassen Sie uns einen Blick darauf werfen, wie Entwickler und Data-Scientist dieses leistungsfähige Modell in Betrieb nehmen können.
Vor dem Training ist Arctic verfügbar und bereit für die Bereitstellung über große Modellhubs wie Hugging Face und Partner-AI-Plattformen. Aber seine wahre Kraft entfaltet sich, wenn es für spezifische Anwendungsfälle angepasst und fein abgestimmt wird.

Arctics Apache-2.0-Lizenz bietet volle Freiheit, es in Ihre Apps, Dienste oder benutzerdefinierte AI-Workflows zu integrieren. Lassen Sie uns einige Code-Beispiele mit der Transformers-Bibliothek durchgehen, um Sie loszulegen:

Grundlegende Inferenz mit Arctic

Für schnelle Textgenerierungsanwendungsfälle können wir Arctic laden und grundlegende Inferenz sehr einfach durchführen:


<p>from transformers import AutoTokenizer, AutoModelForCausalLM</p>

<p># Laden Sie den Tokenizer und das Modell
tokenizer = AutoTokenizer.from_pretrained("Snowflake/snowflake-arctic-instruct")
model = AutoModelForCausalLM.from_pretrained("Snowflake/snowflake-arctic-instruct")</p>

<p># Erstellen Sie eine einfache Eingabe und generieren Sie Text
input_text = "Hier ist eine grundlegende Frage: Was ist die Hauptstadt von Frankreich?"
input_ids = tokenizer.encode(input_text, return_tensors="pt")</p>

<p># Generieren Sie eine Antwort mit Arctic
output = model.generate(input_ids, max_length=150, do_sample=True, top_k=50, top_p=0.95, num_return_sequences=1)
generated_text = tokenizer.decode(output[0], skip_special_tokens=True)</p>

print(generated_text)

Dies sollte etwas wie Folgendes ausgeben:

“Die Hauptstadt von Frankreich ist Paris. Paris ist die größte Stadt in Frankreich und das wirtschaftliche, politische und kulturelle Zentrum des Landes. Es ist die Heimat berühmter Sehenswürdigkeiten wie dem Eiffelturm, dem Louvre-Museum und der Notre-Dame-Kathedrale.”

Wie Sie sehen, versteht Arctic die Anfrage nahtlos und liefert eine detaillierte, fundierte Antwort, die seine robusten Sprachverständigungsfähigkeiten nutzt.

Feinabstimmung für spezifische Aufgaben

Während es bereits beeindruckend ist, wenn es aus der Box kommt, strahlt Arctic wirklich, wenn es angepasst und fein abgestimmt wird, um spezifische Aufgaben auf Ihren eigenen Daten zu erfüllen. Snowflake hat umfassende Rezepte bereitgestellt, die Folgendes abdecken:

  • Curating hochwertige Trainingsdaten, die auf Ihren Anwendungsfall zugeschnitten sind
  • Implementierung benutzerdefinierter mehrstufiger Trainingscurricula
  • Nutzen effizienter LoRA-, P-Tuning- oder FactorizedFusion-Feinabstimmungsansätze
  • Optimierungen für die Unterscheidung von SQL, Codierung oder anderen wichtigen Unternehmensfähigkeiten

Hier ist ein Beispiel, wie man Arctic auf Ihre eigenen Codierungsdatensätze mit LoRA und Snowflakes Rezepten fein abstimmen kann:


<p>from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import LoraConfig, get_peft_model, prepare_model_for_int8_training</p>

<p># Laden Sie das Basis-Arctic-Modell
tokenizer = AutoTokenizer.from_pretrained("Snowflake/snowflake-arctic-instruct")
model = AutoModelForCausalLM.from_pretrained("Snowflake/snowflake-arctic-instruct", load_in_8bit=True)</p>

<p># Initialisieren Sie die LoRA-Konfiguration
lora_config = LoraConfig(
r=8,
lora_alpha=16,
target_modules=["query_key_value"],
lora_dropout=0.05,
bias="none",
task_type="CAUSAL_LM"
)</p>

<p># Vorbereiten des Modells für LoRA-Feinabstimmung
model = prepare_model_for_int8_training(model)
model = get_peft_model(model, lora_config)</p>

<p># Ihre Codierungsdatensätze
data = load_coding_datasets()</p>

<p># Feinabstimmung mit Snowflakes Rezepten
train(model, data, ...)</p>

Dieser Code zeigt, wie Sie Arctic laden, eine LoRA-Konfiguration initialisieren und das Modell auf Ihren eigenen Codierungsdatensätzen fein abstimmen können, indem Sie Snowflakes Anleitung nutzen.

Benutzerdefiniert und fein abgestimmt wird Arctic zu einer privaten Kraft, die auf Ihre Kernunternehmensworkflows und Stakeholderbedürfnisse abgestimmt ist.

Arctics schneller Innovationszyklus

Eine der beeindruckendsten Aspekte von Arctic ist das atemberaubende Tempo, mit dem Snowflakes AI-Forschungsteam das Modell konzipiert, entwickelt und in weniger als drei Monaten der Welt zugänglich gemacht hat. Dieses Tempo zeigt Snowflakes tiefe technische Fähigkeiten und positioniert das Unternehmen, um kontinuierlich die Grenzen für die Entwicklung von neuartigen, unternehmensspezifischen AI-Fähigkeiten zu erweitern.

Diese Fähigkeit, schnell zu iterieren, zu innovieren und Forschungsergebnisse in Produkte umzusetzen, ist wirklich bemerkenswert. Es zeigt, dass Snowflake die notwendigen Ressourcen und das Know-how hat, um kontinuierlich bahnbrechende AI-Forschung zu betreiben und in Produkte umzusetzen.

Die Arctic-Familie und Embeddings

Arctic ist nur der Anfang von Snowflakes Ambitionen im Bereich der Unternehmens-LLMs. Das Unternehmen hat bereits die Snowflake-Arctic-Embed-Familie von Branchen führenden Text-Embedding-Modellen open-source gemacht, die für die Abrufleistung über mehrere Größenprofile optimiert sind.

Wie unten gezeigt, erreichen die Arctic-Embed-Modelle den Spitzenplatz bei der Abrufgenauigkeit auf dem renommierten MTEB-Textabruf-Benchmark, wobei sie andere führende Embedding-Modelle, einschließlich geschlossener Angebote von großen Technologieunternehmen, überbieten.

[Einfügen eines Bildes, das die MTEB-Textabruf-Benchmark-Ergebnisse für die Arctic-Embed-Modelle zeigt]

Diese Embedding-Modelle ergänzen das Arctic-LLM und ermöglichen es Unternehmen, leistungsstarke Frage-Antwort- und Abruf-ergänzte Generierungsanwendungen aus einem integrierten Open-Source-Stack zu erstellen.

Aber Snowflakes Roadmap reicht weit über Arctic und Embeddings hinaus. Die AI-Forscher des Unternehmens arbeiten an der Erweiterung der Arctic-Familie mit neuen Modellen, die für multimodale Aufgaben, Sprache, Video und weitere Grenzfähigkeiten entwickelt werden – alles basierend auf den gleichen Prinzipien von Spezialisierung, Effizienz und Offenheit.

Partnerschaften für ein offenes AI-Ökosystem Snowflake versteht, dass die vollständige Nutzung des Potenzials offener, unternehmensspezifischer AI die Förderung einer reichen Ökosystem-Partnerschaft über die gesamte AI-Community hinweg erfordert. Die Veröffentlichung von Arctic hat bereits Partnerschaften mit großen Plattformen und Anbietern angeregt:

NVIDIA hat eng mit Snowflake zusammengearbeitet, um Arctic für eine effiziente Bereitstellung mit NVIDIAs bahnbrechendem AI-Inferenz-Stack, einschließlich TensorRT, Triton und mehr, zu optimieren. Dies ermöglicht es Unternehmen, Arctic kosteneffizient im großen Maßstab bereitzustellen.

Hugging Face, der führende Open-Source-Modellhub, hat Arctic in seine Bibliotheken und Modell-Repositorys aufgenommen. Dies ermöglicht eine nahtlose Integration von Arctic in bestehende Hugging-Face-basierte AI-Workflows und Anwendungen.

Plattformen wie Replicate, SageMaker und mehr haben sich schnell bewegt, um gehostete Demos, APIs und flüssige Integrationspfade für Arctic bereitzustellen, was dessen Adoption beschleunigt.

Open-Source-Technologie hat die Entwicklung von Arctic vorangetrieben, und offene Ökosysteme bleiben zentral für seine Evolution. Snowflake ist bestrebt, eine reiche Zusammenarbeit mit Forschern, Entwicklern, Partnern und Unternehmen auf der ganzen Welt zu fördern, um die Grenzen dessen zu erweitern, was mit offenen, spezialisierten AI-Modellen möglich ist.

Ich habe die letzten fünf Jahre damit verbracht, mich in die faszinierende Welt des Machine Learning und Deep Learning zu vertiefen. Mein Engagement und meine Expertise haben mich dazu geführt, an über 50 verschiedenen Software-Entwicklungsprojekten mit einem besonderen Fokus auf AI/ML beizutragen. Meine anhaltende Neugier hat mich auch zum Bereich der Natural Language Processing hingezogen, einem Feld, das ich weiter erforschen möchte.