KI-Modelle und Plattformen

Kann man Large Language Models wie ChatGPT zur HÃĪlfte der Kosten bauen?

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufÞgen

Large Language Models (LLMs) wie GPT-3 und ChatGPT haben die kÞnstliche Intelligenz revolutioniert, indem sie FÃĪhigkeiten zur Verarbeitung von natÞrlicher Sprache und zur Generierung von Inhalten bieten. Ihre Entwicklung hat jedoch einen hohen Preis, der die ZugÃĪnglichkeit und weitere Forschung einschrÃĪnkt. Forscher schÃĪtzen, dass die Ausbildung von GPT-3 OpenAI etwa $5 Millionen gekostet hat. Dennoch erkannte Microsoft (MSFT ) das Potenzial und investierte $1 Milliarde im Jahr 2019 und $10 Milliarden im Jahr 2023 in OpenAI’s GPT-3- und ChatGPT-Venture.

LLMs sind Machine-Learning-Modelle, die auf umfangreichen textbasierten Daten fÞr NLP-Anwendungen trainiert werden. Sie basieren auf der Transformer-Architektur und verwenden Aufmerksamkeitsmechanismen fÞr NLP-Aufgaben wie Fragebeantwortung, maschinelle Übersetzung, Sentiment-Analyse usw.

Die Frage stellt sich: Kann die Effizienz dieser großen Modelle erhÃķht werden, wÃĪhrend gleichzeitig die Rechenkosten und die Trainingszeit reduziert werden?

Es gibt mehrere AnsÃĪtze, wie z.B. Progressive Neural Networks, Network Morphism, intra-layer model parallelism, knowledge inheritance usw., die entwickelt wurden, um die Rechenkosten fÞr das Training von neuronalen Netzen zu reduzieren. Der neuartige LiGO-Ansatz (Linear Growth Operator), den wir besprechen werden, setzt einen neuen Benchmark. Er halbiert die Rechenkosten fÞr das Training von LLMs.

Bevor wir diese Technik besprechen, ist es wichtig, die Faktoren zu untersuchen, die zum hohen Preis fÞr die Erstellung von LLMs beitragen.

Kosten fÞr die Erstellung von Large Language Models

Es gibt drei Hauptkosten fÞr die Entwicklung von LLMs:

1. Rechenressourcen

Die Erstellung von LLMs erfordert massive Rechenressourcen, um auf großen DatensÃĪtzen trainiert zu werden. Sie mÞssen Milliarden von Parametern verarbeiten und komplexe Muster aus großen textbasierten Daten lernen.

Die Investition in spezielle Hardware wie Grafikprozessoren (GPUs) und Tensor-Prozessoren (TPUs) ist erforderlich, um LLMs zu bauen und zu trainieren, um eine Spitzenleistung zu erzielen.

Zum Beispiel wurde GPT-3 auf einem Supercomputer mit 10.000 Unternehmens-GPUs (H100 und A100) und 285.000 CPU-Kernen trainiert.

2. Energieverbrauch

Die intensiven Rechenressourcen, die fÞr die Erstellung von LLMs erforderlich sind, fÞhren zu einem erheblichen Energieverbrauch. Zum Beispiel dauerte das Training von 175 Milliarden Parametern von GPT-3 14,8 Tage mit 10.000 V100-GPUs, was 3,55 Millionen GPU-Stunden entspricht. Ein solch hoher Energieverbrauch hat erhebliche Umweltauswirkungen.

3. DatenSpeicherung und -Verwaltung

LLMs werden auf großen DatensÃĪtzen trainiert. Zum Beispiel wurde GPT-3 auf einem umfangreichen Korpus von textbasierten Daten trainiert, einschließlich Common Crawl, WebText2, Books1, Books2 und Wikipedia. Eine erhebliche Infrastrukturinvestition ist erforderlich, um diese DatensÃĪtze zu sammeln, zu kuratieren und zu speichern.

Außerdem ist Cloud-Speicher fÞr die Datenspeicherung und menschliche Expertise fÞr die Datenverarbeitung und Versionierung erforderlich. DarÞber hinaus erhÃķht die Sicherstellung, dass die Datenstrategie den Vorschriften wie der DSGVO entspricht, die Kosten.

LiGO-Technik: Reduzierung der Kosten fÞr die Erstellung von Large Language Models auf die HÃĪlfte

LiGO (Linear Growth Operator) ist eine neuartige Technik, die von Forschern am MIT entwickelt wurde, um die Rechenkosten fÞr das Training von LLMs um 50% zu reduzieren. Die Methode besteht darin, die Gewichte von grÃķßeren Modellen aus denen von kleineren vorgefertigten Modellen zu initialisieren, um eine effiziente Skalierung von neuronalen Netzen zu ermÃķglichen.

Yoon Kim, der Hauptautor des Artikels, sagt:

„Es wurde geschÃĪtzt, dass das Training von Modellen im Maßstab von dem, was ChatGPT hypothetisch ausfÞhren soll, Millionen von Dollar fÞr einen einzigen Trainingslauf kosten kann. KÃķnnen wir die Effizienz dieser Trainingsmethoden verbessern, damit wir gute Modelle in weniger Zeit und fÞr weniger Geld erhalten? Wir schlagen vor, dies zu tun, indem wir kleinere Sprachmodelle nutzen, die zuvor trainiert wurden.“

Diese Methode behÃĪlt die Leistungsvorteile von grÃķßeren Modellen bei reduzierten Rechenkosten und Trainingszeit im Vergleich zum Training eines großen Modells von Grund auf. LiGO verwendet einen datengetriebenen linearen Wachstumsoperator, der Tiefe- und Breitenoperatoren fÞr optimale Leistung kombiniert.

Das Paper verwendete verschiedene DatensÃĪtze, um textbasierte Experimente durchzufÞhren, einschließlich des englischen Wikipedia-Korpus fÞr das Training von BERT- und RoBERTa-Modellen und des C4-Datensatzes fÞr das Training von GPT2.

Die LiGO-Technik-Experimente umfassten das Wachstum von BERT-Small zu BERT-Base, BERT-Base zu BERT-Large, RoBERTa-Small zu RoBERTa-Base, GPT2-Base zu GPT2-Medium und CaiT-XS zu CaiT-S.

Die Forscher verglichen ihren Ansatz mit mehreren anderen Baselines, einschließlich des Trainings von Grund auf, des progressiven Trainings, von bert2BERT und KI.

Die LiGO-Technik bot 44,7% Einsparungen bei den FLOPs (Floating-Point-Operationen pro Sekunde) und 40,7% Einsparungen bei der Wanduhrzeit im Vergleich zum Training von BERT-Base von Grund auf durch die Wiederverwendung des BERT-Small-Modells. Der LiGO-Wachstumsoperator Þbertrifft StackBERT, MSLT, bert2BERT und KI bei der effizienten Ausbildung.

Vorteile der Verwendung einer Trainingsoptimierungstechnik wie LiGO

LiGO ist eine effiziente Methode fÞr die Ausbildung von neuronalen Netzen, die verschiedene Vorteile aufweist:

1. Schnelleres Training

Wie bereits erwÃĪhnt, ist das schnellere Training der Hauptvorteil der LiGO-Technik. Es trainiert LLMs in der HÃĪlfte der Zeit, was die ProduktivitÃĪt erhÃķht und die Kosten reduziert.

2. Ressourceneffizienz

LiGO ist ressourceneffizient, da es die Wanduhrzeit und die FLOPs minimiert, was zu einem kostengÞnstigeren und umweltfreundlicheren Ansatz fÞr die Ausbildung von großen Transformer-Modellen fÞhrt.

3. Generalisierung

Die LiGO-Technik hat die Leistung von Sprach- und Vision-Transformern verbessert, was darauf hindeutet, dass es sich um eine generalisierbare Technik handelt, die auf verschiedene Aufgaben angewendet werden kann.

Die Erstellung von kommerziellen AI-Produkten ist nur ein Aspekt der Gesamtkosten, die mit AI-Systemen verbunden sind. Ein weiterer wichtiger Bestandteil der Kosten entsteht durch den tÃĪglichen Betrieb. Zum Beispiel kostet es OpenAI etwa $700.000 pro Tag, um Anfragen mit ChatGPT zu beantworten. Forscher werden voraussichtlich weiterhin AnsÃĪtze erforschen, die LLMs wÃĪhrend der Ausbildung kostengÞnstig und wÃĪhrend der Laufzeit zugÃĪnglicher machen.

FÞr weitere AI-bezogene Inhalte besuchen Sie unite.ai.

Haziqa ist ein Data Scientist mit umfangreicher Erfahrung in der Erstellung von technischem Inhalt fÞr KI- und SaaS-Unternehmen.