KI-Modelle und Plattformen
Kann man Large Language Models wie ChatGPT zur Hälfte der Kosten bauen?
Large Language Models (LLMs) wie GPT-3 und ChatGPT haben die künstliche Intelligenz revolutioniert, indem sie Fähigkeiten zur Verarbeitung von natürlicher Sprache und zur Generierung von Inhalten bieten. Ihre Entwicklung hat jedoch einen hohen Preis, der die Zugänglichkeit und weitere Forschung einschränkt. Forscher schätzen, dass die Ausbildung von GPT-3 OpenAI etwa $5 Millionen gekostet hat. Dennoch erkannte Microsoft (MSFT ) das Potenzial und investierte $1 Milliarde im Jahr 2019 und $10 Milliarden im Jahr 2023 in OpenAI’s GPT-3- und ChatGPT-Venture.
LLMs sind Machine-Learning-Modelle, die auf umfangreichen textbasierten Daten für NLP-Anwendungen trainiert werden. Sie basieren auf der Transformer-Architektur und verwenden Aufmerksamkeitsmechanismen für NLP-Aufgaben wie Fragebeantwortung, maschinelle Übersetzung, Sentiment-Analyse usw.
Die Frage stellt sich: Kann die Effizienz dieser großen Modelle erhöht werden, während gleichzeitig die Rechenkosten und die Trainingszeit reduziert werden?
Es gibt mehrere Ansätze, wie z.B. Progressive Neural Networks, Network Morphism, intra-layer model parallelism, knowledge inheritance usw., die entwickelt wurden, um die Rechenkosten für das Training von neuronalen Netzen zu reduzieren. Der neuartige LiGO-Ansatz (Linear Growth Operator), den wir besprechen werden, setzt einen neuen Benchmark. Er halbiert die Rechenkosten für das Training von LLMs.
Bevor wir diese Technik besprechen, ist es wichtig, die Faktoren zu untersuchen, die zum hohen Preis für die Erstellung von LLMs beitragen.
Kosten für die Erstellung von Large Language Models
Es gibt drei Hauptkosten für die Entwicklung von LLMs:
1. Rechenressourcen
Die Erstellung von LLMs erfordert massive Rechenressourcen, um auf großen Datensätzen trainiert zu werden. Sie müssen Milliarden von Parametern verarbeiten und komplexe Muster aus großen textbasierten Daten lernen.
Die Investition in spezielle Hardware wie Grafikprozessoren (GPUs) und Tensor-Prozessoren (TPUs) ist erforderlich, um LLMs zu bauen und zu trainieren, um eine Spitzenleistung zu erzielen.
Zum Beispiel wurde GPT-3 auf einem Supercomputer mit 10.000 Unternehmens-GPUs (H100 und A100) und 285.000 CPU-Kernen trainiert.
2. Energieverbrauch
Die intensiven Rechenressourcen, die für die Erstellung von LLMs erforderlich sind, führen zu einem erheblichen Energieverbrauch. Zum Beispiel dauerte das Training von 175 Milliarden Parametern von GPT-3 14,8 Tage mit 10.000 V100-GPUs, was 3,55 Millionen GPU-Stunden entspricht. Ein solch hoher Energieverbrauch hat erhebliche Umweltauswirkungen.
3. DatenSpeicherung und -Verwaltung
LLMs werden auf großen Datensätzen trainiert. Zum Beispiel wurde GPT-3 auf einem umfangreichen Korpus von textbasierten Daten trainiert, einschließlich Common Crawl, WebText2, Books1, Books2 und Wikipedia. Eine erhebliche Infrastrukturinvestition ist erforderlich, um diese Datensätze zu sammeln, zu kuratieren und zu speichern.
Außerdem ist Cloud-Speicher für die Datenspeicherung und menschliche Expertise für die Datenverarbeitung und Versionierung erforderlich. Darüber hinaus erhöht die Sicherstellung, dass die Datenstrategie den Vorschriften wie der DSGVO entspricht, die Kosten.
LiGO-Technik: Reduzierung der Kosten für die Erstellung von Large Language Models auf die Hälfte
LiGO (Linear Growth Operator) ist eine neuartige Technik, die von Forschern am MIT entwickelt wurde, um die Rechenkosten für das Training von LLMs um 50% zu reduzieren. Die Methode besteht darin, die Gewichte von größeren Modellen aus denen von kleineren vorgefertigten Modellen zu initialisieren, um eine effiziente Skalierung von neuronalen Netzen zu ermöglichen.

Bild aus dem Paper: Learning to Grow Pretrained Models For Efficient Transformer Training
Yoon Kim, der Hauptautor des Artikels, sagt:
„Es wurde geschätzt, dass das Training von Modellen im Maßstab von dem, was ChatGPT hypothetisch ausführen soll, Millionen von Dollar für einen einzigen Trainingslauf kosten kann. Können wir die Effizienz dieser Trainingsmethoden verbessern, damit wir gute Modelle in weniger Zeit und für weniger Geld erhalten? Wir schlagen vor, dies zu tun, indem wir kleinere Sprachmodelle nutzen, die zuvor trainiert wurden.“
Diese Methode behält die Leistungsvorteile von größeren Modellen bei reduzierten Rechenkosten und Trainingszeit im Vergleich zum Training eines großen Modells von Grund auf. LiGO verwendet einen datengetriebenen linearen Wachstumsoperator, der Tiefe- und Breitenoperatoren für optimale Leistung kombiniert.
Das Paper verwendete verschiedene Datensätze, um textbasierte Experimente durchzuführen, einschließlich des englischen Wikipedia-Korpus für das Training von BERT- und RoBERTa-Modellen und des C4-Datensatzes für das Training von GPT2.
Die LiGO-Technik-Experimente umfassten das Wachstum von BERT-Small zu BERT-Base, BERT-Base zu BERT-Large, RoBERTa-Small zu RoBERTa-Base, GPT2-Base zu GPT2-Medium und CaiT-XS zu CaiT-S.
Die Forscher verglichen ihren Ansatz mit mehreren anderen Baselines, einschließlich des Trainings von Grund auf, des progressiven Trainings, von bert2BERT und KI.
Die LiGO-Technik bot 44,7% Einsparungen bei den FLOPs (Floating-Point-Operationen pro Sekunde) und 40,7% Einsparungen bei der Wanduhrzeit im Vergleich zum Training von BERT-Base von Grund auf durch die Wiederverwendung des BERT-Small-Modells. Der LiGO-Wachstumsoperator übertrifft StackBERT, MSLT, bert2BERT und KI bei der effizienten Ausbildung.
Vorteile der Verwendung einer Trainingsoptimierungstechnik wie LiGO
LiGO ist eine effiziente Methode für die Ausbildung von neuronalen Netzen, die verschiedene Vorteile aufweist:
1. Schnelleres Training
Wie bereits erwähnt, ist das schnellere Training der Hauptvorteil der LiGO-Technik. Es trainiert LLMs in der Hälfte der Zeit, was die Produktivität erhöht und die Kosten reduziert.
2. Ressourceneffizienz
LiGO ist ressourceneffizient, da es die Wanduhrzeit und die FLOPs minimiert, was zu einem kostengünstigeren und umweltfreundlicheren Ansatz für die Ausbildung von großen Transformer-Modellen führt.
3. Generalisierung
Die LiGO-Technik hat die Leistung von Sprach- und Vision-Transformern verbessert, was darauf hindeutet, dass es sich um eine generalisierbare Technik handelt, die auf verschiedene Aufgaben angewendet werden kann.
Die Erstellung von kommerziellen AI-Produkten ist nur ein Aspekt der Gesamtkosten, die mit AI-Systemen verbunden sind. Ein weiterer wichtiger Bestandteil der Kosten entsteht durch den täglichen Betrieb. Zum Beispiel kostet es OpenAI etwa $700.000 pro Tag, um Anfragen mit ChatGPT zu beantworten. Forscher werden voraussichtlich weiterhin Ansätze erforschen, die LLMs während der Ausbildung kostengünstig und während der Laufzeit zugänglicher machen.
Für weitere AI-bezogene Inhalte besuchen Sie unite.ai.












