Andersons Blickwinkel

Erstellung eines GPT-ähnlichen Sprachmodells für eine einzelne Frage

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Forscher aus China haben eine wirtschaftliche Methode entwickelt, um GPT-3-ähnliche Systeme der natürlichen Sprachverarbeitung zu erstellen, ohne die zunehmend prohibitiven Kosten für Zeit und Geld, die für die Ausbildung von großen Datensätzen erforderlich sind – eine wachsende Tendenz, die sonst dazu führen würde, dass dieser Sektor der künstlichen Intelligenz letztendlich den FAANG-Playern und hochrangigen Investoren vorbehalten bleibt.

Das vorgeschlagene Framework wird als Aufgabenorientiertes Sprachmodell (TLM) bezeichnet. Anstelle eines riesigen und komplexen Modells, das auf einem riesigen Korpus von Milliarden von Wörtern und Tausenden von Labels und Klassen trainiert wird, trainiert TLM ein viel kleineres Modell, das tatsächlich eine Abfrage direkt in das Modell integriert.

Links, ein typischer hyperskalierter Ansatz für große Sprachmodelle; rechts, TLMs schlankes Verfahren, um einen großen Sprachkorpus auf pro-Thema- oder pro-Frage-Basis zu erkunden. Quelle: https://arxiv.org/pdf/2111.04130.pdf

Links, ein typischer hyperskalierter Ansatz für große Sprachmodelle; rechts, TLMs schlankes Verfahren, um einen großen Sprachkorpus auf pro-Thema- oder pro-Frage-Basis zu erkunden. Quelle: https://arxiv.org/pdf/2111.04130.pdf

Effektiv wird ein einzigartiges NLP-Algorithmus oder -Modell erstellt, um eine einzelne Frage zu beantworten, anstelle eines riesigen und unhandlichen allgemeinen Sprachmodells, das eine Vielzahl von Fragen beantworten kann.

Bei der Erprobung von TLM fanden die Forscher heraus, dass der neue Ansatz Ergebnisse erzielt, die denen von vorgefertigten Sprachmodellen wie RoBERTa-Large und hyperskalierbaren NLP-Systemen wie OpenAIs GPT-3, Googles TRILLION Parameter Switch Transformer Modell, Koreas HyperClover, AI21 Labs’ Jurassic 1 und Microsofts Megatron-Turing NLG 530B ähnlich sind oder sogar besser.

Bei Versuchen mit TLM über acht Klassifizierungsdatensätze in vier Domänen fanden die Autoren zusätzlich heraus, dass das System die für die Ausbildung erforderlichen FLOPs (Floating-Point-Operationen pro Sekunde) um zwei Größenordnungen reduziert. Die Forscher hoffen, dass TLM einen Sektor “demokratisieren” kann, der zunehmend elitär wird, mit NLP-Modellen, die so groß sind, dass sie realistisch nicht lokal installiert werden können und stattdessen hinter den teuren und limitierten APIs von OpenAI und jetzt Microsoft Azure sitzen.

Die Autoren stellen fest, dass die Reduzierung der Ausbildungszeit um zwei Größenordnungen die Ausbildungskosten über 1.000 GPUs für einen Tag auf nur 8 GPUs über 48 Stunden reduziert.

Der neue Bericht trägt den Titel NLP From Scratch Without Large-Scale Pretraining: A Simple and Efficient Framework und stammt von drei Forschern der Tsinghua-Universität in Peking und einem Forscher des China-basierten AI-Entwicklungunternehmens Recurrent AI, Inc.

Unerreichbare Antworten

Die Kosten für die Ausbildung effektiver, allgemeiner Sprachmodelle werden zunehmend als potenzielle “thermische Grenze” für den Umfang, in dem leistungsfähige und genaue NLP tatsächlich in der Kultur verbreitet werden kann, charakterisiert.

Statistiken zum Wachstum von Facetten in NLP-Modellarchitekturen, aus einem Bericht von A121 Labs aus dem Jahr 2020. Quelle: https://arxiv.org/pdf/2004.08900.pdf

Statistiken zum Wachstum von Facetten in NLP-Modellarchitekturen, aus einem Bericht von A121 Labs aus dem Jahr 2020. Quelle: https://arxiv.org/pdf/2004.08900.pdf

Im Jahr 2019 berechnete ein Forscher, dass es 61.440 USD kostet, das XLNet-Modell (das zum Zeitpunkt der Veröffentlichung BERT in NLP-Aufgaben übertraf) über 2,5 Tage auf 512 Kernen über 64 Geräten auszubilden, während GPT-3 auf geschätzt 12 Millionen USD zur Ausbildung gekostet hat – 200-mal höhere Ausgaben als für die Ausbildung seines Vorgängers GPT-2 (obwohl jüngste Neuberechnungen behaupten, es könne jetzt für nur 4.600.000 USD auf den günstigsten Cloud-GPUs ausgebildet werden).

Teilmengen von Daten basierend auf Abfrageanforderungen

Stattdessen zielt die neue vorgeschlagene Architektur darauf ab, genaue Klassifizierungen, Labels und Verallgemeinerungen zu erhalten, indem eine Abfrage als eine Art Filter verwendet wird, um eine Teilmenge von Informationen aus einer großen Sprachdatenbank zu definieren, die zusammen mit der Abfrage ausgebildet wird, um Antworten zu einem begrenzten Thema zu liefern.

Die Autoren stellen fest:

‘TLM  ist  durch  zwei  Schlüsselideen  motiviert.   Erstens,  beherrschen Menschen eine Aufgabe, indem sie nur einen kleinen Teil des Weltwissens verwenden (z. B. müssen Studenten nur einige Kapitel überprüfen, um sich auf eine Prüfung vorzubereiten). 

‘Wir gehen davon aus, dass es in einem großen Korpus für eine bestimmte Aufgabe viel Redundanz gibt. Zweitens ist das Training auf beaufsichtigten, gelabelten Daten viel effizienter für die Downstream-Leistung als die Optimierung des Sprachmodellierungsziels auf ungelabelten Daten.  Basierend auf diesen Motivationen verwendet TLM die Aufgaben-Daten als Abfragen, um eine winzige Teilmenge des allgemeinen Korpus abzurufen.  Dies wird gefolgt von der gemeinsamen Optimierung eines beaufsichtigten Aufgabenziels und eines Sprachmodellierungsziels unter Verwendung der abgerufenen Daten und der Aufgaben-Daten.’

Neben der Erstellung einer hoch effizienten NLP-Modell-Ausbildung sehen die Autoren eine Reihe von Vorteilen bei der Verwendung von aufgabenorientierten NLP-Modellen. Einerseits können Forscher eine größere Flexibilität genießen, mit benutzerdefinierten Strategien für Sequenzlänge, Tokenisierung, Hyperparameter-Anpassung und Datenrepräsentation.

Die Forscher sehen auch die Entwicklung von Hybrid-Systemen in der Zukunft, die die begrenzte Vor-Ausbildung eines PLM (die in der aktuellen Implementierung nicht erwartet wird) gegen eine größere Vielseitigkeit und Verallgemeinerung gegen Ausbildungszeiten abwägen. Sie betrachten das System als einen Schritt vorwärts für die Weiterentwicklung von In-Domain-Zero-Shot-Verallgemeinerungsmethoden.

Testen und Ergebnisse

TLM wurde auf Klassifizierungs-Herausforderungen in acht Aufgaben über vier Domänen – biomedizinische Wissenschaft, Nachrichten, Bewertungen und Informatik – getestet. Die Aufgaben wurden in hoch ressourcenintensive und niedrig ressourcenintensive Kategorien unterteilt. Hoch ressourcenintensive Aufgaben umfassten über 5.000 Aufgaben-Daten, wie z. B. AGNews und RCT, sowie andere; niedrig ressourcenintensive Aufgaben umfassten ChemProt und ACL-ARC sowie das HyperPartisan-Nachrichtenerkennungs-Datensatz.

Die Forscher entwickelten zwei Trainings-Sets mit den Namen Corpus-BERT und Corpus-RoBERTa, wobei Letzterer zehnmal so groß war wie Erster. Die Experimente verglichen allgemeine vorgefertigte Sprachmodelle BERT (von Google ) und RoBERTA (von Facebook ) mit der neuen Architektur.

Der Bericht stellt fest, dass TLM, obwohl es ein allgemeines Verfahren ist und daher in seinem Umfang und seiner Anwendbarkeit begrenzter sein sollte als umfassendere und voluminösere State-of-the-Art-Modelle, in der Lage ist, nahe an domänadaptives Feintuning heranzukommen.

Ergebnisse aus dem Vergleich der Leistung von TLM gegenüber BERT- und RoBERTa-basierten Sets. Die Ergebnisse listen den Durchschnittswert des F1-Scores über drei verschiedene Trainings-Skalen auf und listen die Anzahl der Parameter, die Gesamtausbildungs-Compute (FLOPs) und die Größe des Trainings-Korpus auf.

Ergebnisse aus dem Vergleich der Leistung von TLM gegenüber BERT- und RoBERTa-basierten Sets. Die Ergebnisse listen den Durchschnittswert des F1-Scores über drei verschiedene Trainings-Skalen auf und listen die Anzahl der Parameter, die Gesamtausbildungs-Compute (FLOPs) und die Größe des Trainings-Korpus auf.

Die Autoren schlussfolgern, dass TLM in der Lage ist, Ergebnisse zu erzielen, die mit denen von PLMs vergleichbar oder besser sind, mit einer erheblichen Reduzierung der erforderlichen FLOPs und nur 1/16 des Trainings-Korpus. Über mittlere und große Skalen kann TLM offensichtlich die Leistung um 0,59 und 0,24 Punkte im Durchschnitt verbessern, während die Größe der Trainings-Daten um zwei Größenordnungen reduziert wird.

‘Diese Ergebnisse bestätigen, dass TLM hochgenau und viel effizienter ist als PLMs. Darüber hinaus gewinnt TLM mehr Vorteile in der Effizienz bei größeren Skalen. Dies deutet darauf hin, dass größere PLMs möglicherweise dazu trainiert wurden, allgemeines Wissen zu speichern, das nicht für eine bestimmte Aufgabe nützlich ist.’

Schriftsteller über maschinelles Lernen, Domänen-Spezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu dessen Auflösung in DNEG's Brahma.ai.
Portfolio-Website: martinanderson.ai
Kontakt: martin@martinanderson.ai