KI-Modelle und Plattformen
Google macht die AI-Schulung 28% schneller, indem es SLMs als Lehrer verwendet
Die Schulung von großen Sprachmodellen (LLMs) ist für die meisten Organisationen außer Reichweite geraten. Mit Kosten, die in die Millionen gehen, und Rechenanforderungen, die einen Supercomputer zum Schwitzen bringen würden, ist die AI-Entwicklung hinter den Türen der Tech-Riesen geblieben. Doch Google (GOOGL ) hat diese Geschichte gerade auf den Kopf gestellt, mit einem so einfachen Ansatz, dass man sich fragt, warum niemand früher darauf gekommen ist: die Verwendung von kleineren AI-Modellen als Lehrer.
Wie SALT funktioniert: Ein neuer Ansatz für die Schulung von AI-Modellen
In einer kürzlich veröffentlichten Forschungsarbeit mit dem Titel “A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs,” haben Google Research und DeepMind SALT (Small model Aided Large model Training) vorgestellt. Dies ist die neuartige Methode, die unseren traditionellen Ansatz für die Schulung von LLMs in Frage stellt.
Warum ist diese Forschung bedeutend? Derzeit ist die Schulung von großen AI-Modellen wie versuchen, jemandem alles beizubringen, was er über ein Thema wissen muss – es ist ineffizient, teuer und oft auf Organisationen mit massiven Rechenressourcen beschränkt. SALT geht einen anderen Weg, indem es einen zweistufigen Schulungsprozess einführt, der sowohl innovativ als auch praktisch ist.
Wie SALT tatsächlich funktioniert:
Schritt 1: Wissensdestillation
- Ein kleineres Sprachmodell (SLM) fungiert als Lehrer und teilt sein Verständnis mit dem größeren Modell
- Das kleinere Modell konzentriert sich auf die Übertragung seines “erlernten Wissens” durch das, was die Forscher “weiche Labels” nennen
- Stellen Sie sich vor, es wäre wie ein Lehrassistent, der grundlegende Konzepte behandelt, bevor ein Schüler zu fortgeschrittenen Themen übergeht
- Dieser Schritt ist besonders effektiv in “leichten” Bereichen des Lernens – Bereichen, in denen das kleinere Modell eine starke Vorhersagegewissheit hat
Schritt 2: Selbstständiges Lernen
- Das große Modell wechselt zum selbstständigen Lernen
- Es konzentriert sich auf die Beherrschung komplexer Muster und herausfordernder Aufgaben
- Dies ist der Punkt, an dem das Modell Fähigkeiten entwickelt, die über das hinausgehen, was sein kleiner “Lehrer” liefern konnte
- Der Übergang zwischen den Schritten erfolgt mithilfe sorgfältig konzipierter Strategien, einschließlich linearer Abnahme und linearer Verhältnisabnahme des Destillationsverlustgewichts
In nicht-technischen Worten können Sie sich das kleinere AI-Modell wie einen hilfsbereiten Tutor vorstellen, der das größere Modell in den Anfangsstadien der Schulung unterstützt. Dieser Tutor liefert zusätzliche Informationen zusammen mit seinen Antworten, die angeben, wie sicher er sich über jede Antwort ist. Diese zusätzlichen Informationen, bekannt als “weiche Labels”, helfen dem größeren Modell, schneller und effektiver zu lernen.
- Lineare Abnahme: Es ist wie das allmähliche Herunterdrehen der Lautstärke der Stimme des Tutors. Die Anleitung des Tutors wird mit jedem Schritt weniger prominent, sodass das größere Modell sich mehr auf das Lernen aus den rohen Daten selbst konzentrieren kann.
- Lineare Verhältnisabnahme: Dies ist wie die Anpassung des Gleichgewichts zwischen der Beratung des Tutors und der eigentlichen Aufgabe. Im Laufe der Schulung verlagert sich der Schwerpunkt mehr auf die ursprüngliche Aufgabe, während die Eingabe des Tutors weniger dominant wird.
Die Ergebnisse sind überzeugend. Als Google-Forscher SALT mit einem 1,5-Milliarden-Parameter-SLM testeten, um ein 2,8-Milliarden-Parameter-LLM auf dem Pile-Datensatz zu schulen, sahen sie:
- Eine Reduzierung der Schulungszeit um 28% im Vergleich zu herkömmlichen Methoden
- Bedeutende Leistungsverbesserungen nach der Feinabstimmung:
- Die Genauigkeit bei Mathematikproblemen sprang auf 34,87% (im Vergleich zu 31,84% Baseline)
- Das Leseverständnis erreichte eine Genauigkeit von 67% (im Vergleich zu 63,7%)
Aber was SALT wirklich innovativ macht, ist sein theoretischer Rahmen. Die Forscher entdeckten, dass sogar ein “schwächeres” Lehrmodell die Leistung des Schülers durch die Erreichung eines “günstigen Bias-Varianz-Kompromisses” verbessern kann. In einfacheren Worten hilft das kleinere Modell dem größeren, grundlegende Muster effizienter zu lernen, was eine solide Grundlage für fortgeschrittenes Lernen schafft.
Warum SALT das Spielfeld der AI-Entwicklung neu gestalten könnte
Erinnern Sie sich, als die Cloud-Computing-Technologie veränderte, wer ein Tech-Unternehmen gründen konnte? SALT könnte dasselbe für die AI-Entwicklung tun.
Ich habe mich jahrelang mit AI-Schulungsinnovationen beschäftigt, und die meisten Durchbrüche haben hauptsächlich den Tech-Riesen zugutegekommen. Aber SALT ist anders.
Hier ist, was es für die Zukunft bedeuten könnte:
Für Organisationen mit begrenzten Ressourcen:
- Sie benötigen möglicherweise keine massive Recheninfrastruktur mehr, um leistungsfähige AI-Modelle zu entwickeln
- Kleinere Forschungslabore und Unternehmen könnten mit der Entwicklung von benutzerdefinierten Modellen experimentieren
- Die 28-prozentige Reduzierung der Schulungszeit übersetzt sich direkt in niedrigere Rechenkosten
- Wichtiger noch, Sie könnten mit bescheidenen Rechenressourcen beginnen und dennoch professionelle Ergebnisse erzielen
Für das AI-Entwicklungslandscape:
- Mehr Akteure könnten in das Feld eintreten, was zu mehr vielfältigen und spezialisierten AI-Lösungen führen könnte
- Universitäten und Forschungseinrichtungen könnten mit ihren vorhandenen Ressourcen mehr Experimente durchführen
- Die Hürde für den Einstieg in die AI-Forschung sinkt erheblich
- Wir könnten neue Anwendungen in Bereichen sehen, die zuvor nicht in der Lage waren, AI-Entwicklung zu finanzieren
Was dies für die Zukunft bedeutet
Indem wir kleine Modelle als Lehrer verwenden, machen wir die AI-Schulung nicht nur effizienter, sondern verändern auch grundlegend, wer an der AI-Entwicklung teilnehmen kann. Die Auswirkungen gehen weit über bloße technische Verbesserungen hinaus.
Wichtige Punkte, die Sie im Auge behalten sollten:
- Die Reduzierung der Schulungszeit um 28% ist der Unterschied zwischen dem Starten eines AI-Projekts oder der Erwägung, es sei außer Reichweite
- Die Leistungsverbesserungen (34,87% bei Mathematik, 67% bei Lesetasks) zeigen, dass Zugänglichkeit nicht immer bedeutet, auf Qualität zu verzichten
- SALTs Ansatz beweist, dass manchmal die besten Lösungen durch das Neudenken von Grundlagen entstehen, anstatt einfach mehr Rechenleistung hinzuzufügen
Was Sie beobachten sollten:
- Achten Sie auf kleinere Organisationen, die beginnen, benutzerdefinierte AI-Modelle zu entwickeln
- Beobachten Sie neue Anwendungen in Bereichen, die zuvor nicht in der Lage waren, AI-Entwicklung zu finanzieren
- Suchen Sie nach Innovationen in der Verwendung von kleineren Modellen für spezielle Aufgaben
Denken Sie daran: Der wahre Wert von SALT liegt darin, wie es das Spielfeld für die AI-Innovation verändern könnte. Ob Sie ein Forschungslabor leiten, ein Tech-Team managen oder einfach an der AI-Entwicklung interessiert sind, dies ist der Art von Durchbruch, der Ihre nächste große Idee möglich machen könnte.
Vielleicht sollten Sie über das AI-Projekt nachdenken, das Sie für unerreichbar hielten. Es könnte möglich sein, als Sie es sich vorstellen.










