KI-Modelle und Plattformen

Fortschritte bei der Ausrichtung von KI-Systemen mit menschlichen Werten durch WARM

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Ausrichtung von KI-Systemen mit menschlichen Werten

Künstliche Intelligenz (KI)-Systeme werden zunehmend in der Lage, Menschen bei komplexen Aufgaben zu unterstützen, von Chatbots für den Kundenservice bis hin zu Algorithmen für die medizinische Diagnose. Es ist jedoch wichtig, dass diese KI-Systeme mit menschlichen Werten und Vorlieben übereinstimmen, wenn sie mehr Verantwortung übernehmen. Ein Ansatz, um dies zu erreichen, ist die Technik des Reinforcement Learning aus menschlichem Feedback (RLHF). Bei RLHF wird ein KI-System, auch bekannt als Policy, belohnt oder bestraft, basierend auf menschlichen Urteilen über sein Verhalten. Das Ziel ist, dass die Policy lernt, ihre Belohnungen zu maximieren und somit gemäß menschlichen Vorlieben zu handeln.

Ein wichtiger Bestandteil von RLHF ist das Belohnungsmodell (RM). Das RM ist verantwortlich für die Bewertung der Aktionen und Ausgaben der Policy und gibt ein Belohnungssignal zurück, um den Lernprozess zu steuern. Die Entwicklung eines guten RM ist herausfordernd, da menschliche Vorlieben komplex, kontextabhängig und sogar inkonsistent über Individuen hinweg sein können. Kürzlich haben Forscher von Google DeepMind eine innovative Technik namens Weight Averaged Reward Models (WARM) vorgeschlagen, um die Entwicklung von RM zu verbessern.

Die Probleme mit Belohnungshacking

Ein großes Problem bei RLHF ist das Belohnungshacking. Belohnungshacking tritt auf, wenn die Policy Lücken findet, um das RM-System zu manipulieren und hohe Belohnungen zu erhalten, ohne die beabsichtigten Ziele zu erreichen. Zum Beispiel könnte das Ziel sein, ein Schreibassistenten-KI-System zu trainieren, um hochwertige Zusammenfassungen zu generieren. Das RM könnte Zusammenfassungen belohnen, die prägnant und informativ sind. Die Policy könnte dann lernen, dies auszunutzen, indem sie sehr kurze, uninformative Zusammenfassungen mit Schlüsselwörtern generiert, die das RM täuschen.

Belohnungshacking geschieht aus zwei Hauptgründen:

  1. Verteilungsverschiebung – Das RM wird auf einem begrenzten Datensatz von menschlich beschrifteten Beispielen trainiert. Wenn es bereitgestellt wird, können die Ausgaben der Policy aus verschiedenen Verteilungen stammen, auf die das RM nicht gut generalisiert.
  2. Rauschige Beschriftungen – Menschliche Beschriftung ist unvollkommen, mit inter-rater-Übereinstimmungen. Das RM kann sich auf spurhafte Signale statt robuste Indikatoren von Qualität konzentrieren.

Belohnungshacking führt zu nutzlosen Systemen, die menschliche Erwartungen nicht erfüllen. Schlimmer noch, es kann zu KI-Verhaltensweisen führen, die voreingenommen oder sogar gefährlich sind, wenn sie sorglos bereitgestellt werden.

Der Aufstieg des Modell-Mergings

Das wachsende Interesse an Modell-Merging-Strategien wie Model Ratatouille wird durch die Erkenntnis getrieben, dass größere Modelle, obwohl leistungsfähig, ineffizient und unpraktisch sein können. Das Training eines 1-Billionen-Parameter-Modells erfordert enorme Mengen an Daten, Rechenleistung, Zeit und Kosten. Wichtiger noch, solche Modelle neigen dazu, sich an die Trainingsverteilung anzupassen, was ihre Fähigkeit, sich an verschiedene reale Szenarien anzupassen, beeinträchtigt.

Modell-Merging bietet eine alternative Route, um größere Fähigkeiten ohne unkontrolliertes Skalieren zu entsperren. Durch die Wiederverwendung mehrerer spezialisierter Modelle, die auf verschiedenen Verteilungen, Aufgaben oder Zielen trainiert wurden, zielt Modell-Merging darauf ab, Vielseitigkeit und Robustheit außerhalb der Verteilung zu verbessern. Die Prämisse ist, dass verschiedene Modelle unterschiedliche Vorhersagemuster erfassen, die sich gegenseitig ergänzen, wenn sie zusammengeführt werden.

Aktuelle Ergebnisse veranschaulichen das Potenzial dieses Konzepts. Modelle, die durch Merging erhalten werden, können trotz weniger Parameter die Leistung von Riesenmodellen wie GPT-3 erreichen oder sogar übertreffen. Zum Beispiel erreicht ein Model Ratatouille-Ensemble aus nur 7 mittelgroßen Checkpoints die beste Genauigkeit auf hochdimensionalen Text-Implikations-Datensätzen und übertrifft GPT-3.

Die Einfachheit des Mergings durch Gewichtsaveraging ist ein großer Vorteil. Das Training mehrerer Hilfsmodelle erfordert zwar zusätzliche Ressourcen. Kritisch jedoch bleibt die Rechenleistung bei der Inferenzzeit identisch mit einem einzelnen Modell, da die Gewichte in einem zusammengefasst werden. Dies macht die Methode leicht anpassbar, ohne Bedenken hinsichtlich erhöhter Latenz oder Speicherkosten.

Mechanismen hinter dem Modell-Merging

Aber was genau ermöglicht diese Genauigkeitsgewinne durch das Merging von Modellen? Aktuelle Analysen bieten einige Hinweise:

  • Minderung der Memorisation: Jedes Modell sieht unterschiedliche zufällige Batchs des Datensatzes während des Trainings. Durchschnittlich verringert dies jede instanzspezifische Memorisation, wodurch nur datensatzweite Verallgemeinerungen erhalten bleiben.
  • Verringerung der Varianz: Modelle, die unabhängig trainiert werden, haben unkorrelierte Fehler. Durch die Kombination werden diese Fehler gemittelt, was die Kalibrierung verbessert.
  • Regularisierung durch Vielfalt: Die Variation von Hilfsaufgaben zwingt Modelle, sich auf allgemeinere Merkmale zu konzentrieren, die über Verteilungen hinweg nützlich sind.
  • Erhöhung der Robustheit: Inkonsistenzen in den Vorhersagen signalisieren Unsicherheit. Durchschnittlich werden Outlier-Urteile gemildert, was die Zuverlässigkeit erhöht.

Im Wesentlichen gleicht das Modell-Merging die Schwächen einzelner Modelle aus, um ihre kollektiven Stärken zu verstärken. Die zusammengeführte Darstellung erfasst die gemeinsamen zugrunde liegenden kausalen Strukturen und ignoriert zufällige Variationen.

Diese konzeptionelle Grundlage verbindet das Modell-Merging mit anderen beliebten Techniken wie Ensembling und Multi-Task-Lernen. All diese Methoden nutzen Vielfalt über Modelle oder Aufgaben, um vielseitige, unsicherheitsbewusste Systeme zu erhalten. Die Einfachheit und Effizienz des Gewichtsaveraging gibt dem Modell-Merging jedoch einen einzigartigen Vorteil für die Förderung realer Einsatzszenarien.

Weight Averaged Reward Models

Alignment-Prozess mit WARM

Alignment-Prozess mit WARM

WARM setzt innovativ ein Proxy-Belohnungsmodell (RM) ein, das ein Gewichtsdurchschnitt mehrerer einzelner RM ist, die jeweils fein abgestimmt werden von demselben vorgefertigten LLM, aber mit unterschiedlichen Hyperparametern. Diese Methode verbessert die Effizienz, Zuverlässigkeit unter Verteilungsverschiebungen und Robustheit gegen inkonsistente Vorlieben. Die Studie zeigt auch, dass die Verwendung von WARM als Proxy-RM, insbesondere mit einer erhöhten Anzahl von gemittelten RM, die Ergebnisse verbessert und den Beginn von “Belohnungshacking” verzögert, einem Phänomen, bei dem die Kontrollbelohnungen im Laufe der Zeit verschlechtern.

Hier ist eine hochrangige Übersicht:

  1. Beginnen Sie mit einem Basis-Sprachmodell, das auf einem großen Korpus vorgefertigt wurde. Initialisieren Sie mehrere RM, indem Sie kleine, aufgabenspezifische Schichten hinzufügen.
  2. Feinabstimmen Sie jedes RM separat auf dem menschlichen Präferenzdatensatz, unter Verwendung unterschiedlicher Hyperparameter wie Lernrate für Vielfalt.
  3. Mitteln Sie die Gewichte der fein abgestimmten RM, um ein einzelnes WARM-Ensemble zu erhalten.

Der Schlüsselgedanke ist, dass das Gewichtsaveraging nur die invarianten Informationen beibehält, die über alle vielfältigen RM gelernt werden. Dies verringert die Abhängigkeit von spurhaften Signalen und erhöht die Robustheit. Das Ensemble profitiert auch von der Varianzreduktion, was die Zuverlässigkeit trotz Verteilungsverschiebungen verbessert.

Wie bereits diskutiert, ist Vielfalt über unabhängig trainierte Modelle entscheidend, um das volle Potenzial des Modell-Mergings zu entsperren. Aber was sind einige konkrete Techniken, um produktive Vielfalt zu fördern?

Das WARM-Papier erkundet einige clevere Ideen, die sich weiter verbreiten könnten:

Reihenfolge-Vertauschungen

Ein trivialer, aber wirksamer Ansatz ist das Vertauschen der Reihenfolge, in der Datenpunkte von jedem Modell während des Trainings gesehen werden. Selbst dieser einfache Schritt entkoppelt die Gewichte und verringert redundante Memorisation von Mustern.

Hyperparameter-Variationen

Das Anpassen von Hyperparametern wie Lernrate und Dropout-Wahrscheinlichkeit für jeden Lauf führt nützliche Vielfalt ein. Modelle konvergieren unterschiedlich und erfassen unterschiedliche Eigenschaften des Datensatzes.

Checkpoint-Averaging – Baklava

Die Baklava-Methode initialisiert Modelle für das Merging aus verschiedenen Snapshots entlang der gleichen Vorgehens-Traektorie. Dies lockert die Einschränkungen im Vergleich zu Modell-Suppen, die einen gemeinsamen Startpunkt erfordern. Im Vergleich zu Model Ratatouille vermeidet Baklava zusätzliche Aufgaben. Insgesamt schafft es eine effektive Balance zwischen Genauigkeit und Vielfalt.

Feinabstimmung mehrerer Belohnungsmodelle

Der Prozess beginnt mit einem vorgefertigten großen Sprachmodell (LLM) 𝜃_𝑝𝑡. Von diesem Modell werden verschiedene Checkpoints {𝜃_𝑠 𝑓 𝑡_𝑖} während eines überwachten Feinabstimmungs-Laufs (SFT) abgeleitet, jeweils gesammelt bei unterschiedlichen SFT-Trainingschritten. Diese Checkpoints werden dann als Initialisierungen für die Feinabstimmung mehrerer Belohnungsmodelle (RM) {𝜙𝑖} auf einem Präferenzdatensatz verwendet. Diese Feinabstimmung zielt darauf ab, die Modelle besser an menschliche Vorlieben anzupassen. Nach der Feinabstimmung werden diese RM durch ein Verfahren des Gewichtsaveraging kombiniert, was zum endgültigen Modell, 𝜙_WARM, führt.

Die Analyse bestätigt, dass das Hinzufügen älterer Checkpoints durch Mittelwertbildung die individuelle Leistung beeinträchtigt und die Vielfaltsvorteile kompromittiert. Das Mitteln nur der endgültigen Darstellungen aus jedem Lauf führt zu besseren Ergebnissen. Im Allgemeinen bleibt die Balance zwischen Vielfaltszielen und Wahrung der Genauigkeit eine offene Herausforderung in der Forschung.

Insgesamt stimmt das Modell-Merging gut mit der allgemeinen Ethos in dem Feld überein, vorhandene Ressourcen effektiv für verbesserte Zuverlässigkeit, Effizienz und Vielseitigkeit zu recyceln. Die Einfachheit des Gewichtsaveraging festigt ihre Position als führender Kandidat für die Zusammenstellung robuster Modelle aus verfügbaren Bausteinen.

Im Gegensatz zu herkömmlichen Ensembling-Methoden, die Vorhersagen mitteln, hält WARM den Rechenaufwand minimal, indem nur ein Satz von Gewichten aufrechterhalten wird. Experimente auf Textzusammenfassungsaufgaben demonstrieren die Effektivität von WARM:

  • Für die beste-N-Sampling-Methode erreicht WARM eine Gewinnrate von 92,5 % gegenüber der zufälligen Auswahl gemäß menschlicher Präferenzetiketten.
  • Bei RLHF erreicht eine WARM-Richtlinie eine Gewinnrate von 79,4 % gegenüber einer Richtlinie, die mit einem einzelnen RM trainiert wurde, nach der gleichen Anzahl von Schritten.
  • WARM funktioniert auch gut, wenn ein Viertel der menschlichen Etiketten fehlerhaft ist.

Diese Ergebnisse veranschaulichen das Potenzial von WARM als praktische Technik für die Entwicklung realer KI-Assistenten, die zuverlässig funktionieren. Durch das Glätten von Inkonsistenzen im menschlichen Feedback können WARM-Richtlinien robust mit menschlichen Werten übereinstimmen, auch wenn sie weiterhin aus neuen Erfahrungen lernen.

Das größere Bild

WARM steht an der Kreuzung von zwei wichtigen Trends in der KI-Ausrichtungsforschung. Erstens ist dies das Studium der Verallgemeinerung außerhalb der Verteilung (OOD), das darauf abzielt, die Modellleistung auf neuen Daten zu verbessern, die sich von der Trainingsverteilung unterscheiden. Zweitens ist dies die Forschung zur algorithmischen Robustheit, die sich auf die Zuverlässigkeit trotz kleiner Eingabestörungen oder Rauschen konzentriert.

Indem WARM Verbindungen zwischen diesen Bereichen um den Begriff der gelernten Invarianten herstellt, bewegt es sich in Richtung strenger begründeter Techniken für die Wertausrichtung. Die Erkenntnisse aus WARM könnten sogar über RLHF hinausgehen und Lektionen für umfassendere maschinelle Lernsysteme bieten, die mit der offenen Welt interagieren.

Natürlich ist das Belohnungsmodell nur ein Teil des Ausrichtungspuzzles. Wir benötigen noch Fortschritte bei anderen Herausforderungen wie der Belohnungsspezifikation, der skalierbaren Aufsicht und der sicheren Exploration. In Kombination mit komplementären Techniken könnte WARM die Entwicklung von KI beschleunigen, die menschliches Wohlergehen nachhaltig fördert. Durch die gemeinsame Erklärung der Prinzipien, die der robusten Ausrichtung zugrunde liegen, kartieren Forscher den Weg zu vorteilhaften, ethischen KI-Systemen.

Ich habe die letzten fünf Jahre damit verbracht, mich in die faszinierende Welt des Machine Learning und Deep Learning zu vertiefen. Mein Engagement und meine Expertise haben mich dazu geführt, an über 50 verschiedenen Software-Entwicklungsprojekten mit einem besonderen Fokus auf AI/ML beizutragen. Meine anhaltende Neugier hat mich auch zum Bereich der Natural Language Processing hingezogen, einem Feld, das ich weiter erforschen möchte.