KI-Modelle und Plattformen
RAFT – Eine Feinabstimmung und RAG-Ansatz für domänen-spezifische Fragebeantwortung

Von
Aayush Mittal Mittal
Da sich die Anwendungen von großen Sprachmodellen auf spezialisierte Bereiche ausdehnen, wird die Notwendigkeit von effizienten und effektiven Adaptionstechniken immer dringender. Hier kommt RAFT (Retrieval Augmented Fine Tuning) ins Spiel, ein neuer Ansatz, der die Stärken von Retrieval-augmentierter Generation (RAG) und Feinabstimmung kombiniert, speziell für domänen-spezifische Fragebeantwortungsaufgaben entwickelt.
Die Herausforderung der Domänenanpassung
Obwohl LLMs auf großen Datenmengen trainiert werden, ist ihre Fähigkeit, in spezialisierten Bereichen wie medizinischer Forschung, Rechtsdokumentation oder unternehmensspezifischen Wissensbasen gut zu performen, oft begrenzt. Diese Begrenzung entsteht, weil die Trainingsdaten die Nuancen und Feinheiten dieser spezialisierten Bereiche möglicherweise nicht ausreichend repräsentieren. Um diese Herausforderung zu meistern, haben Forscher traditionell zwei Haupttechniken eingesetzt: Retrieval-augmentierte Generation (RAG) und Feinabstimmung.
Retrieval-Augmentierte Generation (RAG)
RAG ist eine Technik, die es LLMs ermöglicht, auf externe Wissensquellen während der Inferenz zuzugreifen und diese zu nutzen.
Sie erreicht dies, indem sie die Echtzeit-Datenabfrage in den generativen Prozess integriert, wodurch die Ausgaben des Modells genauer und aktuell werden. RAG besteht aus drei Kernschritten: Abruf, bei dem relevante Dokumente gesammelt werden; Generation, bei der das Modell eine Ausgabe auf der Grundlage der abgerufenen Daten produziert; und Augmentation, die die Ausgabe weiter verfeinert.
Der Abrufprozess in RAG beginnt mit einer Benutzeranfrage. LLMs analysieren die Anfrage und holen relevante Informationen aus externen Datenbanken, präsentieren einen Datenpool, aus dem das Modell seine Antworten ableiten kann. Die Generationsphase synthetisiert diese Eingaben in eine kohärente Erzählung oder Antwort. Der Augmentations-Schritt verfeinert die Generation, indem er Kontext hinzufügt oder für Kohärenz und Relevanz anpasst.
RAG-Modelle können mit verschiedenen Metriken bewertet werden, die ihre Fähigkeit beurteilen, genaue, relevante und aktuelle Informationen bereitzustellen.
Feinabstimmung
Feinabstimmung beinhaltet das Anpassen eines vortrainierten LLMs an eine spezifische Aufgabe oder einen spezifischen Bereich, indem es auf einem kleineren, aufgabenspezifischen Datensatz weitertrainiert wird. Dieser Ansatz ermöglicht es dem Modell, Muster zu lernen und seine Ausgaben mit der gewünschten Aufgabe oder dem Bereich in Einklang zu bringen. Obwohl die Feinabstimmung die Leistung des Modells verbessern kann, verfehlt sie oft die effektive Integration externer Wissensquellen oder berücksichtigt Abfragefehler während der Inferenz nicht ausreichend.
Der RAFT-Ansatz
RAFT steht für Retrieval-Aware Fine-Tuning und ist eine innovative Trainingsmethode, die für Sprachmodelle entwickelt wurde, um ihre Leistung in domänen-spezifischen Aufgaben, insbesondere bei offenen Fragebeantwortungstests, zu verbessern. RAFT weicht von der Standard-Feinabstimmung ab, indem es Trainingsdaten vorbereitet, die Fragen mit einer Mischung aus relevanten und nicht-relevanten Dokumenten sowie kettenartigen Denkprozessen enthalten, die aus den relevanten Texten abgeleitet werden. Diese Methode zielt darauf ab, die Fähigkeit der Modelle zu verbessern, nicht nur Informationen wiederzugeben, sondern auch aus dem bereitgestellten Inhalt abzuleiten und zu begründen.
Im Wesentlichen feinabstimmt RAFT Sprachmodelle, um in Aufgaben, die Leseverständnis und Wissensextraktion aus einem Satz von Dokumenten erfordern, mehr Profizienz zu erlangen. Durch das Training mit sowohl “Oracle (ORCL ) “-Dokumenten (die die Antwort enthalten) als auch “Ablenkungs”-Dokumenten (die die Antwort nicht enthalten) lernt das Modell, relevante Informationen effektiver zu erkennen und zu nutzen.
Vorbereitung der Trainingsdaten
Der Trainingsprozess unter RAFT umfasst einen Anteil der Daten, der Oracle-Dokumente enthält, die direkt mit den Antworten in Verbindung stehen, während der verbleibende Teil der Daten nur aus Ablenkungsdokumenten besteht. Die Feinabstimmung ermutigt das Modell, zu lernen, wann es auf sein internes Wissen (ähnlich der Memorierung) und wann es auf den bereitgestellten Kontext zurückgreifen soll.
Die Trainingsroutine von RAFT betont auch die Generierung von Denkprozessen, die nicht nur bei der Bildung der Antwort helfen, sondern auch Quellen zitieren, ähnlich wie ein Mensch seine Antwort durch Bezugnahme auf gelesenes Material begründen würde. Dieser Ansatz bereitet das Modell nicht nur auf eine RAG-Umgebung (Retrieval-Augmentierte Generation) vor, in der es die Top-k abgerufenen Dokumente berücksichtigen muss, sondern stellt auch sicher, dass das Training des Modells unabhängig vom verwendeten Abrufsystem ist, was eine flexible Anwendung über verschiedene Abrufsysteme hinweg ermöglicht.
Dieser Ansatz dient mehreren Zwecken:
- Er trainiert das Modell, relevante Informationen aus dem bereitgestellten Kontext zu identifizieren und zu nutzen, ähnlich wie in einer offenen Prüfungssituation.
- Er verbessert die Fähigkeit des Modells, irrelevante Informationen zu ignorieren, eine kritische Fähigkeit für effektive RAG.
- Er setzt das Modell mit Szenarien konfrontiert, in denen die Antwort nicht im Kontext vorhanden ist, und ermutigt es, auf sein eigenes Wissen zurückzugreifen, wenn erforderlich.
Ein weiterer wichtiger Aspekt von RAFT ist die Integration von kettenartigen Denkprozessen in den Trainingsprozess. Anstatt einfach Frage- und Antwortpaare bereitzustellen, generiert RAFT detaillierte Begründungen, die wörtliche Zitate aus den relevanten Dokumenten enthalten. Diese Begründungen, die in einer kettenartigen Denkweise präsentiert werden, leiten das Modell durch die logischen Schritte, die zur richtigen Antwort erforderlich sind.
Durch das Training des Modells auf diesen Denkprozessen fördert RAFT die Entwicklung starker Denkfähigkeiten und verbessert das Verständnis des Modells dafür, wie es externe Wissensquellen effektiv nutzen kann.
Auswertung und Ergebnisse
Die Autoren des RAFT-Papiers führten umfangreiche Auswertungen auf verschiedenen Datensätzen durch, einschließlich PubMed (biomedizinische Forschung), HotpotQA (offene Fragebeantwortung) und der Gorilla APIBench (Codegenerierung). Ihre Ergebnisse zeigten, dass RAFT konsistent besser abschnitt als Vergleichsbasen, wie domänen-spezifische Feinabstimmung mit und ohne RAG sowie größere Modelle wie GPT-3.5 mit RAG.
Beispielsweise erreichte RAFT auf dem HuggingFace-Datensatz eine Genauigkeit von 74 %, was eine signifikante Verbesserung von 31,41 % gegenüber der domänen-spezifischen Feinabstimmung (DSF) und 44,92 % gegenüber GPT-3.5 mit RAG darstellt. Ähnlich verhielt es sich auf dem HotpotQA-Datensatz, wo RAFT einen Genauigkeitszuwachs von 28,9 % im Vergleich zu DSF zeigte.
Einer der Hauptvorteile von RAFT ist seine Robustheit gegenüber Abfragefehlern. Durch das Training des Modells mit einer Mischung aus relevanten und nicht-relevanten Dokumenten verbessert RAFT die Fähigkeit des Modells, relevante Informationen zu erkennen und zu priorisieren, auch wenn das Abrufmodul suboptimale Ergebnisse liefert.
Die Autoren demonstrierten, dass die Feinabstimmung mit nur den Oracle-Dokumenten oft zu einer schlechteren Leistung führt im Vergleich zu Konfigurationen, die auch Ablenkungsdokumente enthalten. Diese Erkenntnis unterstreicht die Bedeutung, das Modell während des Trainings mit verschiedenen Abfrageszenarien zu konfrontieren, um seine Anwendbarkeit in realen Anwendungen sicherzustellen.
Praktische Anwendungen und zukünftige Richtungen
Die RAFT-Technik hat bedeutende Auswirkungen auf eine breite Palette praktischer Anwendungen, einschließlich:
- Fragebeantwortungssysteme: RAFT kann eingesetzt werden, um hochgenaue und domänen-spezifische Fragebeantwortungssysteme zu entwickeln, die sowohl das gelernte Wissen des Modells als auch externe Wissensquellen nutzen.
- Unternehmenswissensmanagement: Organisationen mit großen Wissensbasen können RAFT nutzen, um maßgeschneiderte Fragebeantwortungssysteme zu entwickeln, die es Mitarbeitern ermöglichen, schnell auf relevante Informationen zuzugreifen und diese zu nutzen.
- Medizinische und wissenschaftliche Forschung: RAFT kann insbesondere in Bereichen wie der biomedizinischen Forschung wertvoll sein, wo der Zugang zu den neuesten Erkenntnissen und der Literatur für das Vorankommen des wissenschaftlichen Verständnisses von entscheidender Bedeutung ist.
- Rechts- und Finanzdienstleistungen: RAFT kann Fachleuten in diesen Bereichen helfen, indem es genaue und kontextbezogene Antworten auf der Grundlage relevanter Rechtsdokumente oder Finanzberichte liefert.
Wenn die Forschung in diesem Bereich weitergeht, können wir weitere Fortschritte und Verfeinerungen der RAFT-Technik erwarten. Mögliche zukünftige Richtungen umfassen:
- Die Erforschung effizienterer und effektiverer Abrufmodule, die für spezifische Bereiche oder Dokumentenstrukturen ausgelegt sind.
- Die Integration multimodaler Informationen, wie Bilder oder Tabellen, in den RAFT-Rahmen für ein verbessertes Kontextverständnis.
- Die Entwicklung spezifischer Denkarchitekturen, die die kettenartigen Denkprozesse, die während des Trainings generiert werden, besser nutzen können.
- Die Anpassung von RAFT an andere natürliche Sprachaufgaben jenseits der Fragebeantwortung, wie Zusammenfassung, Übersetzung oder Dialogsysteme.
Schlussfolgerung
RAFT stellt einen bedeutenden Fortschritt im Bereich der domänen-spezifischen Fragebeantwortung mit Sprachmodellen dar. Durch die harmonische Kombination der Stärken von Retrieval-augmentierter Generation und Feinabstimmung rüstet RAFT LLMs mit der Fähigkeit aus, externe Wissensquellen effektiv zu nutzen und ihre Ausgaben mit domänen-spezifischen Mustern und Präferenzen in Einklang zu bringen.
Durch seine innovative Trainingsdatenvorbereitung, die Integration von kettenartigen Denkprozessen und die Robustheit gegenüber Abfragefehlern bietet RAFT eine leistungsstarke Lösung für Organisationen und Forscher, die das volle Potenzial von LLMs in spezialisierten Bereichen ausschöpfen möchten.
Da die Nachfrage nach domänen-spezifischen natürlichen Sprachverarbeitungsfähigkeiten weiter wächst, werden Techniken wie RAFT eine entscheidende Rolle bei der Ermöglichung genauer, kontextbezogener und anpassungsfähiger Sprachmodelle spielen, die den Weg zu einer Zukunft ebnen, in der die menschliche Maschinenkommunikation wirklich nahtlos und bereichsübergreifend wird.
Ich habe die letzten fünf Jahre damit verbracht, mich in die faszinierende Welt des Machine Learning und Deep Learning zu vertiefen. Mein Engagement und meine Expertise haben mich dazu geführt, an über 50 verschiedenen Software-Entwicklungsprojekten mit einem besonderen Fokus auf AI/ML beizutragen. Meine anhaltende Neugier hat mich auch zum Bereich der Natural Language Processing hingezogen, einem Feld, das ich weiter erforschen möchte.
Mehr entdecken


AI’s Gedächtnisproblem: Warum effiziente lange Kontexte alles ändern und was es braucht, um es richtig zu machen


Warum Ihr biomedizinisches RAG Kontradiktionen vor Ihnen versteckt


Der wahre Grund, warum Ihre RAG-Pipeline weiterhin Halluzinationen erzeugt


2026-Prognose – Open Source wird auf der Welle von KI in ihr nächstes Goldenes Zeitalter reiten


Warum die meisten modernen Apps im Zeitalter von KI nutzlos sein werden


Gemini 3.1 Pro erreicht Rekord-Argumentationsgewinne



