Vordenker
Die Wahrheit über synthetische Daten: Warum menschliche Expertise für den Erfolg von LLM entscheidend ist

Entwickler von LLMs greifen immer häufiger auf synthetische Daten zurück, um die Entwicklung zu beschleunigen und Kosten zu reduzieren. Forscher hinter mehreren Top-Modellen wie LLama 3, Qwen 2 und DeepSeek R1 haben in ihren Forschungsarbeiten erwähnt, synthetische Daten zur Ausbildung ihrer Modelle zu verwenden. Von außen betrachtet, scheint dies die perfekte Lösung zu sein: ein unerschöpflicher Informationsquell, der die Entwicklung beschleunigt und Kosten reduziert. Doch diese Lösung hat einen verborgenen Preis, den Geschäftsführer nicht ignorieren können.
In einfachen Worten sind synthetische Daten von AI-Modellen generiert, um künstliche Datensätze für die Ausbildung, Feinabstimmung und Bewertung von LLMs und AI-Agents zu erstellen. Im Vergleich zur traditionellen menschlichen Annotation ermöglicht es die Datenpipeline, schnell zu skalieren, was in der dynamischen und wettbewerbsorientierten Landschaft der AI-Entwicklung unerlässlich ist.
Unternehmen haben möglicherweise andere Gründe, “falsche” Daten zu verwenden, wie zum Beispiel den Schutz sensibler oder vertraulicher Informationen in Finanz- oder Gesundheitsbereichen durch die Erstellung anonymisierter Versionen. Synthetische Daten sind auch ein guter Ersatz, wenn proprietäre Daten nicht verfügbar sind, wie zum Beispiel vor der Markteinführung eines Produkts oder wenn die Daten externen Kunden gehören.
Aber revolutioniert synthetische Daten die AI-Entwicklung? Die kurze Antwort ist ein qualifiziertes Ja: sie haben großes Potenzial, können aber auch LLMs und Agents gegenüber kritischen Schwachstellen aussetzen, wenn sie nicht sorgfältig von Menschen überwacht werden. LLM-Produzenten und AI-Agent-Entwickler können feststellen, dass AI-Modelle, die mit unzureichend geprüften synthetischen Daten ausgebildet werden, ungenaue oder voreingenommene Ausgaben erzeugen, Reputationskrisen verursachen und zu einer Nichteinhaltung von Branchen- und ethischen Standards führen können. Investitionen in menschliche Überwachung, um synthetische Daten zu verfeinern, sind direkte Investitionen in den Schutz des Unternehmens, die Aufrechterhaltung des Vertrauens der Stakeholder und die Gewährleistung einer verantwortungsvollen AI-Einführung.
Mit menschlicher Eingabe können synthetische Daten in hochwertige Trainingsdaten umgewandelt werden. Es gibt drei entscheidende Gründe, um generierte Daten vor ihrer Verwendung zur Ausbildung von AI zu verfeinern: um Lücken im Wissen des Quellmodells zu füllen, um die Datenqualität zu verbessern und die Stichprobengröße zu reduzieren und um sie mit menschlichen Werten in Einklang zu bringen.
Wir müssen einzigartiges Wissen erfassen
Synthetische Daten werden in erster Linie von LLMs generiert, die auf öffentlich zugänglichen Internetquellen trainiert werden, was eine inhärente Einschränkung mit sich bringt. Öffentliche Inhalte erfassen selten das praktische, handwerkliche Wissen, das in der realen Arbeit verwendet wird. Aktivitäten wie das Erstellen einer Marketingkampagne, die Erstellung einer Finanzprognose oder die Durchführung einer Marktanalyse werden typischerweise privat und nicht online dokumentiert. Darüber hinaus spiegeln die Quellen tendenziell US-amerikanische Sprache und Kultur wider, was die globale Repräsentation einschränkt.
Um diese Einschränkungen zu überwinden, können wir Experten einbeziehen, um Datenproben in Bereichen zu erstellen, die wir vermuten, dass das synthetische Datengenerierungsmodell nicht abdecken kann. Wenn wir beispielsweise möchten, dass unser endgültiges Modell Finanzprognosen und Marktanalysen effektiv handhaben kann, müssen die Trainingsdaten realistische Aufgaben aus diesen Bereichen enthalten. Es ist wichtig, diese Lücken zu identifizieren und synthetische Daten mit von Experten erstellten Proben zu ergänzen.
Experten werden oft frühzeitig in das Projekt einbezogen, um den Umfang der Arbeit zu definieren. Dazu gehört die Erstellung einer Taxonomie, die die spezifischen Bereiche des Wissens umreißt, in denen das Modell funktionieren muss. Beispielsweise kann die allgemeine Medizin in Bereiche wie Ernährung, Herzgesundheit, Allergien und mehr unterteilt werden. Ein auf Gesundheit fokussiertes Modell muss in all diesen Bereichen, die es abdecken soll, trainiert werden. Nachdem die Taxonomie von Gesundheitsexperten definiert wurde, können LLMs verwendet werden, um Datenpunkte mit typischen Fragen und Antworten schnell und im großen Maßstab zu generieren. Menschliche Experten sind jedoch immer noch erforderlich, um diesen Inhalt zu überprüfen, zu korrigieren und zu verbessern, um sicherzustellen, dass er nicht nur genau, sondern auch sicher und kontextuell angemessen ist. Dieser Qualitätskontrollprozess ist in Hochrisikobereichen wie der Gesundheitsversorgung unerlässlich, um die DatenGenauigkeit zu gewährleisten und möglichen Schaden zu vermeiden.
Qualität über Quantität: Effizienzsteigerung der Modelle durch weniger, bessere Proben
Wenn Domänenexperten Daten für die Ausbildung von LLMs und AI-Agents erstellen, erstellen sie Taxonomien für Datensätze, schreiben Prompts, erstellen ideale Antworten oder simulieren eine bestimmte Aufgabe. Alle diese Schritte sind sorgfältig darauf ausgelegt, dem Zweck des Modells zu entsprechen, und die Qualität wird durch Fachleute auf dem entsprechenden Gebiet gewährleistet.
Die synthetische Datengenerierung repliziert diesen Prozess nicht vollständig. Sie basiert auf den Stärken des zugrunde liegenden Modells, das zur Datenerstellung verwendet wird, und die resultierende Qualität ist oft nicht mit der von menschlich kuratierten Daten vergleichbar. Dies bedeutet, dass synthetische Daten oft viel größere Mengen erfordern, um zufriedenstellende Ergebnisse zu erzielen, was die Rechenkosten und die Entwicklungszeit in die Höhe treibt.
In komplexen Bereichen gibt es Nuancen, die nur menschliche Experten erkennen können, insbesondere bei Ausreißern oder Randfällen. Menschlich kuratierte Daten liefern konsistent bessere Modellleistungen, auch bei deutlich kleineren Datensätzen. Durch die strategische Einbeziehung menschlicher Expertise in den Datenerstellungsprozess können wir die Anzahl der Proben reduzieren, die für die effektive Funktionsweise des Modells erforderlich sind.
In unserer Erfahrung ist der beste Weg, um diese Herausforderung anzugehen, die Einbeziehung von Fachleuten in die Erstellung synthetischer Datensätze. Wenn Experten die Regeln für die Datengenerierung definieren, Datentaxonomien erstellen und die generierten Daten überprüfen oder korrigieren, ist die endgültige Qualität der Daten viel höher. Dieser Ansatz hat es unseren Kunden ermöglicht, starke Ergebnisse mit weniger Datenproben zu erzielen, was zu einem schnelleren und effizienteren Weg zur Produktion führt.
Aufbau von Vertrauen: Die unersetzliche Rolle der Menschen in der AI-Sicherheit und -Ausrichtung
Automatisierte Systeme können nicht alle Schwachstellen vorhersehen oder die Ausrichtung mit menschlichen Werten gewährleisten, insbesondere in Randfällen und mehrdeutigen Szenarien. Menschliche Experten spielen eine entscheidende Rolle bei der Identifizierung von Risiken und der Gewährleistung ethischer Ergebnisse vor der Bereitstellung. Dies ist ein Schutz, den AI, zumindest vorerst, nicht vollständig selbstständig bieten kann.
Daher reicht synthetische Daten allein nicht aus, um ein starkes Red-Teaming-Datenset zu erstellen. Es ist wichtig, Sicherheitsexperten frühzeitig in den Prozess einzubeziehen. Sie können helfen, die Arten von potenziellen Angriffen zu kartieren und die Struktur des Datensatzes zu leiten. LLMs können dann verwendet werden, um eine große Anzahl von Beispielen zu generieren. Anschließend sind Experten erforderlich, um die Daten zu überprüfen und zu verfeinern, um sicherzustellen, dass sie realistisch, hochwertig und nützlich für die Tests von AI-Systemen sind. Beispielsweise kann ein LLM Tausende von Standard-Hacking-Prompts generieren, aber ein menschlicher Sicherheitsexperte kann neue “soziale Ingenieurskunst”-Angriffe erstellen, die nuancierte psychologische Vorurteile ausnutzen – eine kreative Bedrohung, die automatisierte Systeme Schwierigkeiten haben, selbst zu erfinden.
Es gab bedeutende Fortschritte bei der Ausrichtung von LLMs mithilfe automatisierter Rückmeldungen. In dem Paper “RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback” zeigen Forscher, dass AI-basierte Ausrichtung in vielen Fällen mit menschlicher Rückmeldung vergleichbar ist. Allerdings kämpft RLAIF, während AI-Rückmeldungen mit verbessernden Modellen verbessert werden, in komplexen Bereichen und bei Randfällen oder Ausreißern, Bereichen, in denen die Leistung je nach Anwendung kritisch sein kann. Menschliche Experten sind effektiver bei der Behandlung von Aufgaben-Nuancen und Kontext, was sie für die Ausrichtung zuverlässiger macht.
AI-Agents profitieren auch von automatisierten Tests, um ein breites Spektrum von Sicherheitsrisiken anzugehen. Virtuelle Testumgebungen verwenden generierte Daten, um Agenten-Verhaltensweisen wie die Interaktion mit Online-Tools und die Ausführung von Aktionen auf Websites zu simulieren. Um die Testabdeckung in realistischen Szenarien zu maximieren, ist menschliche Expertise unerlässlich, um Testfälle zu entwerfen, die Ergebnisse automatisierter Bewertungen zu überprüfen und über Schwachstellen zu berichten.
Die Zukunft der synthetischen Daten
Synthetische Daten sind eine hochwertige Technik für die Entwicklung von Large-Language-Modellen, insbesondere wenn Skalierbarkeit und schnelle Bereitstellung in der heutigen dynamischen Landschaft entscheidend sind. Obwohl es keine grundlegenden Mängel in synthetischen Daten selbst gibt, erfordern sie eine Verfeinerung, um ihr volles Potenzial zu entfalten und den größten Wert zu liefern. Ein hybrider Ansatz, der die automatisierte Datengenerierung mit menschlicher Expertise kombiniert, ist eine sehr effektive Methode, um leistungsfähige und zuverlässige Modelle zu entwickeln, da die endgültige Modellleistung mehr von der Datenqualität als von der Gesamtvolumen abhängt. Dieser integrierte Prozess, der AI für die Skalierbarkeit und menschliche Experten für die Validierung verwendet, produziert leistungsfähigere Modelle mit verbesserter Sicherheitsausrichtung, was für den Aufbau von Nutzervertrauen und die Gewährleistung einer verantwortungsvollen Bereitstellung unerlässlich ist.












