KI-Modelle und Plattformen

Was sind LLM-Halluzinationen? Ursachen, ethische Bedenken und PrÃĪvention

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufÞgen

Große Sprachmodelle (LLMs) sind kÞnstliche Intelligenzsysteme, die in der Lage sind, menschliche Texte zu analysieren und zu generieren. Aber sie haben ein Problem – LLMs halluzinieren, d.h. sie erfinden Dinge. LLM-Halluzinationen haben Forscher besorgt gemacht, da sie die Fortschritte in diesem Bereich behindern kÃķnnten, wenn Forscher die Ergebnisse der Modelle nicht kontrollieren kÃķnnen, um kritische Systeme fÞr die Menschheit zu entwickeln. Mehr darÞber spÃĪter.

Im Allgemeinen verwenden LLMs große Mengen an Trainingsdaten und komplexe Lernalgorithmen, um realistische Ausgaben zu generieren. In einigen FÃĪllen wird in-context-Lernen verwendet, um diese Modelle mit nur wenigen Beispielen zu trainieren. LLMs werden immer beliebter in verschiedenen Anwendungsbereichen, von der MaschinensprachÞbersetzung bis hin zur Sentiment-Analyse, virtuellen KI-Assistenten, Bildannotierung, natÞrlicher Sprachverarbeitung usw.

Trotz der fortschrittlichen Natur von LLMs sind sie immer noch anfÃĪllig fÞr Vorurteile, Fehler und Halluzinationen. Yann LeCun, der derzeitige Chief AI Scientist bei Meta, erwÃĪhnte kÞrzlich den zentralen Fehler in LLMs, der Halluzinationen verursacht: “Große Sprachmodelle haben keine Vorstellung von der zugrunde liegenden RealitÃĪt, die die Sprache beschreibt. Diese Systeme generieren Text, der grammatisch und semantisch korrekt klingt, aber sie haben keine objektive Vorstellung davon, außer dass sie einfach statistische Konsistenz mit dem Prompt erfÞllen”.

Halluzinationen in LLMs

Bild von Gerd Altmann von Pixabay

Halluzinationen beziehen sich auf die Generierung von Ausgaben, die syntaktisch und semantisch korrekt sind, aber von der RealitÃĪt abgekoppelt sind und auf falschen Annahmen basieren. Halluzination ist einer der grÃķßten ethischen Bedenken von LLMs, und es kann schÃĪdliche Folgen haben, wenn Benutzer ohne ausreichende DomÃĪnenkenntnisse auf diese zunehmend Þberzeugenden Sprachmodelle vertrauen.

Ein bestimmtes Maß an Halluzination ist unvermeidlich bei allen autoregressiven LLMs. Zum Beispiel kann ein Modell einem Celebrity ein gefÃĪlschtes Zitat zuweisen, das nie gesagt wurde. Sie kÃķnnen etwas Þber ein bestimmtes Thema behaupten, das tatsÃĪchlich falsch ist, oder nicht existierende Quellen in Forschungsarbeiten zitieren, wodurch Fehlinformationen verbreitet werden.

Es ist jedoch nicht immer der Fall, dass die Halluzination von KI-Modellen negative Auswirkungen hat. Zum Beispiel legt eine neue Studie nahe, dass Wissenschaftler durch halluzinierende LLMs “neue Proteine mit einer unbegrenzten Anzahl von Eigenschaften” entdecken.

Was verursacht LLM-Halluzinationen?

LLMs kÃķnnen aufgrund verschiedener Faktoren halluzinieren, von Überanpassungsfehlern bei der Kodierung und Dekodierung bis hin zu Trainingsvorurteilen.

Überanpassung

Bild von janjf93 von Pixabay

Überanpassung ist ein Problem, bei dem ein KI-Modell die Trainingsdaten zu gut anpasst, aber nicht in der Lage ist, den gesamten Bereich von Eingaben, die es mÃķglicherweise begegnen wird, vollstÃĪndig darzustellen, d.h. es versagt bei der Verallgemeinerung seiner Vorhersagekraft auf neue, unbekannte Daten. Überanpassung kann dazu fÞhren, dass das Modell halluzinierte Inhalte produziert.

Kodier- und Dekodierfehler

Bild von geralt von Pixabay

Wenn es Fehler bei der Kodierung und Dekodierung von Text und seinen nachfolgenden Darstellungen gibt, kann dies auch dazu fÞhren, dass das Modell unsinnige und fehlerhafte Ausgaben generiert.

Trainingsvorurteil

Bild von Quince Creative von Pixabay

Ein weiterer Faktor ist das Vorhandensein bestimmter Vorurteile in den Trainingsdaten, die dazu fÞhren kÃķnnen, dass das Modell Ergebnisse liefert, die diese Vorurteile reprÃĪsentieren, anstatt die tatsÃĪchliche Natur der Daten. Dies ist ÃĪhnlich wie der Mangel an Vielfalt in den Trainingsdaten, der die FÃĪhigkeit des Modells einschrÃĪnkt, sich auf neue Daten zu verallgemeinern.

Die komplexe Struktur von LLMs macht es fÞr KI-Forscher und -Praktiker sehr schwierig, die zugrunde liegenden Ursachen von Halluzinationen zu identifizieren, zu interpretieren und zu korrigieren.

Ethische Bedenken von LLM-Halluzinationen

LLMs kÃķnnen schÃĪdliche Vorurteile durch Halluzinationen verbreiten und kÃķnnen negative soziale Konsequenzen haben. Einige der wichtigsten ethischen Bedenken sind unten aufgefÞhrt:

Diskriminierender und toxischer Inhalt

Bild von ar130405 von Pixabay

Da die Trainingsdaten von LLMs oft voller soziokultureller Stereotypen aufgrund der inhÃĪrenten Vorurteile und des Mangels an Vielfalt sind, kÃķnnen LLMs diese schÃĪdlichen Ideen gegen benachteiligte Gruppen in der Gesellschaft produzieren und verstÃĪrken.

Sie kÃķnnen diesen diskriminierenden und hassenden Inhalt aufgrund von Rasse, Geschlecht, Religion, Ethnie usw. generieren.

Datenschutzprobleme

Bild von JanBaby von Pixabay

LLMs werden auf einer großen Trainingskorpus trainiert, die oft persÃķnliche Informationen von Personen enthÃĪlt. Es gab FÃĪlle, in denen solche Modelle die PrivatsphÃĪre von Personen verletzt haben. Sie kÃķnnen spezifische Informationen wie Sozialversicherungsnummern, Wohnanschriften, Telefonnummern und medizinische Details preisgeben.

Fehlinformationen und Desinformation

Bild von geralt von Pixabay

Sprachmodelle kÃķnnen menschlich klingenden Inhalt produzieren, der tatsÃĪchlich falsch und nicht durch empirische Beweise gestÞtzt ist. Dies kann unbeabsichtigt sein und zu Fehlinformationen fÞhren, oder es kann eine bÃķswillige Absicht haben, um absichtlich Desinformation zu verbreiten. Wenn dies unkontrolliert bleibt, kann es negative sozio-kulturelle, wirtschaftliche und politische Trends erzeugen.

Verhinderung von LLM-Halluzinationen

Bild von athree23 von Pixabay

Forscher und Praktiker nutzen verschiedene AnsÃĪtze, um das Problem der Halluzinationen in LLMs anzugehen. Dazu gehÃķren die Verbesserung der Vielfalt der Trainingsdaten, die Beseitigung inhÃĪrenter Vorurteile, die Verwendung besserer Regularisierungstechniken und die Anwendung von adversarialen Trainings- und VerstÃĪrkungslernalgorithmen:

  • Die Entwicklung besserer Regularisierungstechniken ist von zentraler Bedeutung, um Halluzinationen zu bekÃĪmpfen. Sie helfen, Überanpassung und andere Probleme zu vermeiden, die Halluzinationen verursachen.
  • Die DatenvergrÃķßerung kann die HÃĪufigkeit von Halluzinationen verringern, wie eine Studie zeigt. Die DatenvergrÃķßerung beinhaltet die Erweiterung des Trainingssets durch HinzufÞgen eines zufÃĪlligen Tokens an einer beliebigen Stelle im Satz. Dies verdoppelt die GrÃķße des Trainingssets und fÞhrt zu einer Verringerung der HÃĪufigkeit von Halluzinationen.
  • OpenAI und Google’s DeepMind entwickelten eine Technik namens Reinforcement Learning mit menschlicher RÞckmeldung (RLHF), um das Halluzinationsproblem von ChatGPT zu bekÃĪmpfen. Dabei wird ein menschlicher Evaluator eingesetzt, der die Antworten des Modells hÃĪufig ÞberprÞft und die am besten geeigneten fÞr die Benutzereingaben auswÃĪhlt. Diese RÞckmeldung wird dann verwendet, um das Verhalten des Modells anzupassen. Ilya Sutskever, OpenAIs Chief Scientist, erwÃĪhnte kÞrzlich, dass dieser Ansatz potenziell Halluzinationen in ChatGPT beheben kann: “Ich bin zuversichtlich, dass wir durch die Verbesserung dieses nachfolgenden Reinforcement Learning mit menschlicher RÞckmeldung Halluzinationen in ChatGPT verhindern kÃķnnen.”
  • Die Identifizierung von halluziniertem Inhalt, um es als Beispiel fÞr zukÞnftiges Training zu verwenden, ist auch eine Methode, um Halluzinationen zu bekÃĪmpfen. Eine neue Technik in diesem Bereich erkennt Halluzinationen auf Token-Ebene und prognostiziert, ob jedes Token in der Ausgabe halluziniert ist. Sie umfasst auch eine Methode fÞr unsupervisiertes Lernen von Halluzinationsdetektoren.

Um es einfach auszudrÞcken, sind LLM-Halluzinationen ein wachsendes Problem. Und trotz der BemÞhungen muss noch viel Arbeit geleistet werden, um das Problem anzugehen. Die KomplexitÃĪt dieser Modelle macht es im Allgemeinen schwierig, die inhÃĪrenten Ursachen von Halluzinationen korrekt zu identifizieren und zu korrigieren.

Es ist jedoch mÃķglich, Halluzinationen in LLMs zu mindern und ihre ethischen Konsequenzen zu verringern, wenn Forschung und Entwicklung fortgesetzt werden.

Wenn Sie mehr Þber LLMs und die prÃĪventiven Techniken erfahren mÃķchten, die entwickelt werden, um LLM-Halluzinationen zu korrigieren, besuchen Sie unite.ai, um Ihr Wissen zu erweitern.

Haziqa ist ein Data Scientist mit umfangreicher Erfahrung in der Erstellung von technischem Inhalt fÞr KI- und SaaS-Unternehmen.