KI-Modelle und Plattformen
Warum Large Language Models Anweisungen Übergehen und Wie Man Dieses Problem Ansprechen Kann

Large Language Modelle (LLMs) sind zu unverzichtbaren Künstlicher Intelligenz (KI)-Werkzeugen geworden, die Anwendungen von Chatbots und Content-Erstellung bis hin zu Codierungsunterstützung ermöglichen. Trotz ihrer beeindruckenden Fähigkeiten stellen Benutzer fest, dass diese Modelle manchmal Teile der Anweisungen übergehen, die sie erhalten, besonders wenn diese Anweisungen lang oder mehrere Schritte umfassen. Dieses Übergehen führt zu unvollständigen oder ungenauen Ausgaben, was Verwirrung stiften und das Vertrauen in KI-Systeme untergraben kann. Es ist wichtig, zu verstehen, warum LLMs Anweisungen übergehen und wie man dieses Problem ansprechen kann.
Warum LLMs Anweisungen Übergehen
LLMs funktionieren, indem sie Eingabetext als Sequenz von Token lesen. Token sind die kleinen Teile, in die der Text unterteilt wird. Das Modell verarbeitet diese Token nacheinander, von Anfang bis Ende. Das bedeutet, dass Anweisungen am Anfang der Eingabe tendenziell mehr Aufmerksamkeit erhalten. Spätere Anweisungen erhalten möglicherweise weniger Aufmerksamkeit und können ignoriert werden.
Dies geschieht, weil LLMs eine begrenzte Aufmerksamkeitskapazität haben. Aufmerksamkeit ist der Mechanismus, den Modelle verwenden, um zu entscheiden, welche Teile der Eingabe wichtig sind, wenn sie Antworten generieren. Wenn die Eingabe kurz ist, funktioniert die Aufmerksamkeit gut. Aber die Aufmerksamkeit wird schwächer, wenn die Eingabe länger oder die Anweisungen komplexer werden. Dies schwächt die Konzentration auf spätere Teile und verursacht das Übergehen.
Darüber hinaus erhöhen viele Anweisungen auf einmal die Komplexität. Wenn Anweisungen überlappen oder in Konflikt geraten, können Modelle verwirrt werden. Sie könnten versuchen, alles zu beantworten, aber vage oder widersprüchliche Antworten produzieren. Dies führt oft dazu, dass einige Anweisungen übergegangen werden.
LLMs teilen auch einige menschliche Grenzen. Zum Beispiel können Menschen die Konzentration verlieren, wenn sie lange oder wiederholte Texte lesen. Ähnlich können LLMs vergessen, spätere Anweisungen, wenn sie mehr Token verarbeiten. Dieser Fokusverlust ist Teil des Modell-Designs und der Grenzen.
Ein weiterer Grund ist, wie LLMs trainiert werden. Sie sehen viele Beispiele für einfache Anweisungen, aber weniger komplexe, mehrschrittige Anweisungen. Deshalb neigen Modelle dazu, einfache Anweisungen zu bevorzugen, die in ihren Trainingsdaten häufiger vorkommen. Diese Voreingenommenheit verursacht, dass sie komplexe Anweisungen übergehen. Außerdem beschränken Token-Grenzen die Menge an Eingabe, die das Modell verarbeiten kann. Wenn Eingaben diese Grenzen überschreiten, werden Anweisungen jenseits der Grenze ignoriert.
Beispiel: Angenommen, Sie geben einem LLM fünf Anweisungen in einem einzigen Prompt. Das Modell konzentriert sich möglicherweise hauptsächlich auf die ersten beiden Anweisungen und ignoriert die letzten drei teilweise oder vollständig. Dies beeinflusst direkt, wie das Modell Token sequenziell verarbeitet und seine Aufmerksamkeitsgrenzen hat.
Wie Gut LLMs Sequenzielle Anweisungen Verarbeiten, Basierend auf den SIFo-2024-Ergebnissen
Jüngste Studien haben sich genau damit auseinandergesetzt, wie gut LLMs mehrere Anweisungen verarbeiten, die nacheinander gegeben werden. Eine wichtige Studie ist der Sequential Instructions Following (SIFo)-Benchmark 2024. Dieser Benchmark testet Modelle anhand von Aufgaben, die die schrittweise Vervollständigung von Anweisungen wie Textmodifikation, Fragebeantwortung, Mathematik und Sicherheitsregeln erfordern. Jede Anweisung in der Sequenz hängt von der korrekten Vervollständigung der vorherigen Anweisung ab. Dieser Ansatz hilft, zu überprüfen, ob das Modell die gesamte Sequenz ordnungsgemäß verfolgt hat.
Die Ergebnisse von SIFo zeigen, dass sogar die besten LLMs, wie GPT-4 und Claude-3, oft Schwierigkeiten haben, alle Anweisungen korrekt abzuschließen. Dies ist besonders dann der Fall, wenn die Anweisungen lang oder kompliziert sind. Die Forschung hebt drei Hauptprobleme hervor, mit denen LLMs bei der Verfolgung von Anweisungen konfrontiert sind:
Verständnis: Vollständiges Erfassen dessen, was jede Anweisung bedeutet.
Argumentation: Logisches Verbinden mehrerer Anweisungen, um die Antwort klar zu halten.
Zuverlässige Ausgabe: Erzeugen vollständiger und genauer Antworten, die alle gegebenen Anweisungen abdecken.
Techniken wie Prompt-Engineering und Feinabstimmung helfen, die Fähigkeit der Modelle zur Verfolgung von Anweisungen zu verbessern. Diese Methoden helfen jedoch nicht vollständig bei dem Problem des Übergehens von Anweisungen. Die Verwendung von Reinforcement Learning mit menschlichem Feedback (RLHF) verbessert die Fähigkeit des Modells, angemessen zu antworten. Modelle haben jedoch Schwierigkeiten, wenn Anweisungen viele Schritte oder sehr komplexe Anforderungen haben.
Die Studie zeigt auch, dass LLMs am besten funktionieren, wenn Anweisungen einfach, klar getrennt und gut organisiert sind. Wenn Aufgaben lange Argumentationsketten oder viele Schritte erfordern, sinkt die Genauigkeit des Modells. Diese Ergebnisse helfen, bessere Wege zur Nutzung von LLMs aufzuzeigen und den Bedarf an stärkeren Modellen zu unterstreichen, die Anweisungen wirklich nacheinander verfolgen können.
Warum LLMs Anweisungen Übergehen: Technische Herausforderungen und Praktische Überlegungen
LLMs können Anweisungen übergehen, weil sie mehrere technische und praktische Faktoren haben, die in der Art und Weise verwurzelt sind, wie sie Eingabetext verarbeiten und kodieren.
Begrenzte Aufmerksamkeitsspanne und Informationsverdünnung
LLMs verlassen sich auf Aufmerksamkeitsmechanismen, um der Bedeutung verschiedener Teile der Eingabe zu entscheiden. Wenn Prompts prägnant sind, ist die Aufmerksamkeit des Modells fokussiert und effektiv. Wenn der Prompt jedoch länger oder wiederholter wird, wird die Aufmerksamkeit verdünnt, und spätere Token oder Anweisungen erhalten weniger Aufmerksamkeit, was die Wahrscheinlichkeit erhöht, dass sie übersehen werden. Dieses Phänomen, bekannt als Informationsverdünnung, ist besonders problematisch für Anweisungen, die spät in einem Prompt erscheinen. Darüber hinaus haben Modelle feste Token-Grenzen (z.B. 2048 Token); jeder Text, der diese Grenze überschreitet, wird abgeschnitten und ignoriert, was dazu führt, dass Anweisungen am Ende vollständig übergegangen werden.
Ausgabekomplexität und Mehrdeutigkeit
LLMs können Schwierigkeiten haben, klare und vollständige Antworten zu liefern, wenn sie mit mehreren oder widersprüchlichen Anweisungen konfrontiert werden. Das Modell kann partielle oder vage Antworten generieren, um Widersprüche oder Verwirrung zu vermeiden, was effektiv dazu führt, dass einige Anweisungen übergegangen werden. Mehrdeutigkeit in der Formulierung von Anweisungen stellt auch Herausforderungen dar: unklare oder ungenaue Prompts machen es dem Modell schwer, die beabsichtigten Aktionen zu bestimmen, was das Risiko erhöht, Teile der Eingabe zu übergehen oder falsch zu interpretieren.
Prompt-Design und FormatierungsEmpfindlichkeit
Die Struktur und Formulierung von Prompts spielen auch eine entscheidende Rolle bei der Verfolgung von Anweisungen. Forschung zeigt, dass sogar kleine Änderungen in der Formulierung oder Formatierung von Anweisungen erhebliche Auswirkungen darauf haben können, ob das Modell ihnen folgt.
Schlecht strukturierte Prompts, die keine klare Trennung, Aufzählungspunkte oder Nummerierungen aufweisen, machen es dem Modell schwerer, zwischen Schritten zu unterscheiden, was die Wahrscheinlichkeit erhöht, dass Anweisungen zusammengeführt oder übergegangen werden. Die interne Repräsentation des Prompts durch das Modell ist sehr empfindlich gegenüber diesen Variationen, was erklärt, warum Prompt-Engineering (Umformulierung oder Neustrukturierung von Prompts) die Einhaltung von Anweisungen erheblich verbessern kann, auch wenn der zugrunde liegende Inhalt unverändert bleibt.
Wie Man Das Übergehen von Anweisungen in LLMs Beheben Kann
Die Fähigkeit von LLMs, Anweisungen genau zu verfolgen, ist entscheidend für die Erzeugung zuverlässiger und präziser Ergebnisse. Die folgenden Best Practices sollten berücksichtigt werden, um das Übergehen von Anweisungen zu minimieren und die Qualität von KI-generierten Antworten zu verbessern:
Aufgaben Sollten in Kleinerere Teile Aufgeteilt Werden
Lange oder mehrschrittige Prompts sollten in kleinere, fokussiertere Segmente unterteilt werden. Die Bereitstellung von einer oder zwei Anweisungen auf einmal ermöglicht es dem Modell, eine bessere Aufmerksamkeit zu erhalten und reduziert die Wahrscheinlichkeit, dass Schritte übergegangen werden.
Beispiel
Anstatt alle Anweisungen in einem einzigen Prompt zu kombinieren, wie z.B. “Den Text zusammenfassen, die wichtigsten Punkte auflisten, Vorschläge für Verbesserungen machen und den Text ins Französische übersetzen“, sollten jede Anweisung getrennt oder in kleineren Gruppen präsentiert werden.
Anweisungen Sollten Mit Nummerierten Listen oder Aufzählungspunkten Formatieren Werden
Die Organisation von Anweisungen mit expliziter Formatierung, wie nummerierten Listen oder Aufzählungspunkten, hilft, anzugeben, dass jedes Element eine individuelle Aufgabe ist. Diese Klarheit erhöht die Wahrscheinlichkeit, dass die Antwort alle Anweisungen berücksichtigt.
Beispiel
- Den folgenden Text zusammenfassen.
- Die wichtigsten Punkte auflisten.
- Vorschläge für Verbesserungen machen.
Eine solche Formatierung bietet visuelle Hinweise, die dem Modell helfen, unterschiedliche Aufgaben in einem Prompt zu erkennen und zu trennen.
Anweisungen Sollten Explizit und Eindeutig Sein
Es ist wichtig, dass Anweisungen klar und unmissverständlich sind. Mehrdeutige oder vage Sprache sollte vermieden werden. Der Prompt sollte explizit angeben, dass keine Schritte übergegangen werden dürfen.
Beispiel
“Bitte führen Sie alle drei Aufgaben unten aus. Das Übergehen von Schritten ist nicht akzeptabel.”
Direkte Aussagen wie diese reduzieren Verwirrung und ermutigen das Modell, vollständige Antworten zu liefern.
Getrennte Prompts Sollten für Hochrisiko- oder Kritische Aufgaben Verwendet Werden
Jede Anweisung sollte als individueller Prompt für Aufgaben eingereicht werden, bei denen Genauigkeit und Vollständigkeit entscheidend sind. Obwohl dieser Ansatz die Interaktionszeit verlängern kann, verbessert er erheblich die Wahrscheinlichkeit, vollständige und präzise Ausgaben zu erhalten. Diese Methode stellt sicher, dass das Modell sich voll und ganz auf eine Aufgabe konzentriert, was das Risiko übergegangener Anweisungen reduziert.
Erweiterte Strategien zur Balance von Vollständigkeit und Effizienz
Das Warten auf eine Antwort nach jeder einzelnen Anweisung kann für Benutzer zeitaufwändig sein. Um Effizienz zu verbessern und gleichzeitig Klarheit und Vollständigkeit zu erhalten, können die folgenden erweiterten Prompt-Techniken wirksam sein:
Anweisungen in Batches mit Klarer Formatierung und Expliziten Labels
Mehrere verwandte Anweisungen können in einen einzigen Prompt kombiniert werden, aber jede sollte durch Nummerierung oder Überschriften getrennt werden. Der Prompt sollte auch das Modell anweisen, auf alle Anweisungen vollständig und in der richtigen Reihenfolge zu antworten.
Beispiel-Prompt
Bitte führen Sie alle folgenden Aufgaben sorgfältig aus, ohne eine zu übergehen:
- Den Text zusammenfassen.
- Die wichtigsten Punkte aus Ihrer Zusammenfassung auflisten.
- Vorschläge für Verbesserungen basierend auf den wichtigsten Punkten machen.
- Den verbesserten Text ins Französische übersetzen.
Chain-of-Thought-Style-Prompts
Chain-of-Thought-Prompting leitet das Modell an, durch jeden Aufgabenschritt zu denken, bevor es eine Antwort liefert. Die Ermutigung des Modells, Anweisungen sequenziell innerhalb einer einzelnen Antwort zu verarbeiten, hilft sicherzustellen, dass keine Schritte übergegangen werden, was die Vollständigkeit verbessert.
Beispiel-Prompt
Lesen Sie den Text unten und führen Sie die folgenden Aufgaben in der Reihenfolge aus. Zeigen Sie Ihre Arbeit klar:
- Den Text zusammenfassen.
- Die wichtigsten Punkte aus Ihrer Zusammenfassung identifizieren.
- Vorschläge für Verbesserungen des Textes machen.
- Den verbesserten Text ins Französische übersetzen.
Bitte beantworten Sie alle Aufgaben vollständig und getrennt in einer Antwort.
Hinzufügen von Abschlussanweisungen und Erinnerungen
Explizite Erinnerungen an das Modell, dass es:
- Jede Aufgabe vollständig beantworten soll.
- Keine Anweisung übergehen soll.
- Seine Antworten klar trennen soll.
Solche Erinnerungen helfen dem Modell, sich auf Vollständigkeit zu konzentrieren, wenn mehrere Anweisungen kombiniert werden.
Unterschiedliche Modelle und Parameter-Einstellungen Sollten Getestet Werden
Nicht alle LLMs erbringen gleich gute Leistungen bei der Verfolgung mehrerer Anweisungen. Es ist ratsam, verschiedene Modelle zu bewerten, um diejenigen zu identifizieren, die bei Aufgaben mit mehreren Schritten hervorragend sind. Darüber hinaus kann die Anpassung von Parametern wie Temperatur, maximale Token und Systemprompts die Konzentration und Vollständigkeit der Antworten weiter verbessern. Das Testen dieser Einstellungen hilft, das Modellverhalten an die spezifischen Anforderungen der Aufgabe anzupassen.
Feinabstimmung von Modellen und Nutzung von externen Werkzeugen Sollte in Betracht Gezogen Werden
Modelle sollten auf Datensätzen feinabgestimmt werden, die mehrschrittige oder sequenzielle Anweisungen enthalten, um ihre Einhaltung komplexer Prompts zu verbessern. Techniken wie RLHF können die Verfolgung von Anweisungen weiter verbessern.
Für fortgeschrittene Anwendungsfälle kann die Integration von externen Werkzeugen wie APIs, aufgabenspezifischen Plug-ins oder Retrieval Augmented Generation (RAG)-Systemen zusätzlichen Kontext und Kontrolle bieten, was die Zuverlässigkeit und Genauigkeit der Ausgaben verbessert.
Die Zusammenfassung
LLMs sind leistungsstarke Werkzeuge, aber sie können Anweisungen übergehen, wenn Prompts lang oder komplex sind. Dies geschieht, weil sie Eingaben lesen und ihre Aufmerksamkeit fokussieren. Anweisungen sollten klar, einfach und gut organisiert sein, um bessere und zuverlässigere Ergebnisse zu erzielen. Die Aufteilung von Aufgaben in kleinere Teile, die Verwendung von Listen und die direkte Anweisung helfen Modellen, Schritte vollständig zu verfolgen.
Getrennte Prompts können die Genauigkeit für kritische Aufgaben verbessern, obwohl sie mehr Zeit in Anspruch nehmen. Darüber hinaus helfen erweiterte Prompt-Methoden wie Chain-of-Thought und klare Formatierung, Geschwindigkeit und Präzision in Einklang zu bringen. Darüber hinaus kann das Testen unterschiedlicher Modelle und die Feinabstimmung auch die Ergebnisse verbessern. Diese Ideen helfen Benutzern, konsistente, vollständige Antworten zu erhalten und machen KI-Werkzeuge in der realen Arbeit nützlicher.












