Andersons Blickwinkel
Die Verbosity verringert die Genauigkeit in großen Sprachmodellen

Neue Forschungsergebnisse zeigen, dass die Verpflichtung von Large Language Models, kürzere Antworten zu geben, die Genauigkeit und Qualität ihrer Antworten deutlich verbessert.
Jeder, der bereits versucht hat, einen Chatbot davon abzuhalten, “schwätzig” zu sein, wird die Schlussfolgerungen neuer Forschungsergebnisse erkennen: Die Verpflichtung von KI-Systemen, kürzere Antworten zu geben, macht sie genauer.
Bei der Untersuchung der Gründe, warum größere KI-Chatbots in bestimmten Fällen (bekannt als inverse Skalierung) schlechter abschneiden als kleinere, fand die Forschung heraus, dass die Verpflichtung von 31 beliebten Large Language Modellen (LLMs), kürzere Antworten zu geben, zu einer Verbesserung der Genauigkeit ihrer Antworten um bis zu 26,3% führte:
‘Die Ergebnisse liefern überzeugende kausale Beweise: Brevity-Einschränkungen verbesserten die Genauigkeit großer Modelle um 26,3 Prozentpunkte und reduzierten die inverse Skalierungslücke um 67% (von 44,2% auf 14,8%, gepaarter t-Test: t = 7,80, p < 0,0001).'
Übermäßige Verbosity ist ein häufiger Grund für Beschwerden unter Endnutzern, insbesondere unter denen, die kommerzielle Modelle wie ChatGPT verwenden, wo die Support-Foren dieses Thema häufig behandeln.
Der Bereich, der am meisten von der Behebung von Verbosity in Antworten betroffen ist, ist Mathematik, wo die getesteten KI-Systeme auf Antworten mit 50 Worten oder weniger beschränkt waren. Bei Leseverständnistests wurden sie auf Antworten mit nur 10 Worten beschränkt.
Das Papier definiert die Tendenz von KI-Systemen zur Verbosity als Überdenken, bei dem die zentrale Botschaft nicht nur durch Wörter verdeckt wird, sondern manchmal auch negativ beeinflusst wird. Je kleiner das Modell ist, beobachtet das Papier, desto weniger ist diese Abhilfe erforderlich oder wirksam.
Die Forschung kommt zu dem Schluss, dass es nichts architektonisches gibt, das zur systematischen Anwendung dieser Lösung angepasst werden muss. Allerdings würde in einer Benutzersitzung eine Richtlinie zur Kürze wahrscheinlich wiederholt werden, während ein global angewandter Systemprompt – der als Standard auf Plattformen wie ChatGPT implementiert werden müsste – kürzere Antworten zum Standardverhalten machen könnte.
Stürmische Winde
Nichts davon erklärt genau, warum größere Modelle tendenziell zur Verbosity neigen, da dies auch Open-Source-Modelle betrifft. Das Papier legt nahe, dass Protokolle und gängige Praktiken in der Verstärkungs-Lernmethode von menschlichem Feedback (RLHF) eine Erklärung liefern könnten*:
‘Ein plausibler Ursprung ist die RLHF-Alignierungs-Schulung, bei der menschliche Annotatoren Gründlichkeit unverhältnismäßig in größeren Modellen mit größerer Kapazität zur Ausführung von Längensignalen belohnen – konsistent mit Verbosity-Unterschieden, die in anweisungsorientierten Varianten größer sind als in Basis-Modell-Varianten.
‘Vorherige Arbeiten dokumentieren systematische Längen-Voreingenommenheit in Belohnungs Modellen, bei denen Annotatoren Länge mit Qualität verwechseln.
‘Größere Modelle, die eine größere Kapazität haben, um Längensignale zu befriedigen, internalisieren möglicherweise verbose Generation tiefer als kleinere Modelle, was zu der skalenabhängigen Überdenkens führt, die wir beobachten.’
Bei Menschen kann Verbosity auftreten, um Schweigen zu füllen, oder um Unbehagen zu maskieren, wegen psychischer Erkrankungen, oder um mangelndes Wissen zu verbergen. In der Tat könnte ein KI-System nur durch die Aufnahme von Trainingsdaten, die diese Merkmale widerspiegeln, von diesen Faktoren beeinflusst werden.
In Datensätzen gibt es andere Motive für umfangreiche Antworten, wie den SEO-Anreiz, längere Textinhalte zu produzieren, zum Beispiel in Rezept-Beiträgen, bei denen Länge oft fälschlicherweise mit Autorität assoziiert wird.
Was nicht vollständig ausgeschlossen werden kann, ist, dass API-basierte Plattformen, die Benutzer zu einem höheren und teureren Abonnement-Tarif drängen, entweder Verbosity fördern oder nicht überwachen, da dies Token-Nutzung sehr billig erhöht, ohne dass exzessive Argumentation oder RAG-Anrufe erforderlich sind†.
Die neue Studie trägt den Titel Brevity-Einschränkungen kehren Leistungs-Hierarchien in Sprachmodellen um und stammt aus dem Department of Computer Science am Sweden Polytechnic Institute in Chattogram, in Bangladesch.
Methode
Um die Theorien des Papiers zu testen, wurden 31 Sprachmodelle ausgewertet – zu viele, um sie hier in Textform aufzulisten, aber in dem folgenden Bild dargestellt:

Die Large Language Models (LLMs), die in verschiedenen Teilen der Studien für die neue Studie getestet wurden.
Die Modelle wurden gegen fünf Benchmark-Sammlungen ausgewertet: GSM8K, für mathematische Argumentation; BoolQ, für Leseverständnis; CommonsenseQA, für Alltags-Argumentation; ARC-Easy, für naturwissenschaftliche Fragen; und MMLU-STEM, auch für naturwissenschaftliche Kenntnisse.
Antworten wurden mit gierigem Decoding generiert, um deterministische Ausgaben zu gewährleisten, dann mit aufgaben-spezifischen Regeln extrahiert, wobei die Genauigkeit als Anteil korrekter Antworten gegen Ground-Truth gemessen wurde.
Modelle wurden nach Größe aufgeteilt, wobei Modelle mit bis zu zehn Milliarden Parametern als “klein” und Modelle mit über siebzig Milliarden Parametern als “groß” behandelt wurden, basierend auf beobachteten Leistungsunterschieden.
Inverse Skalierung wurde quantifiziert, indem die Leistung dieser Gruppen bei jedem Problem verglichen wurde, wobei Fälle markiert wurden, in denen kleinere Modelle größere Modelle übertrafen; der statistische Effekt wurde dann verwendet, um zu bestätigen, dass diese Lücken konsistente, bedeutsame Unterschiede und nicht nur Rauschen widerspiegeln.
Ausschluss von Erinnerung
Um die Möglichkeit auszuschließen, dass Modelle einfach Trainingsdaten abrufen, wurden drei separate Überprüfungen durchgeführt, um zu prüfen, wie sehr die Antworten variierten; wie sehr ihre Länge schwankte; und wie Fehler gemacht wurden. Wenn Modelle auf gemerkte Muster angewiesen wären, würden Antworten tendenziell wiederholt oder feste Vorlagen folgen; stattdessen erwiesen sich die Antworten als überwiegend einzigartig über Modelle hinweg, mit bemerkbarer Variation in der Länge, von einer Antwort zur anderen.
Fehler wurden auch direkt untersucht, wobei die meisten Ausfälle die Form von langen, falschen Erklärungen annahmen, anstatt kurzer, ausweichender Antworten – was darauf hindeutet, dass die Modelle tatsächliche Argumentation generierten, anstatt gespeicherte Antworten abzurufen.
Daten und Tests
Beim Testen von einzelnen Fragen anstelle von Überschriften-Scores erwies sich, dass ein großer Anteil von Benchmark-Aufgaben uninformativ war, da 27,1% nicht in der Lage waren, Modelle zu unterscheiden, da entweder jedes System erfolgreich war oder jedes System fehlte, was keine echten Signale über relative Leistung lieferte:

Problem-Level-Aufschlüsselung über fünf Benchmarks hinweg zeigte, dass ein erheblicher Anteil von Aufgaben nicht in der Lage war, zwischen Modellen zu unterscheiden, während ein kleinerer, aber konsistenter Anteil inverse Skalierung aufwies, bei der kleinere Modelle größere Modelle übertrafen. Die Gesamtaufschlüsselung über 1.485 Probleme zeigt, dass 7,7% inverse Skalierung aufweisen. Quelle
Unter den Fragen, die tatsächlich Modelle unterschieden, verhielten sich die meisten wie erwartet, wobei größere Systeme besser abschnitten, aber ein kleinerer Anteil das Gegenteil zeigte, wobei kleinere Modelle vorne lagen. Über alle Probleme hinweg trat inverse Skalierung in 7,7% der Fälle auf, was darauf hindeutet, dass der Effekt nicht marginal ist.
Inverse Skalierung auftauchen
Über die fünf Benchmarks hinweg wurden 115 Probleme gefunden, bei denen kleinere Modelle größere Modelle übertrafen, was 7,7% aller 1.485 Aufgaben ausmacht, was darauf hindeutet, dass inverse Skalierung kein seltener oder marginaler Vorgang in diesem Kontext ist.
Tatsächlich trat der Effekt in allen Datensätzen auf: am stärksten in BoolQ und schwächer in CommonsenseQA, ARC-Easy, GSM8K und MMLU-STEM, was darauf hindeutet, dass er weit verbreitet ist, aber je nach Aufgabe variiert:

Inverse Skalierung trat über alle Benchmarks hinweg auf, von 3,9% in MMLU-STEM bis 11,3% in BoolQ, mit 115 Problemen insgesamt. Leistungsunterschiede begünstigten kleinere Modelle im Durchschnitt um 28,4 Prozentpunkte. Die Genauigkeit sank, als die Modellgröße zunahm, wobei kleinere Modelle 66,1% erreichten, im Vergleich zu 41,5% für größere Modelle.
Die Größe der Lücke erwies sich als erheblich, wobei kleinere Modelle im Durchschnitt um 28,4 Prozentpunkte vorne lagen, und jeder Fall zeigte den gleichen Vorteil, was auf einen konsistenten Leistungsabfall und nicht auf gelegentliche oder ad-hoc-Fehler hindeutet.
Das gleiche Muster galt über verschiedene Modellfamilien hinweg, einschließlich Llama, Qwen, Gemma und Mistral, bei denen größere Versionen schlechter abschnitten als kleinere, wobei die Genauigkeit tendenziell sank, als die Modellgröße zunahm.
Die Lücke zwischen kleinen und großen Modellen war groß genug, dass der Zufall sie nicht erklären könnte; und da das gleiche Muster über verschiedene Benchmarks, Aufgaben und Modellfamilien hinweg auftrat, erwies sich die inverse Skalierung als konsistenter Effekt.
Bei der Betrachtung innerhalb jeder Modellfamilie schnitten größere Versionen wiederholt schlechter ab als kleinere auf diesen Problemen, was darauf hindeutet, dass der Leistungsabfall möglicherweise an die Skalierung selbst und nicht an Unterschiede im Design gebunden ist.
Die Ergebnisse deuten auch darauf hin, dass es für jede Aufgabe eine Grenze gibt, bei der die Erhöhung der Modellgröße die Leistung schädigt, was darauf hindeutet, dass größere Modelle nicht immer zu besseren Ergebnissen führen.
Überdenken untersuchen
Nachdem festgestellt wurde, dass größere Modelle manchmal in bestimmten Bereichen schlechter abschneiden, wandte sich die Analyse der Frage zu, warum dies geschieht, und schlug vor, dass das Problem nicht mangelnde Fähigkeit, sondern zu viel Erklärung ist – d. h. Fälle, in denen längere Antworten die korrekte Argumentation verdecken.
Über die Daten hinweg wurden längere Antworten mit geringerer Genauigkeit bei diesen schwierigen Problemen in Verbindung gebracht, obwohl große und kleine Modelle etwa die gleiche Anzahl von Argumentationsschritten produzierten, was darauf hindeutet, dass das Problem nicht darin besteht, wie viel Argumentation durchgeführt wird, sondern wie es ausgedrückt wird:

Kürzere Antworten verbesserten die Leistung von großen Modellen und verringerten die Lücke zu kleineren Modellen, indem sie die Differenz von 44,2 Prozentpunkten auf 14,8 verringerten (und in einigen Fällen sogar umkehrten), während direkte Antwortformate die Lücke weiter verkleinerten. Die stärksten Gewinne traten in GSM8K und MMLU-STEM auf, wo die Rankings zugunsten größerer Modelle umkehrten und Überprüfungen der Antwortlänge bestätigten, dass die Intervention funktionierte, wobei die Ausgaben von etwa 197 Token auf unter 80 sanken, was Kürze mit verbesserter Genauigkeit in Verbindung brachte.
Wenn Antworten gezwungen wurden, kürzer zu sein, verbesserten sich große Modelle deutlich, verringerten eine erhebliche Leistungs-Lücke und kehrten sie in einigen Fällen sogar um. Im Gegensatz dazu änderten sich kleine Modelle nur sehr wenig, was darauf hindeutet, dass Verbosity aktive Schäden bei größeren Systemen verursachte.
Der Effekt variierte je nach Aufgabe, wobei einige Benchmarks stark von kürzeren Antworten profitierten und andere ein gewisses Maß an Erklärung erforderten; jedoch kehrte sich in einigen Fällen die Rangordnung zwischen kleinen und großen Modellen vollständig um, als Verbosity eingeschränkt wurde, was darauf hindeutet, dass größere Modelle versteckte Fähigkeiten hatten, die durch übermäßige Erklärung maskiert wurden.
Weitere Analysen zeigten, dass große Modelle tendenziell längere Ausgaben produzierten, obwohl sie slightly weniger explizite Argumentationsschritte verwendeten, was auf einen diffuseren und weniger strukturierten Stil der Argumentation hindeutet.
Im Gegensatz dazu gaben kleinere Modelle kürzere, direktere Antworten, was darauf hindeutet, dass die Art und Weise, wie Argumentation ausgedrückt wird, und nicht die Menge der Argumentation selbst, den Leistungsabfall verursacht.
Die Autoren kommen zu dem Schluss, dass Brevity-Einschränkungen Genauigkeits-Vorteile mit sich bringen und betrachten dies als mögliche grundlegende Funktion in Sprachmodellen, anstatt als wiederholte, benutzer-applizierte Einschränkung, die nicht über Sitzungen hinweg besteht; und sie stellen fest:
‘[Brevity]-Einschränkungen helfen großen Modellen dramatisch, während sie kleine Modelle kaum beeinflussen.
‘Wenn Verbosity nebensächlich und nicht ursächlich wäre, würden einheitliche Genauigkeits-Veränderungen über beide Größenkategorien hinweg erwartet werden. Die unterschiedliche Reaktion bestätigt, dass Überdenken ein skalen-spezifischer Fehler-Modus ist, nicht ein Aufgaben-Schwierigkeits-Effekt.’
Schlussfolgerung
Über die getesteten Open-Source-Versionen hinaus erscheint das Verbosity-Problem, anekdotisch, mit einer bestimmten Häufigkeit über viele große Modelle hinweg, einschließlich Claude, Gemini und Grok.
Ob diese Plattformen das Verbosity-Problem übersehen, weil es die Token-Nutzung erhöht und höhere Ausgaben fördert†, es scheint nicht vernünftig, dass sie den damit verbundenen Genauigkeits-Verlust akzeptieren würden.
Es wäre interessant zu sehen, ob eine empirische Methode mit Sicherheit bestimmen könnte, woher die Tendenz zur Verbosity stammt. Jeder, der jemals versucht hat, einen Chatbot dazu zu bringen, tatsächlich zu chatten, anstatt “blogartige”, verbose, mehrschrittige Antworten zu geben, wird erkannt haben, dass das Modell stark mit “Alles-in-einem”-Benutzerhandbüchern und “akzeptierten Lösungen” in seinen Trainingsdaten geprägt wurde.
Es wäre daher sehr interessant zu sehen, ob ein Modell, das speziell auf schrittweise Konversationen trainiert wurde, tatsächlich von der verbose, zusammenfassenden Tendenz abrücken könnte. Allerdings scheint es wahrscheinlich, dass einige Einschränkungen oder Filter auf das Gewicht gelegt werden müssten, das dem Modell beigebracht wird, auf die “entschiedene” Antwort zu geben, sodass es direkt auch auf das vorhergehende Material trainiert – im Wesentlichen, die explizite Argumentation, die in schrittweisen Konversationen ausgedrückt wird.
Da solche Daten wahrscheinlich rar sind, könnte der einzige Weg vorwärts mit diesem Ansatz über synthetische Daten führen, bei denen “zusammengesetzte” endgültige Schlussfolgerungen konversationell aufgebrochen werden – ironischerweise in ähnlicher Weise, wie die AI-Podcasts, die Google NotebookLM aus Plain-Text-Eingabe interpretieren kann.
* Meine Umwandlung der inline-Zitate der Autoren in Hyperlinks.
† Aber lasst uns ehrlich sein, die Lücke zwischen den tatsächlichen Kosten für die Bereitstellung von KI und den Abonnement-Gebühren ist derzeit so groß, dass dies lediglich den Ruf der Benutzerbasis schädigen würde, ohne die schwerwiegenden Grundprobleme dieser Phase der “Konversion” und “Konvergenz” von KI zu lösen.
Erstveröffentlichung Sonntag, 5. April 2026












