Andersons Blickwinkel
Die Verbosity verringert die Genauigkeit in groÃen Sprachmodellen

Neue Forschungsergebnisse zeigen, dass die Verpflichtung von Large Language Models, kÞrzere Antworten zu geben, die Genauigkeit und QualitÃĪt ihrer Antworten deutlich verbessert.
Â
Jeder, der bereits versucht hat, einen Chatbot davon abzuhalten, âschwÃĪtzigâ zu sein, wird die Schlussfolgerungen neuer Forschungsergebnisse erkennen: Die Verpflichtung von KI-Systemen, kÞrzere Antworten zu geben, macht sie genauer.
Bei der Untersuchung der GrÞnde, warum grÃķÃere KI-Chatbots in bestimmten FÃĪllen (bekannt als inverse Skalierung) schlechter abschneiden als kleinere, fand die Forschung heraus, dass die Verpflichtung von 31 beliebten Large Language Modellen (LLMs), kÞrzere Antworten zu geben, zu einer Verbesserung der Genauigkeit ihrer Antworten um bis zu 26,3% fÞhrte:
âDie Ergebnisse liefern Þberzeugende kausale Beweise: Brevity-EinschrÃĪnkungen verbesserten die Genauigkeit groÃer Modelle um 26,3 Prozentpunkte und reduzierten die inverse SkalierungslÞcke um 67% (von 44,2% auf 14,8%, gepaarter t-Test: t = 7,80, p < 0,0001).'
ÃbermÃĪÃige Verbosity ist ein hÃĪufiger Grund fÞr Beschwerden unter Endnutzern, insbesondere unter denen, die kommerzielle Modelle wie ChatGPT verwenden, wo die Support-Foren dieses Thema hÃĪufig behandeln.
Der Bereich, der am meisten von der Behebung von Verbosity in Antworten betroffen ist, ist Mathematik, wo die getesteten KI-Systeme auf Antworten mit 50 Worten oder weniger beschrÃĪnkt waren. Bei LeseverstÃĪndnistests wurden sie auf Antworten mit nur 10 Worten beschrÃĪnkt.
Das Papier definiert die Tendenz von KI-Systemen zur Verbosity als Ãberdenken, bei dem die zentrale Botschaft nicht nur durch WÃķrter verdeckt wird, sondern manchmal auch negativ beeinflusst wird. Je kleiner das Modell ist, beobachtet das Papier, desto weniger ist diese Abhilfe erforderlich oder wirksam.
Die Forschung kommt zu dem Schluss, dass es nichts architektonisches gibt, das zur systematischen Anwendung dieser LÃķsung angepasst werden muss. Allerdings wÞrde in einer Benutzersitzung eine Richtlinie zur KÞrze wahrscheinlich wiederholt werden, wÃĪhrend ein global angewandter Systemprompt â der als Standard auf Plattformen wie ChatGPT implementiert werden mÞsste â kÞrzere Antworten zum Standardverhalten machen kÃķnnte.
StÞrmische Winde
Nichts davon erklÃĪrt genau, warum grÃķÃere Modelle tendenziell zur Verbosity neigen, da dies auch Open-Source-Modelle betrifft. Das Papier legt nahe, dass Protokolle und gÃĪngige Praktiken in der VerstÃĪrkungs-Lernmethode von menschlichem Feedback (RLHF) eine ErklÃĪrung liefern kÃķnnten*:
âEin plausibler Ursprung ist die RLHF-Alignierungs-Schulung, bei der menschliche Annotatoren GrÞndlichkeit unverhÃĪltnismÃĪÃig in grÃķÃeren Modellen mit grÃķÃerer KapazitÃĪt zur AusfÞhrung von LÃĪngensignalen belohnen â konsistent mit Verbosity-Unterschieden, die in anweisungsorientierten Varianten grÃķÃer sind als in Basis-Modell-Varianten.
âVorherige Arbeiten dokumentieren systematische LÃĪngen-Voreingenommenheit in Belohnungs Modellen, bei denen Annotatoren LÃĪnge mit QualitÃĪt verwechseln.
âGrÃķÃere Modelle, die eine grÃķÃere KapazitÃĪt haben, um LÃĪngensignale zu befriedigen, internalisieren mÃķglicherweise verbose Generation tiefer als kleinere Modelle, was zu der skalenabhÃĪngigen Ãberdenkens fÞhrt, die wir beobachten.â
Bei Menschen kann Verbosity auftreten, um Schweigen zu fÞllen, oder um Unbehagen zu maskieren, wegen psychischer Erkrankungen, oder um mangelndes Wissen zu verbergen. In der Tat kÃķnnte ein KI-System nur durch die Aufnahme von Trainingsdaten, die diese Merkmale widerspiegeln, von diesen Faktoren beeinflusst werden.
In DatensÃĪtzen gibt es andere Motive fÞr umfangreiche Antworten, wie den SEO-Anreiz, lÃĪngere Textinhalte zu produzieren, zum Beispiel in Rezept-BeitrÃĪgen, bei denen LÃĪnge oft fÃĪlschlicherweise mit AutoritÃĪt assoziiert wird.
Was nicht vollstÃĪndig ausgeschlossen werden kann, ist, dass API-basierte Plattformen, die Benutzer zu einem hÃķheren und teureren Abonnement-Tarif drÃĪngen, entweder Verbosity fÃķrdern oder nicht Þberwachen, da dies Token-Nutzung sehr billig erhÃķht, ohne dass exzessive Argumentation oder RAG-Anrufe erforderlich sindâ .
Die neue Studie trÃĪgt den Titel Brevity-EinschrÃĪnkungen kehren Leistungs-Hierarchien in Sprachmodellen um und stammt aus dem Department of Computer Science am Sweden Polytechnic Institute in Chattogram, in Bangladesch.
Methode
Um die Theorien des Papiers zu testen, wurden 31 Sprachmodelle ausgewertet â zu viele, um sie hier in Textform aufzulisten, aber in dem folgenden Bild dargestellt:

Die Large Language Models (LLMs), die in verschiedenen Teilen der Studien fÞr die neue Studie getestet wurden.
Die Modelle wurden gegen fÞnf Benchmark-Sammlungen ausgewertet: GSM8K, fÞr mathematische Argumentation; BoolQ, fÞr LeseverstÃĪndnis; CommonsenseQA, fÞr Alltags-Argumentation; ARC-Easy, fÞr naturwissenschaftliche Fragen; und MMLU-STEM, auch fÞr naturwissenschaftliche Kenntnisse.
Antworten wurden mit gierigem Decoding generiert, um deterministische Ausgaben zu gewÃĪhrleisten, dann mit aufgaben-spezifischen Regeln extrahiert, wobei die Genauigkeit als Anteil korrekter Antworten gegen Ground-Truth gemessen wurde.
Modelle wurden nach GrÃķÃe aufgeteilt, wobei Modelle mit bis zu zehn Milliarden Parametern als âkleinâ und Modelle mit Þber siebzig Milliarden Parametern als âgroÃâ behandelt wurden, basierend auf beobachteten Leistungsunterschieden.
Inverse Skalierung wurde quantifiziert, indem die Leistung dieser Gruppen bei jedem Problem verglichen wurde, wobei FÃĪlle markiert wurden, in denen kleinere Modelle grÃķÃere Modelle Þbertrafen; der statistische Effekt wurde dann verwendet, um zu bestÃĪtigen, dass diese LÞcken konsistente, bedeutsame Unterschiede und nicht nur Rauschen widerspiegeln.
Ausschluss von Erinnerung
Um die MÃķglichkeit auszuschlieÃen, dass Modelle einfach Trainingsdaten abrufen, wurden drei separate ÃberprÞfungen durchgefÞhrt, um zu prÞfen, wie sehr die Antworten variierten; wie sehr ihre LÃĪnge schwankte; und wie Fehler gemacht wurden. Wenn Modelle auf gemerkte Muster angewiesen wÃĪren, wÞrden Antworten tendenziell wiederholt oder feste Vorlagen folgen; stattdessen erwiesen sich die Antworten als Þberwiegend einzigartig Þber Modelle hinweg, mit bemerkbarer Variation in der LÃĪnge, von einer Antwort zur anderen.
Fehler wurden auch direkt untersucht, wobei die meisten AusfÃĪlle die Form von langen, falschen ErklÃĪrungen annahmen, anstatt kurzer, ausweichender Antworten â was darauf hindeutet, dass die Modelle tatsÃĪchliche Argumentation generierten, anstatt gespeicherte Antworten abzurufen.
Daten und Tests
Beim Testen von einzelnen Fragen anstelle von Ãberschriften-Scores erwies sich, dass ein groÃer Anteil von Benchmark-Aufgaben uninformativ war, da 27,1% nicht in der Lage waren, Modelle zu unterscheiden, da entweder jedes System erfolgreich war oder jedes System fehlte, was keine echten Signale Þber relative Leistung lieferte:

Problem-Level-AufschlÞsselung Þber fÞnf Benchmarks hinweg zeigte, dass ein erheblicher Anteil von Aufgaben nicht in der Lage war, zwischen Modellen zu unterscheiden, wÃĪhrend ein kleinerer, aber konsistenter Anteil inverse Skalierung aufwies, bei der kleinere Modelle grÃķÃere Modelle Þbertrafen. Die GesamtaufschlÞsselung Þber 1.485 Probleme zeigt, dass 7,7% inverse Skalierung aufweisen. Quelle
Unter den Fragen, die tatsÃĪchlich Modelle unterschieden, verhielten sich die meisten wie erwartet, wobei grÃķÃere Systeme besser abschnitten, aber ein kleinerer Anteil das Gegenteil zeigte, wobei kleinere Modelle vorne lagen. Ãber alle Probleme hinweg trat inverse Skalierung in 7,7% der FÃĪlle auf, was darauf hindeutet, dass der Effekt nicht marginal ist.
Inverse Skalierung auftauchen
Ãber die fÞnf Benchmarks hinweg wurden 115 Probleme gefunden, bei denen kleinere Modelle grÃķÃere Modelle Þbertrafen, was 7,7% aller 1.485 Aufgaben ausmacht, was darauf hindeutet, dass inverse Skalierung kein seltener oder marginaler Vorgang in diesem Kontext ist.
TatsÃĪchlich trat der Effekt in allen DatensÃĪtzen auf: am stÃĪrksten in BoolQ und schwÃĪcher in CommonsenseQA, ARC-Easy, GSM8K und MMLU-STEM, was darauf hindeutet, dass er weit verbreitet ist, aber je nach Aufgabe variiert:

Inverse Skalierung trat Þber alle Benchmarks hinweg auf, von 3,9% in MMLU-STEM bis 11,3% in BoolQ, mit 115 Problemen insgesamt. Leistungsunterschiede begÞnstigten kleinere Modelle im Durchschnitt um 28,4 Prozentpunkte. Die Genauigkeit sank, als die ModellgrÃķÃe zunahm, wobei kleinere Modelle 66,1% erreichten, im Vergleich zu 41,5% fÞr grÃķÃere Modelle.
Die GrÃķÃe der LÞcke erwies sich als erheblich, wobei kleinere Modelle im Durchschnitt um 28,4 Prozentpunkte vorne lagen, und jeder Fall zeigte den gleichen Vorteil, was auf einen konsistenten Leistungsabfall und nicht auf gelegentliche oder ad-hoc-Fehler hindeutet.
Das gleiche Muster galt Þber verschiedene Modellfamilien hinweg, einschlieÃlich Llama, Qwen, Gemma und Mistral, bei denen grÃķÃere Versionen schlechter abschnitten als kleinere, wobei die Genauigkeit tendenziell sank, als die ModellgrÃķÃe zunahm.
Die LÞcke zwischen kleinen und groÃen Modellen war groà genug, dass der Zufall sie nicht erklÃĪren kÃķnnte; und da das gleiche Muster Þber verschiedene Benchmarks, Aufgaben und Modellfamilien hinweg auftrat, erwies sich die inverse Skalierung als konsistenter Effekt.
Bei der Betrachtung innerhalb jeder Modellfamilie schnitten grÃķÃere Versionen wiederholt schlechter ab als kleinere auf diesen Problemen, was darauf hindeutet, dass der Leistungsabfall mÃķglicherweise an die Skalierung selbst und nicht an Unterschiede im Design gebunden ist.
Die Ergebnisse deuten auch darauf hin, dass es fÞr jede Aufgabe eine Grenze gibt, bei der die ErhÃķhung der ModellgrÃķÃe die Leistung schÃĪdigt, was darauf hindeutet, dass grÃķÃere Modelle nicht immer zu besseren Ergebnissen fÞhren.
Ãberdenken untersuchen
Nachdem festgestellt wurde, dass grÃķÃere Modelle manchmal in bestimmten Bereichen schlechter abschneiden, wandte sich die Analyse der Frage zu, warum dies geschieht, und schlug vor, dass das Problem nicht mangelnde FÃĪhigkeit, sondern zu viel ErklÃĪrung ist â d. h. FÃĪlle, in denen lÃĪngere Antworten die korrekte Argumentation verdecken.
Ãber die Daten hinweg wurden lÃĪngere Antworten mit geringerer Genauigkeit bei diesen schwierigen Problemen in Verbindung gebracht, obwohl groÃe und kleine Modelle etwa die gleiche Anzahl von Argumentationsschritten produzierten, was darauf hindeutet, dass das Problem nicht darin besteht, wie viel Argumentation durchgefÞhrt wird, sondern wie es ausgedrÞckt wird:

KÞrzere Antworten verbesserten die Leistung von groÃen Modellen und verringerten die LÞcke zu kleineren Modellen, indem sie die Differenz von 44,2 Prozentpunkten auf 14,8 verringerten (und in einigen FÃĪllen sogar umkehrten), wÃĪhrend direkte Antwortformate die LÞcke weiter verkleinerten. Die stÃĪrksten Gewinne traten in GSM8K und MMLU-STEM auf, wo die Rankings zugunsten grÃķÃerer Modelle umkehrten und ÃberprÞfungen der AntwortlÃĪnge bestÃĪtigten, dass die Intervention funktionierte, wobei die Ausgaben von etwa 197 Token auf unter 80 sanken, was KÞrze mit verbesserter Genauigkeit in Verbindung brachte.
Wenn Antworten gezwungen wurden, kÞrzer zu sein, verbesserten sich groÃe Modelle deutlich, verringerten eine erhebliche Leistungs-LÞcke und kehrten sie in einigen FÃĪllen sogar um. Im Gegensatz dazu ÃĪnderten sich kleine Modelle nur sehr wenig, was darauf hindeutet, dass Verbosity aktive SchÃĪden bei grÃķÃeren Systemen verursachte.
Der Effekt variierte je nach Aufgabe, wobei einige Benchmarks stark von kÞrzeren Antworten profitierten und andere ein gewisses Maà an ErklÃĪrung erforderten; jedoch kehrte sich in einigen FÃĪllen die Rangordnung zwischen kleinen und groÃen Modellen vollstÃĪndig um, als Verbosity eingeschrÃĪnkt wurde, was darauf hindeutet, dass grÃķÃere Modelle versteckte FÃĪhigkeiten hatten, die durch ÞbermÃĪÃige ErklÃĪrung maskiert wurden.
Weitere Analysen zeigten, dass groÃe Modelle tendenziell lÃĪngere Ausgaben produzierten, obwohl sie slightly weniger explizite Argumentationsschritte verwendeten, was auf einen diffuseren und weniger strukturierten Stil der Argumentation hindeutet.
Im Gegensatz dazu gaben kleinere Modelle kÞrzere, direktere Antworten, was darauf hindeutet, dass die Art und Weise, wie Argumentation ausgedrÞckt wird, und nicht die Menge der Argumentation selbst, den Leistungsabfall verursacht.
Die Autoren kommen zu dem Schluss, dass Brevity-EinschrÃĪnkungen Genauigkeits-Vorteile mit sich bringen und betrachten dies als mÃķgliche grundlegende Funktion in Sprachmodellen, anstatt als wiederholte, benutzer-applizierte EinschrÃĪnkung, die nicht Þber Sitzungen hinweg besteht; und sie stellen fest:
â[Brevity]-EinschrÃĪnkungen helfen groÃen Modellen dramatisch, wÃĪhrend sie kleine Modelle kaum beeinflussen.
âWenn Verbosity nebensÃĪchlich und nicht ursÃĪchlich wÃĪre, wÞrden einheitliche Genauigkeits-VerÃĪnderungen Þber beide GrÃķÃenkategorien hinweg erwartet werden. Die unterschiedliche Reaktion bestÃĪtigt, dass Ãberdenken ein skalen-spezifischer Fehler-Modus ist, nicht ein Aufgaben-Schwierigkeits-Effekt.â
Schlussfolgerung
Ãber die getesteten Open-Source-Versionen hinaus erscheint das Verbosity-Problem, anekdotisch, mit einer bestimmten HÃĪufigkeit Þber viele groÃe Modelle hinweg, einschlieÃlich Claude, Gemini und Grok.
Ob diese Plattformen das Verbosity-Problem Þbersehen, weil es die Token-Nutzung erhÃķht und hÃķhere Ausgaben fÃķrdertâ , es scheint nicht vernÞnftig, dass sie den damit verbundenen Genauigkeits-Verlust akzeptieren wÞrden.
Es wÃĪre interessant zu sehen, ob eine empirische Methode mit Sicherheit bestimmen kÃķnnte, woher die Tendenz zur Verbosity stammt. Jeder, der jemals versucht hat, einen Chatbot dazu zu bringen, tatsÃĪchlich zu chatten, anstatt âblogartigeâ, verbose, mehrschrittige Antworten zu geben, wird erkannt haben, dass das Modell stark mit âAlles-in-einemâ-BenutzerhandbÞchern und âakzeptierten LÃķsungenâ in seinen Trainingsdaten geprÃĪgt wurde.
Es wÃĪre daher sehr interessant zu sehen, ob ein Modell, das speziell auf schrittweise Konversationen trainiert wurde, tatsÃĪchlich von der verbose, zusammenfassenden Tendenz abrÞcken kÃķnnte. Allerdings scheint es wahrscheinlich, dass einige EinschrÃĪnkungen oder Filter auf das Gewicht gelegt werden mÞssten, das dem Modell beigebracht wird, auf die âentschiedeneâ Antwort zu geben, sodass es direkt auch auf das vorhergehende Material trainiert â im Wesentlichen, die explizite Argumentation, die in schrittweisen Konversationen ausgedrÞckt wird.
Da solche Daten wahrscheinlich rar sind, kÃķnnte der einzige Weg vorwÃĪrts mit diesem Ansatz Þber synthetische Daten fÞhren, bei denen âzusammengesetzteâ endgÞltige Schlussfolgerungen konversationell aufgebrochen werden â ironischerweise in ÃĪhnlicher Weise, wie die AI-Podcasts, die Google NotebookLM aus Plain-Text-Eingabe interpretieren kann.
Â
* Meine Umwandlung der inline-Zitate der Autoren in Hyperlinks.
â Aber lasst uns ehrlich sein, die LÞcke zwischen den tatsÃĪchlichen Kosten fÞr die Bereitstellung von KI und den Abonnement-GebÞhren ist derzeit so groÃ, dass dies lediglich den Ruf der Benutzerbasis schÃĪdigen wÞrde, ohne die schwerwiegenden Grundprobleme dieser Phase der âKonversionâ und âKonvergenzâ von KI zu lÃķsen.
ErstverÃķffentlichung Sonntag, 5. April 2026












