Berichte
Wenn KI‑Agenten der Menge folgen: Das verborgene Risiko beim Konsens mehrerer Agenten

Ein Raum voller zustimmender KI‑Agenten kann beruhigend wirken. Einer schlägt eine Antwort vor, ein anderer prüft sie, und mehrere weitere befürworten das Ergebnis. Aber wie viele dieser Agenten haben tatsächlich die zugrunde liegenden Beweise geprüft? Wenn jeder das Urteil des vorherigen Agenten übernimmt, kann ein einstimmiges Ergebnis einen einzelnen Fehler verbergen.
Neue Forschung, hervorgehoben von der University of Chicago Harris School of Public Policy, untersucht dieses Problem. In den bewusst nachteiligen Experimenten, die in ihrer Ankündigung beschrieben werden, folgten spätere Agenten einer frühen falschen Schlussfolgerung, selbst wenn ihre eigenen Informationen auf die richtige Antwort hindeuteten. Die Ankündigung betont zudem, dass es sich hierbei um frühe Stress‑Test‑Ergebnisse handelt und nicht um Belege dafür, dass autonome Agenten routinemäßig so handeln.
Für Organisationen, die Multi‑Agent‑Workflows aufbauen, ist die zentrale Frage, wie man unabhängige Verifizierung von einem Echo unterscheidet. Im Folgenden untersuchen wir das Experiment, verknüpfen es mit etablierter Forschung zum sozialen Lernen und leiten praktische Implikationen für das Systemdesign ab. Die ingenieurtechnischen Vorschläge und numerischen Illustrationen sind unsere Analyse, nicht zusätzliche experimentelle Befunde.
Was die Forschenden getestet haben
Andy Hall, Dan Thompson, Alexander Fouirnaies und Sandy Handan‑Nader veröffentlichten Extraordinary Multi-Agent Delusions and the Madness of Crowds am 29. September 2026. Die Agenten schlossen daraus, wie ein simuliertes Aufgaben‑Bewertungssystem funktionierte, anhand privater Annahme‑ oder Ablehnungssignale, die zu 70 % informativ waren. Sie lasen frühere Board‑Beiträge, veröffentlichten Schlussfolgerungen und berichteten separat über ihre Überzeugungen. Die Stress‑Bedingung machte die ersten vier Signale fehlerhaft.
Ohne Kommunikation verwässerten spätere unabhängige Signale den ursprünglichen Fehler. Mit einem Board blieben falsche Urteile bestehen; die Agenten meldeten zudem ihre eigenen Beweise falsch. Die meisten Experimente nutzten Claude Haiku 4.5. Die Autoren berichten über Replikationen mit Sonnet 4.6, Opus 4.6 und GPT‑5 mini, möglicherweise mit einer Ausnahme für Gemini 2.5 Flash.
Über sieben Kommunikationsrichtlinien und weitere Szenarien hinweg erzielten Regeln, die private Testergebnisse bewahrten, die besten Ergebnisse. Eine Regel verlangte exakte Berichterstattung und verbot erfundene Tests oder Zählungen. Post‑hoc‑Begründungen erwähnten die Board‑Mehrheit in über 90 % der Fälle, doch die Autoren warnen, dass diese Erklärungen den internen Mechanismus nicht belegen.
Der Unterschied zwischen einer Menge und einem Echo
Der intellektuelle Hintergrund liegt vor der generativen KI. In ihrem 1992‑Paper über Informationskaskaden beschreiben Sushil Bikhchandani, David Hirshleifer und Ivo Welch, wie sequenzielle Entscheidungsträger Vorgängern folgen können, während sie ihre eigenen Informationen ignorieren. Ihr Rahmenwerk hilft zu erklären, warum Konformität mit fragilen kollektiven Überzeugungen koexistieren kann. Eine spätere Übersicht über Informationskaskaden und soziales Lernen, gemeinsam mit Omer Tamuz verfasst, gibt einen Überblick über die darauf folgende theoretische und empirische Forschung.
Betrachten wir eine hypothetische Softwareuntersuchung. Agent A interpretiert einen fehlgeschlagenen Test als Beweis dafür, dass eine Authentifizierungsbibliothek defekt ist. Agent B liest As Bericht und empfiehlt, die Bibliothek zu ersetzen. Agent C fasst beide Nachrichten als zwei Bestätigungen desselben Defekts zusammen. Ein Koordinator sieht nun drei Agenten, die zustimmen, obwohl die gesamte Kette auf einer einzigen Interpretation eines Tests beruht.
Das Hinzufügen von Agent D liefert nicht zwangsläufig neue Informationen. Wenn D nur die Zusammenfassung liest, hat der Workflow eine weitere Möglichkeit geschaffen, die Behauptung zu wiederholen. Die relevante Einheit der Bestätigung ist die unabhängige Beobachtung: eine separate Reproduktion, ein anderer Test oder eine direkte Inspektion des vermuteten Fehlers.
Diese Unterscheidung ist wichtig, selbst wenn jede Komponente fähig und kooperativ ist. Zustimmung ist nur dann nützlich, wenn ihre beweisführenden Grundlagen sie rechtfertigen. Ein System sollte daher nachverfolgen, welche Agenten eine Prüfung durchgeführt haben, welche lediglich die Ausgabe eines anderen Agenten interpretierten und welche eine Schlussfolgerung wiederholten, ohne sie zu prüfen.
Warum Unabhängigkeit die Rechnung verändert
Eine einfache Rechnung verdeutlicht die Bedeutung. Angenommen, fünf hypothetische Wähler beantworten jeweils eine Ja‑/Nein‑Frage mit einer Wahrscheinlichkeit von 0,7 korrekt, und ihre Antworten sind unabhängig. Die Wahrscheinlichkeit, dass mindestens drei korrekt sind, liegt bei etwa 83,7 %. Die Kombination ihrer Stimmen verbessert die Genauigkeit gegenüber den 70 % eines einzelnen Wählers.
Nehmen wir nun an, alle fünf kopieren dieselbe Antwort. Die Mehrheit ist nur dann korrekt, wenn die ursprüngliche Antwort korrekt ist: in 70 % der Fälle. Die sichtbare Zahl der Teilnehmenden ist gestiegen, aber die Menge an unabhängigen Informationen nicht. Dies sind illustrative Wahrscheinlichkeiten, keine Leistungsmaße aus der neuen Forschung.
Eine weitere nützliche Rechnung hilft, die Stress‑Bedingung zu interpretieren. Wenn vier Signale unabhängig jeweils eine 30 %ige Fehlerrate haben, beträgt die Wahrscheinlichkeit, dass alle vier falsch sind, 0,3⁴, also 0,81 %. Das beschreibt die Wahrscheinlichkeit einer bestimmten Ausgangssequenz unter diesen Annahmen. Es beschreibt nicht die Wahrscheinlichkeit, dass ein eingesetztes Agententeam versagt.
Eine Schätzung des Ausfalls würde sowohl erfordern, wie häufig schwierige Situationen auftreten, als auch wie das System sich verhält, wenn sie auftreten. Das Verwechseln dieser Größen kann ein Ergebnis entweder alarmierender oder beruhigender erscheinen lassen, als die Evidenz es zulässt. Ein Stresstest kann eine folgenschwere Schwäche aufdecken, ohne ihre Häufigkeit in der normalen Arbeit zu messen.
Erstelle eine Beweiskette, bevor du Konsens aufbaust
Eine praktische Antwort besteht darin, Beobachtungen von Interpretationen im gemeinsamen Arbeitsbereich zu trennen. Für die hypothetische Authentifizierungsuntersuchung könnte eine Beobachtung eine Testkennung, die getestete Code‑Revision, das tatsächliche Ergebnis und die Ausführungszeit enthalten. Ein separates Feld würde die vom Agenten vorgeschlagene Erklärung und deren Unsicherheit festhalten.
Diese Struktur ermöglicht es dem Koordinator, eine konkrete Frage zu stellen: Führt diese Empfehlung zu einer neuen Beobachtung, oder bezieht sie sich auf bereits gezählte Evidenz? Drei Zusammenfassungen, die denselben fehlgeschlagenen Test zitieren, sollten als ein Test im Evidenz‑Ledger verbleiben. Eine zweite unabhängige Reproduktion sollte als separater Check sichtbar sein.
Für teure oder folgenschwere Entscheidungen könnten Teams zudem erste Einschätzungen sammeln, bevor sie Agenten den Schlussfolgerungen der anderen aussetzen. Ein Prüfer würde das Quellmaterial prüfen, ein erstes Urteil fällen und erst danach die Gruppendiskussion sehen. Meinungsänderungen blieben möglich, aber das System könnte festhalten, welche neuen Beweise sie begründeten.
Dies sind Designvorschläge zur Bewertung, keine durch dieses Experiment validierten Schutzmaßnahmen. Sie bringen Kosten mit sich: strukturiertere Aufzeichnungen, zusätzliche Tool‑Aufrufe und potenziell langsamere Koordination. Ihr Wert sollte im Verhältnis zu den Entscheidungen, die sie schützen, beurteilt werden. Ein Brainstorming‑Workflow kann lockere Gespräche tolerieren; eine Untersuchung von Produktionsvorfällen könnte eine deutlich strengere Beweiskette erfordern.
Prompt‑Regeln und Laufzeit‑Kontrollen lösen unterschiedliche Probleme
Es ist sinnvoll, einen Agenten anzuweisen, Beweise zu bewahren, doch eine Produktionsarchitektur kann noch weiter gehen, indem sie die ursprüngliche Tool‑Ausgabe selbst speichert. Ein Ausführungsservice könnte Ergebnisse in einen Datensatz schreiben, den Agenten zitieren, aber nicht überschreiben können. Leser könnten dann die Interpretation mit der zugrunde liegenden Ausgabe vergleichen.
Selbst ein unveränderliches Protokoll garantiert nicht, dass ein Test gut gestaltet, die Quelle vertrauenswürdig oder die Interpretation korrekt ist. Es macht jedoch Diskrepanzen prüfbar. Ein System kann einen fehlerhaften Test von einem Bericht unterscheiden, der diesen Test ungenau beschreibt.
Autorisation sollte eine separate Entscheidung bleiben. Eine zuversichtliche Schlussfolgerung, dass ein System repariert werden muss, verleiht nicht die Erlaubnis, es zu ändern. Die Ausführungsrechte außerhalb des Konsensprozesses zu halten, verhindert, dass ein epistemischer Fehler automatisch zu einer operativen Handlung wird. Ein Agententeam kann falsch liegen, ohne dass ihm eine uneingeschränkte Änderung gestattet wird.
Modellvielfalt sollte ebenso bewertet werden, anstatt anzunehmen, dass sie das Problem löst. Verschiedene Modelle können unterschiedliche Interpretationen beitragen, doch die Zuweisung verschiedener Namen oder Rollen an Agenten beweist nicht, dass ihre Evidenz unabhängig ist. Eine diverse Gruppe, die dieselbe fehlerhafte Zusammenfassung liest, kann dennoch einen einzigen Beweisengpass teilen.
Was eine stärkere Bewertung messen sollte
Die verlinkte Publikation ist ein öffentliches Forschungspapier. Leser sollten vermeiden, sie als umfassenden Benchmark für eingesetzte Multi‑Agent‑Produkte zu behandeln. Ihr Wert liegt in dem spezifischen Fehlermodus, den sie testbar macht; ihre weiterreichenden Implikationen benötigen zusätzliche Evidenz.
Eine nützliche Folgebewertung würde die Reihenfolge der Signale, die Genauigkeit privater Evidenz, die Anzahl der Teilnehmenden und die Kommunikationsstruktur variieren. Sie sollte gewöhnliche Sequenzen neben bewusst irreführenden einbeziehen und korrekte frühe Mehrheiten neben falschen frühen Mehrheiten berücksichtigen. Andernfalls könnte eine Richtlinie scheinbar erfolgreich erscheinen, weil sie Agenten lehrt, jedem Konsens zu misstrauen.
Nur die Genauigkeit zu messen, würde wichtige Unterscheidungen übersehen. Bewertende sollten messen, ob Berichte Beobachtungen treu wiedergeben, wie oft Agenten unterstützende Evidenz erfinden, ob eine korrekte Minderheit die endgültige Entscheidung ändern kann und ob der Koordinator wiederholte Zitate als separate Checks zählt. Token‑Verbrauch und Latenz gehören in denselben Vergleich: Ein sichereres Protokoll benötigt dennoch einen betrieblich sinnvollen Aufwand.
Um Mechanismen zu untersuchen, könnten Forschende experimentell den Zugang zu früheren Urteilen variieren, während die Aufgabenevidenz konstant bleibt. Sie könnten unabhängige Anfangsbewertungen mit Bewertungen nach Durchsicht des Boards vergleichen. Die Randomisierung der Präsentationsreihenfolge würde helfen, Evidenzeffekte von Reihen‑ oder Hervorhebungseffekten zu trennen. Generierte Erklärungen können Hypothesen leiten, sollten jedoch nicht der alleinige Beweis dafür sein, warum ein Modell seine Antwort geändert hat.
Eine bessere Definition von Multi‑Agent‑Zuverlässigkeit
Die Sprache der Herdenmentalität ist anschaulich, sollte jedoch nicht als Hinweis darauf gelesen werden, dass Modelle menschlichen sozialen Druck erleben oder menschliche Überzeugungen besitzen. Das operative Anliegen ist beobachtbar: Informationen gelangen in einen Workflow, Urteile beeinflussen nachfolgende Urteile, und die endgültige Antwort kann verschleiern, woher ihre Unterstützung stammt.
Für Entwickler sollte der nächste Meilenstein eine nachweisbare Korrektur sein. Wenn ein Agent einen plausiblen Fehler macht, kann ein anderer den widersprüchlichen Beweis identifizieren? Kann der Koordinator diese Meinungsverschiedenheit lange genug aufrechterhalten, um sie zu untersuchen? Kann die endgültige Entscheidung erklären, welche unabhängigen Prüfungen das Problem gelöst haben?
Ein größeres Team gewinnt Vertrauen, wenn es überprüfbare Informationen hinzufügt und Entscheidungen unter Herausforderung verbessert. Das Zählen von Agenten, das Zählen von Befürwortungen und das Erzeugen längerer Diskussionen sind unzureichende Ersatzmaßnahmen. Das nützlichste Multi‑Agent‑System ist eines, dessen Belege auch dann noch prüfbar bleiben, wenn seine Teilnehmer übereinstimmen.












