Rapporter
Når AI‑agenter følger mængden: Den skjulte risiko i multi‑agent‑konsensus

Et rum fyldt med enige AI‑agenter kan virke beroligende. En foreslår et svar, en anden tjekker det, og flere andre bakker op om konklusionen. Men hvor mange af disse agenter har faktisk efterset det underliggende bevis? Hvis hver absorberer den foregående agents dom, kan en enstemmig afgørelse skjule en enkelt fejl.
Ny forskning fremhævet af University of Chicago Harris School of Public Policy undersøger dette problem. I de bevidst ugunstige eksperimenter, der beskrives i deres meddelelse, fulgte senere agenter en tidlig forkert konklusion, selv når deres egen information pegede mod det korrekte svar. Meddelelsen understreger også, at dette er tidlige stresstestresultater, snarere end beviser for, at autonome agenter rutinemæssigt opfører sig på denne måde.
For organisationer, der bygger multi‑agent‑arbejdsprocesser, er det vigtige spørgsmål, hvordan man skelner mellem uafhængig verifikation og en ekkoeffekt. Nedenfor gennemgår vi eksperimentet, forbinder det med etableret forskning om social læring, og udvikler praktiske implikationer for systemdesign. De tekniske forslag og numeriske illustrationer er vores analyse, ikke yderligere eksperimentelle fund.
Hvad forskerne testede
Andy Hall, Dan Thompson, Alexander Fouirnaies og Sandy Handan‑Nader offentliggjorde Extraordinary Multi-Agent Delusions and the Madness of Crowds den 29. september 2026. Agenterne udledte, hvordan en simuleret opgavebedømmer fungerede ud fra private accept‑ eller afvisningssignaler, der var informative i 70 % af tilfældene. De læste tidligere opslag på tavlen, postede konklusioner og rapporterede separat deres overbevisninger. Stressbetingelsen gjorde de første fire signaler forkerte.
Uden kommunikation udvandede senere uafhængige signaler den oprindelige fejl. Med en tavle vedvarede de forkerte domme; agenterne rapporterede også deres egne beviser forkert. De fleste eksperimenter brugte Claude Haiku 4.5. Forfatterne rapporterer replikation med Sonnet 4.6, Opus 4.6 og GPT‑5 mini, med en mulig undtagelse for Gemini 2.5 Flash.
På tværs af syv kommunikationspolitikker og yderligere scenarier klarede regler, der bevarede private testresultater, sig bedst. En regel krævede nøjagtig rapportering og forbød opfundne tests eller optællinger. Efter‑hoc‑begrundelser nævnte tavlens flertal mere end 90 % af tiden, men forfatterne advarer om, at disse forklaringer ikke fastslår den interne mekanisme.
Forskellen mellem en mængde og et ekko
Den intellektuelle baggrund går forud for generativ AI. I deres 1992‑papir om informationskaskader beskriver Sushil Bikhchandani, David Hirshleifer og Ivo Welch, hvordan sekventielle beslutningstagere kan følge forgængere, mens de ignorerer deres egen information. Deres rammeværk hjælper med at forklare, hvorfor konformitet kan sameksistere med skrøbelige kollektive overbevisninger. En senere gennemgang af informationskaskader og social læring, medforfatter Omer Tamuz, undersøger den teoretiske og empiriske forskning, der fulgte.
Forestil dig en hypotetisk softwareundersøgelse. Agent A fortolker en mislykket test som bevis på, at et autentificeringsbibliotek er defekt. Agent B læser A’s rapport og anbefaler at udskifte biblioteket. Agent C sammenfatter begge beskeder som to bekræftelser af den samme fejl. En koordinator ser nu tre agenter, der er enige, selvom hele kæden hviler på én fortolkning af én test.
Tilføjelse af Agent D vil ikke nødvendigvis skabe ny information. Hvis D kun læser sammenfatningen, har arbejdsprocessen skabt en ny mulighed for at gentage påstanden. Den relevante enhed af bekræftelse er den uafhængige observation: en separat reproduktion, en anden test eller en direkte inspektion af den formodede fejl.
Denne sondring er vigtig, selv når hver komponent er kompetent og samarbejdsvillig. Enighed er kun nyttig i det omfang, dens bevismæssige grundlag retfærdiggør den. Et system bør derfor spore, hvilke agenter der udførte en kontrol, hvilke der blot fortolkede en anden agents output, og hvilke der gentog en konklusion uden at tjekke den.
Hvorfor uafhængighed ændrer aritmetikken
En simpel beregning illustrerer konsekvenserne. Antag, at fem hypotetiske vælgere hver svarer korrekt på et binært spørgsmål med sandsynlighed 0,7, og deres svar er uafhængige. Sandsynligheden for, at mindst tre svar er korrekte, er omkring 83,7 %. At kombinere deres stemmer forbedrer den enkelte vælgers 70 % nøjagtighed.
Forestil dig nu, at alle fem kopierer ét svar. Flertallet er kun korrekt, når det oprindelige svar er korrekt: 70 % af tiden. Antallet af synlige deltagere er steget, men mængden af uafhængig information er ikke. Dette er illustrative sandsynligheder, ikke præstationsmålinger fra den nye forskning.
Der findes en anden nyttig beregning til fortolkning af stresstilstanden. Hvis fire signaler uafhængigt har en 30 % chance for at være forkerte, er sandsynligheden for, at alle fire er forkerte, 0,3 i fjerde potens, dvs. 0,81 %. Det beskriver sandsynligheden for en bestemt startsekvens under de antagelser. Det beskriver ikke sandsynligheden for, at et implementeret agentteam vil fejle.
Et fejlevaluering ville kræve både hvor ofte vanskelige situationer opstår, og hvordan systemet opfører sig, når de opstår. At forveksle disse størrelser kan få et resultat til at fremstå enten mere alarmerende eller mere beroligende, end beviserne tillader. En stresstest kan afsløre en væsentlig svaghed uden at måle dens hyppighed i almindeligt arbejde.
Opbyg en evidenssti, før du bygger konsensus
En praktisk respons er at adskille observationer fra fortolkninger i det delte arbejdsområde. For den hypotetiske autentificeringsundersøgelse kunne en observation indeholde en testidentifikator, den testede kodeversion, den faktiske output og udførelsestiden. Et separat felt ville registrere agentens foreslåede forklaring og dens usikkerhed.
Den struktur gør det muligt for koordinatoren at stille et konkret spørgsmål: Introducerer denne anbefaling en ny observation, eller refererer den tilbage til allerede tælt evidens? Tre opsummeringer, der citerer den samme mislykkede test, bør forblive én test i evidensregistret. En anden uafhængig reproduktion bør fremstå som en separat kontrol.
For dyre eller væsentlige beslutninger kan hold også indsamle indledende vurderinger, inden agenterne udsættes for hinandens konklusioner. En reviewer ville inspicere kilde materialet, afgive en indledende dom og først derefter se gruppediskussionen. Ændringer i holdning ville forblive mulige, men systemet kunne registrere, hvilken ny evidens der begrundede dem.
Dette er designforslag, der skal evalueres, ikke sikkerhedsforanstaltninger valideret af dette eksperiment. De medfører omkostninger: mere strukturerede registre, ekstra værktøjskald og potentielt langsommere koordinering. Deres værdi bør vurderes i forhold til de beslutninger, de beskytter. En brainstorming‑workflow kan tolerere løst snak; en produktions‑incidentundersøgelse kan kræve en meget strengere evidenssti.
Prompt‑regler og køretidskontroller løser forskellige problemer
Det er nyttigt at bede en agent om at bevare evidens, men en produktionsarkitektur kan gå videre ved at bevare selve den oprindelige værktøjsoutput. En eksekveringsservice kunne skrive resultater ind i et register, som agenter kan citere, men ikke overskrive. Læserne kunne derefter sammenligne fortolkningen med den underliggende output.
Selv en uforanderlig log garanterer ikke, at en test var veludformet, at kilden var troværdig, eller at fortolkningen er korrekt. Den gør dog uoverensstemmelser mulige at inspicere. Et system kan skelne mellem en fejlagtig test og en rapport, der fejlagtigt beskriver den pågældende test.
Autorisation bør forblive en separat beslutning. En sikker konklusion om, at et system kræver reparation, giver ikke tilladelse til at ændre det. At holde eksekveringsrettigheder uden for konsensusprocessen forhindrer en epistemisk fejl i automatisk at blive til en operationel handling. Et agentteam kan tage fejl uden at få lov til at foretage en ubegrænset ændring.
Modeldiversitet bør også evalueres i stedet for at antage, at den løser problemet. Forskellige modeller kan bidrage med forskellige fortolkninger, men at tildele agenter forskellige navne eller roller beviser ikke, at deres evidens er uafhængig. En mangfoldig gruppe, der læser den samme fejlagtige opsummering, kan stadig dele en enkelt evidensflaskehals.
Hvad en stærkere evaluering bør måle
Den linkede publikation er en offentlig forskningsrapport. Læserne bør undgå at betragte den som en omfattende benchmark af implementerede multi‑agent‑produkter. Dens værdi ligger i den specifikke fejlsituation, den gør testbar; dens bredere implikationer kræver yderligere beviser.
En nyttig opfølgende evaluering ville variere rækkefølgen af signaler, nøjagtigheden af privat evidens, antallet af deltagere og kommunikationsstrukturen. Den bør inkludere almindelige sekvenser ved siden af bevidst vildledende, samt korrekte tidlige flertalsbeslutninger ved siden af forkerte tidlige flertalsbeslutninger. Ellers kan en politik fremstå succesfuld blot fordi den lærer agenter at mistro enhver konsensus.
Kun nøjagtighed ville overse vigtige forskelle. Evaluatorer bør måle, om rapporter trofast bevarer observationer, hvor ofte agenter opfinder støttende evidens, om en korrekt minoritet kan ændre den endelige beslutning, og om koordinatoren tæller gentagne citater som separate kontroller. Token‑forbrug og latenstid skal sammenlignes: en sikrere protokol kræver stadig en operationelt brugbar omkostning.
For at undersøge mekanismer kunne forskere eksperimentelt variere adgangen til tidligere domme, mens de holder opgaveevidensen konstant. De kunne sammenligne uafhængige indledende vurderinger med vurderinger, der er dannet efter at have læst tavlen. Randomisering af præsentationsrækkefølgen ville hjælpe med at adskille evidenseffekter fra sekvens‑ eller fremtrædelses‑effekter. Genererede forklaringer kan vejlede hypoteser, men de bør ikke fungere som den eneste bevis for, hvorfor en model ændrede sit svar.
En bedre definition af multi‑agent‑pålidelighed
Sproget om flokmentalitet er levende, men det bør ikke læses som bevis på, at modeller oplever menneskeligt socialt pres eller besidder menneskelige overbevisninger. Den operationelle bekymring er observerbar: information træder ind i en arbejdsproces, domme påvirker senere domme, og det endelige svar kan skjule, hvor dets støtte stammer fra.
For dem, der bygger, bør den næste milepæl være demonstrerbar korrektion. Når en agent begår en plausibel fejl, kan en anden identificere den modstridende evidens? Kan koordinatoren bevare den uenighed længe nok til at undersøge den? Kan den endelige beslutning forklare, hvilke uafhængige kontroller der løste problemet?
Et større team opnår tillid, når det tilføjer verificerbar information og forbedrer beslutninger under udfordring. At tælle agenter, tælle godkendelser og producere længere diskussioner er utilstrækkelige erstatninger. Det mest nyttige multi-agent system er et, hvis evidens forbliver inspicerbar, selv når deltagerne er enige.












