Rapporter
När AI‑agenter följer massan: Den dolda risken i multi‑agent‑konsensus

Ett rum fullt av överensstämmande AI‑agenter kan verka lugnande. En föreslår ett svar, en annan kontrollerar det, och flera fler godkänner slutsatsen. Men hur många av dessa agenter har faktiskt granskat den underliggande bevisningen? Om var och en absorberade den föregående agentens bedömning kan en enhällig dom dölja ett enda misstag.
Ny forskning som lyfts fram av University of Chicago Harris School of Public Policy undersöker detta problem. I de avsiktligt ogynnsamma experiment som beskrivs i deras tillkännagivande följde senare agenter en tidig felaktig slutsats även när deras egen information pekade mot det korrekta svaret. Tillkännagivandet betonar också att detta är tidiga stresstestresultat, snarare än bevis för att autonoma agenter rutinmässigt beter sig så här.
För organisationer som bygger multi‑agent‑arbetsflöden är den viktiga frågan hur man skiljer oberoende verifiering från ett eko. Nedan granskar vi experimentet, kopplar det till etablerad forskning om socialt lärande och utvecklar praktiska implikationer för systemdesign. De tekniska förslagen och numeriska illustrationerna är vår analys, inte ytterligare experimentella fynd.
Vad forskarna testade
Andy Hall, Dan Thompson, Alexander Fouirnaies och Sandy Handan‑Nader publicerade Extraordinära multi‑agent‑hallucinationer och trängselns galenskap den 29 september 2026. Agenterna härledde hur en simulerad uppgiftsgranskare fungerade utifrån privata godkännande‑ eller avvisningssignaler som var informativa 70 % av tiden. De läste tidigare inlägg på tavlan, publicerade slutsatser och rapporterade separat sina övertygelser. Stress‑villkoret gjorde de första fyra signalerna felaktiga.
Utan kommunikation spädde senare oberoende signaler ut den ursprungliga felaktigheten. Med en tavla bestod felaktiga bedömningar kvar; agenterna felrapporterade också sin egen bevisning. De flesta experiment använde Claude Haiku 4.5. Författarna rapporterar replikering med Sonnet 4.6, Opus 4.6 och GPT‑5 mini, med ett möjligt undantag för Gemini 2.5 Flash.
Över sju kommunikationspolicyer och ytterligare scenarier presterade regler som bevarade privata testresultat bäst. En regel krävde exakt rapportering och förbjöd påhittade tester eller räknare. Efterhands‑rationaliseringar nämnde tavlans majoritet mer än 90 % av tiden, men författarna varnar för att dessa förklaringar inte fastställer den interna mekanismen.
Skillnaden mellan en massa och ett eko
Den intellektuella bakgrunden föregår generativ AI. I deras 1992‑papper om informationskaskader beskriver Sushil Bikhchandani, David Hirshleifer och Ivo Welch hur sekventiella beslutsfattare kan följa föregångare samtidigt som de bortser från sin egen information. Deras ramverk hjälper till att förklara varför konformitet kan samexistera med sköra kollektiva övertygelser. En senare översikt över informationskaskader och socialt lärande, medförfattad av Omer Tamuz, sammanställer den teoretiska och empiriska forskningen som följde.
Tänk dig en hypotetisk mjukvaruundersökning. Agent A tolkar ett misslyckat test som bevis på att ett autentiseringsbibliotek är trasigt. Agent B läser A:s rapport och rekommenderar att byta ut biblioteket. Agent C sammanfattar båda meddelandena som två bekräftelser av samma fel. En koordinator ser nu tre agenter som håller med, även om hela kedjan vilar på en tolkning av ett enda test.
Att lägga till agent D kommer inte nödvändigtvis att ge ny information. Om D bara läser sammanfattningen har arbetsflödet skapat en ny möjlighet att upprepa påståendet. Den relevanta enheten för bekräftelse är den oberoende observationen: en separat reproduktion, ett annat test eller en direkt inspektion av den misstänkta felet.
Denna distinktion är viktig även när varje komponent är kapabel och samarbetsvillig. Överenskommelse är bara användbar i den grad dess bevismässiga grund rättfärdigar den. Ett system bör därför spåra vilka agenter som utförde en kontroll, vilka som bara tolkade en annan agents output, och vilka som upprepade en slutsats utan att kontrollera den.
Varför oberoende förändrar aritmetiken
En enkel beräkning illustrerar insatserna. Anta att fem hypotetiska väljare svarar korrekt på en binär fråga med sannolikhet 0,7, och deras svar är oberoende. Sannolikheten att minst tre svarar korrekt är cirka 83,7 %. Att kombinera deras röster förbättrar den enskilda väljaren 70 %-iga noggrannheten.
Anta nu att alla fem kopierar ett svar. Majoriteten är korrekt endast när det ursprungliga svaret är korrekt: 70 % av tiden. Antalet synliga deltagare har ökat, men mängden oberoende information har inte gjort det. Detta är illustrativa sannolikheter, inte prestationsmått från den nya forskningen.
Det finns en annan användbar beräkning för att tolka stress‑villkoret. Om fyra signaler oberoende har en 30 % chans att vara felaktiga, är sannolikheten att alla fyra är felaktiga 0,3⁴, eller 0,81 %. Det beskriver sannolikheten för en specifik startsekvens under dessa antaganden. Det beskriver inte sannolikheten att ett distribuerat agentteam misslyckas.
En felbedömning skulle kräva både hur ofta svåra situationer inträffar och hur systemet beter sig när de inträffar. Att förväxla dessa kvantiteter kan få ett resultat att framstå antingen mer alarmerande eller mer lugnande än vad bevisen tillåter. Ett stresstest kan avslöja en betydande svaghet utan att mäta dess frekvens i vanligt arbete.
Skapa ett bevisspår innan du bygger konsensus
Ett praktiskt svar är att separera observationer från tolkningar i det delade arbetsutrymmet. För den hypotetiska autentiseringsutredningen kan en observation innehålla ett testidentifierare, den testade kodrevisionen, det faktiska resultatet och exekveringstiden. Ett separat fält skulle registrera agentens föreslagna förklaring och dess osäkerhet.
Den strukturen låter koordinatorn ställa en konkret fråga: introducerar detta förslag en ny observation, eller hänvisar det tillbaka till redan räknad bevisning? Tre sammanfattningar som citerar samma misslyckade test bör förbli ett test i bevisregistret. En andra oberoende reproduktion bör synas som en separat kontroll.
För dyra eller betydelsefulla beslut kan team också samla in initiala bedömningar innan de exponerar agenter för varandras slutsatser. En granskare skulle inspektera källmaterialet, fatta en första bedömning och först därefter se gruppdiskussionen. Ändringar av uppfattning skulle fortfarande vara möjliga, men systemet kan registrera vilket nytt bevis som motiverade dem.
Detta är designförslag att utvärdera, inte skyddsåtgärder som validerats av detta experiment. De medför kostnader: mer strukturerade register, ytterligare verktygsanrop och potentiellt långsammare samordning. Deras värde bör bedömas mot de beslut de skyddar. Ett brainstorming‑arbetsflöde kan tolerera löst samtal; en produktionsincidentutredning kan behöva ett mycket striktare bevisspår.
Promptregler och körningstidkontroller löser olika problem
Att be en agent att bevara bevis är användbart, men en produktionsarkitektur kan gå längre genom att bevara själva det ursprungliga verktygsresultatet. En exekveringstjänst skulle kunna skriva resultat till ett register som agenter kan citera men inte skriva över. Läsare kan då jämföra tolkningen med det underliggande resultatet.
Även en oföränderlig logg garanterar inte att ett test var väl utformat, att källan var pålitlig eller att tolkningen är korrekt. Den gör dock avvikelser inspekterbara. Ett system kan skilja på ett felaktigt test och en rapport som felaktigt beskriver det testet.
Behörighet bör förbli ett separat beslut. En säker slutsats att ett system behöver repareras ger inte tillåtelse att ändra det. Att hålla exekveringsbehörigheter utanför konsensusprocessen förhindrar att ett epistemiskt fel automatiskt blir en operativ handling. Ett agentteam kan ha fel utan att få göra en obegränsad förändring.
Modelldiversitet bör också utvärderas snarare än att antas lösa problemet. Olika modeller kan bidra med olika tolkningar, men att ge agenter olika namn eller roller etablerar inte att deras bevis är oberoende. En diversifierad grupp som läser samma felaktiga sammanfattning kan fortfarande dela en gemensam bevisflaskhals.
Vad en starkare utvärdering bör mäta
Den länkade publikationen är en offentlig forskningsrapport. Läsare bör undvika att betrakta den som ett omfattande jämförelsetal för distribuerade multi‑agent‑produkter. Dess värde ligger i den specifika felmod som den gör testbar; dess bredare implikationer kräver ytterligare bevis.
En användbar uppföljningsutvärdering skulle variera signalernas ordning, noggrannheten i privat bevisning, antalet deltagare och kommunikationsstrukturen. Den bör inkludera vanliga sekvenser tillsammans med avsiktligt vilseledande, samt korrekta tidiga majoriteter tillsammans med felaktiga tidiga majoriteter. Annars kan en policy verka framgångsrik enbart för att den lär agenter att misstro varje konsensus.
Noggrannhet ensam skulle missa viktiga skillnader. Utvärderare bör mäta om rapporter troget bevarar observationer, hur ofta agenter uppfinner stödjande bevis, om en korrekt minoritet kan förändra det slutgiltiga beslutet, och om koordinatorn räknar upprepade citeringar som separata kontroller. Token‑förbrukning och latens bör jämföras tillsammans: ett säkrare protokoll kräver fortfarande en operativt användbar kostnad.
För att undersöka mekanismer kan forskare experimentellt variera tillgången till tidigare bedömningar samtidigt som de håller uppgiftens bevis konstant. De kan jämföra oberoende initiala bedömningar med bedömningar som bildas efter att ha läst tavlan. Randomisering av presentationsordning skulle hjälpa att separera bevisens effekt från sekvens‑ eller framträdandeeffekter. Genererade förklaringar kan vägleda hypoteser, men de bör inte vara det enda beviset på varför en modell ändrade sitt svar.
En bättre definition av multi‑agent‑tillförlitlighet
Språket om flockmentalitet är levande, men det bör inte tolkas som bevis för att modeller upplever mänskligt socialt tryck eller har mänskliga övertygelser. Den operativa frågan är observerbar: information kommer in i ett arbetsflöde, bedömningar påverkar senare bedömningar, och det slutgiltiga svaret kan dölja var dess stöd härstammar från.
För byggare bör nästa milstolpe vara demonstrerbar korrigering. När en agent gör ett plausibelt misstag, kan en annan identifiera den motsägelsefulla bevisningen? Kan koordinatorn bevara den oenigheten tillräckligt länge för att undersöka den? Kan det slutgiltiga beslutet förklara vilka oberoende kontroller som löste problemet?
Ett större team får förtroende när det tillför verifierbar information och förbättrar beslut under press. Att räkna agenter, räkna stöd och producera längre diskussioner är otillräckliga ersättningar. Det mest användbara multi‑agent‑systemet är ett vars bevis förblir inspekterbara även när deltagarna är överens.












