Raporty
Kiedy agenci AI podążają za tłumem: ukryte ryzyko w konsensusie wieloagentowym

Pokój pełen zgadzających się agentów AI może wydawać się uspokajający. Jeden proponuje odpowiedź, drugi ją sprawdza, a kilku kolejnych popiera wniosek. Ale ilu z tych agentów faktycznie sprawdziło podstawowe dowody? Jeśli każdy przyjął osąd poprzedniego agenta, jednogłośny werdykt może ukrywać pojedynczy błąd.
Nowe badania podkreślone przez University of Chicago Harris School of Public Policy analizują ten problem. W celowo niekorzystnych eksperymentach opisanych w ich ogłoszeniu, późniejsze agenty podążały za wczesnym błędnym wnioskiem, nawet gdy ich własne informacje wskazywały na prawidłową odpowiedź. Ogłoszenie podkreśla również, że są to wczesne wyniki testów wytrzymałościowych, a nie dowody na to, że autonomiczne agenty regularnie zachowują się w ten sposób.
Dla organizacji budujących wieloagentowe przepływy pracy kluczowe pytanie brzmi, jak odróżnić niezależną weryfikację od echa. Poniżej analizujemy eksperyment, łączymy go z ustalonymi badaniami nad uczeniem społecznym i opracowujemy praktyczne implikacje dla projektowania systemów. Propozycje inżynieryjne oraz ilustracje liczbowe stanowią naszą analizę, a nie dodatkowe wyniki eksperymentalne.
Co badali badacze
Andy Hall, Dan Thompson, Alexander Fouirnaies i Sandy Handan-Nader opublikowali Nadzwyczajne wieloagentowe złudzenia i szaleństwo tłumu 29 września 2026. Agenci wnioskowali, jak działa symulowany oceniający zadania, na podstawie prywatnych sygnałów akceptacji lub odrzutu, które były informacyjne w 70% przypadków. Czytali wcześniejsze posty na tablicy, publikowali wnioski i osobno zgłaszali przekonania. Warunek stresowy sprawił, że pierwsze cztery sygnały były niepoprawne.
Bez komunikacji późniejsze niezależne sygnały rozmywały początkowy błąd. Z tablicą niepoprawne oceny utrzymywały się; agenci także nieprawidłowo zgłaszali własne dowody. Większość eksperymentów wykorzystała Claude Haiku 4.5. Autorzy donoszą o replikacji z Sonnet 4.6, Opus 4.6 i GPT-5 mini, z możliwym wyjątkiem dla Gemini 2.5 Flash.
Wśród siedmiu polityk komunikacji i dodatkowych scenariuszy, zasady zachowujące prywatne wyniki testów wypadały najlepiej. Jedna wymagała dokładnego raportowania i zakazywała wymyślonych testów lub liczników. Uzasadnienia powstające po fakcie wspominały większość na tablicy ponad 90% czasu, jednak autorzy ostrzegają, że te wyjaśnienia nie dowodzą istnienia wewnętrznego mechanizmu.
Różnica między tłumem a echem
Intellektualne tło sięga czasów przed generatywną sztuczną inteligencją. W ich artykuł z 1992 roku o kaskadach informacyjnych, Sushil Bikhchandani, David Hirshleifer i Ivo Welch opisują, jak kolejni decydenci mogą podążać za poprzednikami, ignorując własne informacje. Ich ramy pomagają wyjaśnić, dlaczego konformizm może współistnieć z kruchymi przekonaniami zbiorowymi. Późniejszy przegląd kaskad informacyjnych i uczenia społecznego, współautorstwa z Omerem Tamuzem, przegląda teoretyczne i empiryczne badania, które nastąpiły.
Rozważmy hipotetyczne badanie oprogramowania. Agent A interpretuje nieudaną próbę jako dowód, że biblioteka uwierzytelniania jest uszkodzona. Agent B czyta raport A i zaleca wymianę biblioteki. Agent C podsumowuje obie wiadomości jako dwa potwierdzenia tego samego defektu. Koordynator widzi teraz trzech agentów zgadzających się, choć cała łańcuch opiera się na jednej interpretacji jednego testu.
Dodanie agenta D nie musi koniecznie dostarczyć nowych informacji. Jeśli D tylko czyta podsumowanie, przepływ pracy stworzył kolejną okazję do powtórzenia twierdzenia. Odpowiednią jednostką potwierdzenia jest niezależna obserwacja: oddzielna reprodukcja, inny test lub bezpośrednia inspekcja podejrzanej awarii.
To rozróżnienie ma znaczenie nawet wtedy, gdy każdy komponent jest zdolny i współpracujący. Zgoda jest użyteczna tylko w takim stopniu, w jakim jej dowodowe podstawy to uzasadniają. System powinien więc śledzić, które agenty przeprowadziły weryfikację, które jedynie interpretowały wynik innego agenta oraz które powtórzyły wniosek bez jego sprawdzenia.
Dlaczego niezależność zmienia rachunek
Proste obliczenie ilustruje stawkę. Załóżmy, że pięciu hipotetycznych wyborców odpowiada na pytanie binarne poprawnie z prawdopodobieństwem 0.7, a ich odpowiedzi są niezależne. Prawdopodobieństwo, że przynajmniej trzech będzie poprawnych, wynosi około 83.7%. Połączenie ich głosów poprawia dokładność w stosunku do 70% pojedynczego wyborcy.
Teraz załóżmy, że wszyscy pięciu kopiują jedną odpowiedź. Większość jest poprawna tylko wtedy, gdy pierwotna odpowiedź jest prawidłowa: 70% czasu. Liczba widocznych uczestników wzrosła, ale ilość niezależnych informacji nie uległa zmianie. Są to ilustracyjne prawdopodobieństwa, a nie pomiary wydajności z nowych badań.
Istnieje kolejne przydatne obliczenie do interpretacji warunku stresowego. Jeśli cztery sygnały mają niezależnie 30% szansy na błąd, prawdopodobieństwo, że wszystkie cztery będą błędne, wynosi 0.3 do czwartej potęgi, czyli 0.81%. Opisuje to prawdopodobieństwo konkretnej początkowej sekwencji przy tych założeniach. Nie opisuje to prawdopodobieństwa, że wdrożony zespół agentów zawiedzie.
Szacowanie awarii wymaga zarówno określenia, jak często występują trudne sytuacje, jak i tego, jak system zachowuje się, gdy się pojawiają. Mylenie tych wielkości może sprawić, że wynik wyda się albo bardziej alarmujący, albo bardziej uspokajający niż pozwalają na to dowody. Test wytrzymałościowy może ujawnić istotną słabość, nie mierząc jej częstotliwości w codziennej pracy.
Zbuduj ścieżkę dowodową przed budowaniem konsensusu
Praktyczną odpowiedzią jest oddzielenie obserwacji od interpretacji w wspólnej przestrzeni roboczej. W przypadku hipotetycznego dochodzenia w sprawie uwierzytelniania, obserwacja może zawierać identyfikator testu, wersję testowanego kodu, rzeczywisty wynik oraz czas wykonania. Oddzielne pole rejestrowałoby proponowane wyjaśnienie agenta oraz jego niepewność.
Ta struktura pozwala koordynatorowi zadać konkretne pytanie: czy ta rekomendacja wprowadza nową obserwację, czy odwołuje się do już policzonych dowodów? Trzy podsumowania cytujące ten sam nieudany test powinny pozostać jednym testem w rejestrze dowodów. Druga niezależna reprodukcja powinna być widoczna jako oddzielna kontrola.
W przypadku kosztownych lub istotnych decyzji zespoły mogą także zbierać wstępne oceny, zanim udostępnią agentom wnioski innych. Recenzent przejrzałby materiały źródłowe, sformułował wstępną ocenę i dopiero potem zobaczył dyskusję grupy. Zmiany zdania pozostawałyby możliwe, ale system mógłby zarejestrować, które nowe dowody je uzasadniły.
Są to propozycje projektowe do oceny, a nie zabezpieczenia zweryfikowane w tym eksperymencie. Wprowadzają koszty: bardziej ustrukturyzowane zapisy, dodatkowe wywołania narzędzi i potencjalnie wolniejszą koordynację. Ich wartość powinna być oceniana w odniesieniu do decyzji, które chronią. Praca w stylu burzy mózgów może tolerować luźną rozmowę; dochodzenie w sprawie incydentu produkcyjnego może wymagać znacznie surowszej ścieżki dowodowej.
Zasady promptów i kontrole w czasie wykonywania rozwiązują różne problemy
Poproszenie agenta o zachowanie dowodów jest przydatne, ale architektura produkcyjna może pójść dalej, zachowując sam oryginalny wynik narzędzia. Usługa wykonawcza mogłaby zapisywać wyniki w rekordzie, który agenci mogą cytować, ale nie mogą nadpisać. Czytelnicy mogliby wtedy porównać interpretację z podstawowym wynikiem.
Nawet niezmienny dziennik nie gwarantuje, że test został dobrze zaprojektowany, że źródło jest wiarygodne lub że interpretacja jest prawidłowa. Jednakże umożliwia on wgląd w niezgodności. System może odróżnić wadliwy test od raportu, który nieprawidłowo opisuje ten test.
Autoryzacja powinna pozostać odrębną decyzją. Pewny wniosek, że system wymaga naprawy, nie upoważnia do jego modyfikacji. Trzymanie uprawnień wykonawczych poza procesem konsensusu zapobiega automatycznemu przekształceniu błędu epistemicznego w działanie operacyjne. Zespół agentów może się mylić, nie mając jednocześnie pozwolenia na wprowadzenie nieograniczonej zmiany.
Różnorodność modeli powinna być również oceniana, a nie zakładana jako rozwiązanie problemu. Różne modele mogą wnosić odrębne interpretacje, ale nadawanie agentom różnych nazw lub ról nie dowodzi, że ich dowody są niezależne. Zróżnicowana grupa, która czyta to samo błędne podsumowanie, może wciąż mieć jedną wąską szyjkę dowodową.
Co powinna mierzyć silniejsza ocena
Połączona publikacja jest publicznym opracowaniem badawczym. Czytelnicy powinni unikać traktowania jej jako kompleksowego benchmarku wdrożonych produktów wieloagentowych. Jej wartość polega na konkretnym trybie awarii, który czyni testowalnym; szersze implikacje wymagają dalszych dowodów.
Użyteczna ocena następcza powinna zmieniać kolejność sygnałów, dokładność prywatnych dowodów, liczbę uczestników oraz strukturę komunikacji. Powinna obejmować zwykłe sekwencje obok celowo wprowadzających w błąd, oraz poprawne wczesne większości obok niepoprawnych wczesnych większości. W przeciwnym razie polityka może wydawać się skuteczna po prostu dlatego, że uczy agentów nieufności wobec każdego konsensusu.
Sama dokładność pominęłaby istotne rozróżnienia. Oceny powinny mierzyć, czy raporty wiernie zachowują obserwacje, jak często agenci wymyślają wspierające dowody, czy poprawna mniejszość może zmienić ostateczną decyzję oraz czy koordynator liczy powtarzające się cytowania jako oddzielne kontrole. Zużycie tokenów i opóźnienia powinny być porównywane razem: bezpieczniejszy protokół nadal musi mieć operacyjnie użyteczny koszt.
Aby zbadać mechanizmy, badacze mogliby eksperymentalnie zmieniać dostęp do wcześniejszych ocen, przy zachowaniu stałych dowodów zadania. Mogliby porównać niezależne wstępne oceny z ocenami powstałymi po przeczytaniu tablicy. Randomizacja kolejności prezentacji pomogłaby oddzielić efekty dowodów od efektów kolejności lub wyeksponowania. Wygenerowane wyjaśnienia mogą inspirować hipotezy, ale nie powinny stanowić jedynego dowodu na to, dlaczego model zmienił swoją odpowiedź.
Lepsza definicja niezawodności wieloagentowej
Język „mentalności stada” jest obrazowy, ale nie powinien być odczytywany jako dowód, że modele doświadczają ludzkiej presji społecznej lub posiadają ludzkie przekonania. Operacyjną troską jest to, co można zaobserwować: informacje wchodzą do przepływu pracy, oceny wpływają na późniejsze oceny, a ostateczna odpowiedź może ukrywać, skąd pochodzi jej wsparcie.
Dla twórców kolejnym kamieniem milowym powinno być wykazywalna korekta. Gdy jeden agent popełni wiarygodny błąd, czy inny może zidentyfikować sprzeczne dowody? Czy koordynator może zachować tę niezgodę wystarczająco długo, aby ją zbadać? Czy ostateczna decyzja może wyjaśnić, które niezależne kontrole rozwiązały problem?
Większy zespół zdobywa zaufanie, gdy dodaje weryfikowalne informacje i usprawnia decyzje w obliczu wyzwania. Liczenie agentów, liczenie poparć i prowadzenie dłuższych dyskusji to niewystarczające zamienniki. Najbardziej przydatny system wieloagentowy to taki, którego dowody pozostają możliwe do zbadania, nawet gdy jego uczestnicy się zgadzają.












