Informes
Cuando los agentes de IA siguen a la multitud: El riesgo oculto en el consenso multiagente

Una sala llena de agentes de IA que están de acuerdo puede parecer tranquilizadora. Uno propone una respuesta, otro la verifica, y varios más respaldan la conclusión. Pero, ¿cuántos de esos agentes realmente comprobaron la evidencia subyacente? Si cada uno absorbió el juicio del agente anterior, un veredicto unánime puede ocultar un único error.
Una nueva investigación resaltada por la University of Chicago Harris School of Public Policy examina ese problema. En los experimentos deliberadamente adversos descritos en su anuncio, los agentes posteriores siguieron una conclusión errónea inicial incluso cuando su propia información apuntaba a la respuesta correcta. El anuncio también subraya que se trata de resultados preliminares de pruebas de estrés, más que de evidencia de que los agentes autónomos se comportan rutinariamente de esta manera.
Para las organizaciones que construyen flujos de trabajo multiagente, la cuestión importante es cómo distinguir la verificación independiente de un eco. A continuación, examinamos el experimento, lo conectamos con la investigación establecida sobre aprendizaje social y desarrollamos implicaciones prácticas para el diseño del sistema. Las propuestas de ingeniería y las ilustraciones numéricas son nuestro análisis, no hallazgos experimentales adicionales.
Qué probaron los investigadores
Andy Hall, Dan Thompson, Alexander Fouirnaies y Sandy Handan-Nader publicaron Delirios Multiagente Extraordinarios y la Locura de las Multitudes el 29 de septiembre de 2026. Los agentes inferían cómo funcionaba un evaluador de tareas simulado a partir de señales privadas de aceptación o rechazo que eran informativas el 70 % de las veces. Leían publicaciones anteriores en el tablero, publicaban conclusiones y reportaban creencias por separado. La condición de estrés hizo que las primeras cuatro señales fueran incorrectas.
Sin comunicación, las señales independientes posteriores diluyeron el error inicial. Con un tablero, los juicios incorrectos persistieron; los agentes también informaron erróneamente su propia evidencia. La mayoría de los experimentos utilizaron Claude Haiku 4.5. Los autores informan una replicación con Sonnet 4.6, Opus 4.6 y GPT-5 mini, con una posible excepción para Gemini 2.5 Flash.
En siete políticas de comunicación y escenarios adicionales, las reglas que preservan los resultados de pruebas privadas obtuvieron el mejor desempeño. Una requería informes exactos y prohibía pruebas o recuentos inventados. Las justificaciones post hoc mencionaron la mayoría del tablero más del 90 % de las veces, pero los autores advierten que estas explicaciones no establecen el mecanismo interno.
La diferencia entre una multitud y un eco
El trasfondo intelectual precede a la IA generativa. En su artículo de 1992 sobre cascadas informativas, Sushil Bikhchandani, David Hirshleifer e Ivo Welch describen cómo los tomadores de decisiones secuenciales pueden seguir a sus predecesores mientras ignoran su propia información. Su marco ayuda a explicar por qué la conformidad puede coexistir con creencias colectivas frágiles. Una posterior revisión de cascadas informativas y aprendizaje social, coautoria con Omer Tamuz, examina la investigación teórica y empírica que siguió.
Considere una investigación hipotética de software. El agente A interpreta una prueba fallida como prueba de que una biblioteca de autenticación está rota. El agente B lee el informe de A y recomienda reemplazar la biblioteca. El agente C resume ambos mensajes como dos confirmaciones del mismo defecto. Un coordinador ahora ve a tres agentes de acuerdo, aunque toda la cadena se basa en una única interpretación de una prueba.
Añadir al agente D no producirá necesariamente información nueva. Si D solo lee el resumen, el flujo de trabajo ha creado otra oportunidad para repetir la afirmación. La unidad relevante de corroboración es la observación independiente: una reproducción separada, una prueba distinta o una inspección directa del fallo sospechado.
Esta distinción importa incluso cuando cada componente es capaz y cooperativo. El acuerdo es útil solo en la medida en que sus fundamentos probatorios lo justifiquen. Por lo tanto, un sistema debe registrar qué agentes realizaron una verificación, cuáles simplemente interpretaron la salida de otro agente y cuáles repitieron una conclusión sin comprobarla.
Por qué la independencia cambia la aritmética
Un cálculo simple ilustra lo que está en juego. Supongamos que cinco votantes hipotéticos responden correctamente una pregunta binaria con una probabilidad de 0,7, y sus respuestas son independientes. La probabilidad de que al menos tres sean correctas es aproximadamente del 83,7 %. Combinar sus votos mejora la precisión del 70 % de un solo votante.
Ahora supongamos que los cinco copian una respuesta. La mayoría es correcta solo cuando esa respuesta original es correcta: el 70 % de las veces. El número visible de participantes ha aumentado, pero la cantidad de información independiente no lo ha hecho. Estas son probabilidades ilustrativas, no mediciones de rendimiento de la nueva investigación.
Existe otro cálculo útil para interpretar la condición de estrés. Si cuatro señales tienen independientemente un 30 % de probabilidad de estar equivocadas, la probabilidad de que las cuatro estén equivocadas es 0,3 a la cuarta potencia, o 0,81 %. Eso describe la probabilidad de una secuencia inicial particular bajo esas suposiciones. No describe la probabilidad de que un equipo de agentes desplegado falle.
Una estimación de fallos requeriría tanto la frecuencia con la que ocurren situaciones difíciles como el comportamiento del sistema cuando ocurren. Confundir esas cantidades puede hacer que un resultado parezca más alarmante o más tranquilizador de lo que la evidencia permite. Una prueba de estrés puede revelar una debilidad importante sin medir su frecuencia en el trabajo ordinario.
Construir una cadena de evidencia antes de construir consenso
Una respuesta práctica es separar las observaciones de las interpretaciones en el espacio de trabajo compartido. Para la investigación hipotética de autenticación, una observación podría contener un identificador de prueba, la revisión del código probado, la salida real y el tiempo de ejecución. Un campo separado registraría la explicación propuesta por el agente y su incertidumbre.
Esa estructura permite al coordinador formular una pregunta concreta: ¿esta recomendación introduce una nueva observación, o hace referencia a evidencia ya contabilizada? Tres resúmenes que citan la misma prueba fallida deberían permanecer como una sola prueba en el registro de evidencia. Una segunda reproducción independiente debería mostrarse como una verificación separada.
Para decisiones costosas o de gran consecuencia, los equipos también podrían recopilar evaluaciones iniciales antes de exponer a los agentes a las conclusiones de los demás. Un revisor inspeccionaría el material fuente, emitiría un juicio inicial y solo entonces vería la discusión grupal. Los cambios de opinión seguirían siendo posibles, pero el sistema podría registrar qué nueva evidencia los justificó.
Estas son propuestas de diseño para evaluar, no salvaguardas validadas por este experimento. Introducen costos: registros más estructurados, llamadas adicionales a herramientas y una coordinación potencialmente más lenta. Su valor debe evaluarse frente a las decisiones que protegen. Un flujo de trabajo de lluvia de ideas puede tolerar conversaciones sueltas; una investigación de incidentes de producción puede requerir una cadena de evidencia mucho más estricta.
Reglas de indicaciones y controles de tiempo de ejecución resuelven problemas diferentes
Pedir a un agente que preserve la evidencia es útil, pero una arquitectura de producción puede ir más allá al preservar la salida original de la herramienta en sí. Un servicio de ejecución podría escribir los resultados en un registro que los agentes pueden citar pero no sobrescribir. Los lectores podrían entonces comparar la interpretación con la salida subyacente.
Incluso un registro inmutable no garantiza que una prueba haya sido bien diseñada, que la fuente sea confiable o que la interpretación sea correcta. Sin embargo, hace que las discrepancias sean inspeccionables. Un sistema puede distinguir una prueba defectuosa de un informe que describe de manera inexacta esa prueba.
La autorización debe seguir siendo una decisión separada. Una conclusión segura de que un sistema necesita reparación no confiere permiso para alterarlo. Mantener los permisos de ejecución fuera del proceso de consenso evita que un error epistémico se convierta automáticamente en una acción operativa. Un equipo de agentes puede estar equivocado sin que se le permita realizar un cambio sin restricciones.
La diversidad de modelos también debe evaluarse en lugar de asumirse como solución al problema. Diferentes modelos pueden aportar interpretaciones distintas, pero asignar nombres o roles diferentes a los agentes no establece que su evidencia sea independiente. Un grupo diverso que lea el mismo resumen erróneo aún puede compartir un cuello de botella evidencial.
Lo que una evaluación más rigurosa debería medir
La publicación enlazada es un informe de investigación pública. Los lectores deben evitar tratarla como una referencia exhaustiva de productos multi‑agente desplegados. Su valor radica en el modo de falla específico que hace posible probar; sus implicaciones más amplias requieren evidencia adicional.
Una evaluación útil de seguimiento variaría el orden de las señales, la precisión de la evidencia privada, el número de participantes y la estructura de comunicación. Debería incluir secuencias ordinarias junto a otras deliberadamente engañosas, y mayorías correctas tempranas junto a mayorías incorrectas tempranas. De lo contrario, una política podría parecer exitosa simplemente porque enseña a los agentes a desconfiar de todo consenso.
La precisión por sí sola pasaría por alto distinciones importantes. Los evaluadores deberían medir si los informes preservan fielmente las observaciones, con qué frecuencia los agentes inventan evidencia de apoyo, si una minoría correcta puede cambiar la decisión final, y si el coordinador cuenta las citas repetidas como verificaciones separadas. El consumo de tokens y la latencia deben incluirse en la misma comparación: un protocolo más seguro sigue necesitando un costo operativamente útil.
Para investigar los mecanismos, los investigadores podrían variar experimentalmente el acceso a juicios anteriores mientras mantienen constante la evidencia de la tarea. Podrían comparar evaluaciones iniciales independientes con evaluaciones formadas después de leer el tablero. Aleatorizar el orden de presentación ayudaría a separar los efectos de la evidencia de los efectos de la secuencia o prominencia. Las explicaciones generadas pueden guiar hipótesis, pero no deben servir como la única prueba de por qué un modelo cambió su respuesta.
Una mejor definición de fiabilidad multi‑agente
El lenguaje de mentalidad de rebaño es vívido, pero no debe interpretarse como evidencia de que los modelos experimentan presión social humana o poseen creencias humanas. La preocupación operativa es observable: la información ingresa a un flujo de trabajo, los juicios influyen en juicios posteriores y la respuesta final puede ocultar de dónde provino su apoyo.
Para los constructores, el siguiente hito debería ser una corrección demostrable. Cuando un agente comete un error plausible, ¿puede otro identificar la evidencia contradictoria? ¿Puede el coordinador mantener ese desacuerdo el tiempo suficiente para investigarlo? ¿Puede la decisión final explicar qué verificaciones independientes resolvieron el problema?
Un equipo más grande gana confianza cuando aporta información verificable y mejora las decisiones bajo presión. Contar agentes, contar avales y generar discusiones más largas son sustitutos insuficientes. El sistema multi‑agente más útil es aquel cuya evidencia sigue siendo inspeccionable incluso cuando sus participantes están de acuerdo.












