Báo cáo
Khi các tác nhân AI theo đám đông: Rủi ro ẩn trong sự đồng thuận đa tác nhân

Một phòng đầy các tác nhân AI đồng ý có thể trông rất an tâm. Một đề xuất câu trả lời, một khác kiểm tra nó, và một vài nữa ủng hộ kết luận. Nhưng có bao nhiêu trong số các tác nhân đó thực sự kiểm tra bằng chứng nền tảng? Nếu mỗi tác nhân hấp thụ phán đoán của tác nhân trước, một phán quyết đồng thuận có thể che giấu một sai lầm duy nhất.
Nghiên cứu mới được trường Harris School of Public Policy, Đại học Chicago, làm nổi bật đã xem xét vấn đề này. Trong các thí nghiệm cố ý gây khó khăn được mô tả trong thông báo, các tác nhân sau đã theo một kết luận sai sớm ngay cả khi thông tin của chúng chỉ ra câu trả lời đúng. Thông báo cũng nhấn mạnh rằng đây là kết quả kiểm tra áp lực ban đầu, chứ không phải bằng chứng cho thấy các tác nhân tự động thường hành xử như vậy.
Đối với các tổ chức xây dựng quy trình làm việc đa tác nhân, câu hỏi quan trọng là làm sao phân biệt kiểm chứng độc lập với tiếng vang. Dưới đây, chúng tôi sẽ xem xét thí nghiệm, liên kết nó với nghiên cứu học tập xã hội đã được thiết lập, và phát triển các hàm ý thực tiễn cho thiết kế hệ thống. Các đề xuất kỹ thuật và minh họa số liệu là phân tích của chúng tôi, không phải là các phát hiện thí nghiệm bổ sung.
Những gì các nhà nghiên cứu đã kiểm tra
Andy Hall, Dan Thompson, Alexander Fouirnaies và Sandy Handan-Nader đã công bố Extraordinary Multi-Agent Delusions and the Madness of Crowds vào ngày 29 tháng 9 năm 2026. Các tác nhân suy luận cách một bộ chấm điểm nhiệm vụ mô phỏng hoạt động dựa trên các tín hiệu chấp nhận hoặc từ chối riêng tư, với độ tin cậy 70% thời gian. Họ đọc các bài đăng trên bảng trước đó, đăng kết luận và riêng biệt báo cáo niềm tin. Điều kiện áp lực đã làm cho bốn tín hiệu đầu tiên sai.
Không có giao tiếp, các tín hiệu độc lập sau này đã làm loãng lỗi ban đầu. Khi có bảng, các phán đoán sai vẫn tồn tại; các tác nhân cũng báo cáo sai bằng chứng của mình. Hầu hết các thí nghiệm sử dụng Claude Haiku 4.5. Các tác giả báo cáo việc sao chép với Sonnet 4.6, Opus 4.6 và GPT-5 mini, có thể ngoại lệ đối với Gemini 2.5 Flash.
Trong bảy chính sách giao tiếp và các kịch bản bổ sung, các quy tắc bảo vệ kết quả kiểm tra riêng tư đạt hiệu suất tốt nhất. Một quy tắc yêu cầu báo cáo chính xác và cấm các bài kiểm tra hoặc đếm số được bịa đặt. Các lý do hậu kỳ đề cập đến đa số trên bảng hơn 90% thời gian, nhưng các tác giả cảnh báo rằng những giải thích này không thiết lập cơ chế nội tại.
Sự khác biệt giữa Đám đông và Tiếng vang
Nền tảng trí tuệ này xuất hiện trước thời kỳ AI sinh tạo. Trong bài báo năm 1992 về chuỗi thông tin, Sushil Bikhchandani, David Hirshleifer và Ivo Welch mô tả cách các nhà quyết định theo thứ tự có thể theo sau những người đi trước mà bỏ qua thông tin của chính mình. Khung lý thuyết của họ giúp giải thích tại sao sự tuân thủ có thể đồng thời tồn tại cùng các niềm tin tập thể mong manh. Một đánh giá về chuỗi thông tin và học tập xã hội sau này, đồng tác giả với Omer Tamuz, tổng quan các nghiên cứu lý thuyết và thực nghiệm đã được thực hiện tiếp theo.
Hãy xem xét một cuộc điều tra phần mềm giả định. Tác nhân A diễn giải một bài kiểm tra thất bại như bằng chứng rằng một thư viện xác thực bị hỏng. Tác nhân B đọc báo cáo của A và đề xuất thay thế thư viện. Tác nhân C tóm tắt cả hai tin nhắn như hai xác nhận của cùng một lỗi. Một điều phối viên giờ nhìn thấy ba tác nhân đồng ý, mặc dù toàn bộ chuỗi dựa trên một diễn giải của một bài kiểm tra duy nhất.
Thêm Tác nhân D không nhất thiết tạo ra thông tin mới. Nếu D chỉ đọc bản tóm tắt, quy trình làm việc đã tạo ra một cơ hội khác để lặp lại khẳng định. Đơn vị liên quan của sự xác nhận là quan sát độc lập: một phép tái tạo riêng biệt, một bài kiểm tra khác hoặc một kiểm tra trực tiếp lỗi nghi ngờ.
Sự phân biệt này quan trọng ngay cả khi mọi thành phần đều có khả năng và hợp tác. Sự đồng thuận chỉ hữu ích ở mức độ mà nền tảng bằng chứng của nó biện minh cho nó. Do đó, một hệ thống nên theo dõi tác nhân nào đã thực hiện kiểm tra, tác nhân nào chỉ diễn giải đầu ra của người khác, và tác nhân nào lặp lại kết luận mà không kiểm tra.
Tại sao tính độc lập thay đổi phép tính
Một phép tính đơn giản minh họa mức độ quan trọng. Giả sử năm cử tri giả định mỗi người trả lời đúng một câu hỏi nhị phân với xác suất 0,7, và các câu trả lời của họ là độc lập. Xác suất có ít nhất ba câu trả lời đúng là khoảng 83,7%. Kết hợp các phiếu bầu cải thiện độ chính xác 70% của một cử tri duy nhất.
Bây giờ giả sử cả năm đều sao chép một câu trả lời. Đa số chỉ đúng khi câu trả lời gốc đúng: 70% thời gian. Số lượng người tham gia hiển thị tăng lên, nhưng lượng thông tin độc lập không thay đổi. Đây là các xác suất minh họa, không phải là các đo lường hiệu suất từ nghiên cứu mới.
Có một phép tính hữu ích khác để diễn giải điều kiện áp lực. Nếu bốn tín hiệu độc lập có 30% khả năng sai, xác suất tất cả bốn sai là 0,3 mũ bốn, hay 0,81%. Điều này mô tả xác suất của một chuỗi khởi đầu cụ thể dưới các giả định đó. Nó không mô tả xác suất một đội tác nhân được triển khai sẽ thất bại.
Một ước tính thất bại sẽ cần cả tần suất xảy ra các tình huống khó khăn và cách hệ thống hoạt động khi chúng xảy ra. Nhầm lẫn giữa hai lượng này có thể khiến kết quả trông có vẻ đáng lo ngại hơn hoặc an tâm hơn so với bằng chứng cho phép. Kiểm tra áp lực có thể phơi bày một điểm yếu quan trọng mà không cần đo tần suất của nó trong công việc thường ngày.
Xây dựng Dấu vết Bằng chứng Trước khi Xây dựng Đồng thuận
Một phản hồi thực tiễn là tách biệt quan sát khỏi diễn giải trong không gian làm việc chung. Đối với cuộc điều tra xác thực giả định, một quan sát có thể bao gồm mã định danh kiểm thử, phiên bản mã đã kiểm thử, kết quả thực tế và thời gian thực thi. Một trường riêng sẽ ghi lại lời giải thích đề xuất của tác nhân và mức độ không chắc chắn của nó.
Cấu trúc đó cho phép người điều phối đặt một câu hỏi cụ thể: đề xuất này có tạo ra một quan sát mới không, hay nó tham chiếu lại bằng chứng đã được tính trước? Ba bản tóm tắt trích dẫn cùng một bài kiểm tra thất bại nên được ghi là một bài kiểm tra duy nhất trong sổ bằng chứng. Một bản sao độc lập thứ hai nên hiển thị như một kiểm tra riêng.
Đối với các quyết định tốn kém hoặc có hậu quả, các nhóm cũng có thể thu thập đánh giá ban đầu trước khi để các tác nhân tiếp xúc với kết luận của nhau. Một người đánh giá sẽ kiểm tra tài liệu nguồn, đưa ra phán quyết ban đầu và chỉ sau đó mới xem cuộc thảo luận nhóm. Việc thay đổi quan điểm vẫn có thể xảy ra, nhưng hệ thống có thể ghi lại bằng chứng mới nào đã biện minh cho chúng.
Đây là các đề xuất thiết kế để đánh giá, không phải là các biện pháp bảo vệ đã được thí nghiệm này xác nhận. Chúng tạo ra chi phí: hồ sơ có cấu trúc hơn, các lời gọi công cụ bổ sung và khả năng điều phối chậm hơn. Giá trị của chúng nên được đánh giá dựa trên các quyết định mà chúng bảo vệ. Một quy trình suy nghĩ nhóm có thể chấp nhận cuộc trò chuyện lỏng lẻo; một cuộc điều tra sự cố sản xuất có thể cần một dấu vết bằng chứng chặt chẽ hơn nhiều.
Quy tắc Gợi ý và Kiểm soát Thời gian chạy Giải quyết các Vấn đề Khác nhau
Yêu cầu một tác nhân bảo tồn bằng chứng là hữu ích, nhưng kiến trúc sản xuất có thể tiến xa hơn bằng cách bảo tồn ngay kết quả đầu ra gốc của công cụ. Một dịch vụ thực thi có thể ghi kết quả vào một bản ghi mà các tác nhân có thể trích dẫn nhưng không thể ghi đè. Người đọc sau đó có thể so sánh diễn giải với kết quả gốc.
Ngay cả một nhật ký không thể thay đổi cũng không đảm bảo rằng một bài kiểm tra được thiết kế tốt, nguồn tin đáng tin cậy hoặc diễn giải là chính xác. Tuy nhiên, nó cho phép kiểm tra các sự không nhất quán. Một hệ thống có thể phân biệt một bài kiểm tra lỗi với một báo cáo mô tả không chính xác bài kiểm tra đó.
Quyền ủy quyền nên được giữ là một quyết định riêng. Một kết luận chắc chắn rằng hệ thống cần sửa chữa không đồng nghĩa với việc được phép thay đổi nó. Giữ quyền thực thi ngoài quy trình đồng thuận ngăn một lỗi nhận thức tự động trở thành hành động vận hành. Một nhóm tác nhân có thể sai mà không được phép thực hiện thay đổi không giới hạn.
Đa dạng mô hình cũng nên được đánh giá thay vì giả định sẽ giải quyết vấn đề. Các mô hình khác nhau có thể đóng góp các diễn giải riêng biệt, nhưng việc gán tên hoặc vai trò khác nhau cho các tác nhân không chứng minh bằng chứng của chúng là độc lập. Một nhóm đa dạng đọc cùng một bản tóm tắt sai lầm vẫn có thể chia sẻ một nút thắt bằng chứng duy nhất.
Những Điều Một Đánh Giá Mạnh Hơn Nên Đo Lường
Ấn phẩm được liên kết là một bản viết nghiên cứu công cộng. Độc giả nên tránh coi nó như một chuẩn mực toàn diện cho các sản phẩm đa tác nhân đã triển khai. Giá trị của nó nằm ở chế độ lỗi cụ thể mà nó có thể kiểm tra; các hệ quả rộng hơn của nó cần thêm bằng chứng.
Một đánh giá tiếp theo hữu ích sẽ thay đổi thứ tự các tín hiệu, độ chính xác của bằng chứng riêng, số lượng người tham gia và cấu trúc giao tiếp. Nó nên bao gồm các chuỗi bình thường cùng với các chuỗi cố ý gây nhầm lẫn, và đa số đúng sớm cùng với đa số sai sớm. Nếu không, một chính sách có thể trông thành công chỉ vì nó dạy các tác nhân không tin tưởng mọi đồng thuận.
Chỉ độ chính xác sẽ bỏ lỡ những khác biệt quan trọng. Người đánh giá nên đo lường liệu các báo cáo có trung thực bảo tồn các quan sát, tần suất các tác nhân tự tạo bằng chứng hỗ trợ, liệu một thiểu số đúng có thể thay đổi quyết định cuối cùng, và liệu người điều phối có tính các trích dẫn lặp lại như các kiểm tra riêng không. Tiêu thụ token và độ trễ cũng cần được so sánh cùng nhau: một giao thức an toàn hơn vẫn cần một chi phí vận hành có ích.
Để nghiên cứu cơ chế, các nhà nghiên cứu có thể thí nghiệm thay đổi quyền truy cập vào các phán đoán trước đó trong khi giữ bằng chứng nhiệm vụ không đổi. Họ có thể so sánh các đánh giá ban đầu độc lập với các đánh giá được hình thành sau khi đọc bảng. Việc ngẫu nhiên hoá thứ tự trình bày sẽ giúp tách biệt ảnh hưởng của bằng chứng khỏi ảnh hưởng của trình tự hoặc độ nổi bật. Các giải thích được tạo ra có thể hướng dẫn giả thuyết, nhưng chúng không nên là bằng chứng duy nhất giải thích tại sao một mô hình thay đổi câu trả lời.
Định Nghĩa Tốt Hơn về Độ Tin Cậy Đa Tác Nhân
Ngôn ngữ về tâm lý bầy đàn rất sinh động, nhưng không nên được hiểu là bằng chứng cho thấy các mô hình trải qua áp lực xã hội của con người hoặc có niềm tin của con người. Mối quan tâm thực tiễn là có thể quan sát được: thông tin đi vào quy trình làm việc, các phán đoán ảnh hưởng đến các phán đoán sau, và câu trả lời cuối cùng có thể che giấu nguồn gốc của sự hỗ trợ.
Đối với những người xây dựng, cột mốc tiếp theo nên là việc sửa chữa có thể chứng minh được. Khi một tác nhân mắc lỗi có vẻ hợp lý, liệu một tác nhân khác có thể xác định bằng chứng mâu thuẫn không? Điều phối viên có thể giữ lại sự bất đồng đó đủ lâu để điều tra không? Quyết định cuối cùng có thể giải thích những kiểm tra độc lập nào đã giải quyết vấn đề không?
Một đội lớn hơn sẽ được tin tưởng khi nó bổ sung thông tin có thể xác minh được và cải thiện quyết định trong tình huống thách thức. Đếm số tác nhân, đếm số lần ủng hộ và tạo ra các cuộc thảo luận dài hơn đều là những biện pháp thay thế không đủ. Hệ thống đa tác nhân hữu ích nhất là hệ thống mà bằng chứng vẫn có thể kiểm tra được ngay cả khi các thành phần tham gia đồng ý.












