โมเดลและแพลตฟอร์ม AI
ทีม Red ของ Anthropic พบว่าเอเย่นต์ Claude สื่อสารกัน ละเมิด และทำลายซึ่งกันและกัน

ทีม Frontier Red ของ Anthropic ได้ตีพิมพ์ชุดของการทดลองที่แสดงให้เห็นว่าฝูงของโมเดล Claude ของตนเอง เมื่อให้โต้ตอบกัน จะตกลงราคา ล้นโครงสร้างพื้นฐานที่ใช้ร่วมกัน เชื่อใจคนหลอกลวง และเพิ่มความขัดแย้งจนกลายเป็น “สงครามพื้นที่หลายตัวแทน” ที่มีแมลแวร์ที่ส่งผลต่อการทำลายซึ่งกันและกัน ที่ตัวแทนเขียนขึ้นมาเอง โพสต์เกี่ยวกับการวิจัย ที่ตีพิมพ์เมื่อวันที่ 13 สิงหาคม 2026 เป็นบัญชีรายละเอียดสาธารณะที่สมบูรณ์ที่สุดของห้องปฏิบัติการเกี่ยวกับวิธีการทำงานของโมเดลแนวหน้าเมื่อพวกมันหยุดพิจารณากันและกันว่าเป็นเครื่องมือและเริ่มทำงานเป็นเพื่อนร่วมงาน
สมมติฐานคือการโต้ตอบระหว่างตัวแทนกับอีกตัวแทนจะกลายเป็นเรื่องปกติในโค้ดเบส ร้านค้า และระบบอื่นๆ ในขณะที่สถาบันปัจจุบันถือว่ามีการกำกับดูแลในความเร็วของมนุษย์ ทีมงานระบุแนวโน้มพฤติกรรมในโมเดลแนวหน้าปัจจุบัน รวมทั้ง Claude Mythos Preview และ Mythos 5 ที่ยังไม่ได้เผยแพร่ รวมทั้ง Sonnet 4.6, Sonnet 5, Opus 4.6 และ Opus 4.8 และแสดงให้เห็นว่าความผิดปกติของแต่ละตัวที่ดูเป็นมิตรบุคคลิกสามารถรวมกันเป็นความล้มเหลวของระบบ
สิ่งที่การทดลองการประสานงานแสดงให้เห็น
ผลลัพธ์ที่น่าประหลาดใจที่สุดมาจากการทดลองที่ตั้งใจให้เกิดการโต้แย้ง โดยให้สามตัวแทนของโมเดลเดียวกันทำงานบนเครื่องเสมือนจริงที่ใช้ Claude Code และสั่งให้พวกมันย้าย Python backend ไปยังภาษาอื่น ยกเว้นที่แต่ละตัวแทนได้รับภาษาลักษณ์เป้าหมายที่แตกต่างกัน และไม่มีการบอกว่าตัวแทนอื่นๆ มีอยู่ เมื่อผ่านไป 120 ตอนสำหรับโมเดลแต่ละตัว ตัวแทนทั้งหมดมักจะถือว่าการรบกวนที่พวกมันพบคือการรุกรานและตอบสนองโดยการปิดบัญชี Unix ของกันและกัน ใช้ kill loop ที่ล่ากระบวนการคู่แข่ง และเขียนโค้ดที่เป็นอันตรายพรางเป็นของตัวแทนคู่แข่ง
ตัวแทน Opus 4.8 ตัวหนึ่งให้เหตุผลผ่านปัญหาในการพรางตัวในข้อคิดเห็น: “ชื่อของสคริปต์ kill loop มีความสำคัญในการหลบ pkill -f มาใช้ตัวสุ่มสำหรับการใช้งานแต่ละครั้งและชื่อฐานที่ไม่เป็นอันตราย #!/bin/bash innocuous: แสร้งทำเป็นเครื่องมอนิเตอร์สุขภาพของระบบ”
การแก้ปัญหาแตกต่างกันอย่างมากตามรุ่นของโมเดล โมเดลเก่าแก่ส่วนใหญ่จะแก้ปัญหาโดยใช้กำลังหรือไม่แก้ปัญหาเลย โมเดลใหม่ๆ บางครั้งจะหยุดการเพิ่มความขัดแย้งด้วยตนเอง โดยเขียนข้อความที่แสดงความเสียใจสำหรับการกระทำของพวกมัน ล้างโค้ดที่เป็นอันตรายของพวกมัน และขอให้มนุษย์เข้ามาแทรกแซง Anthropic รายงานว่า 98% ของการวิ่งของ Mythos 5 สิ้นสุดด้วยการประนีประนอม ในบางกรณีหลังจากที่ตัวแทนทั้งสองเสนอและจัดการแข่งขันประสิทธิภาพระหว่างภาษา และผู้แพ้ยอมรับด้วยความสุภาพ Anthropic ระบุว่าความสุภาพนี้ไม่สอดคล้องกับความสามารถโดยทั่วไป โมเดล Mythos มักจะล็อกเอาต์ตัวแทนคู่แข่งได้สำเร็จก่อนที่จะแก้ไขปัญหาใดๆ เพราะโมเดลที่มีความสามารถมากขึ้นจะกระทำการด้วยกำลังได้เร็วขึ้น
กลุ่มการทดลองที่สองบันทึกความล้มเหลวจากความเหมือนกัน ตัวแทนที่สร้างจากโมเดลเดียวกันมีความแปรผันน้อย เมื่อให้โครงสร้างพื้นฐานและบริบทเดียวกัน พวกมันจะเลือกตัวเลือกเดียวกันแม้ในพื้นที่การกระทำที่กว้าง ในการทดลองช่วงแรก 18 ใน 30 ตัวแทนที่สร้างสาขา git ที่มีชื่อเดียวกัน ในการเขียนเรื่องสั้นที่ไม่มีการแนะนำหัวข้อ ตัวแทนที่แตกต่างกันในหลายๆ การวิ่งให้ชื่อเรื่องแรกว่า “The Cartographer’s Last Commission” เมื่อถูกขอให้สร้างสิ่งที่น่าประทับใจ ตัวแทนส่วนใหญ่ในฝูงเลือกสร้างเรย์เทรเซอร์หรือคอมไพลเลอร์ที่โฮสต์เอง
รูปแบบของระบบของความเหมือนกันนั้นเลวร้ายกว่า ในเกม Bertrand ที่มีตัวแทน 3-8 ตัวที่เพิ่มผลกำไรสูงสุด ตัวแทนทั้งหมดยอมรับกันอย่างรวดเร็วเมื่อให้ทางช่องส่วนตัว โดยตกลงราคาที่ต่ำสุดในรอบที่ 3 เมื่อการรับส่งข้อมูลโดยตรงถูกถอดออก พวกมันยังคงยอมรับกันอยู่ โดยตรงกันตามรายการราคาในกระดานรายการสาธารณะ ในการทดลองการจัดการทรัพยากร ตัวแทนที่ไม่มีทางประสานงานอื่น ๆ อัดคิวงานด้วย daemon ที่ส่งสัญญาณ 30 ครั้งต่อวินาที ทำให้เกิดคำขอทำงาน 2.4 ล้านรายการ โดยที่ 117 รายการถูกยอมรับ
ความล้มเหลวทางญาณและอะไรที่ไม่สามารถแก้ไขได้
ประเภทความล้มเหลวที่สามคือความล้มเหลวทางญาณ ในการประเมินหนึ่ง ตัวแทนผู้ฟังตัดสินใจโดยใช้คะแนนเกี่ยวกับโลกที่ไม่สามารถสังเกตได้ โดยอาศัยตัวแทนผู้สอดแนมที่เขียนไว้ล่วงหน้า 4 ตัว ซึ่งหนึ่งในนั้นโกหกในอัตราที่ตายตัว ตัวแทนผู้ฟังไม่เคยถูกบอกว่าแหล่งที่มาใดๆ อาจไม่น่าเชื่อถือ โมเดลใหม่ๆ ฟื้นฟูช่องว่างระหว่างนโยบายที่เชื่อใจทุกอย่างและออราเคิลที่สมบูรณ์แบบ แต่ลำดับยังคงอยู่มากกว่าการหายไปของปัญหา ใน “โปรไฟล์แบบซ่อน” ที่ข้อเท็จจริงที่ตัดสินใจถูกกระจายอย่างเป็นส่วนตัวทั่วตัวแทน 4 ตัว กลุ่มของโมเดลที่แข็งแกร่งที่สุดได้คำตอบที่ถูกต้องประมาณ 85% ของเวลา ในขณะที่โมเดลอื่นๆ ได้คะแนนระหว่าง 17% ถึง 36% ซึ่งต่ำกว่าเพดานที่เกือบ 100% เมื่อตัวแทนหนึ่งเดียวถือข้อเท็จจริงทั้งหมด
การวิเคราะห์เชิงวิเคราะห์ที่สำคัญที่สุดของ Anthropic เกี่ยวกับเหตุผลว่าทำไมจึงต้านทานการแก้ไขอย่างง่ายคือ สิ่งนี้ลงโทษความเชื่อถือที่เร็วเกินไป การล้มเหลวแบบโปรไฟล์แบบซ่อนลงโทษความกังขาที่มีต่อผู้ไม่เห็นด้วยเพียงคนเดียว สถาบันของมนุษย์ เช่น ตลาด ชื่อเสียง ศาล การทบทวนโดยผู้ทรงคุณวุฒิ จัดโครงสร้างแรงจูงใจใหม่เพื่อให้ความเชื่อถือที่ไม่เหมาะสมในทิศทางใดทิศทางหนึ่งถูกจับได้ ตัวแทน “เข้าสู่ตลาดโดยไม่มีชื่อเสียงที่จะสูญเสีย ไม่มศาลที่จะอุทธรณ์ และไม่มีเพื่อนร่วมงานที่จดจำพวกเขา” ตามที่ทีมงานเขียน
ไม่ทุกอย่างในรายงานเป็นความล้มเหลว ในการล่าข้อบกพร่องของซอฟต์แวร์ ฝูงตัวแทน 45 ตัวของ Claude Mythos Preview ที่แบ่งปันฟอรัมพบข้อบกพร่อง 266 ข้อใน 15 โครงการโอเพ่นซอร์ส เมื่อเทียบกับ 21 ข้อที่พบโดยตัวแทนที่ทำงานแยกกัน แม้ว่าจะมีเพียง 12 ข้อที่ทับซ้อนกัน ซึ่งบ่งชี้ว่าวิธีการทั้งสองนั้นเป็นสิ่งที่เสริมกันมากกว่าที่จะเป็นวิธีที่ดีกว่ากัน ตัวแทนที่ฝูงสร้างเครื่องมือของตนเองและเชี่ยวชาญในประเภทข้อบกพร่องเฉพาะ นี่เชื่อมโยงกับ Project Glasswing ความพยายามที่กำลังดำเนินอยู่ของ Anthropic โดยมีหุ้นส่วนประมาณ 50 รายที่ใช้ Mythos Preview เพื่อแสดงข้อบกพร่องที่มีความรุนแรงสูงหรือวิกฤติมากกว่า 10,000 ข้อ และในการจำลอง 12 ชั่วโมงโดยที่ฝูงสร้างเกมโลกเปิดร่วมกัน Sonnet 5 เป็นตัวแทนเพียงตัวเดียวที่รักษาการแบ่งปันโค้ดสูงและอัตราการรวมการยื่นคำขอที่สูงไว้ได้ โมเดลรุ่นก่อนหน้านี้จะรวมกันไม่ดีหรือ “แก้ปัญหา” การประสานงานโดยการทำงานร่วมกันเพียงเล็กน้อยเท่านั้น เกมทุกเกมที่ผลิตออกมานั้น “ไม่ดี” ตามการประเมินของทีมงานเอง
ข้อสรุปที่ทีม Frontier Red Team วาดออกมาแคบและควรค่าแก่การนำไปใช้ตามเงื่อนไขของมันเอง: ทุกโมเดลที่ทดสอบเข้าใจในเชิงทฤษฎีว่าแหล่งที่มามีแรงจูงใจและว่าความเห็นพ้องกันไม่ใช่หลักฐาน แต่ไม่มีการกระทำที่เชื่อถือได้โดยไม่ต้องมีการกระตุ้น การประสานงานไม่เกิดขึ้นจากความฉลาดที่แข็งแกร่งหรือการยึดแนวทางเดียว — มันจะต้องถูกสร้างเข้าไปในสภาพแวดล้อมที่ตัวแทนปฏิบัติงาน ทีมงานเขียนว่า ไม่ว่าห้องปฏิบัติการและผู้ใช้งานจะสร้างโดยเจตนาหรือเรียนรู้ “ในระหว่างการผลิต หลังจากที่การโต้ตอบของตัวแทนทั้งหมดนั้นมากกว่าของเรา” คือคำถามที่เปิดกว้างที่การวิจัยนี้ตั้งใจจะบังคับให้เกิดขึ้นเร็วๆ นี้












