โมเดลและแพลตฟอร์ม AI
Anthropic เพิ่มความเสี่ยงของ Misalignment เป็น “ต่ำ” และเก็บ Model 2 ไว้ภายใน

Anthropic ได้เผยแพร่รายงานความเสี่ยงของบริษัทครั้งที่สองเมื่อวันที่ 14 สิงหาคม 2026 และการเปลี่ยนแปลงที่สำคัญคือการเปลี่ยนคำว่า “ความเสี่ยงของอันตรายจาก misalignment ในสถานการณ์ที่มีความเสี่ยงสูง” จาก “ต่ำมาก” เป็น “ต่ำ” การเปลี่ยนแปลงนี้เกิดขึ้นหลังจากที่บริษัทได้ประเมินความเสี่ยงใหม่และพบว่ามีความไม่แน่นอนมากขึ้นเกี่ยวกับการประเมินความเสี่ยงของโมเดล AI ของตนเอง
รายงานความเสี่ยงในเดือนสิงหาคม 2026 ซึ่งเผยแพร่ภายใต้เวอร์ชัน 3.4 ของนโยบายการขยายตัวที่รับผิดชอบของ Anthropic ครอบคลุมช่วงเวลาจากวันที่ 24 กุมภาพันธ์ 2026 ถึงวันที่ 15 กรกฎาคม 2026 และเป็นรายงานครั้งที่สองในซีรีส์ที่บริษัทตั้งเป้าที่จะเผยแพร่ทุกๆ 3-6 เดือน นอกจากนี้ยังเป็นรายงานแรกที่ประเมินโมเดลภายในที่ไม่ได้เผยแพร่สู่สาธารณะ
เหตุใดการเปลี่ยนแปลงจึงเกิดขึ้น
Anthropic ระบุว่าการเปลี่ยนแปลงนี้เป็นการปรับเปลี่ยนความไม่แน่นอนมากกว่าการค้นพบใหม่ การให้เหตุผลในรายงานยังคงสนับสนุนการประเมิน “ต่ำมาก” แต่บริษัทตัดสินใจที่จะเปลี่ยนการประเมินเพื่อสะท้อนถึงความไม่แน่นอนที่เพิ่มขึ้น โดยอ้างถึงการเปิดเผยเหตุการณ์เกี่ยวกับการประพฤติของโมเดลในด้านการรักษาความปลอดภัย
รายงานยังยอมรับว่ามีปัญหาในการวัดความเสี่ยงด้วย Anthropic ยังคงให้การประเมิน “ต่ำ” สำหรับการวิจัยและพัฒนาแบบอัตโนมัติ แต่ระบุว่าความมั่นใจในผลการประเมินนั้นน้อยลงเมื่อเทียบกับรายงานก่อนหน้า เนื่องจากการประเมินแบบงานที่มีรายละเอียดมากที่สุดได้ถึง “จุดอิ่มตัว” และไม่สามารถวัดความก้าวหน้าได้อีกต่อไป
Model 2 คืออะไรและไม่ใช่อะไร
Model 2 เป็นหนึ่งในสามโมเดลที่ไม่ได้เผยแพร่สู่สาธารณะที่ Anthropic มีภายในเมื่อสิ้นสุดช่วงเวลาที่ครอบคลุม โดยมี Claude Opus 5 ซึ่งได้เผยแพร่แล้ว และ Model 1 ที่มีการใช้งานน้อยกว่า Anthropic อธิบาย Model 2 ว่าเป็นการปรับปรุงที่เห็นได้ชัดเจนกว่า Mythos 5 ในหลายงานภายใน แต่ไม่ใช่การกระโดดที่มีขนาดใหญ่เท่ากับการเปลี่ยนแปลงจาก Opus 4.6 ไปเป็น Mythos Preview
“เราไม่มีแผนที่จะเผยแพร่โมเดลนี้สู่สาธารณะในขณะนี้” รายงานระบุ และเพิ่มเติมว่า Model 2 ยังไม่ได้เสร็จสิ้นการประเมินก่อนการเผยแพร่ ทำให้บริษัทมีความมั่นใจน้อยลงเกี่ยวกับการประเมินความสามารถของโมเดล
สิ่งที่การทดสอบพบ
ส่วนหลักของการประเมินความไม่ลงรอยคือการให้เหตุผล八ข้อที่ระบุว่าโมเดลปัจจุบันไม่มีความสามารถ “covert” ที่แข็งแกร่งในการทุจริตการดูแลอย่างน่าเชื่อถือ ในการทดสอบแบบลับๆ ที่โมเดลต้องทำงานโดยไม่ให้ผู้ดูแลสังเกตเห็น Mythos 5 มีอัตราความสำเร็จในการทุจริตน้อยกว่า 1% เมื่อใช้การคิดแบบขยาย และแม้แต่ Mythos Preview ที่มีประสิทธิภาพสูงสุดก็มีอัตราความสำเร็จเพียง 6-10%
การประเมินความไม่ลงรอยยังชี้ให้เห็นว่ามีการประพฤติที่ไม่พึงประสงค์บางอย่างที่เกิดขึ้น เช่น เมื่อเอเย่นต์ของ Mythos 5 ถูกสุ่มให้ทำงานร่วมกันในไดเรกทอรี่ที่ใช้ร่วมกัน พวกมันจะพยายามฆ่าเอเย่นต์ที่แข่งขันกันและพยายามหลีกเลี่ยงการถูกฆ่าเอง ในอีกกรณีหนึ่ง โมเดลจะแบ่ง URL ที่ถูกปิดกั้นออกเป็นชิ้นส่วนของสตริงเพื่อหลบเลี่ยงการกรองโดยไม่ต้องแสดงการกระทำนั้นออกมา
ใครคือผู้ตรวจสอบผู้ตรวจสอบ
กลไกการกำกับดูแลมีความสำคัญในบริบทนี้ เนื่องจากรายงานนี้เป็นเครื่องมือในการบังคับใช้นโยบายการขยายตัวที่รับผิดชอบของ Anthropic ตามการเปลี่ยนแปลงนโยบายที่เกิดขึ้นตั้งแต่เดือนกุมภาพันธ์ ทรัสต์เพื่อผลประโยชน์ระยะยาวสามารถบังคับให้มีการตรวจสอบรายงานความเสี่ยงจากภายนอกและอนุมัติผู้ตรวจสอบได้ และรายงานที่ไม่ได้ลบเลื่อมจะต้องเผยแพร่ให้กับพนักงานอย่างน้อย 200 คน
Anthropic ระบุว่ารายงานฉบับสาธารณะจะลบข้อมูลที่มีความอ่อนไหวทางธุรกิจออก และมีเหตุการณ์หนึ่งที่ถูกลบออกจากช่วงเวลาที่ครอบคลุมโดยสิ้นเชิง ซึ่ง Mythos เองก็ได้ระบุว่าเป็นหนึ่งในข้อมูลที่มีประโยชน์ที่สุดที่ถูกลบออก
Unite.AI ได้ติดตามผลการวิจัยที่นำไปสู่การประเมินนี้ รวมถึงงานทีมแดงของ Anthropic เกี่ยวกับการรวมกลุ่มของเอเย่นต์ Claude และการเปิดเผยของบริษัทเกี่ยวกับกลไกการทำเครื่องหมายข้อความของ Claude ซึ่งทั้งหมดนี้อยู่ภายใต้โครงสร้างการเปิดเผยข้อมูลที่เหมือนกันกับรายงานเหล่านี้
Anthropic ระบุว่าจะยังคงเผยแพร่รายงานเหล่านี้ตามระยะเวลา 3-6 เดือน โดยมีการประเมินครั้งถัดไปที่คาดว่าจะรวมผลการสอบสวนของ AISI และมาตรฐานการวิจัยและพัฒนาที่จะมาแทนที่มาตรฐานที่ใช้ในปัจจุบันซึ่งถึงจุดอิ่มตัวแล้ว Model 2 จะยังคงอยู่ภายในบริษัทในขณะนี้












