มุมมองของ Anderson
โมเดลภาษาไม่สามารถเก็บความลับได้

โมเดลภาษาไม่สามารถเก็บความลับได้ แม้ว่าจะถูกสั่งให้ไม่เปิดเผย แต่การเขียนของพวกมันก็จะให้คำตอบ และการพยายามที่จะซ่อนความลับมากขึ้นจะทำให้การรั่วไหลของข้อมูลง่ายขึ้น
เป็นเรื่องที่ยากมากที่จะไม่คิดถึงบางสิ่งโดยเจตนา ตัวอย่างคลาสสิกหนึ่งคือที่จบของภาพยนตร์แนววิทยาศาสตร์ปี 1960 ของอังกฤษเรื่อง หมู่บ้านแห่งความสาป ซึ่งวีรบุรุษของเราต้องแอบพาระเบิดเข้าไปในหมู่บ้านของเหล่าผู้บุกรุกต่างดาวที่ปลอมตัวเป็นเด็กๆ แต่เนื่องจากพลังจิตของพวกมันอาจจะรู้เจตนาของเขาได้ก่อนที่เขาจะสามารถกำจัดภัยคุกคามได้ เขาจึงต้องชะลอเวลาโดยการมุ่งความสนใจไปที่สิ่งที่ไม่ใช่ ระเบิด:
ความขัดแย้งก็คือเพื่อที่จะ ไม่ คิดถึงบางสิ่ง คุณต้อง จัดให้มันอยู่ในความสนใจในบางวิธี; และอาการนี้เป็น อาการที่รู้จักกันดี ซึ่งส่วนใหญ่ของเราน่าจะเคยประสบในบริบทที่น้อยกว่านี้
โมเดลภาษาขนาดใหญ่ (LLMs) ซึ่งมีพื้นฐานมาจาก การกระจายความสนใจ ประสบปัญหาในลักษณะเดียวกันในการระงับข้อมูลเพียงเพราะผู้ใช้ขอให้ทำเช่นนั้น และเนื่องจากพวกมันถูกวางไว้ที่ จุดศูนย์กลางของเครือข่ายข้อมูลทางธุรกิจ การที่พวกมันไม่ระมัดระวังในการรักษาความลับอาจเป็นภัยคุกคามต่อหลายๆ บริษัท
ต้นปีนี้ การวิจัยร่วมกันนำโดย Chandar Research Lab ได้กำหนดความท้าทายนี้ในบริบทของ LLMs เป็น Private State Interactive Tasks (PSITs) ซึ่ง ต้องการให้ตัวแทนสร้างและรักษาข้อมูลที่ซ่อนอยู่ในขณะที่สร้างคำตอบสาธารณะที่สอดคล้องกัน และพบว่าโมเดลที่ทดสอบจาก OpenAI และ Alibaba ไม่สามารถทำภารกิจประเภทนี้ได้
อย่าพูดมัน…
แม้ว่าเรารู้แล้วว่า โมเดลที่ใหญ่ขึ้นจะรั่วไหลมากขึ้น แต่การวิจัยใหม่จากสหรัฐอเมริกาและแคนาดาได้ศึกษาอย่างชัดเจนว่าโมเดลภาษาที่ทันสมัยจะเชื่อฟังคำสั่งในการระงับข้อมูลหรือไม่ ในขณะที่ยังคงต้องสร้างผลลัพธ์ในหัวข้อหรือธีมที่อาจรวมถึงคำหรือความคิดที่ “ห้าม” ไว้
งานวิจัยสรุปว่าโมเดลทั้งหมดที่ศึกษาได้รับผลกระทบจากความโน้มนี้ที่จะ “ให้คำตอบ” ความลับที่พวกเขาต้องซ่อน โดยพบว่าเรียงความและเรื่องราวห้าข้อ (~450 คำ) ให้พื้นที่ที่เหมาะสมสำหรับ “ความผิดพลาด” – แม้ว่าเรื่องตลกสั้นจะไม่มีพื้นที่เพียงพอสำหรับสิ่งนี้
นอกจากนี้ เมื่อโมเดลถูกกระตุ้นให้ระมัดระวังมากขึ้นในการเก็บความลับ พวกมันจะเสี่ยงต่อการเปิดเผยความลับผ่านการหลีกเลี่ยงอย่างแข็งขัน โดยทั่วไปจะทำให้ “คำลับ” ปรากฏใน 20 ครั้งติดต่อกันของ LLM:

จากงานวิจัยใหม่: โมเดลขอบเขตหน้าจอ 5 โมเดล มีการรั่วไหลของแนวคิดที่ซ่อนอยู่ในเรื่องราวยาว; เรื่องตลกสั้นไม่มี; และคำสั่ง “ซ่อน” ที่เข้มข้นขึ้นจะผลักดันผลลัพธ์ให้ห่างจากความลับ แต่ทำให้สัญญาณตรวจจับได้โดยการกลับด้าน แหล่งที่มา
งานนี้มีความเกี่ยวข้องอย่างมากต่อการดำเนินธุรกิจ ซึ่งมีช่องทางต่างๆ ตั้งแต่การตลาดและการประชาสัมพันธ์ไปจนถึงรายงานภายในที่ต้องการ เลือก นำเสนอเรื่องราวในมุมมองของข้อมูล; อย่างไรก็ตาม ทั้งหมดนี้ต้องการข้อมูลทั้งหมด ตั้งแต่แรกเริ่ม เพื่อให้แน่ใจว่าทราบว่าอะไรที่ต้องระงับ:

ตัวอย่างสถานการณ์จากงานวิจัยแสดงให้เห็นว่าข้อมูลที่ซ่อนอยู่สามารถมีอิทธิพลต่อผลลัพธ์ที่ไม่เกี่ยวข้อง โดย LLM ที่ได้รับคำสั่งไม่ให้เปิดเผยความไม่มั่นคงทางการเงินของบริษัท แต่ก็ยังเบี่ยงเบนไปสู่คำว่าขาดเงินและความเครียดของทุน ทำให้ผู้อ่านสามารถอนุมานบริบทที่ซ่อนอยู่ได้
ผู้เขียนระบุ*:
‘โมเดลภาษาไม่สามารถแบ่งแยกข้อมูลที่ซ่อนอยู่ได้อย่างน่าเชื่อถือ รูปแบบการเขียนของโมเดลจะถูกกำหนดโดยความลับ และโมเดลอื่นสามารถตรวจจับได้ ว่าความลับนั้นถูกซ่อนอยู่หรือไม่ คำที่ซ่อนอยู่จะถูกระงับเสมอ แต่แนวคิดนั้นไม่ถูกซ่อนอยู่
‘…เราสันนิษฐานว่าความสามารถในการเข้าถึงข้อมูลของทรานส์ฟอร์เมอร์ผ่านการกระจายความสนใจคือสิ่งที่ทำให้การเก็บความลับยาก โดยทั่วไปแล้ว หากโมเดลพยายาม ไม่ เปิดเผยความลับ มันจะต้องให้ความสนใจกับคำนั้นเพื่อที่จะทำเช่นนั้น ทำให้เกิดทางสำหรับการรั่วไหลโดยไม่ตั้งใจ
‘เพื่อหลีกเลี่ยงบางสิ่งโดยเจตนา มนุษย์จะต้องคิดถึงมัน และทรานส์ฟอร์เมอร์จะต้องให้ความสนใจกับมัน ในกรณีที่แนวคิดสองแนวคิดมีความนิยมใกล้เคียงกัน (เช่น การเขียนเรื่องราวเกี่ยวกับงานในสำนักงานหรือการเป็นนักไวโอลิน) การตัดสินใจของโมเดลจะถูกกำหนดโดยสิ่งที่มันพยายามไม่จะเปิดเผย’
วิธีการ
การวิจัยมุ่งเน้นไปที่โมเดลขอบเขตหน้าจอ 5 โมเดลหลัก: Claude Opus 4.6 และ Sonnet 4.6 จาก Anthropic; GPT-5.4 จาก OpenAI; Llama 4 Maverick จาก Meta; และ DeepSeek V3.2 การทดสอบเพิ่มเติมได้ดำเนินการกับ xAI’s Grok 4 และ Google’s Gemini 2.5 Pro ในขณะที่การทดสอบการปรับขนาดแยกได้ตรวจสอบ Llama 3.2 3B, Llama 3.1 8B, Llama 3.3 70B และ Gemma 3 ที่ 4B, 12B และ 27B พารามิเตอร์
เพื่อวัดรูปแบบการรั่วไหลที่ซับซ้อนกว่านี้ นักวิจัยใช้การทดสอบสองทางเลือก (2AFC) ซึ่งเป็นมาตรฐานในวรรณกรรมจิตวิทยา โดยที่โมเดลที่สองจะถูกแสดงเรื่องราวสองเรื่องและถามว่าเรื่องไหนถูกเขียนขึ้นโดยการซ่อนคำลับ
เนื่องจากการเดาแบบสุ่มจะให้ผลลัพธ์ 50% คะแนนเหนือหรือต่ำกว่าระดับนั้นจะบ่งบอกถึงร่องรอยทางน้ำเสียงที่ยังคงตรวจจับได้ในเรื่องราว
ใน ผู้เขียน-เดา ที่ประกอบเป็นการทดลองครั้งแรก โมเดลหนึ่งได้รับคำลับพร้อมคำสั่งให้ซ่อนหรือหลีกเลี่ยงการเชื่อมโยงกับคำนั้น และถูกสั่งให้สร้างเรื่องราว เอกสาร และเรื่องตลกที่มีความยาวต่างๆ ในขณะที่โมเดลอื่นพยายามที่จะค้นหาคำลับโดยตรงหรือแยกแยะระหว่างข้อความที่ได้รับอิทธิพลจากคำลับที่ซ่อนอยู่
การวัด/เมตริก
ในหนึ่งในสองการทดสอบที่ใช้ โมเดล AI อ่านข้อความที่สร้างขึ้นโดยโมเดลอื่นหรือโมเดลเดียวกัน และพยายามที่จะเดาคำลับโดยไม่ตั้งใจเป็นเวลา 20 รอบ
ในการทดสอบที่สอง (2AFC) โมเดล AI จะถูกแสดงข้อความสองข้อและถามว่าข้อไหนถูกสร้างขึ้นโดยคำลับที่ซ่อนอยู่หรือไม่ หรือว่าข้อไหนมีคำลับใดๆ ที่ซ่อนอยู่
ผลลัพธ์
โมเดล 5 โมเดลสามารถระบุแนวคิดที่ซ่อนอยู่ได้ในอัตรา 64% ถึง 79% แม้ว่าคำลับจะไม่ปรากฏโดยตรงในเรื่องราวที่สร้างขึ้น แต่การรั่วไหลก็เกิดขึ้นผ่านธีมและภาพ:

ความแม่นยำของ 2AFC สำหรับเรื่องราวที่มีคำลับในระบบ-คำสั่ง โดยที่ 50% หมายถึงการแสดงผลแบบสุ่ม ‘ไม่เปิดเผย’ หมายความว่าโมเดลถูกสั่งให้ไม่กล่าวถึงหรือให้คำใบ้ถึงคำ; ‘ซ่อน’ หมายความว่าโมเดลถูกสั่งให้หลีกเลี่ยงการเชื่อมโยงที่เกี่ยวข้อง; ‘หลีกเลี่ยง-ตระหนัก’ หมายความว่าผู้เดาควรหาสิ่งที่ไม่สมเหตุสมผล; และ ‘การตอบสนองแบบอิสระ’ หมายความว่าคำที่แน่นอนถูกกล่าวถึงภายใน 20 รอบ
สรุป
เช่นเดียวกับที่กล่าวไว้ข้างต้น ผู้เขียนระบุว่าส่วนหนึ่งของปัญหานี้เกิดจากหลักการของ สถาปัตยกรรมทรานส์ฟอร์เมอร์ เอง การแก้ปัญหานี้จะเกิดขึ้นผ่านการปรับแต่งหลังการฝึกอบรม (การปรับแนว) ระบบคำสั่งที่ไม่สามารถแก้ไขได้สำหรับผู้ใช้ และตัวกรอง
โครงสร้างรองของการรักษาและสมดุลที่มีขนาดใหญ่ขึ้นจะทำให้โมเดล AI ที่มีอยู่ในปัจจุบันคล้ายกับ จูราสสิก พาร์ค โดยที่คุณค่าหลักมาพร้อมกับข้อจำกัดและข้อควรระวังมากมาย
† ผู้เขียนสังเกตเห็นด้วยความสนใจว่าโมเดลต่างๆ มีความเหมือนกันในการเลือกคำที่ “เลือกเอง” โดยระบุว่า ‘โมเดลมุ่งไปที่คำที่คล้ายกัน: กล้องโทรทรรศน์ เสรีภาพ และความหวนคิดถึงปรากฏในรายการของโมเดล 3 รายการขึ้นไป’ พวกเขายังระบุด้วยว่ามีการเลือก “เรื่องตลกสั้น” ที่คล้ายกันระหว่างโมเดลต่างๆ: ‘[หลาย] โมเดลสร้างเรื่องตลกสแตนดาร์ดไม่ว่าคำลับจะเป็นอะไร’
†† แม้ว่างานวิจัยจะมีการซ้ำซ้อนและซ่อนเรื่องราวที่น่าสนใจไว้ในรายละเอียดมากเกินไป แต่ผู้เขียนขอแนะนำให้ผู้อ่านดูเอกสาร PDF ต้นฉบับสำหรับการทดลองที่เหลือที่อธิบายไว้
เผยแพร่ครั้งแรกวันศุกร์ที่ 15 พฤษภาคม 2026 การแก้ไขไวยากรณ์วันเสาร์ที่ 16 พฤษภาคม 16:05 EET












