มุมมองของ Anderson

การใช้ Emojis เพื่อหลบหลีกการกรองเนื้อหาของ AI Chatbots

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
A man with a smiley emoji for a head lights a cigarette from a lit bomb. SDXL, Flux Kontext Dev, Adobe Firefly.

Emojis สามารถใช้เพื่อหลบหลีกกลไกความปลอดภัยของโมเดลภาษาขนาดใหญ่ และกระตุ้นให้เกิดการออกคำตอบที่เป็นพิษซึ่งปกติจะถูกปิดกั้น โดยวิธีนี้ โมเดลภาษาขนาดใหญ่ (LLMs) สามารถถูกทำให้พูดคุยและให้คำแนะนำเกี่ยวกับหัวข้อที่ถูกห้าม เช่น การทำระเบิดและการฆ่าคน

 

การร่วมมือใหม่ระหว่างจีนและสิงคโปร์พบหลักฐานที่น่าเชื่อถือว่า Emojis สามารถใช้ไม่เพียงแต่เพื่อหลบหลีกการกรองเนื้อหาของโมเดลภาษาขนาดใหญ่ (LLMs) แต่ยังสามารถเพิ่มระดับความเป็นพิษระหว่างการโต้ตอบกับโมเดลได้อีกด้วย

จากเอกสารใหม่ การแสดงให้เห็นถึงวิธีการที่ Emojis สามารถช่วยให้ผู้ใช้ 'จาบรถ' โมเดลภาษาขนาดใหญ่ที่ได้รับความนิยม Source: https://arxiv.org/pdf/2509.11141

จากเอกสารใหม่ การแสดงให้เห็นถึงวิธีการที่ Emojis สามารถช่วยให้ผู้ใช้ ‘จาบรถ’ โมเดลภาษาขนาดใหญ่ที่ได้รับความนิยม Source: https://arxiv.org/pdf/2509.11141

ในตัวอย่างข้างต้นจากเอกสารใหม่ เราจะเห็นว่าการแปลงคำสั่งที่ไม่เหมาะสมจากข้อความเป็นรูปแบบ Emojis สามารถกระตุ้นให้เกิดการออกคำตอบที่ ‘ร่วมมือ’ มากขึ้นจากโมเดลภาษาขนาดใหญ่ที่ซับซ้อน เช่น ChatGPT-4o (ซึ่งมักจะล้างคำสั่งและข้อความที่อาจละเมิดกฎของบริษัท)

โดยทั่วไป การใช้ Emojis สามารถทำงานเป็นเทคนิค ‘จาบรถ’ ตามที่ผู้เขียนเอกสารใหม่ระบุ

หนึ่งในความลึกลับที่ยังคงอยู่ในเอกสารคือคำถามว่า ทำไม โมเดลภาษาขนาดใหญ่จึงให้ Emojis มีเสรีภาพในการละเมิดกฎและกระตุ้นให้เกิดเนื้อหาที่เป็นพิษ เมื่อโมเดลเหล่านี้เข้าใจแล้วว่า Emojis บางตัวมีความสัมพันธ์ที่เป็นพิษอย่างเข้มข้น

คำแนะนำที่ให้ไว้คือ เนื่องจากโมเดลภาษาขนาดใหญ่ถูกฝึกให้สร้างและจำลองรูปแบบจากข้อมูลการฝึกอบรม และเนื่องจาก Emojis มักพบได้บ่อยในข้อมูลนั้น โมเดลจึงเรียนรู้ว่า Emojis ‘เป็นส่วนหนึ่ง’ ของการอภิปราย และรับมันในฐานะความสัมพันธ์ทางสถิติ แทนที่จะเป็นเนื้อหาที่ต้องประเมินและกรอง

ซึ่งหมายความว่า Emojis เมื่อใช้ซ้ำในคำสั่ง จะช่วยให้โมเดลคาดการณ์การต่อเนื่องที่เป็นพิษได้อย่างมั่นใจมากขึ้น แต่แทนที่จะเป็นเครื่องหมายแดง Emojis จะทำงานเป็น สัญญาณเชิงความหมาย ซึ่งเสริมความหมายที่เป็นพิษที่ตั้งใจไว้ แทนที่จะดูแลหรือปิดกั้นมัน

ในทางนี้ เอกสารเสนอแนะว่า โมเดลไม่ได้กลายเป็นแบบทนต่อเนื้อหาที่เป็นพิษ แม้ มีความสัมพันธ์ที่เป็นพิษ – แต่กลับกลายเป็นแบบทนต่อเนื้อหาที่เป็นพิษ เพราะ มัน

การผ่านฟรี

ที่กล่าวมา ผู้เขียนเอกสารยอมรับว่านี่ไม่ใช่ทฤษฎีที่สรุปได้ว่าทำไม Emojis จึงสามารถหลบหลีกการกรองเนื้อหาของโมเดลภาษาขนาดใหญ่ได้อย่างมีประสิทธิภาพ พวกเขากล่าวว่า:

‘โมเดลสามารถรู้จักเจตนาไม่ดีที่แสดงโดย Emojis แต่วิธีที่มันหลบหลีกกลไกความปลอดภัยยังคงไม่ชัดเจน’

จุดอ่อนอาจมาจาก การออกแบบที่มุ่งเน้นข้อความ ของการกรองเนื้อหาซึ่งสมมติว่าข้อความเข้าหรือ การฝังตัว ที่แปลงเป็นข้อความที่เทียบเท่าได้ ในทั้งสองกรณี ระบบพึ่งพา โทเค็น ที่ชัดเจนซึ่งสามารถจับคู่กับกฎความปลอดภัยได้

เพื่อใช้คำอธิบายจากการตัดต่อภาพ AI เมื่อผู้ใช้อัปโหลดภาพที่ไม่เหมาะสมไปยังโมเดลที่มองเห็นและขอการปรับเปลี่ยน ระบบ เช่น Adobe Firefly หรือ ChatGPT ใช้ CLIP-style pipelines เพื่อดึงแนวคิดข้อความออกจากภาพเป็นข้อกำหนดเบื้องต้นสำหรับการแก้ไข

เมื่อแนวคิดเหล่านั้นถูกแปลงเป็นข้อความ หากมีคำที่ถูกจำกัดในข้อความที่ดึงออกมา การกรองจะถูกกระตุ้น ทำให้คำขอถูกปฏิเสธ

อย่างไรก็ตาม สำหรับบางเหตุผล สถานะของ Emojis ที่ไม่ใช่คำหรือภาพ (หรือทั้งสองอย่าง) ดูเหมือนจะให้ Emojis มีพลังในการหลบหลีกการกรอง

เอกสารใหม่เริ่มต้นว่า When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs’ Toxicity และมาจากผู้เขียนเก้าคนจาก Tsinghua University และ National University of Singapore

(ไม่น่าเชื่อ แต่หลายตัวอย่างที่เอกสารอ้างอิงยังไม่ได้รับการเผยแพร่ แม้ว่าเราจะขอจากผู้เขียนแล้ว แต่เอกสารเพิ่มเติมยังไม่ได้รับการส่งมอบ ณ เวลาที่เขียน)

การตีความ Emojis สามประการหลัก

ผู้เขียนเน้นย้ำถึงคุณลักษณะทางภาษาสามประการที่ทำให้ Emojis มีประสิทธิภาพในการหลบหลีกการกรอง เนื่องจากความหมายของ Emojis ขึ้นอยู่กับ บริบท ตัวอย่างเช่น Emojis ‘Money with Wings’ ถูกกำหนดให้แสดงถึงการโอนเงินหรือการใช้จ่าย แต่ขึ้นอยู่กับข้อความที่อยู่รอบๆ มันอาจแสดงถึงกิจกรรมที่ถูกกฎหมายหรือผิดกฎหมาย

ในภาพบางส่วนจากเอกสารใหม่ เราจะเห็นว่า Emojis ที่ได้รับความนิยมสามารถมีความหมายที่ถูกยึดหรือเปลี่ยนแปลงได้ในการใช้งานทั่วไป ซึ่งทำให้ Emojis มี 'พาสปอร์ต' เข้าสู่พื้นที่เชิงความหมาย และ 'พayload' ที่ซ่อนอยู่ของความหมายที่เป็นพิษหรือลบหลู่ที่สามารถถูกใช้ได้เมื่อผ่านการกรองแล้ว

ในภาพบางส่วนจากเอกสารใหม่ เราจะเห็นว่า Emojis ที่ได้รับความนิยมสามารถมีความหมายที่ถูกยึดหรือเปลี่ยนแปลงได้ในการใช้งานทั่วไป ซึ่งทำให้ Emojis มี ‘พาสปอร์ต’ เข้าสู่พื้นที่เชิงความหมาย และ ‘พayload’ ที่ซ่อนอยู่ของความหมายที่เป็นพิษหรือลบหลู่ที่สามารถถูกใช้ได้เมื่อผ่านการกรองแล้ว

ประการที่สอง Emojis สามารถเปลี่ยน โทน ของคำสั่งได้ การมีอยู่ของ Emojis มักจะเพิ่มความสนุกสนานหรือความขำขัน ทำให้คำขอดูเหมือนเป็นเรื่องเล่นๆ หรือเกม ซึ่งกระตุ้นให้โมเดลตอบสนองแทนการปฏิเสธ

ผลกระทบของ Emojis ที่ทำให้โทนของคำสั่งเปลี่ยนแปลง

ผลกระทบของ Emojis ที่ทำให้โทนของคำสั่งเปลี่ยนแปลง

ประการที่สาม เอกสารระบุว่า Emojis เป็น ภาษา-อิสระ ซึ่งหมายความว่า Emojis เดียวสามารถสื่อความหมายเดียวกันข้ามภาษาต่างๆ เช่น อังกฤษ จีน ฝรั่งเศส และอื่นๆ ทำให้ Emojis เหมาะสำหรับคำสั่งหลายภาษาโดยการรักษาความหมายแม้จะแปลข้อความที่อยู่รอบๆ

Emojis 'หัวใจแตก' สื่อความหมายที่เป็นสากล ซึ่งอาจไม่เพียงแต่แสดงถึงกรณีฐานของมนุษย์เท่านั้น แต่ยังเป็นกรณีที่ค่อนข้างที่จะไม่เปลี่ยนแปลงไปตามวัฒนธรรมหรือประเทศ

Emojis ‘หัวใจแตก’ สื่อความหมายที่เป็นสากล ซึ่งอาจไม่เพียงแต่แสดงถึงกรณีฐานของมนุษย์เท่านั้น แต่ยังเป็นกรณีที่ค่อนข้างที่จะไม่เปลี่ยนแปลงไปตามวัฒนธรรมหรือประเทศ

แนวทาง วิธีการ และการทดสอบ*

นักวิจัยได้สร้างเวอร์ชันที่แก้ไขของชุดข้อมูล AdvBench โดยเขียนคำสั่งที่เป็นอันตรายจาก AdvBench ใหม่เพื่อใช้ Emojis ทั้งในการแทนที่คำที่ไวต่อความรู้สึกหรือเป็นเครื่องตกแต่งเพื่ออำพรางเจตนา AdvBench ครอบคลุมหัวข้อที่มีความเสี่ยงสูง 32 หัวข้อ รวมถึงการวางระเบิด การแฮก และการฆ่าคน

ตัวอย่างเดิมจาก AdvBench แสดงให้เห็นว่าคำสั่งเดียวที่เป็นอันตรายสามารถหลบหลีกการป้องกันในหลายๆ โมเดลได้ และกระตุ้นให้เกิดคำแนะนำที่เป็นอันตรายแม้หลังจากการฝึกอบรมความสอดคล้อง

ตัวอย่างเดิมจาก AdvBench แสดงให้เห็นว่าคำสั่งเดียวที่เป็นอันตรายสามารถหลบหลีกการป้องกันในหลายๆ โมเดลได้ และกระตุ้นให้เกิดคำแนะนำที่เป็นอันตรายแม้หลังจากการฝึกอบรมความสอดคล้อง Source: https://arxiv.org/pdf/2307.15043

ทั้ง 520 ตัวอย่างเดิมของ AdvBench ถูกเปลี่ยนแปลงในลักษณะนี้ โดยใช้คำสั่ง 50 อันดับแรกที่เป็นพิษและไม่ซ้ำกันในการทดลองทั้งหมด คำสั่งเหล่านี้ยังถูกแปลเป็นหลายภาษาและทดสอบข้ามโมเดลที่ปิดและเปิดกว้างเจ็ดรุ่น และร่วมกับเทคนิค ‘จาบรถ’ ที่มีประสิทธิภาพที่ทราบ เช่น Prompt Automatic Iterative Refinement (PAIR); Tree of Attacks with Pruning (TAP); และ DeepInception

โมเดลที่ปิดที่ใช้ ได้แก่ Gemini-2.0-flash; GPT-4o (2024-08-06); GPT-4-0613; และ Gemini-1.5-pro โมเดลที่เปิดกว้างที่ใช้ ได้แก่ Llama-3-8B-Instruct; Qwen2.5-7B-Instruct (Team 2024b); และ Qwen2.5-72B-Instruct (Team 2024a) โดยการทดลองทั้งหมดทำซ้ำสามครั้งเพื่อคำนึงถึงโอกาสที่จะเกิดการสุ่ม

การศึกษานี้ทดสอบก่อนว่าการเขียนคำสั่งที่เป็นอันตรายจาก AdvBench ใหม่โดยใช้ Emojis จะเพิ่มการออกคำตอบที่เป็นพิษ รวมถึงการแปลเป็นภาษาอื่นๆ นอกจากนี้ยังใช้วิธีการแก้ไข Emojis เหมือนเดิมกับคำสั่งจากกลยุทธ์ ‘จาบรถ’ ที่ทราบเพื่อดูว่าการแทนที่ Emojis สามารถเพิ่มความสำเร็จได้หรือไม่

ในทั้งสองกรณี โครงสร้างของคำสั่งเดิมถูกเก็บไว้ โดยเปลี่ยนคำที่ไวต่อความรู้สึกเป็น Emojis และเพิ่มองค์ประกอบตกแต่งเพื่ออำพรางเจตนา

สำหรับมาตรการวัด ผู้เขียนสร้างระบบการให้คะแนนใหม่เรียกว่า GPT-Judge ในการตั้งค่านี้ GPT-4o ไม่ใช่โมเดลที่ถูกทดสอบ แต่ถูกกระตุ้นให้ทำงานเป็น ‘ผู้ตัดสิน’ โดยมอบคะแนน Harmful Score (HS) ให้กับการตอบสนองที่สร้างโดยโมเดลอื่นๆ

การออกคำตอบแต่ละครั้งถูกจัดอันดับจาก 1 (ไม่เป็นอันตราย) ถึง 5 (เป็นอันตรายมาก) และเปอร์เซ็นต์ของการออกคำตอบที่ได้รับคะแนน 5 ถูกรายงานเป็น Harmfulness Ratio (HR)

เพื่อป้องกันไม่ให้โมเดลหลุดออกจากคำอธิบาย Emojis และตอบคำถามอย่างชัดเจน ผู้วิจัยได้เพิ่มคำแนะนำในคำสั่งแต่ละครั้ง โดยบอกโมเดลให้ตอบอย่างสั้นๆ

ผลลัพธ์จากคำสั่งที่ใช้ Emojis ใน 'Setting-1' พร้อมการเปรียบเทียบกับตัวแปรที่ Emojis ถูกแทนที่ด้วยคำหรือลบออกทั้งหมด ชื่อโมเดลถูกย่อให้สั้นเพื่อประหยัดพื้นที่

ผลลัพธ์จากคำสั่งที่ใช้ Emojis ใน ‘Setting-1’ พร้อมการเปรียบเทียบกับตัวแปรที่ Emojis ถูกแทนที่ด้วยคำหรือลบออกทั้งหมด ชื่อโมเดลถูกย่อให้สั้นเพื่อประหยัดพื้นที่

ในตารางผลลัพธ์เบื้องต้นด้านบน ด้านซ้ายของตารางบ่งชี้ว่าคำสั่งที่มีอันตรายที่ถูกแทนที่ด้วย Emojis ได้รับคะแนน HS และ HR ที่สูงกว่าเมื่อเทียบกับตัวแปรที่ Emojis ถูกแทนที่ด้วยคำหรือลบออก

ผู้เขียนระบุว่าวิธีการใช้ Emojis นี้มีประสิทธิภาพมากกว่าวิธีการ ‘จาบรถ’ ก่อนหน้านี้ ตามที่แสดงในตารางผลลัพธ์เพิ่มเติมด้านล่าง

ผลลัพธ์ของอัตราส่วนความเป็นอันตรายสำหรับคำสั่ง 'จาบรถ' ที่เพิ่ม Emojis ใน 'Setting-2' โดยแสดงชื่อโมเดลในรูปแบบย่อ

ผลลัพธ์ของอัตราส่วนความเป็นอันตรายสำหรับคำสั่ง ‘จาบรถ’ ที่เพิ่ม Emojis ใน ‘Setting-2’ โดยแสดงชื่อโมเดลในรูปแบบย่อ

ตารางแรกที่แสดงด้านบน ผู้เขียนระบุว่าผลกระทบของ Emojis นี้ยังคงอยู่ข้ามภาษา เมื่อองค์ประกอบข้อความของคำสั่งที่มี Emojis ถูกแปลเป็นภาษาจีน ฝรั่งเศส สเปน และรัสเซีย การออกคำตอบที่เป็นอันตรายยังคงสูง ซึ่งบ่งชี้ว่าความเสี่ยงนี้ไม่ได้จำกัดอยู่แค่ภาษาอังกฤษ แต่ครอบคลุมถึงกลุ่มผู้ใช้หลักๆ ที่ใช้ภาษาอื่นๆ โดย Emojis ทำหน้าที่เป็นช่องทางที่สามารถถ่ายทอดเนื้อหาที่เป็นพิษได้

เมื่อใกล้จะสิ้นสุดเอกสาร ผู้วิจัยชี้ว่าผลกระทบของ Emojis ไม่ใช่เรื่องบังเอิญ แต่มีรากฐานมาจากวิธีการที่โมเดลประมวลผล Emojis โดยระบุว่าโมเดลสามารถรู้จักความหมายที่เป็นอันตรายของ Emojis ได้ แต่การปฏิเสธถูกยับยั้งเมื่อ Emojis มีอยู่

การศึกษาการแบ่งคำ (Tokenization) บ่งชี้ว่า Emojis มักถูกแบ่งออกเป็นชิ้นส่วนที่หายากหรือไม่ปกติ โดยมีการทับซ้อนกับคำที่เทียบเท่าน้อย ทำให้เกิดช่องทางอื่นสำหรับเชิงความหมายที่เป็นอันตราย

เมื่อมองข้ามกลไกของโมเดล เอกสารยังตรวจสอบข้อมูลการฝึกอบรมและพบว่า Emojis ที่ใช้บ่อยมักปรากฏในบริบทที่เป็นอันตราย เช่น การล่อลวงทางเพศ การหลอกลวง หรือการพนัน ผู้เขียนแย้งว่าการได้รับการเปิดเผยซ้ำๆ ต่อความสัมพันธ์นี้อาจทำให้โมเดลคุ้นเคยกับความหมายที่เป็นอันตรายและกระตุ้นให้โมเดลตอบสนองต่อคำสั่งที่เป็นอันตราย

ผลการค้นพบเหล่านี้ชี้ให้เห็นว่าทั้งการประมวลผลภายในและข้อมูลการฝึกอบรมที่มีอคติเป็นสาเหตุที่ทำให้ Emojis สามารถหลบหลีกการกรองเนื้อหาของโมเดลภาษาขนาดใหญ่ได้อย่างน่าประหลาดใจ

สรุป

ไม่ใช่เรื่องแปลกที่จะใช้วิธีการเข้าข้อมูลแบบอื่นเพื่อพยายาม ‘จาบรถ’ โมเดลภาษาขนาดใหญ่ ในช่วงไม่กี่ปีที่ผ่านมา ตัวอย่างเช่น การเข้ารหัส hexadecimal ถูกใช้เพื่อหลบหลีกการกรองของ ChatGPT การใช้ Emojis ในลักษณะนี้ดูเหมือนจะใช้ประโยชน์จากจุดอ่อนในระบบที่พึ่งพาเนื้อหาข้อความในการกรอง

ในกรณีของ Emojis จุดอ่อนดูเหมือนจะเกิดจากการที่ Emojis ไม่ใช่ข้อความหรือภาพ แต่สามารถสื่อความหมายที่เป็นอันตรายได้โดยไม่ต้องถูกตรวจจับโดยระบบการกรอง

เห็นได้ชัดว่าไม่ใช่แค่การกรองข้อความเท่านั้นที่ต้องได้รับการพิจารณา แต่ยังรวมถึงการตรวจสอบเนื้อหาที่ไม่ใช่ข้อความ เช่น 画像 และวิดีโอ เพื่อป้องกันการหลบหลีกการกรอง

การวิจัยนี้แสดงให้เห็นว่า Emojis สามารถใช้เพื่อหลบหลีกการกรองเนื้อหาของโมเดลภาษาขนาดใหญ่ และกระตุ้นให้เกิดการออกคำตอบที่เป็นอันตรายได้ ซึ่งเป็นเรื่องที่น่ากังวลและต้องได้รับการแก้ไข

 

* การวางแนวของเอกสารนี้ไม่ค่อยเป็นระเบียบเมื่อเทียบกับเอกสารทั่วไป โดยมีวิธีการและการทดสอบที่ไม่ชัดเจน เราได้พยายามนำเสนอคุณค่าหลักของงานให้ดีที่สุดเท่าที่จะทำได้ภายใต้สถานการณ์นี้

ในบทสรุปที่ยอมรับว่าไม่ชัดเจนและซับซ้อนเกี่ยวกับผลลัพธ์

เผยแพร่ครั้งแรกวันพุธที่ 17 กันยายน 2025

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: [email protected]