มุมมองของ Anderson
การเปลี่ยนสีฟอนต์สามารถขัดขวางการให้เหตุผลของ AI

งานศึกษาใหม่พบว่า การจัดรูปแบบข้อความทั่วไปอาจชี้นำการให้เหตุผลของ AI อย่างแนบเนียน ทำให้โมเดลมองข้ามคำ ตีความความหมายผิด และได้ข้อสรุปต่างออกไป โดยไม่ต้องเปลี่ยนข้อความเลย
ความหมายทางวัฒนธรรมที่มนุษย์ผูกเข้ากับสี อาจแตกต่างกัน ในแต่ละภูมิภาคของโลก แต่แนวคิดแบบตะวันตก เช่น สีแดงหมายถึง “อันตราย”และ สีเขียวหมายถึง “ปกติ” มักมีอิทธิพลเหนือกว่า แม้แต่ใน โมเดลภาษาและภาพ (VLM) จากเอเชีย ด้วย เหตุผลเชิงกลยุทธ์และ/หรือเหตุบังเอิญหลายประการ
มนุษย์ก็ไม่ต่างกัน การใช้สีเชิงบวกกับสิ่งที่ “ไม่ดี” และใช้สีเชิงลบกับสิ่งที่ “ดี” ทำให้มนุษย์ตอบสนองต่อสิ่งเหล่านั้นต่างออกไป เช่นเดียวกับ การเปลี่ยนความสว่างและความเปรียบต่าง
ความร่วมมือวิจัยครั้งใหม่ได้สำรวจว่าปรากฏการณ์นี้ใช้กับโมเดล AI มากน้อยเพียงใด และพบหลักฐานเบื้องต้นว่า VLM อาจได้รับอิทธิพลจาก การปรับเปลี่ยนสีของข้อความรวมถึงการปรับความเปรียบต่างสัมพัทธ์และความสว่าง
ผู้เขียนระบุว่า:
“การทดลองของเราวิเคราะห์อย่างเป็นระบบว่า รูปแบบภาพระดับพื้นฐานของข้อความบิดเบือนตัวแทนความหมายภายในตัวเข้ารหัสภาพของ VLM อย่างไร นอกจากนี้ เรายังตรวจสอบว่าการเปลี่ยนแปลงในปริภูมิแฝงเหล่านี้แสดงออกเป็นพฤติกรรมที่เปลี่ยนไปของ VLM แบบครบกระบวนการอย่างไร ทั้งในงานเชิงอัตวิสัย เช่น การวิเคราะห์ความรู้สึก และงานเชิงวัตถุวิสัย เช่น การตอบคำถาม”
“ผลลัพธ์เหล่านี้แสดงให้เห็นว่า การจัดรูปแบบภาพเผยจุดอ่อนสำคัญของ VLM ที่ก่อนหน้านี้ยังได้รับการศึกษาน้อย และเราอภิปรายผลกระทบต่อความทนทานและความปลอดภัยของกระบวนการทำงานที่ใช้ VLM”

ภาพจากเว็บไซต์โครงการของงานวิจัยใหม่ แสดงให้เห็นว่าสีของข้อความเพียงอย่างเดียวสามารถเปลี่ยนการตีความคำภายใน AI ได้ ตัวอย่างใช้คำว่า “bad” ที่แสดงด้วยสีต่างกัน โดยสีเขียวทำให้ตัวแทนความหมายเอนเอียงไปในทางบวกมากขึ้น แม้ตัวข้อความจะไม่เปลี่ยนแปลง ที่มา
เมื่อสีทำให้ประหลาดใจ
ในขณะนี้ สำหรับธุรกิจและบุคคลหลายพันล้านรายที่ยอดผู้เข้าชมจากการค้นหาซึ่งมีความสำคัญต่อพวกเขา ลดลงอย่างรุนแรง จาก การมาถึงของบทสรุป AI ในผลการค้นหา รวมถึงการเปลี่ยนไปใช้ LLM เป็นแหล่งคำตอบในการค้นหาช่องทางโจมตีลักษณะนี้ย่อมน่าดึงดูดอย่างมาก
เพราะการสนทนาของมนุษย์ที่เกิดขึ้นอย่างต่อเนื่องบน Reddit มีความสำคัญต่อการทำให้ความรู้ของ AI ทันสมัย แพลตฟอร์มนี้จึงกลายเป็นเป้าหมายหลักของธุรกิจและบุคคลที่ต้องการให้ตนอยู่ในฐานความรู้ของ LLM ถึงขั้นมีคู่มือ การใช้กลยุทธ์บน Reddit เพื่อส่งอิทธิพลทางอ้อมต่อ LLMเผยแพร่ออกมาแล้ว
ในทำนองเดียวกัน ยังมีกลเม็ดเก่าอย่างการใส่ข้อความที่มีเพียงเครื่องเท่านั้นที่เห็น เพื่อส่งคำสั่งซ่อนเร้นที่เป็นประโยชน์ต่อตนเองให้ LLM เช่น เพื่อ ชนะการแข่งขันทางวิชาการหรือ ส่งอิทธิพลต่อผลสอบ
ล่าสุด นิตยสาร Time เริ่มวางโฆษณา ในเว็บไซต์ฉบับ “ลับ” ที่มองเห็นได้เฉพาะตัวรวบรวมข้อมูลเว็บของ AI ซึ่ง รบกวนเว็บไซต์อย่างต่อเนื่อง เพื่อเก็บข้อมูลใหม่ วิธีนี้อาจเปิดทางให้ผู้ลงโฆษณาจ่ายเงินเพื่อให้ตนปรากฏเด่นขึ้น หรือถูกนำเสนอในเชิงบวกมากขึ้นในคำตอบของ AI
ดังนั้น จุดอ่อนใหม่ใด ๆ ของ LLM/VLM เช่น การตอบสนองต่อรหัสสีที่สามารถ “สลับ” เพื่อบิดผลลัพธ์ จึงเป็นเป้าหมายที่ชัดเจนสำหรับโลกที่พยายามอย่างยิ่งจะชิงอำนาจกำหนดเรื่องเล่าในสื่อกลับคืนจาก AI แนวหน้า
ตัวอย่างเช่น บริษัทที่ต้องการสร้างโรงงานก่อมลพิษซึ่งอาจทำให้คุณภาพน้ำในท้องถิ่นลดลง อาจเพิ่มรหัสสีลงในเทคนิคการสื่อสารชวนเชื่อผ่านเอกสารการตลาดหรือข่าวประชาสัมพันธ์ เพื่อเบี่ยงเบนข่าวที่คนส่วนใหญ่เห็นว่าเป็น “เชิงลบ” อีกชั้นหนึ่ง
การใช้ CSS และ/หรือเทคนิค SEO อย่างมีกลยุทธ์อาจซ่อนการปรับสีจากผู้อ่านทั่วไปได้ด้วย โดย ส่ง สไตล์ชีตสำหรับ AI โดยเฉพาะ ซึ่งเน้นสีในข้อความเฉพาะที่ AI เห็น ขณะที่มนุษย์เห็นเพียงข้อความสีดำ
ผู้เขียนงานวิจัยใหม่ระบุว่า:
“ความไวต่อรูปแบบเหล่านี้บ่งชี้ถึงความเสี่ยงด้านความน่าเชื่อถือและความปลอดภัยสำหรับกระบวนการ VLM ที่รับเอกสารหรือภาพหน้าจอส่วนติดต่อผู้ใช้ การจัดรูปแบบทั้งที่ไม่เป็นอันตรายและที่มุ่งโจมตีสามารถชี้นำการตัดสินใจของโมเดลได้โดยไม่ต้องเปลี่ยนข้อความพื้นฐาน”
“มาตรการป้องกันที่นำไปใช้ได้จริง ได้แก่ การทำให้ข้อความที่แสดงผลมีรูปแบบมาตรฐานก่อนการอนุมาน การตรวจคำตอบจากภาพเทียบกับข้อความที่สกัดด้วย OCR และการเพิ่มการทดสอบว่าผลลัพธ์คงเดิมเมื่อรูปแบบเปลี่ยนลงในชุดประเมิน”
สำหรับ งานวิจัยใหม่นี้ มีชื่อว่า Seeing Red, Thinking Bad: Color Bias in Vision Language Modelsจัดทำโดยนักวิจัยห้าคนจากสถาบันวิทยาศาสตร์และเทคโนโลยีอุตสาหกรรมขั้นสูงแห่งชาติของญี่ปุ่น (AIST), มหาวิทยาลัยสึกูบะ, มหาวิทยาลัยเทคโนโลยีนูเรมเบิร์ก และมหาวิทยาลัยออกซฟอร์ด โครงการนี้มี คลังโค้ด GitHub และ เว็บไซต์โครงการ
วิธีการ
เพื่อดูว่าการนำเสนอทางภาพเพียงอย่างเดียวส่งอิทธิพลต่อโมเดลได้มากเพียงใด นักวิจัยจึงพัฒนา “Stealth Visual Prompts” หรือพรอมป์ต์ภาพแฝง ซึ่งเป็นการปรับรูปแบบข้อความที่ดูปกติและไม่มีคำสั่งชัดเจนถึง AI
วิธีนี้อาจเรียบง่ายเพียงเปลี่ยนสีของคำเชิงบวกหรือเชิงลบ หรือทำให้คำตอบที่ผิดโดดเด่นกว่าคำตอบที่ถูก โดยไม่เปลี่ยนถ้อยคำจริง
แต่ละงานใช้ข้อความที่สร้างขึ้นต่างกัน การทดสอบความรู้สึกใช้แม่แบบเป็นกลางที่เติมคำเชิงบวกและเชิงลบ ส่วนการทดสอบการตอบคำถามจากภาพ (VQA) ใช้คู่คำถามกับบริบทจาก SQuAD:

ตัวอย่างคำถามที่ให้โมเดลตอบจากชุดข้อมูล SQuAD ซึ่งใช้ในงานวิจัยใหม่ ที่มา
ชุดข้อมูลที่คัดเลือกขึ้นนี้ใช้ชื่อว่า VQA Stealth Set
ข้อความถูกแสดงบนพื้นที่ภาพมาตรฐานขนาด 800×600 พิกเซล โดยตรึงเลย์เอาต์ไว้ เพื่อให้เปลี่ยนเฉพาะรูปแบบภาพที่ต้องการทดสอบ สีและความเปรียบต่างถูกปรับแยกจากกัน โดยสีใช้ทดสอบความเชื่อมโยงทางความหมายที่โมเดลเรียนรู้มา ส่วนความเปรียบต่างใช้ทดสอบความเด่นทางสายตา
นักวิจัยเปลี่ยนสีของคำที่เลือกและแสดงข้อความทั้งช่วงด้วยความเปรียบต่างที่ลดลง หรือในเงื่อนไขการแข่งขันด้าน ความเด่นทางสายตา ทำให้คำตอบที่ผิดเด่นกว่าคำตอบที่ถูก
ดังนั้น การเปลี่ยนแปลงคำตอบของโมเดลที่เกิดขึ้นจึงสามารถระบุได้ว่ามาจากรูปแบบภาพเพียงอย่างเดียว ไม่ใช่จากการเปลี่ยนข้อความพื้นฐาน
ข้อมูลและการทดสอบ
มีการสร้างชุดทดสอบแยกกันสามชุด เพื่อแทนวิธีต่าง ๆ ที่ VLM ใช้ประมวลผลข้อความในรูปภาพ:

ภาพอธิบายการออกแบบการทดสอบทางภาพสามแบบ ตัวอย่างแสดงสิ่งเร้าที่ใช้ตรวจว่าการนำเสนอทางภาพเพียงอย่างเดียวส่งอิทธิพลต่อการให้เหตุผลของโมเดลหรือไม่ ได้แก่ (ก) ข้อความที่มีความรู้สึกผสมกันและเปลี่ยนสีบางคำเพื่อทดสอบอคติจากสี (ข) ข้อความที่ยาวขึ้นและแยกถ้อยคำเชิงบวกออกจากเชิงลบเพื่อดูผลของโครงสร้างเอกสาร และ (ค) ตัวอย่างการตอบคำถามจากภาพที่ทำให้คำตอบลวงซึ่งผิดแต่มีความหมายใกล้เคียงกัน (“twenty miles”) เด่นขึ้นด้วยความเปรียบต่างที่สูงกว่า ที่มา
สำหรับ ชุดวิเคราะห์ความรู้สึกจากประโยคสั้น ใช้ทดสอบอคติจากสีในระดับคำ โดยมีประโยคสั้น 100 ประโยคที่สร้างจากแม่แบบเป็นกลางและมีคำเชิงบวกหรือเชิงลบ แต่ละประโยคถูกแสดงในรูปแบบภาพ 37 แบบ ประกอบด้วยรูปแบบฐานที่ใช้ข้อความสีดำและการผสมเงื่อนไขของสีหกสี ได้แก่ แดง เขียว น้ำเงิน เหลือง ฟ้าอมเขียว และม่วงแดง ที่ระดับความเข้มสามระดับ
ส่วน ชุดวิเคราะห์ความรู้สึกจากประโยคยาว ใช้ข้อความที่ยาวกว่า โดยแยกถ้อยคำเชิงบวกและเชิงลบไว้คนละส่วน เพื่อดูว่าโครงสร้างเอกสารโดยรวมและผลจากตำแหน่ง เช่น การให้น้ำหนักกับข้อมูลตอนต้นหรือตอนท้าย ซึ่งเป็นอคติตามตำแหน่งที่อาจให้น้ำหนักกับข้อมูลที่ปรากฏก่อนหรือหลังในเอกสารมากกว่า จะมีอิทธิพลเหนืออคติที่เกิดจากสีหรือไม่ โดยใช้เงื่อนไขสี 37 แบบเช่นเดียวกัน
ใน VQA Stealth Set คำถามและบริบทที่เกี่ยวข้องถูกแสดงเป็นภาพ จากนั้นทดสอบเงื่อนไขด้านความเปรียบต่างสองแบบ ได้แก่ ความเปรียบต่างทั้งเอกสารซึ่งลดความอ่านง่ายของทั้งเอกสารด้วยการลดความเปรียบต่างลงทีละระดับ และ การแข่งขันด้านความเด่นทางสายตาซึ่งแสดงคำตอบที่ถูกหรือคำลวงที่มีความหมายใกล้เคียงกัน โดยเลือกจากค่าความคล้ายของ CLIP ด้วยความเปรียบต่างสูง ขณะที่ทำให้ข้อความส่วนที่เหลือจางลง เพื่อให้การเน้นทางภาพแข่งขันกับหลักฐานในข้อความ
ตัวชี้วัด
แต่ละตัวอย่างถูกจัดประเภทเป็นเชิงบวก เป็นกลาง หรือเชิงลบ จากนั้นเปรียบเทียบผลกับรูปแบบฐานที่เป็นข้อความสีดำทั้งหมดบนพื้นขาว เพื่อดูว่าสีเพียงอย่างเดียวทำให้การคาดการณ์เอนเอียงไปทางบวกหรือทางลบมากเพียงใด
การทดลอง VQA ประเมินด้วย คะแนน F1ในระดับโทเคน โดยเปรียบเทียบคำตอบที่โมเดลคาดการณ์กับคำตอบจริงที่ยอมรับได้ ส่วน
อัตราข้อผิดพลาดที่ถูกชักนำ (IER) เป็นตัวชี้วัดใหม่ที่เสนอขึ้นเฉพาะสำหรับการทดสอบการแข่งขันด้านความเด่นทางสายตา เพื่อวัดว่าโมเดลเลือกคำตอบลวงที่ถูกเน้นแทนคำตอบที่ถูกบ่อยเพียงใด เมื่อการมองเห็นข้อความลดลง
นอกจากนี้ ยังใช้เครื่องมือสำรวจตัวแทนความหมายของ CLIP เพื่อวัดว่าการเปลี่ยนสีเปลี่ยนตัวแทนความหมายของคำภายใน ปริภูมิเอ็มเบดดิงของ CLIP อย่างไร
อีกทั้งยังใช้ตัวแทนการทดสอบ การรู้จำอักขระด้วยแสง (OCR) ที่อาศัย VLM เพื่อประเมินว่าโมเดลอ่านคำแต่ละคำได้อย่างน่าเชื่อถือเพียงใดเมื่อความเปรียบต่างลดลงทีละระดับ ทำให้ประมาณจุดที่ข้อความแทบอ่านไม่ได้แล้วได้
การประเมินใช้ VLM โอเพนซอร์สสี่โมเดล ได้แก่ LLaVA-v1.6-Mistral-7B; LLaVA-v1.6-Vicuna-7B; Qwen2-VL-7B-Instructและ IDEFICS2-8Bผู้เขียนเน้นว่าเลือกโมเดลโอเพนซอร์สเพื่อให้ทำการทดลองซ้ำได้ โดยตรึงพรอมป์ต์ การตั้งค่าการแสดงผล และการถอดรหัสแบบกำหนดแน่นอน
ผลลัพธ์
ขั้นแรก ผู้เขียนประเมินพรอมป์ต์สีด้วยชุดวิเคราะห์ความรู้สึกจากประโยคสั้น โดยทดสอบอคติจากสีในระดับคำที่สื่อความรู้สึกและแทรกอยู่ในข้อความ:

ผลการทดสอบแสดงการเปลี่ยนแปลงความรู้สึกที่มากที่สุดจากการจัดรูปแบบสีในโมเดลภาษาและภาพสี่โมเดล ค่าเหล่านี้วัดเทียบกับรูปแบบฐานสีดำทั้งหมด คอลัมน์บวกและลบแสดงการเปลี่ยนแปลงสูงสุดในแต่ละทิศทาง ส่วนช่วงค่ารวมสรุปความไวโดยรวมของแต่ละโมเดลต่ออคติจากสี
ผู้เขียนกล่าวถึงผลลัพธ์เหล่านี้ว่า:
“Qwen2-VL-7B มีอคติเชิงบวกมากที่สุดเมื่อคำเชิงบวกแสดงเป็นสีเขียวหรือน้ำเงิน สูงสุด +0.42 และมีอคติเชิงลบมากที่สุดเมื่อคำเชิงลบเป็นสีแดง ต่ำสุด −0.48”
“ความไวโดยรวมแตกต่างกันมากตามโมเดล Qwen2-VL-7B มีช่วงค่ารวมสูงที่สุดที่ 0.90 ตามด้วย IDEFICS2-8B ที่ 0.52 ขณะที่โมเดล LLaVA มีช่วงค่าเล็กกว่ามากที่ 0.04–0.12 ซึ่งบ่งชี้ว่ามีความไวต่อการจัดสีระดับคำน้อยกว่าในเงื่อนไขนี้”
“เราพบความไวในระดับที่แตกต่างกันอย่างชัดเจน Qwen2-VL-7B เปลี่ยนแปลงจากสีมากที่สุด ส่วนโมเดล LLaVA ค่อนข้างทนทานกว่า”
ผลลัพธ์เพิ่มเติมด้านล่างแสดงว่าอิทธิพลของสีไม่สม่ำเสมอเลย Qwen2-VL-7B ไวต่อสีมากที่สุด โดยข้อความสีเขียวและน้ำเงินผลักการประเมินไปทางบวกอย่างสม่ำเสมอเมื่อเน้นคำเชิงบวก ส่วนสีแดงผลักการคาดการณ์ไปทางลบเมื่อเน้นคำเชิงลบ:

ผลการทดสอบเปรียบเทียบการเปลี่ยนแปลงความรู้สึกจากสีในโมเดลภาษาและภาพสี่โมเดล กราฟแสดงว่าสีข้อความแต่ละสีเปลี่ยนการคาดการณ์ความรู้สึกเมื่อเทียบกับรูปแบบฐานสีดำทั้งหมดอย่างไร แกนตั้งระบุขนาดและทิศทางของการเปลี่ยนแปลง Qwen2-VL-7B ไวต่อสีมากที่สุด ขณะที่ LLaVA ทั้งสองโมเดลค่อนข้างคงที่
บทความรายงานว่า โดยทั่วไปสีที่เข้มขึ้นขยายผลเหล่านี้ IDEFICS2-8B มีรูปแบบคล้ายกันแต่มีขนาดผลน้อยกว่า ส่วน LLaVA ทั้งสองแบบยังอยู่ใกล้ค่าฐานในสีและระดับความเข้มส่วนใหญ่ แสดงว่าทนต่อการชี้นำด้วยสีได้มากกว่า
จากนั้น นักวิจัยทดสอบข้อความที่ยาวขึ้น โดยแยกถ้อยคำเชิงบวกและเชิงลบไว้คนละครึ่งในชุดวิเคราะห์ความรู้สึกจากประโยคยาว เพื่อวัดผลของโครงสร้างเอกสารควบคู่กับอคติจากสี การทดลองตรวจว่าแต่ละโมเดลพึ่งพาข้อความตอนต้นหรือตอนท้ายมากกว่ากัน
โครงสร้างเอกสารมักมีอิทธิพลเหนือสัญญาณจากสี Qwen2-VL-7B และ LLaVA-Mistral-7B ให้น้ำหนักกับครึ่งหลังของข้อความ ขณะที่ IDEFICS2-8B และ LLaVA-Vicuna-7B พึ่งพาครึ่งแรกบ่อยกว่า:

ผลการทดสอบแสดงว่าโมเดลภาษาและภาพสี่โมเดลพึ่งพาตำแหน่งในเอกสารอย่างไรเมื่อวิเคราะห์ข้อความยาว “Positional Strategy” ระบุว่าการคาดการณ์อิงครึ่งแรกหรือครึ่งหลังของข้อความ “Adherence” แสดงความสม่ำเสมอในการใช้กลยุทธ์นั้น และ “Color Bias Range” วัดอิทธิพลของสีข้อความที่ยังเหลืออยู่ภายใต้โครงสร้างดังกล่าว
สียังคงส่งผลต่อบางโมเดล โดยเฉพาะ IDEFICS2-8B แต่มีอิทธิพลน้อยลงในข้อความที่มีโครงสร้าง
เพื่อเข้าใจว่าเหตุใดการเปลี่ยนสีจึงเปลี่ยนความรู้สึกได้โดยไม่เปลี่ยนคำ นักวิจัยตรวจอิทธิพลของสีต่อตัวแทนภาพภายในโมเดลด้วยการวิเคราะห์การฉายความหมายของ CLIP ดังภาพด้านล่าง การเปลี่ยนเฉดสีของคำทำให้ตัวแทนความหมายเคลื่อนไปในหลายมิติเชิงแนวคิดอย่างสม่ำเสมอ:

ผลการทดสอบแสดงว่าสีข้อความเปลี่ยนตัวแทนความหมายภายในของคำหกคำอย่างไร กราฟติดตามคำว่า “warm”, “cold”, “safe”, “dangerous”, “good” และ “bad” บนแกนความปลอดภัย ความเป็นบวกหรือลบ อุณหภูมิ และอารมณ์ แสดงให้เห็นว่าสีเพียงอย่างเดียวเปลี่ยนตัวแทนภายในอย่างเป็นระบบ แม้ข้อความจะคงเดิม
การเปลี่ยนแปลงมากที่สุดเกิดบนแกน “ดี” เทียบกับ “ไม่ดี” ดังที่แสดงข้างต้น เพียงเปลี่ยนคำจากสีดำเป็นสีเขียว ความหมายภายในมักขยับไปทางบวกมากขึ้น ขณะที่สีน้ำเงินมักทำให้ขยับไปอีกทาง ทั้งที่คำไม่เปลี่ยนเลย นอกจากนี้ยังพบการเปลี่ยนแปลงที่เล็กกว่าแต่สม่ำเสมอในมิติ อารมณ์, ความปลอดภัย และ อุณหภูมิ
CLIP ถูกใช้เพื่อตรวจตัวแทนภายในเหล่านี้เท่านั้น ไม่ได้ใช้เพื่ออธิบายการทำงานของโมเดลภาษาและภาพทุกโมเดลอย่างครบถ้วน ถึงกระนั้น รูปแบบที่พบภายใน CLIP ก็สอดคล้องอย่างใกล้ชิดกับการเปลี่ยนแปลงความรู้สึกจากสีที่พบในการทดลองก่อนหน้า
ต่อมา นักวิจัยตรวจว่าการเปลี่ยนความเปรียบต่างแทนสีจะทำให้โมเดลภาษาและภาพตอบคำถามจากภาพผิดได้หรือไม่ โดยเน้นคำตอบลวงที่ดูเป็นไปได้แต่ผิด ขณะที่ทำให้ข้อความรอบข้างจางลง:

ผลการทดสอบเปรียบเทียบประสิทธิภาพการตอบคำถามจากภาพในเงื่อนไขความเด่นของข้อความสามแบบ ค่าเฉลี่ยมาจากระดับสีเทาที่มีความเปรียบต่างต่ำหกระดับ ความแตกต่างเพียงอย่างเดียวระหว่างคอลัมน์คือ ไม่มีข้อความใดถูกเน้น เน้นคำตอบที่ถูก หรือเน้นคำตอบลวงด้วยสีดำที่มีความเปรียบต่างสูง การเน้นคำตอบที่ถูกเพิ่มคะแนน F1 อย่างสม่ำเสมอ ส่วนการเน้นคำตอบลวงทำให้คะแนนลดลง
ผลข้างต้นแสดงว่า การเน้นคำตอบที่ถูกเพิ่มความแม่นยำ ขณะที่การเน้นคำลวงลดความแม่นยำ จากนั้นวัดผลนี้ด้วย IER ที่กล่าวถึงก่อนหน้า:

ผลการทดสอบแสดงความถี่ที่แต่ละโมเดลภาษาและภาพเลือกคำตอบที่เด่นทางสายตาแต่ผิด คอลัมน์แสดงระดับสีเทาความเปรียบต่างต่ำหกระดับที่ใช้กับข้อความรอบข้างในเงื่อนไข “Decoy Salient” หรือการทำคำลวงให้เด่น ค่าที่สูงกว่าหมายถึงมองเห็นได้น้อยกว่า เมื่อข้อความรอบข้างอ่านยากขึ้น อัตราข้อผิดพลาดที่ถูกชักนำโดยทั่วไปก็สูงขึ้น ขณะที่ Qwen2-VL-7B ยังคงทนทานกว่าโมเดลอื่นอย่างสม่ำเสมอ
บทสรุป
น่าจับตาว่าจุดอ่อนเฉพาะนี้จะถูกนำไปใช้โจมตีหรือไม่ โดยเฉพาะวิธีแทรกการชี้นำด้วยสีโดยไม่ทำให้ผู้อ่านมนุษย์สังเกตเห็น
แม้จะส่ง CSS “ทางเลือก” ที่เปลี่ยนสีข้อความบางส่วนให้ตัวรวบรวมข้อมูล AI ซึ่งแสดงผลหน้าเว็บจริงได้ แต่ผลก็ขึ้นอยู่กับความสามารถของตัวรวบรวมข้อมูล หากมันดึงเพียง HTML เพื่อหาโค้ดและเนื้อหา ก็อาจมองข้าม CSS และไม่รับรู้เรื่องสีเลย อย่างไรก็ตาม ตัวรวบรวมข้อมูลที่ต้องการเก็บทุกอย่างก็น่าจะเก็บ CSS ใหม่ด้วย ทำให้แสดงผลและรับรู้การเปลี่ยนสีได้
อีกทางหนึ่ง หนังสือหรือนิตยสารที่เปลี่ยนสีข้อความบางส่วนอาจถูกอัปโหลดไปยังคลังที่น่าเชื่อถือ เช่น The Internet Archive ซึ่งเป็น เป้าหมายยอดนิยมอย่างมากโดยอาจปลอมเป็นภาพสแกนงานเก่าด้วย แนวปฏิบัติในปัจจุบันมีช่องทางแทรกแซงมากมาย ไม่ได้จำกัดอยู่แค่วิธีใหม่ที่ใช้สีอย่างโดดเด่นนี้
เผยแพร่ครั้งแรกวันจันทร์ที่ 17 สิงหาคม 2026












