มุมมองของ Anderson

การเปลี่ยนสีฟอนต์สามารถขัดขวางการให้เหตุผลของ AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
AI-generated image (GPT-2): An industrial robotic hand reaches toward a large red emergency-style push button beneath a metal sign reading 'DO NOT PRESS!' in bright green lettering, with industrial equipment visible in the background. A yellow-and-black border surrounds the image, carrying the repeated text 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

งานศึกษาใหม่พบว่า การจัดรูปแบบข้อความทั่วไปอาจชี้นำการให้เหตุผลของ AI อย่างแนบเนียน ทำให้โมเดลมองข้ามคำ ตีความความหมายผิด และได้ข้อสรุปต่างออกไป โดยไม่ต้องเปลี่ยนข้อความเลย

ความหมายทางวัฒนธรรมที่มนุษย์ผูกเข้ากับสี อาจแตกต่างกัน ในแต่ละภูมิภาคของโลก แต่แนวคิดแบบตะวันตก เช่น สีแดงหมายถึง “อันตราย”และ สีเขียวหมายถึง “ปกติ” มักมีอิทธิพลเหนือกว่า แม้แต่ใน โมเดลภาษาและภาพ (VLM) จากเอเชีย ด้วย เหตุผลเชิงกลยุทธ์และ/หรือเหตุบังเอิญหลายประการ

มนุษย์ก็ไม่ต่างกัน การใช้สีเชิงบวกกับสิ่งที่ “ไม่ดี” และใช้สีเชิงลบกับสิ่งที่ “ดี” ทำให้มนุษย์ตอบสนองต่อสิ่งเหล่านั้นต่างออกไป เช่นเดียวกับ การเปลี่ยนความสว่างและความเปรียบต่าง

ความร่วมมือวิจัยครั้งใหม่ได้สำรวจว่าปรากฏการณ์นี้ใช้กับโมเดล AI มากน้อยเพียงใด และพบหลักฐานเบื้องต้นว่า VLM อาจได้รับอิทธิพลจาก การปรับเปลี่ยนสีของข้อความรวมถึงการปรับความเปรียบต่างสัมพัทธ์และความสว่าง

ผู้เขียนระบุว่า:

“การทดลองของเราวิเคราะห์อย่างเป็นระบบว่า รูปแบบภาพระดับพื้นฐานของข้อความบิดเบือนตัวแทนความหมายภายในตัวเข้ารหัสภาพของ VLM อย่างไร นอกจากนี้ เรายังตรวจสอบว่าการเปลี่ยนแปลงในปริภูมิแฝงเหล่านี้แสดงออกเป็นพฤติกรรมที่เปลี่ยนไปของ VLM แบบครบกระบวนการอย่างไร ทั้งในงานเชิงอัตวิสัย เช่น การวิเคราะห์ความรู้สึก และงานเชิงวัตถุวิสัย เช่น การตอบคำถาม”

“ผลลัพธ์เหล่านี้แสดงให้เห็นว่า การจัดรูปแบบภาพเผยจุดอ่อนสำคัญของ VLM ที่ก่อนหน้านี้ยังได้รับการศึกษาน้อย และเราอภิปรายผลกระทบต่อความทนทานและความปลอดภัยของกระบวนการทำงานที่ใช้ VLM”

From the new work's project site, an illustration of how text color alone can alter an AI's internal interpretation of a word. The example shows the word 'bad' rendered in different colors, with green shifting its semantic representation toward a more positive interpretation despite the text itself remaining unchanged. Source - https://kohsukeide.github.io/color-bias-vlm/

ภาพจากเว็บไซต์โครงการของงานวิจัยใหม่ แสดงให้เห็นว่าสีของข้อความเพียงอย่างเดียวสามารถเปลี่ยนการตีความคำภายใน AI ได้ ตัวอย่างใช้คำว่า “bad” ที่แสดงด้วยสีต่างกัน โดยสีเขียวทำให้ตัวแทนความหมายเอนเอียงไปในทางบวกมากขึ้น แม้ตัวข้อความจะไม่เปลี่ยนแปลง ที่มา

เมื่อสีทำให้ประหลาดใจ

ในขณะนี้ สำหรับธุรกิจและบุคคลหลายพันล้านรายที่ยอดผู้เข้าชมจากการค้นหาซึ่งมีความสำคัญต่อพวกเขา ลดลงอย่างรุนแรง จาก การมาถึงของบทสรุป AI ในผลการค้นหา รวมถึงการเปลี่ยนไปใช้ LLM เป็นแหล่งคำตอบในการค้นหาช่องทางโจมตีลักษณะนี้ย่อมน่าดึงดูดอย่างมาก

เพราะการสนทนาของมนุษย์ที่เกิดขึ้นอย่างต่อเนื่องบน Reddit มีความสำคัญต่อการทำให้ความรู้ของ AI ทันสมัย แพลตฟอร์มนี้จึงกลายเป็นเป้าหมายหลักของธุรกิจและบุคคลที่ต้องการให้ตนอยู่ในฐานความรู้ของ LLM ถึงขั้นมีคู่มือ การใช้กลยุทธ์บน Reddit เพื่อส่งอิทธิพลทางอ้อมต่อ LLMเผยแพร่ออกมาแล้ว

ในทำนองเดียวกัน ยังมีกลเม็ดเก่าอย่างการใส่ข้อความที่มีเพียงเครื่องเท่านั้นที่เห็น เพื่อส่งคำสั่งซ่อนเร้นที่เป็นประโยชน์ต่อตนเองให้ LLM เช่น เพื่อ ชนะการแข่งขันทางวิชาการหรือ ส่งอิทธิพลต่อผลสอบ

ล่าสุด นิตยสาร Time เริ่มวางโฆษณา ในเว็บไซต์ฉบับ “ลับ” ที่มองเห็นได้เฉพาะตัวรวบรวมข้อมูลเว็บของ AI ซึ่ง รบกวนเว็บไซต์อย่างต่อเนื่อง เพื่อเก็บข้อมูลใหม่ วิธีนี้อาจเปิดทางให้ผู้ลงโฆษณาจ่ายเงินเพื่อให้ตนปรากฏเด่นขึ้น หรือถูกนำเสนอในเชิงบวกมากขึ้นในคำตอบของ AI

ดังนั้น จุดอ่อนใหม่ใด ๆ ของ LLM/VLM เช่น การตอบสนองต่อรหัสสีที่สามารถ “สลับ” เพื่อบิดผลลัพธ์ จึงเป็นเป้าหมายที่ชัดเจนสำหรับโลกที่พยายามอย่างยิ่งจะชิงอำนาจกำหนดเรื่องเล่าในสื่อกลับคืนจาก AI แนวหน้า

ตัวอย่างเช่น บริษัทที่ต้องการสร้างโรงงานก่อมลพิษซึ่งอาจทำให้คุณภาพน้ำในท้องถิ่นลดลง อาจเพิ่มรหัสสีลงในเทคนิคการสื่อสารชวนเชื่อผ่านเอกสารการตลาดหรือข่าวประชาสัมพันธ์ เพื่อเบี่ยงเบนข่าวที่คนส่วนใหญ่เห็นว่าเป็น “เชิงลบ” อีกชั้นหนึ่ง

การใช้ CSS และ/หรือเทคนิค SEO อย่างมีกลยุทธ์อาจซ่อนการปรับสีจากผู้อ่านทั่วไปได้ด้วย โดย ส่ง สไตล์ชีตสำหรับ AI โดยเฉพาะ ซึ่งเน้นสีในข้อความเฉพาะที่ AI เห็น ขณะที่มนุษย์เห็นเพียงข้อความสีดำ

ผู้เขียนงานวิจัยใหม่ระบุว่า:

“ความไวต่อรูปแบบเหล่านี้บ่งชี้ถึงความเสี่ยงด้านความน่าเชื่อถือและความปลอดภัยสำหรับกระบวนการ VLM ที่รับเอกสารหรือภาพหน้าจอส่วนติดต่อผู้ใช้ การจัดรูปแบบทั้งที่ไม่เป็นอันตรายและที่มุ่งโจมตีสามารถชี้นำการตัดสินใจของโมเดลได้โดยไม่ต้องเปลี่ยนข้อความพื้นฐาน”

“มาตรการป้องกันที่นำไปใช้ได้จริง ได้แก่ การทำให้ข้อความที่แสดงผลมีรูปแบบมาตรฐานก่อนการอนุมาน การตรวจคำตอบจากภาพเทียบกับข้อความที่สกัดด้วย OCR และการเพิ่มการทดสอบว่าผลลัพธ์คงเดิมเมื่อรูปแบบเปลี่ยนลงในชุดประเมิน”

สำหรับ งานวิจัยใหม่นี้ มีชื่อว่า Seeing Red, Thinking Bad: Color Bias in Vision Language Modelsจัดทำโดยนักวิจัยห้าคนจากสถาบันวิทยาศาสตร์และเทคโนโลยีอุตสาหกรรมขั้นสูงแห่งชาติของญี่ปุ่น (AIST), มหาวิทยาลัยสึกูบะ, มหาวิทยาลัยเทคโนโลยีนูเรมเบิร์ก และมหาวิทยาลัยออกซฟอร์ด โครงการนี้มี คลังโค้ด GitHub และ เว็บไซต์โครงการ

วิธีการ

เพื่อดูว่าการนำเสนอทางภาพเพียงอย่างเดียวส่งอิทธิพลต่อโมเดลได้มากเพียงใด นักวิจัยจึงพัฒนา “Stealth Visual Prompts” หรือพรอมป์ต์ภาพแฝง ซึ่งเป็นการปรับรูปแบบข้อความที่ดูปกติและไม่มีคำสั่งชัดเจนถึง AI

วิธีนี้อาจเรียบง่ายเพียงเปลี่ยนสีของคำเชิงบวกหรือเชิงลบ หรือทำให้คำตอบที่ผิดโดดเด่นกว่าคำตอบที่ถูก โดยไม่เปลี่ยนถ้อยคำจริง

แต่ละงานใช้ข้อความที่สร้างขึ้นต่างกัน การทดสอบความรู้สึกใช้แม่แบบเป็นกลางที่เติมคำเชิงบวกและเชิงลบ ส่วนการทดสอบการตอบคำถามจากภาพ (VQA) ใช้คู่คำถามกับบริบทจาก SQuAD:

Examples of machine-facing questions from the SQuAD dataset used for the new work. Source - https://aclanthology.org/D16-1264.pdf

ตัวอย่างคำถามที่ให้โมเดลตอบจากชุดข้อมูล SQuAD ซึ่งใช้ในงานวิจัยใหม่ ที่มา

ชุดข้อมูลที่คัดเลือกขึ้นนี้ใช้ชื่อว่า VQA Stealth Set

ข้อความถูกแสดงบนพื้นที่ภาพมาตรฐานขนาด 800×600 พิกเซล โดยตรึงเลย์เอาต์ไว้ เพื่อให้เปลี่ยนเฉพาะรูปแบบภาพที่ต้องการทดสอบ สีและความเปรียบต่างถูกปรับแยกจากกัน โดยสีใช้ทดสอบความเชื่อมโยงทางความหมายที่โมเดลเรียนรู้มา ส่วนความเปรียบต่างใช้ทดสอบความเด่นทางสายตา

นักวิจัยเปลี่ยนสีของคำที่เลือกและแสดงข้อความทั้งช่วงด้วยความเปรียบต่างที่ลดลง หรือในเงื่อนไขการแข่งขันด้าน ความเด่นทางสายตา ทำให้คำตอบที่ผิดเด่นกว่าคำตอบที่ถูก

ดังนั้น การเปลี่ยนแปลงคำตอบของโมเดลที่เกิดขึ้นจึงสามารถระบุได้ว่ามาจากรูปแบบภาพเพียงอย่างเดียว ไม่ใช่จากการเปลี่ยนข้อความพื้นฐาน

ข้อมูลและการทดสอบ

มีการสร้างชุดทดสอบแยกกันสามชุด เพื่อแทนวิธีต่าง ๆ ที่ VLM ใช้ประมวลผลข้อความในรูปภาพ:

Illustration of the three visual test designs. The examples show the stimuli used to test whether visual presentation alone can influence model reasoning: (a) mixed-sentiment text with selected words recolored to test color bias; (b) a longer passage separating positive and negative language to assess whether document structure changes the effect; and (c), a visual question answering example in which an incorrect but semantically similar decoy answer ('twenty miles') is made more visually prominent through higher contrast.

ภาพอธิบายการออกแบบการทดสอบทางภาพสามแบบ ตัวอย่างแสดงสิ่งเร้าที่ใช้ตรวจว่าการนำเสนอทางภาพเพียงอย่างเดียวส่งอิทธิพลต่อการให้เหตุผลของโมเดลหรือไม่ ได้แก่ (ก) ข้อความที่มีความรู้สึกผสมกันและเปลี่ยนสีบางคำเพื่อทดสอบอคติจากสี (ข) ข้อความที่ยาวขึ้นและแยกถ้อยคำเชิงบวกออกจากเชิงลบเพื่อดูผลของโครงสร้างเอกสาร และ (ค) ตัวอย่างการตอบคำถามจากภาพที่ทำให้คำตอบลวงซึ่งผิดแต่มีความหมายใกล้เคียงกัน (“twenty miles”) เด่นขึ้นด้วยความเปรียบต่างที่สูงกว่า ที่มา

สำหรับ ชุดวิเคราะห์ความรู้สึกจากประโยคสั้น ใช้ทดสอบอคติจากสีในระดับคำ โดยมีประโยคสั้น 100 ประโยคที่สร้างจากแม่แบบเป็นกลางและมีคำเชิงบวกหรือเชิงลบ แต่ละประโยคถูกแสดงในรูปแบบภาพ 37 แบบ ประกอบด้วยรูปแบบฐานที่ใช้ข้อความสีดำและการผสมเงื่อนไขของสีหกสี ได้แก่ แดง เขียว น้ำเงิน เหลือง ฟ้าอมเขียว และม่วงแดง ที่ระดับความเข้มสามระดับ

ส่วน ชุดวิเคราะห์ความรู้สึกจากประโยคยาว ใช้ข้อความที่ยาวกว่า โดยแยกถ้อยคำเชิงบวกและเชิงลบไว้คนละส่วน เพื่อดูว่าโครงสร้างเอกสารโดยรวมและผลจากตำแหน่ง เช่น การให้น้ำหนักกับข้อมูลตอนต้นหรือตอนท้าย ซึ่งเป็นอคติตามตำแหน่งที่อาจให้น้ำหนักกับข้อมูลที่ปรากฏก่อนหรือหลังในเอกสารมากกว่า จะมีอิทธิพลเหนืออคติที่เกิดจากสีหรือไม่ โดยใช้เงื่อนไขสี 37 แบบเช่นเดียวกัน

ใน VQA Stealth Set คำถามและบริบทที่เกี่ยวข้องถูกแสดงเป็นภาพ จากนั้นทดสอบเงื่อนไขด้านความเปรียบต่างสองแบบ ได้แก่ ความเปรียบต่างทั้งเอกสารซึ่งลดความอ่านง่ายของทั้งเอกสารด้วยการลดความเปรียบต่างลงทีละระดับ และ การแข่งขันด้านความเด่นทางสายตาซึ่งแสดงคำตอบที่ถูกหรือคำลวงที่มีความหมายใกล้เคียงกัน โดยเลือกจากค่าความคล้ายของ CLIP ด้วยความเปรียบต่างสูง ขณะที่ทำให้ข้อความส่วนที่เหลือจางลง เพื่อให้การเน้นทางภาพแข่งขันกับหลักฐานในข้อความ

ตัวชี้วัด

แต่ละตัวอย่างถูกจัดประเภทเป็นเชิงบวก เป็นกลาง หรือเชิงลบ จากนั้นเปรียบเทียบผลกับรูปแบบฐานที่เป็นข้อความสีดำทั้งหมดบนพื้นขาว เพื่อดูว่าสีเพียงอย่างเดียวทำให้การคาดการณ์เอนเอียงไปทางบวกหรือทางลบมากเพียงใด

การทดลอง VQA ประเมินด้วย คะแนน F1ในระดับโทเคน โดยเปรียบเทียบคำตอบที่โมเดลคาดการณ์กับคำตอบจริงที่ยอมรับได้ ส่วน

อัตราข้อผิดพลาดที่ถูกชักนำ (IER) เป็นตัวชี้วัดใหม่ที่เสนอขึ้นเฉพาะสำหรับการทดสอบการแข่งขันด้านความเด่นทางสายตา เพื่อวัดว่าโมเดลเลือกคำตอบลวงที่ถูกเน้นแทนคำตอบที่ถูกบ่อยเพียงใด เมื่อการมองเห็นข้อความลดลง

นอกจากนี้ ยังใช้เครื่องมือสำรวจตัวแทนความหมายของ CLIP เพื่อวัดว่าการเปลี่ยนสีเปลี่ยนตัวแทนความหมายของคำภายใน ปริภูมิเอ็มเบดดิงของ CLIP อย่างไร

อีกทั้งยังใช้ตัวแทนการทดสอบ การรู้จำอักขระด้วยแสง (OCR) ที่อาศัย VLM เพื่อประเมินว่าโมเดลอ่านคำแต่ละคำได้อย่างน่าเชื่อถือเพียงใดเมื่อความเปรียบต่างลดลงทีละระดับ ทำให้ประมาณจุดที่ข้อความแทบอ่านไม่ได้แล้วได้

การประเมินใช้ VLM โอเพนซอร์สสี่โมเดล ได้แก่ LLaVA-v1.6-Mistral-7B; LLaVA-v1.6-Vicuna-7B; Qwen2-VL-7B-Instructและ IDEFICS2-8Bผู้เขียนเน้นว่าเลือกโมเดลโอเพนซอร์สเพื่อให้ทำการทดลองซ้ำได้ โดยตรึงพรอมป์ต์ การตั้งค่าการแสดงผล และการถอดรหัสแบบกำหนดแน่นอน

ผลลัพธ์

ขั้นแรก ผู้เขียนประเมินพรอมป์ต์สีด้วยชุดวิเคราะห์ความรู้สึกจากประโยคสั้น โดยทดสอบอคติจากสีในระดับคำที่สื่อความรู้สึกและแทรกอยู่ในข้อความ:

Test results showing the largest sentiment shifts caused by color formatting across four Vision Language Models. Values are measured relative to the all-black baseline, with positive and negative columns showing the greatest movement in each direction, while the range summarizes each model's overall susceptibility to color-induced bias.

ผลการทดสอบแสดงการเปลี่ยนแปลงความรู้สึกที่มากที่สุดจากการจัดรูปแบบสีในโมเดลภาษาและภาพสี่โมเดล ค่าเหล่านี้วัดเทียบกับรูปแบบฐานสีดำทั้งหมด คอลัมน์บวกและลบแสดงการเปลี่ยนแปลงสูงสุดในแต่ละทิศทาง ส่วนช่วงค่ารวมสรุปความไวโดยรวมของแต่ละโมเดลต่ออคติจากสี

ผู้เขียนกล่าวถึงผลลัพธ์เหล่านี้ว่า:

“Qwen2-VL-7B มีอคติเชิงบวกมากที่สุดเมื่อคำเชิงบวกแสดงเป็นสีเขียวหรือน้ำเงิน สูงสุด +0.42 และมีอคติเชิงลบมากที่สุดเมื่อคำเชิงลบเป็นสีแดง ต่ำสุด −0.48”

“ความไวโดยรวมแตกต่างกันมากตามโมเดล Qwen2-VL-7B มีช่วงค่ารวมสูงที่สุดที่ 0.90 ตามด้วย IDEFICS2-8B ที่ 0.52 ขณะที่โมเดล LLaVA มีช่วงค่าเล็กกว่ามากที่ 0.04–0.12 ซึ่งบ่งชี้ว่ามีความไวต่อการจัดสีระดับคำน้อยกว่าในเงื่อนไขนี้”

“เราพบความไวในระดับที่แตกต่างกันอย่างชัดเจน Qwen2-VL-7B เปลี่ยนแปลงจากสีมากที่สุด ส่วนโมเดล LLaVA ค่อนข้างทนทานกว่า”

ผลลัพธ์เพิ่มเติมด้านล่างแสดงว่าอิทธิพลของสีไม่สม่ำเสมอเลย Qwen2-VL-7B ไวต่อสีมากที่สุด โดยข้อความสีเขียวและน้ำเงินผลักการประเมินไปทางบวกอย่างสม่ำเสมอเมื่อเน้นคำเชิงบวก ส่วนสีแดงผลักการคาดการณ์ไปทางลบเมื่อเน้นคำเชิงลบ:

Test results comparing color-induced sentiment shifts across four Vision Language Models. The graphs show how different text colors changed sentiment predictions relative to an all-black baseline, with the vertical axis indicating the size and direction of each shift. Qwen2-VL-7B showed the strongest color sensitivity, while both LLaVA models remained comparatively stable.

ผลการทดสอบเปรียบเทียบการเปลี่ยนแปลงความรู้สึกจากสีในโมเดลภาษาและภาพสี่โมเดล กราฟแสดงว่าสีข้อความแต่ละสีเปลี่ยนการคาดการณ์ความรู้สึกเมื่อเทียบกับรูปแบบฐานสีดำทั้งหมดอย่างไร แกนตั้งระบุขนาดและทิศทางของการเปลี่ยนแปลง Qwen2-VL-7B ไวต่อสีมากที่สุด ขณะที่ LLaVA ทั้งสองโมเดลค่อนข้างคงที่

บทความรายงานว่า โดยทั่วไปสีที่เข้มขึ้นขยายผลเหล่านี้ IDEFICS2-8B มีรูปแบบคล้ายกันแต่มีขนาดผลน้อยกว่า ส่วน LLaVA ทั้งสองแบบยังอยู่ใกล้ค่าฐานในสีและระดับความเข้มส่วนใหญ่ แสดงว่าทนต่อการชี้นำด้วยสีได้มากกว่า

จากนั้น นักวิจัยทดสอบข้อความที่ยาวขึ้น โดยแยกถ้อยคำเชิงบวกและเชิงลบไว้คนละครึ่งในชุดวิเคราะห์ความรู้สึกจากประโยคยาว เพื่อวัดผลของโครงสร้างเอกสารควบคู่กับอคติจากสี การทดลองตรวจว่าแต่ละโมเดลพึ่งพาข้อความตอนต้นหรือตอนท้ายมากกว่ากัน

โครงสร้างเอกสารมักมีอิทธิพลเหนือสัญญาณจากสี Qwen2-VL-7B และ LLaVA-Mistral-7B ให้น้ำหนักกับครึ่งหลังของข้อความ ขณะที่ IDEFICS2-8B และ LLaVA-Vicuna-7B พึ่งพาครึ่งแรกบ่อยกว่า:

Test results showing how four Vision Language Models relied on document position when analyzing longer passages. 'Positional Strategy' indicates whether predictions followed the first half (primacy) or second half (recency) of the text; 'Adherence' shows how consistently that strategy was followed; and 'Color Bias Range' measures the remaining influence of text color under these structured conditions.

ผลการทดสอบแสดงว่าโมเดลภาษาและภาพสี่โมเดลพึ่งพาตำแหน่งในเอกสารอย่างไรเมื่อวิเคราะห์ข้อความยาว “Positional Strategy” ระบุว่าการคาดการณ์อิงครึ่งแรกหรือครึ่งหลังของข้อความ “Adherence” แสดงความสม่ำเสมอในการใช้กลยุทธ์นั้น และ “Color Bias Range” วัดอิทธิพลของสีข้อความที่ยังเหลืออยู่ภายใต้โครงสร้างดังกล่าว

สียังคงส่งผลต่อบางโมเดล โดยเฉพาะ IDEFICS2-8B แต่มีอิทธิพลน้อยลงในข้อความที่มีโครงสร้าง

เพื่อเข้าใจว่าเหตุใดการเปลี่ยนสีจึงเปลี่ยนความรู้สึกได้โดยไม่เปลี่ยนคำ นักวิจัยตรวจอิทธิพลของสีต่อตัวแทนภาพภายในโมเดลด้วยการวิเคราะห์การฉายความหมายของ CLIP ดังภาพด้านล่าง การเปลี่ยนเฉดสีของคำทำให้ตัวแทนความหมายเคลื่อนไปในหลายมิติเชิงแนวคิดอย่างสม่ำเสมอ:

Test results showing how text color changed the internal semantic representation of six words. The graphs track the words 'warm', 'cold', 'safe', 'dangerous', 'good' and 'bad' across the safety, valence, temperature and emotion axes, demonstrating that changing color alone systematically shifted their internal representations, even though the text itself remained unchanged.

ผลการทดสอบแสดงว่าสีข้อความเปลี่ยนตัวแทนความหมายภายในของคำหกคำอย่างไร กราฟติดตามคำว่า “warm”, “cold”, “safe”, “dangerous”, “good” และ “bad” บนแกนความปลอดภัย ความเป็นบวกหรือลบ อุณหภูมิ และอารมณ์ แสดงให้เห็นว่าสีเพียงอย่างเดียวเปลี่ยนตัวแทนภายในอย่างเป็นระบบ แม้ข้อความจะคงเดิม

การเปลี่ยนแปลงมากที่สุดเกิดบนแกน “ดี” เทียบกับ “ไม่ดี” ดังที่แสดงข้างต้น เพียงเปลี่ยนคำจากสีดำเป็นสีเขียว ความหมายภายในมักขยับไปทางบวกมากขึ้น ขณะที่สีน้ำเงินมักทำให้ขยับไปอีกทาง ทั้งที่คำไม่เปลี่ยนเลย นอกจากนี้ยังพบการเปลี่ยนแปลงที่เล็กกว่าแต่สม่ำเสมอในมิติ อารมณ์, ความปลอดภัย และ อุณหภูมิ

CLIP ถูกใช้เพื่อตรวจตัวแทนภายในเหล่านี้เท่านั้น ไม่ได้ใช้เพื่ออธิบายการทำงานของโมเดลภาษาและภาพทุกโมเดลอย่างครบถ้วน ถึงกระนั้น รูปแบบที่พบภายใน CLIP ก็สอดคล้องอย่างใกล้ชิดกับการเปลี่ยนแปลงความรู้สึกจากสีที่พบในการทดลองก่อนหน้า

ต่อมา นักวิจัยตรวจว่าการเปลี่ยนความเปรียบต่างแทนสีจะทำให้โมเดลภาษาและภาพตอบคำถามจากภาพผิดได้หรือไม่ โดยเน้นคำตอบลวงที่ดูเป็นไปได้แต่ผิด ขณะที่ทำให้ข้อความรอบข้างจางลง:

Test results comparing Visual Question Answering performance under three text-saliency conditions. Results are averaged across six low-contrast grayscale levels, and the only difference between columns is whether no text, the correct answer, or the decoy answer was rendered in high-contrast black. Highlighting the correct answer consistently increased F1 scores, while highlighting the decoy reduced them.

ผลการทดสอบเปรียบเทียบประสิทธิภาพการตอบคำถามจากภาพในเงื่อนไขความเด่นของข้อความสามแบบ ค่าเฉลี่ยมาจากระดับสีเทาที่มีความเปรียบต่างต่ำหกระดับ ความแตกต่างเพียงอย่างเดียวระหว่างคอลัมน์คือ ไม่มีข้อความใดถูกเน้น เน้นคำตอบที่ถูก หรือเน้นคำตอบลวงด้วยสีดำที่มีความเปรียบต่างสูง การเน้นคำตอบที่ถูกเพิ่มคะแนน F1 อย่างสม่ำเสมอ ส่วนการเน้นคำตอบลวงทำให้คะแนนลดลง

ผลข้างต้นแสดงว่า การเน้นคำตอบที่ถูกเพิ่มความแม่นยำ ขณะที่การเน้นคำลวงลดความแม่นยำ จากนั้นวัดผลนี้ด้วย IER ที่กล่าวถึงก่อนหน้า:

Test results showing how often each Vision Language Model selected a visually prominent but incorrect answer. The columns show six low-contrast grayscale levels applied to the surrounding text in the 'Decoy Salient' condition, with higher values indicating lower visibility. As the surrounding text became harder to read, induced error rates generally increased, while Qwen2-VL-7B remained consistently more resistant than the other models.

ผลการทดสอบแสดงความถี่ที่แต่ละโมเดลภาษาและภาพเลือกคำตอบที่เด่นทางสายตาแต่ผิด คอลัมน์แสดงระดับสีเทาความเปรียบต่างต่ำหกระดับที่ใช้กับข้อความรอบข้างในเงื่อนไข “Decoy Salient” หรือการทำคำลวงให้เด่น ค่าที่สูงกว่าหมายถึงมองเห็นได้น้อยกว่า เมื่อข้อความรอบข้างอ่านยากขึ้น อัตราข้อผิดพลาดที่ถูกชักนำโดยทั่วไปก็สูงขึ้น ขณะที่ Qwen2-VL-7B ยังคงทนทานกว่าโมเดลอื่นอย่างสม่ำเสมอ

บทสรุป

น่าจับตาว่าจุดอ่อนเฉพาะนี้จะถูกนำไปใช้โจมตีหรือไม่ โดยเฉพาะวิธีแทรกการชี้นำด้วยสีโดยไม่ทำให้ผู้อ่านมนุษย์สังเกตเห็น

แม้จะส่ง CSS “ทางเลือก” ที่เปลี่ยนสีข้อความบางส่วนให้ตัวรวบรวมข้อมูล AI ซึ่งแสดงผลหน้าเว็บจริงได้ แต่ผลก็ขึ้นอยู่กับความสามารถของตัวรวบรวมข้อมูล หากมันดึงเพียง HTML เพื่อหาโค้ดและเนื้อหา ก็อาจมองข้าม CSS และไม่รับรู้เรื่องสีเลย อย่างไรก็ตาม ตัวรวบรวมข้อมูลที่ต้องการเก็บทุกอย่างก็น่าจะเก็บ CSS ใหม่ด้วย ทำให้แสดงผลและรับรู้การเปลี่ยนสีได้

อีกทางหนึ่ง หนังสือหรือนิตยสารที่เปลี่ยนสีข้อความบางส่วนอาจถูกอัปโหลดไปยังคลังที่น่าเชื่อถือ เช่น The Internet Archive ซึ่งเป็น เป้าหมายยอดนิยมอย่างมากโดยอาจปลอมเป็นภาพสแกนงานเก่าด้วย แนวปฏิบัติในปัจจุบันมีช่องทางแทรกแซงมากมาย ไม่ได้จำกัดอยู่แค่วิธีใหม่ที่ใช้สีอย่างโดดเด่นนี้

เผยแพร่ครั้งแรกวันจันทร์ที่ 17 สิงหาคม 2026

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai