มุมมองของ Anderson

ระบบการมองเห็นของ AI อาจไม่ได้ ‘มอง’ จริงๆ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
AI-generated image (GPT-2): a supermarket bin contains misshapen green apples beneath a sign showing a red apple and the words 'Red, glossy and round.' The image is surrounded by a yellow-and-black border labelled “AI fantasy inside” and “reality outside,” with inward-pointing arrows.

ระบบการมองเห็นของ AI อาจอธิบายภาพด้วยสเตอริโอไทป์แทนการมองเห็นจริงๆ การลบฉลากออก และคำอธิบายที่ถูกกล่าวถึงจะล่มสลาย

 

เนื่องจากแพลตฟอร์ม AI ชั้นแนวหน้ากำลัง สูญเสียเงิน อย่างต่อเนื่องในความหวังของ ขอบเขตเหตุการณ์ AI การประหยัดเล็กๆ น้อยๆ ในการให้บริการและจัดหาเลี้ยงชีพของพวกเขาสามารถช่วยให้ประหยัดได้มาก เช่น ทุกครั้งที่โมเดลภาษาขนาดใหญ่ (LLM) สามารถให้คำตอบจากเมทริกซ์ที่ได้รับการฝึกฝนของตนเองแทนการเดินทางไปที่เว็บเพื่อให้ได้ ข้อมูลปัจจุบัน ที่ต้องได้รับการกลั่นกรองและปรับปรุงใหม่ มันจะตอบกลับได้เร็วขึ้นและช่วยให้ผู้ให้บริการประหยัดเงิน

แน่นอนว่ามันอาจ หลอกลวง ได้โดยไม่ต้องใช้โทเค็นและพลังงานเพิ่มเติมในการให้เหตุผลและตรวจสอบสมมติฐานของมัน

ในทำนองเดียวกัน แม้ว่า LLM จะเข้าถึงเว็บ แต่ก็มักจะอ้างถึง URL ที่คลุมเครือ ไม่เหมาะสม หรือไม่เกี่ยวข้องกันเพราะมันประหยัดพลังงานโดยการประเมินเมตาดาต้าสำหรับหน้าเหล่านั้นแทนการอ่านมันจริงๆ

ในทำนองเดียวกัน หากคุณอัปโหลด PDF ไปยัง LLM และต้องการอภิปรายเกี่ยวกับมัน LLM อาจลบเนื้อหาของ PDF ออกจากหน่วยความจำและใช้เฉพาะเมตาดาต้าบางส่วนเกี่ยวกับมันเพื่อตอบคำถามของคุณโดยไม่ต้องระบุว่าคุณควรอัปโหลดมันอีกครั้ง ซึ่งนำไปสู่ข้อผิดพลาด ความคิดที่ไม่ถูกต้อง และการหลอกลวงมากขึ้น

การทดลองในอุตสาหกรรม

สิ่งเหล่านี้เป็นการประหยัดที่เป็นไปได้ แต่ไม่ซื่อสัตย์ ที่บังคับให้ผู้ใช้สำหรับเหตุผลในการดำเนินงาน ในโลกการรวบรวมข้อมูลและฝึกอบรมแบบอัพสตรีมที่ต้องประมวลผลภาพหลายล้านภาพ เป็นจำนวนมาก และไม่สามารถมีการทำเครื่องหมายโดยมนุษย์ได้ ความกดดันที่จะลดการใช้พลังงานและเวลาเป็นเรื่องราวที่มีความกดดันมาก

วิธีการหลีกเลี่ยงหนึ่งคือการใช้โมเดลภาษาและภาพที่เป็นกลาง เช่น การฝึกฝนภาษาและภาพแบบขัดแย้ง (CLIP) ซึ่งแมปภาพและข้อความเข้าสู่พื้นที่เชิงความหมายร่วมกัน เพื่อให้สามารถเปรียบเทียบแนวคิดเชิงภาพโดยใช้ภาษาแทนการให้ฉลากที่ชัดเจน

สิ่งนี้หมายถึงอะไร บอกว่าเด็กที่เรียนรู้จากภาพที่มีคำบรรยายหลายล้านภาพจนพัฒนาแนวคิดที่ไม่ชัดเจนว่าภาพและคำใดที่มีความเกี่ยวข้องตามธรรมชาติ

ปัญหาก็คือ คำบรรยายหลายครั้งถูกเขียนโดยเจ้าของเว็บไซต์และหน่วยงานที่มีผลประโยชน์ ซึ่ง มีความสนใจในการทำ SEO ที่ดี มากกว่าการทำเครื่องหมายที่ดี ซึ่งนำไปสู่ ‘เสียงรบกวน’ หรือการทำเครื่องหมายที่ไม่ถูกต้อง

อย่างไรก็ตาม การที่แนวคิดและคำที่เกี่ยวข้องซ้ำกันในเซตข้อมูลขนาดใหญ่โดยทั่วไปหมายความว่าคำหลักจะถูกจับคู่กับภาพที่ถูกต้อง เนื่องจาก ‘ป้ายกำกับไร้สาระ’ ที่น้อยกว่าจะถูกบังคับให้อยู่ใน กลุ่มผู้ชาย และจะไม่เกี่ยวข้องกับภาพโดยทั่วไป ดังนั้นมันจึงทำงานได้มากกว่าไม่ทำงาน

การทำเครื่องหมายข้อมูลทำได้เพราะมันถูกและใช้งานได้ไม่มาก ไม่ใช่เพราะมันดี

การทำเครื่องหมายที่ไม่เหมาะสม

ในสถานการณ์ที่ยุ่งยากนี้ มีงานวิจัยใหม่จากคาร์เนกีเมลลอน ซึ่งแสดงให้เห็นว่าคำบรรยายที่มอบให้กับภาพ – ตัวอย่างเช่น CLIP – เป็นเพียง สเตอริโอไทป์ ที่อ้างอิงจากชื่อภาพ (ข้อความ) แทนที่จะ ‘มอง’ ภาพเอง

ในตัวอย่างที่น่าประทับใจจากงานวิจัย CLIP ถูกจับคู่กับคำบรรยายที่สร้างจากชื่อคลาส สตรอเบอร์รี่ จากนั้นทดสอบบน ImageNet-Sketch โดยที่สตรอเบอร์รี่ทุกอันคือการวาดภาพขาวดำ – แต่คำบรรยายยังคงยืนยันว่าผลไม้ ‘สีแดง’ และ ‘สุก’:

คำบรรยายชื่อคลาสล้มเหลวบน ImageNet-Sketch: ความชอบของภาษาแสดง 'สีแดง' และ 'สุก' ในขณะที่คุณลักษณะที่ยึดตามภาพตรงกับการวาดภาพขาวดำ. Source - https://www.unite.ai/wp-content/uploads/2026/07/figure-1-4.jpg

คำบรรยายชื่อคลาสล้มเหลวบน ImageNet-Sketch: ความชอบของภาษาแสดง ‘สีแดง’ และ ‘สุก’ ในขณะที่คุณลักษณะที่ยึดตามภาพตรงกับการวาดภาพขาวดำ. Source

ที่นี่ CLIP ถูกจับคู่กับคำบรรยายที่สร้างจากชื่อคลาส สตรอเบอร์รี่ ผ่าน GPT-3 หรือความรู้ภายนอก ซึ่งไม่เคยเห็นภาพ ดังนั้นจึงใช้ คุณลักษณะที่เป็นปกติ เช่น สีแดง และ มีใบ เมื่อใช้กับการวาดภาพเส้นขาวดำใน ImageNet-Sketch การกระบวนการนี้ล้มเหลว

ในทางกลับกัน คุณลักษณะที่ได้รับจากภาพเองเลือกคุณลักษณะที่ยังคงถูกต้องภายใต้การเปลี่ยนแปลง เช่น จุด หรือ รูปหัวใจ

ดังนั้น เราสามารถเห็นว่าวัตถุที่ระบุถูกโฆษณาไม่สำหรับสิ่งที่มันคือ แต่ ‘โดยชื่อเสียง’ คุณศัพท์ ‘สีแดง’ และ ‘มีใบ’ เป็นคำที่ถูกต้องสำหรับย่อยดอม สตรอเบอร์รี่ แต่เกินขอบเขตของภาพ (ตัวอย่าง) ในคำถาม

ผู้เขียนของ งานวิจัยใหม่ – ชื่อเรื่อง คุณลักษณะควรมาจากภาพ ไม่ใช่ชื่อคลาส: การเลือกคุณลักษณะที่มีเงื่อนไขการกระจายสำหรับโมเดลภาษาและภาพ – แย้งว่านี่เป็นปัญหาเรื้อรังและกว้างขวาง และแนะนำให้เลือกคุณลักษณะโดยตรงจากภาพเอง เพื่อให้สะท้อนถึงสิ่งที่มองเห็นได้จริงภายใต้ การเปลี่ยนแปลงการกระจาย แทนที่จะพึ่งพาคุณลักษณะที่มี ความชอบก่อน ของชื่อคลาส

ผู้เขียนระบุ:

‘เส้นทางที่เป็นที่นิยมในการจัดประเภทแบบ zero-shot ที่ต้องการให้โมเดลภาษาขนาดใหญ่ (LLM) อธิบายชื่อคลาสแต่ละชื่อและให้ CLIP พร้อมคำบรรยายที่ได้รับ เราแสดงให้เห็นว่าคำบรรยายเหล่านี้มีหลักฐานเชิงภาพน้อย: การเอาชื่อคลาสออกจากคำสั่งจะล้มเหลวความแม่นยำของ ImageNet จาก 59.5% เป็น 15.5% ‘

‘การวินิจฉัยคือว่าคำบรรยายถูกมีเงื่อนไขโดยฉลากมากกว่าภาพ ดังนั้นจึงอธิบายแนวคิดโดยทั่วไปและหลอกลวงเมื่อข้อมูลเปลี่ยนแปลง: LLM ยืนยันว่าสตรอเบอร์รี่เป็นสีแดง แต่ทุกสตรอเบอร์รี่ใน ImageNet-Sketch เป็นการวาดเส้นขาวดำ ‘

‘ดังนั้นเราจึงเลือกคุณลักษณะจากคอลเลกชันภาพเป้าหมายแทน: เราให้คะแนนคุณลักษณะที่เป็นไปได้จำนวนมากเทียบกับภาพในพื้นที่การฝึกฝนร่วมกันของ CLIP และเก็บคุณลักษณะที่มีคะแนนสูงสุดต่อคลาส’

วิธีการแก้ปัญหาที่เสนอคือโมเดลยังคงเหมือนเดิม แต่แทนที่จะพึ่งพาคำบรรยายชื่อคลาส มันจะตรวจสอบ กลุ่มคุณลักษณะที่เป็นไปได้ เทียบกับภาพ และเก็บเฉพาะคุณลักษณะที่เหมาะสมกับสิ่งที่มองเห็นได้จริง

ต้นทุนของสิ่งนี้อาจถือว่าสามารถยอมรับได้ เนื่องจากไม่แนะนำให้เรียกคืนพลังงานที่ ‘โกง’ ซึ่งนำไปสู่ปัญหาในตอนแรก แต่เพิ่ม การผ่านการให้คะแนน เหนือคุณลักษณะที่เป็นไปได้สำหรับแต่ละคลาส ดังนั้นความล่าช้าจึงเพิ่มขึ้นเล็กน้อย – แต่น้อยกว่าการฝึกอบรมใหม่หรือการผ่าน RAG ทั้งหมด ในทฤษฎี ต้นทุนพลังงานจะยอมรับได้ เมื่อเทียบกับการปรับปรุงความสอดคล้อง

วิธีการ

เนื่องจากวิธีการทดสอบของนักวิจัยมีลักษณะพิเศษและไม่จำเป็นต้องมีข้อมูลเพิ่มเติม เราจะพิจารณาแค่ภาพรวมที่ย่อของแนวทางของพวกเขา

งานวิจัยนี้อธิบายปัญหาหลักเป็น การผิดปกติของชื่อคลาส: สถานการณ์ที่ประสิทธิภาพดูเหมือนจะมาจากคำบรรยายที่มีความหมาย แต่ในความเป็นจริง ขึ้นอยู่กับชื่อคลาสเอง โดยมีคำบรรยายที่เพิ่มเล็กน้อยและล้มเหลวเมื่อการสนับสนุนถูกถอดออก

จากนั้นเอกสารนี้แย้งว่าการล้มเหลวนี้เป็นเรื่องที่หลีกเลี่ยงไม่ได้ เนื่องจากคำบรรยายที่สร้างจากชื่อคลาสสามารถอธิบายได้เพียงว่าสิ่งหนึ่ง มักจะ ดูเหมือนอย่างไร ไม่ใช่ว่ามันคืออะไรในภาพเฉพาะ เมื่อข้อมูลออกจากความคาดหวัง คำบรรยายจะกลายเป็นไม่เพียงแต่ไม่มีประโยชน์ แต่ยังหลอกลวงด้วย ซึ่ง ลงคะแนนเสียงต่อต้านคำตอบที่ถูกต้อง

นักวิจัยยังพิจารณาว่า CLIP อาจไม่ดีในการตรวจจับคุณลักษณะโดยไม่มีการช่วยเหลือจากชื่อคลาส หรือว่าคำบรรยายที่สร้างโดย GPT มีประโยชน์หรือไม่ แต่การทดลองต่อๆ ไปของพวกเขาจะหักล้างทั้งสองคำอธิบาย

เพื่อแก้ไขปัญหานี้ โมเดล CLIP ที่ ถูกแช่แข็ง ถูกใช้เพื่อเปรียบเทียบภาพกับคุณลักษณะที่เป็นไปได้จำนวนมากที่ดึงมาจาก VAW LSA และเอาท์พุตของ GPT-3 โดยเก็บเฉพาะคุณลักษณะที่ตรงกับภาพที่ดีที่สุดโดยไม่ต้องมีการฝึกอบรมหรือการดูแลภาพและข้อความเพิ่มเติม:

ภาพรวมของระบบที่เสนอ: โมเดล CLIP ที่ถูกแช่แข็งเข้ารหัสภาพและข้อความคุณลักษณะที่เป็นไปได้จำนวนมาก โดยใช้ความคล้ายคลึงกันโคไซน์เพื่อวัดว่าคำบรรยายแต่ละคำตรงกับเนื้อหาทางภาพมากน้อยเพียงใด คุณลักษณะที่มีคะแนนสูงสุดจะถูกเก็บไว้ต่อคลาส ทำให้เกิดชุดคำบรรยายที่สามารถอธิบายได้ ในขณะที่ตัวเข้ารหัสภาพและข้อความยังคงเหมือนเดิมตลอดกระบวนการ

ภาพรวมของระบบที่เสนอ: โมเดล CLIP ที่ถูกแช่แข็งเข้ารหัสภาพและข้อความคุณลักษณะที่เป็นไปได้จำนวนมาก โดยใช้ความคล้ายคลึงกันโคไซน์เพื่อวัดว่าคำบรรยายแต่ละคำตรงกับเนื้อหาทางภาพมากน้อยเพียงใด คุณลักษณะที่มีคะแนนสูงสุดจะถูกเก็บไว้ต่อคลาส ทำให้เกิดชุดคำบรรยายที่สามารถอธิบายได้ ในขณะที่ตัวเข้ารหัสภาพและข้อความยังคงเหมือนเดิมตลอดกระบวนการ

ข้อมูลและการทดสอบ

การทดลองของนักวิจัยใช้ CLIP พร้อมกับ ResNet-50 และประเมินประสิทธิภาพบน ImageNet พร้อมด้วยสี่รุ่นที่เปลี่ยนแปลงการกระจาย: ImageNetV2; ImageNet-Sketch; ImageNet-A; และ ImageNet-R

คุณลักษณะถูกเลือกโดยใช้เฉพาะภาพที่ฝึกอบรม ImageNet เดิม – ทำให้เซตข้อมูลที่เปลี่ยนแปลงการกระจายสามารถใช้เป็นการทดสอบนอก ข้อมูล ว่าคุณลักษณะที่ได้มาจากภาพยังคงมีประโยชน์เมื่อความปรากฏทางภาพเปลี่ยนแปลง:

ความแม่นยำในการจัดประเภทอันดับ 1 ข้าม ImageNet และสี่รุ่นที่เปลี่ยนแปลงการกระจายที่แสดง ผลลัพธ์แสดงให้เห็นว่าประสิทธิภาพยังคงเหมือนเดิมเมื่อชื่อคลาสถูกรวมเข้ากับคำสั่ง แต่ล้มเหลวเมื่อคำบรรยายถูกบังคับให้ยืนอยู่ตามลำพัง โดยแสดงให้เห็นว่าประสิทธิภาพที่ดูเหมือนจะมาจากชื่อคลาสเอง ในทางกลับกัน คุณลักษณะที่เลือกโดยตรงจากภาพยังคงมีประโยชน์มากกว่าในทุกเซตข้อมูลที่ทดสอบ

ความแม่นยำในการจัดประเภทอันดับ 1 ข้าม ImageNet และสี่รุ่นที่เปลี่ยนแปลงการกระจายที่แสดง ผลลัพธ์แสดงให้เห็นว่าประสิทธิภาพยังคงเหมือนเดิมเมื่อชื่อคลาสถูกรวมเข้ากับคำสั่ง แต่ล้มเหลวเมื่อคำบรรยายถูกบังคับให้ยืนอยู่ตามลำพัง โดยแสดงให้เห็นว่าประสิทธิภาพที่ดูเหมือนจะมาจากชื่อคลาสเอง ในทางกลับกัน คุณลักษณะที่เลือกโดยตรงจากภาพยังคงมีประโยชน์มากกว่าในทุกเซตข้อมูลที่ทดสอบ

การคัดเลือกคุณลักษณะใหม่จากกลุ่มคุณลักษณะเดียวกัน แต่ปรับให้เหมาะสมกับภาพ ImageNet ทำให้ความแม่นยำที่ไม่มีชื่อคลาสเพิ่มขึ้นจาก 15.5% เป็น 19.4% เนื่องจากโมเดล คุณลักษณะกลุ่ม และโพรโทคอลการประเมินยังคงไม่เปลี่ยนแปลง การเพิ่มขึ้นนี้สามารถอธิบายได้จากคุณลักษณะที่เลือกโดยอิงจากภาพ

ผลลัพธ์นี้ยังชี้ให้เห็นว่า CLIP สามารถระบุคุณลักษณะโดยไม่ต้องมีชื่อคลาส และกลุ่มคุณลักษณะที่สร้างโดย GPT มีคุณลักษณะที่มีประโยชน์อยู่แล้ว ปัญหาหลักดูเหมือนจะอยู่ที่ การสร้างที่มีเงื่อนไขจากฉลาก ซึ่งมักล้มเหลวในการเปิดเผยคุณลักษณะที่เกี่ยวข้องกับภาพมากที่สุด

แม้ว่านักวิจัยจะดำเนินการทดลองเพิ่มเติม แต่เราต้องอ้างอิงผู้อ่านไปยังวัสดุแหล่งเดิมสำหรับรายละเอียดเพิ่มเติมของสิ่งเหล่านี้ เนื่องจากแทนที่จะขยายขอบเขตของผลลัพธ์ มันจะยืนยันสมมติฐานหลักที่อธิบายไว้จนถึงตอนนี้ – ว่าการพึ่งพาชื่อคลาสอาจบ่อนทำลายศักยภาพของข้อมูลภาพจริงในแอปพลิเคชันการมองเห็นของคอมพิวเตอร์สมัยใหม่ โดยการอาศัยความน่าจะเป็น ‘โดยชื่อเสียง’ ที่ถูกต้องเป็นภัยคุกคามต่อความแม่นยำของผลลัพธ์

สรุป

น่าสนใจที่จะพิจารณาความสัมพันธ์ที่ AI ที่สร้างขึ้นสมัยใหม่ซึ่งยืมมาจากภาพหลายล้านภาพที่มีคำบรรยายที่ถูกดูดเข้าไปในเซตข้อมูลขนาดใหญ่ เช่น Common Crawl ตั้งแต่ต้นยุคสมัยใหญ่

ทุกครั้งที่ระบบการรู้จำภาพหรือการทำเครื่องหมายอัตโนมัติพยายามจัดประเภทหรือทำเครื่องหมายภาพใหม่หรือเก่า ความเป็นมาของความรู้นั้นย้อนกลับไปสู่ผู้ขายที่เขียน ‘นิตยสารร้อนยุค 70!’ ใน alt ลงบนรายการ eBay ในปี 2004 หรือเหตุการณ์ที่คล้ายกัน

แม้ว่าหลายคนเชื่อว่ายุคทองของการเติมคีย์เวิร์ดถูกกวาดล้างไปโดยอัลกอริทึม PageRank ที่ซับซ้อนกว่าของ Google เมื่อเกือบสามทศวรรษที่แล้ว การเขียน ‘กำแพงเนื้อหา หวังว่าจะติด’ ยังคงมีชีวิตอยู่: เมื่อวานนี้ หัวข้อ HTML ของ การเปิดตัวโมเดล Qwen-Image-3.0 มี การระเบิดของความบ้าคลั่งในการเติมคีย์เวิร์ด (อาจยังคงอยู่!):

โค้ด HTML สำหรับการเปิดตัว Qwen Image 3 เป็น 'กำแพง' ของข้อความคีย์เวิร์ดที่ไม่เหมาะสม Source - https://www.unite.ai/wp-content/uploads/2026/07/qwen-keyword-stuffing.jpg

โค้ด HTML สำหรับการเปิดตัว Qwen Image 3 เป็น ‘กำแพง’ ของข้อความคีย์เวิร์ดที่ไม่เหมาะสม Source

ไม่ว่าจะเป็นการดึงคีย์เวิร์ดเหล่านี้ออกมาจากตารางเป้าหมายอย่างเป็นระบบหรือเขียนด้วยมือโดยผู้เชี่ยวชาญด้าน SEO สิ่งนี้เป็นตัวอย่างที่ดีของต้นกำเนิดดั้งเดิมของระบบ AI ที่สร้างขึ้นสมัยใหม่ โดยมีความหมายที่มีภาระผูกพันของผลประโยชน์ส่วนตัวที่ต้องถูกถอดออกหรือคำนึงถึงในบางวิธี เมื่อคำศัพท์เหล่านี้ขัดขวางหรือยับยั้งระบบและแอปพลิเคชันเชิงตรรกะ

 

เผยแพร่ครั้งแรกวันพุธที่ 22 กรกฎาคม 2026

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai