มุมมองของ Anderson

AI มีความสามารถต่ำกว่ามนุษย์อย่างมากในการประกอบเฟอร์นิเจอร์

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
AI-generated image (GPT-2): An industrial humanoid robot sits on the floor of a sparsely furnished apartment beside a grotesquely malformed piece of self-assembled furniture, holding a screwdriver while studying the collapsed structure amid IKEA boxes, scattered components, and assembly instructions.

ChatGPT และ Google Gemini ยังคงไม่สามารถเข้าใจวิดีโอประกอบเฟอร์นิเจอร์ IKEA ได้อย่างน่าเชื่อถือ โดยมีระบบ AI อื่นๆ ที่มีชื่อเสียงหลายระบบสับสนกับชิ้นส่วน ละเว้นการเชื่อมต่อ และแทบจะไม่ใช้วิดีโอเพื่อทำความเข้าใจสิ่งที่เกิดขึ้น

 

มีมีมวัฒนธรรมที่ยั่งยืนเกี่ยวกับความยากในการประกอบเฟอร์นิเจอร์ IKEA สไตล์แฟลตแพ็ค ทำให้หัวข้อนี้เป็นเป้าหมายที่น่าสนใจสำหรับการวิจัยด้านการมองเห็นของคอมพิวเตอร์ — ไม่ต้องสงสัยเลยว่าเนื่องจากลำดับเหตุการณ์ที่ยาวนาน การติดตามวัตถุ และการให้เหตุผลด้านพื้นที่ที่เกี่ยวข้องจะทำให้ระบบการควบคุมหุ่นยนต์ไปไกลเกินรูปร่างที่เรียบง่ายและสภาพแวดล้อมที่ควบคุมซึ่งพวกมันคุ้นเคย

ดังนั้นการทำงานเกี่ยวกับขั้นตอนการประกอบเฟอร์นิเจอร์แฟลตแพ็คที่ใช้ AI จึงกลายเป็นสาขาย่อยที่น่านับถือในวรรณกรรม โดยมีการออกตัวเช่น สภาพแวดล้อมการประกอบเฟอร์นิเจอร์ IKEA ของ USC ในปี 2019 ซึ่งเป็นหนึ่งในชุดข้อมูลและบริบทการวิจัยที่มุ่งหมายเพื่อการประกอบเฟอร์นิเจอร์เป็นหลัก:

คลิกเพื่อเล่น ตัวอย่างการฝึกอบรมการประกอบหุ่นยนต์ จากเว็บไซต์โครงการสำหรับโครงการสภาพแวดล้อมการประกอบเฟอร์นิเจอร์ IKEA ในปี 2019 แหล่งที่มา

ในปี 2024 การร่วมมือระหว่าง Stanford และ J.P. Morgan ที่เรียกว่า คู่มือ IKEA ที่ทำงาน เป็นครั้งแรกที่สำรวจความสามารถของ AI ในการดำเนินการนี้ ซึ่งดูเหมือนจะเป็นกระบวนการที่น่าเบื่อ (แต่บ่อยครั้งที่น่าหงุดหงิด) โดยอาศัยชุดข้อมูลใหม่ของภาพจากคู่มือคำแนะนำ และใช้วิดีโอคำแนะนำ:

วิธีการและรายละเอียดจากโครงการ IKEA Manuals at Work ในปี 2024 แหล่งที่มา - https://arxiv.org/abs/2411.11409

วิธีการและรายละเอียดจากโครงการ IKEA Manuals at Work ในปี 2024 แหล่งที่มา

ผู้เขียนของเอกสารปี 2024 — ซึ่งใช้ DGCNN, CNOS, SAM-6D, MegaPose, MiDaS, SAM2 Hiera-L, Cutie-base, และ GPT-4o — สรุปว่างานนี้ให้ผล ‘ความท้าทายที่สำคัญในการยึดวิดีโอประกอบคำแนะนำ รวมถึงการแยกส่วนและท่าทางของชิ้นส่วน การสร้างแผนการประกอบระดับสูง และการตรวจจับขั้นตอนการประกอบที่สำคัญในวิดีโอ’

วอกซ์ ออน วอกซ์ ออฟ

ต้องชัดเจนว่าการทำให้ AI อัตโนมัติออกจากงานที่ไม่ค่อยมีใครชื่นชมจะดี แต่ไม่ใช่ดาวนำทางทางวิทยาศาสตร์ หรือสูงในรายการลำดับความสำคัญของภาคการวิจัยการมองเห็นของคอมพิวเตอร์

คุณค่าของงานนี้อยู่ที่ความจริงที่ว่าสิ่งที่ระบบ AI ต้องเรียนรู้ เพื่อให้เชี่ยวชาญในเรื่องนี้ จะทำให้พวกมันพร้อมสำหรับงานที่ร้ายแรงกว่าซึ่งเท่าเทียมกันหรือท้าทายมากกว่าในเกษตรกรรม อุตสาหกรรม ภาคบริการ และสาขาอื่นๆ

ในลักษณะนี้ โครงการ LEGO-Puzzles และชุดข้อมูล ตรวจสอบว่าโมเดลภาษา-ภาพ (VLMs) จัดการเหตุผลเชิงพื้นที่หลายขั้นตอนได้ดีเพียงใด โดยพิจารณาจากสถาปัตยกรรมต่างๆ เนื่องจากระบบการประกอบขึ้นอยู่ไม่เพียงแต่การคู่ชิ้นส่วนที่ถูกต้องในขณะที่ถูกต้อง — กระบวนการที่เรียกว่า การคู่ — แต่ยังต้องปฏิบัติตามคำแนะนำที่อาจเป็นนามธรรมมากกว่าฉากภาพที่มองเห็นได้สำหรับโมเดลในแต่ละขั้นตอน:

คำถามที่ท้าทายจากโครงการ LEGO-Puzzles แหล่งที่มา - https://tangkexian.github.io/LEGO-Puzzles/

คำถามที่ท้าทายจากโครงการ LEGO-Puzzles แหล่งที่มา

โครงการล่าสุดที่พยายามท้าทายการประกอบเฟอร์นิเจอร์ใช้โมเดล AI ที่ทันสมัยและสามารถใช้ได้มากกว่า รวมถึง Google Gemini 2.5/3.1 และ OpenAI’s GPT-5 — แต่ยังคงไม่สามารถทำได้ดีกว่า AI ในงาน โดยมีการปรับปรุงที่ดีเพียงเล็กน้อยเหนือโอกาส และประสิทธิภาพ ‘ต่ำกว่าระดับมนุษย์’

ผู้เขียนระบุว่า:

‘การทดลองของเราพบว่าโมเดล LVLM ที่มีประสิทธิภาพสูงสุดต้องดิ้นรนกับการให้เหตุผลเชิงพื้นที่-เวลาอย่างละเอียด โดยเน้นถึงข้อจำกัดในการใช้ข้อมูลทางกาลเวลาจากวิดีโออย่างมีประสิทธิภาพ ความสามารถในการติดตามที่จำกัด และความเข้าใจเกี่ยวกับการโต้ตอบทางกายภาพ เช่น การสัมผัสกันทางกายภาพ’

ปัญหาที่กำลังแก้ไขในแนวทางนี้ของการวิจัยมีความเกี่ยวข้องทางทฤษฎีกับหุ่นยนต์เชิงปฏิบัติเพียงเล็กน้อยในขณะนี้ แม้ว่าจะมีการท้าทายเพิ่มเติมเมื่อประเด็นทางทฤษฎีกลายเป็น AI ที่มีรูปร่างในอนาคต

เอกสารใหม่ชื่อ Flat-Pack Bench: การประเมินความเข้าใจเชิงพื้นที่-เวลาในโมเดลภาษา-ภาพขนาดใหญ่ผ่านการประกอบเฟอร์นิเจอร์ มาจากผู้เขียนแปดคนจาก Cornell University, Cornell Tech, MBZUAI และ UC Berkeley เอกสารนี้มาพร้อมกับ เว็บไซต์โครงการ

วิธีการ

ผู้เขียนของงานใหม่นี้เน้นย้ำถึงความยากที่ AI ต้องเผชิญในการเข้าใจกระบวนการประกอบผ่านการสังเกต เช่น ผ่านวิดีโอคำแนะนำสไตล์ YouTube ที่ผู้คนจำนวนมากหันไปใช้เพื่อประโยชน์จากความรู้ของชุมชน:

คำถามบางส่วนที่งานประกอบเฟอร์นิเจอร์แฟลตแพ็คทำให้เกิดขึ้น พร้อมทั้งความสามารถที่จำเป็นสี่ประการในการเอาชนะความท้าทาย

คำถามบางส่วนที่งานประกอบเฟอร์นิเจอร์แฟลตแพ็คทำให้เกิดขึ้น พร้อมทั้งความสามารถที่จำเป็นสี่ประการในการเอาชนะความท้าทาย แหล่งที่มา

พวกเขาได้สร้างชุดข้อมูลที่กรองจากชุดข้อมูล IKEA-Manuals-at-Work (IMaW) ที่กล่าวถึงก่อนหน้านี้ ซึ่งมีวิดีโอด้านนอกของคนกำลังประกอบเฟอร์นิเจอร์ IKEA การบンチมาร์กใหม่จะลบการ์ดคำแนะนำเฉพาะข้อความออกจากวิดีโอเดิม โดยมีรูปแบบวิดีโอที่ตัดและเฟรมหลักแยกจากกัน และยังเพิ่มคำแนะนำภาพที่มีเครื่องหมายกำกับพาร์ทชิ้นส่วนเฟอร์นิเจอร์สำหรับงานให้เหตุผลแบบหลายตัวเลือก

การบンチมาร์กนี้มีศูนย์กลางอยู่ที่ประเภทคำถามสี่ประเภท: คู่ เพื่อกำหนดว่าชิ้นส่วนสองชิ้นเชื่อมต่อกันในเฟอร์นิเจอร์ที่ประกอบเสร็จแล้ว; ติดตาม ซึ่งจำเป็นต้องให้โมเดลฟื้นฟูการเชื่อมโยงที่ถูกต้องระหว่าง ID ชิ้นส่วนที่สับเปลี่ยนไปทั่วเฟรมที่มีเครื่องหมายกำกับโดยใช้วิดีโอ; TOdr เพื่อประเมินว่าโมเดลสามารถอนุมานลำดับการเชื่อมต่อที่ถูกต้องได้หรือไม่; และ TLoc เพื่อทดสอบว่าโมเดลสามารถระบุกิจกรรมที่เกิดขึ้นในทันทีก่อนหรือหลังสถานะที่แสดงในคำแนะนำภาพได้หรือไม่ ซึ่งต้องใช้การระบุตำแหน่งและให้เหตุผลเกี่ยวกับเหตุการณ์ที่อยู่ใกล้ๆ

ตัวอย่างจากการบัญชีใหม่ โดยแสดงประเภทงานหลักสี่ประเภทที่ออกแบบมาเพื่อทดสอบการให้เหตุผลเชิงพื้นที่-เวลาในวิดีโอประกอบเฟอร์นิเจอร์: การระบุตำแหน่งทางกาลเวลา; การเรียงลำดับทางกาลเวลา; การติดตาม; และการคู่ การทำงานแต่ละงานรวมวิดีโอประกอบกับคำแนะนำภาพที่มีเครื่องหมายกำกับหนึ่งหรือหลายรายการและคำถามให้เหตุผลแบบหลายตัวเลือก

ตัวอย่างจากการบัญชีใหม่ โดยแสดงประเภทงานหลักสี่ประเภทที่ออกแบบมาเพื่อทดสอบการให้เหตุผลเชิงพื้นที่-เวลาในวิดีโอประกอบเฟอร์นิเจอร์: การระบุตำแหน่งทางกาลเวลา; การเรียงลำดับทางกาลเวลา; การติดตาม; และการคู่ การทำงานแต่ละงานรวมวิดีโอประกอบกับคำแนะนำภาพที่มีเครื่องหมายกำกับหนึ่งหรือหลายรายการและคำถามให้เหตุผลแบบหลายตัวเลือก

แบบจำลองที่แสดงในภาพสคีมาบoven ถูกสร้างจากแบบจำลองคำถามสี่แบบนี้

ผู้เขียนยังระบุด้วยว่าพวกเขาได้เพิ่มการกำกับพาร์ทชิ้นส่วนประกอบที่ละเอียดลงในแต่ละวิดีโอ IMaW เดิม โดยระบุว่าชิ้นส่วนใดเชื่อมต่อกับชิ้นส่วนอื่น — รายละเอียดที่ไม่มีอยู่ในคอลเลกชันเดิม

การหลบหลีก

คำถามที่เอกสารระบุว่าต้องคัดเลือกด้วยมือ เนื่องจากคำถามที่สร้างอัตโนมัติ经常ให้โอกาส AI เพื่อเพิกเฉยต่อวิดีโอและอาศัยความเข้าใจที่ฝึกฝนมา — สถานการณ์ที่ผู้ใช้ LLM/VLM ทั่วไปอาจรู้จักดี เนื่องจากการเพิ่มประสิทธิภาพและลำดับความสำคัญขององค์กรอื่นๆ ทำให้โมเดลแนวหน้าเพิกเฉยต่อข้อมูลที่ส่งมา เช่น PDF หรือภาพ และอาศัยความเข้าใจของตนเองแทน*:

‘[เรา] พบว่าการสร้างอัตโนมัติสร้างคำถามที่สามารถตอบได้โดยการเพิกเฉยต่อวิดีโอและใช้ทางลัด ตัวอย่างเช่น คำถาม การคู่ ที่สร้างอัตโนมัติเกี่ยวกับชิ้นส่วนที่ถูกวางไว้สำหรับการเชื่อมต่อ หรือรวมตัวเลือกที่เบี่ยงเบนความสนใจที่มีรูปร่างหรือสีที่แตกต่างกันอย่างชัดเจน ทำให้สามารถกำจัดได้ง่าย [การกำจัด] เพื่อแก้ไขปัญหานี้ เราคัดเลือกคำถามด้วยมือโดยใช้แบบจำลองคำถามที่ตายตัว

‘ผู้กำกับได้รับวิดีโอประกอบที่สมบูรณ์ เฟรมที่มีเครื่องหมายกำกับสำหรับคำแนะนำภาพ แบบจำลองคำถาม และคำแนะนำที่ละเอียดสำหรับการหลีกเลี่ยงทางลัดตามสัญญาณคงที่จากคำแนะนำภาพ’

การบัญชีใหม่ประกอบด้วยคำถามแบบหลายตัวเลือก 602 คำถามใน 50 วิดีโอประกอบเฟอร์นิเจอร์ที่แตกต่างกัน

ข้อมูลและการทดสอบ

โมเดลที่ประเมินสำหรับการทดสอบรอบนี้รวมถึง ChatGPT และรุ่น Gemini ที่กล่าวถึงก่อนหน้านี้ เช่นเดียวกับ Video-LLaVA; LLaVA-NeXT-Vid; LLaVA-OneVision; LLaVA-Video; Qwen 2.5/Qwen 3-VL; InternVL3; ArrowRL; PerceptionLM; และ Video-Refer

GenS ถูกใช้เพื่อเลือกเฟรมที่เกี่ยวข้องกับคำถามในวิดีโอที่ยาวสำหรับโมเดล Gemini 2.5 Pro และโมเดลส่วนใหญ่ถูกทดสอบใน แบบหนึ่งวินาที ภายใต้ การถอดรหัสแบบ Greedy (ไม่รองรับใน GPT-5)

แบบคำถามสามแบบถูกสร้างขึ้นสำหรับการบัญชีใหม่: แบบคำถาม สื่อผสม ให้คำแนะนำภาพเป็นภาพแยกต่างหากข้างวิดีโอประกอบ; แบบคำถาม คอลลาژ ใส่คำแนะนำภาพไว้ตรงกลางวิดีโอแต่ละเฟรมเป็นส่วนหนึ่งของการวางแนวตาราง; และแบบคำถาม ต่อท้าย ใส่คำแนะนำภาพไว้ที่จุดเริ่มต้นของวิดีโอ

ทั้งรูปแบบวิดีโอที่ตัดและรูปแบบเฟรมหลักถูกทดสอบในแบบคำถามเหล่านี้ เพื่อวัดว่าโครงสร้างคำถามและความกดดันทางกาลเวลาอาจส่งผลต่อประสิทธิภาพของโมเดลอย่างไร

ความเป็นไปได้ของโอกาสที่พิจารณาในการทดสอบยังรวมถึง ‘โอกาสความถี่’ ซึ่งเลือกตัวเลือกที่พบบ่อยที่สุด (ไม่ใช่ตัวเลือกแบบสุ่ม) เป็นตัวเลือก

ปัจจัยมนุษย์

ประสิทธิภาพของมนุษย์ถูกประเมินโดยผู้เข้าร่วมที่มาจากโปรแกรมคอมพิวเตอร์ศาสตร์ ตั้งแต่ระดับอุดมศึกษาถึงระดับ 박사 ผู้เข้าร่วมแต่ละคนได้รับวิดีโอประกอบ คำแนะนำภาพ และคำถามแบบหลายตัวเลือกที่เกี่ยวข้อง เช่นเดียวกับคำแนะนำงาน ก่อนที่จะเลือกคำตอบ

มีการรวบรวมคำตอบสามคำตอบต่อคำถามและแก้ไขผ่านการลงคะแนนเสียงส่วนใหญ่ ในขณะที่การศึกษาที่ได้รับการสนับสนุนจากฝูงชนยังได้รับการดำเนินการในแบบสุ่มจากชุดการบัญชีใหม่

ความแม่นยำ ถูกใช้เป็นมาตราสำหรับการทดสอบ:

โมเดล อันดับ ค่าเฉลี่ย Micro TOrd TLoc ติดตาม คู่
ประสิทธิภาพของมนุษย์ 94.18 93.54 93.20 93.77 97.70
โอกาสพื้นฐาน
โอกาสสุ่ม 26.41 25.00 25.00 25.49 33.33
โอกาสความถี่ 26.74 27.74 30.10 26.46 36.78
โมเดลที่มีลิขสิทธิ์
GPT-5 1 37.71 40.65 53.40 25.68 49.43
Gemini 2.5 Pro 2 33.72 40.65 44.66 23.35 39.08
Gemini 3.1 Pro 3 32.89 34.84 43.69 21.79 49.43
Gemini 2.5 Flash 4 31.06 31.61 41.75 23.35 40.23
Gemini 2.5 Pro + GenS 5 25.58 33.55 32.04 13.23 40.23
โมเดลแบบเปิด
Video-LLaVA-7B 26 23.75 21.29 35.92 10.89 51.72
InternVL3-14B 5 37.71 42.58 21.36 37.74 48.28
InternVL3-38B 12 36.05 42.58 37.86 25.68 52.87
InternVL3-78B 1 41.03 43.87 39.81 42.02 34.48
Qwen2.5-VL-7B 22 30.23 27.10 18.45 33.07 41.38
Qwen2.5-VL-32B 13 35.88 34.84 29.13 33.07 54.02
Qwen2.5-VL-72B 2 40.37 41.29 30.10 45.14 36.78
Qwen3-VL-4B 11 36.54 34.19 33.01 32.68 56.32
Qwen3-VL-4B-Think 9 37.21 31.61 25.24 37.74 59.77
Qwen3-VL-8B 15 33.72 36.13 30.10 33.85 33.33
Qwen3-VL-8B-Think 17 31.73 34.19 33.01 25.29 44.83
Qwen3-VL-32B 6 37.71 38.71 46.60 31.91 42.53
Qwen3-VL-32B-Think 3 40.03 38.71 22.33 45.53 47.13
Qwen3-VL-30B-A3B 10 36.71 30.32 22.33 42.02 49.43
Qwen3-VL-235B-A22B 8 37.21 37.42 25.24 39.69 43.68
LLaVA-NeXT-Vid-7B 25 25.08 33.55 24.27 16.73 35.63
LLaVA-NeXT-Vid-34B 21 30.40 30.32 24.27 32.68 31.03
LlaVA-OneVision-7B 16 32.89 26.45 30.10 34.24 43.68
LlaVA-OneVision-72B 4 38.37 35.48 25.24 38.91 57.47
LLaVA-Video-7B 19 30.73 30.97 24.27 25.68 52.87
LLaVA-Video-72B 7 37.54 36.77 27.18 35.80 56.32
Perception-LM-1B 24 27.74 28.39 26.21 25.29 35.63
Perception-LM-3B 18 31.40 28.39 32.04 29.96 40.23
Perception-LM-8B 14 35.38 26.45 26.21 44.75 34.48
VideoRefer 23 28.57 32.90 30.10 17.51 51.72
ArrowRL-7B 20 30.56 30.97 24.27 29.18 41.38

ผลลัพธ์ประสิทธิภาพบน FLAT-PACK BENCH โดยเปรียบเทียบโมเดลหลายรูปแบบที่มีลิขสิทธิ์และแบบเปิดทั่ว TOrd, TLoc, ติดตาม และการคู่ โดยประสิทธิภาพของมนุษย์ยังคงอยู่ห่างจากทุกระบบที่ทดสอบ แม้จะมีการปรับปรุงที่ดีในโมเดลแนวหน้าที่ใหญ่กว่า

ตามการทดสอบเบื้องต้น (ภาพด้านบน) มนุษย์ทำคะแนนได้มากกว่า 90% ในทุกหมวดคำถาม โดยมีความเห็นพ้องกัน 80% ซึ่งยืนยันว่าคำถามถูกกำหนดไว้อย่างชัดเจนและไม่มีข้อขัดแย้ง

GPT-5 และ Gemini 2.5/3.1 Pro ต้องดิ้นรนบนชุดข้อมูลนี้ โดยทำได้เพียงเล็กน้อยเหนือโอกาสพื้นฐาน และยังคงอยู่ห่างจากประสิทธิภาพของมนุษย์

ในหมวดแบบเปิด ผลลัพธ์ที่ดีที่สุดมาจากตระกูล InternVL และ Qwen แม้ว่าประสิทธิภาพจะแตกต่างกันอย่างมากในหมวด และโมเดลหลายตัวเพียงเล็กน้อยที่ทำได้ดีกว่าโอกาส ในขณะที่ระบบเฉพาะ เช่น PerceptionLM และ VideoRefer ก็ยังต้องดิ้นรนบนการบัญชีใหม่ของงานประกอบที่ซับซ้อน และผู้เข้าร่วมมนุษย์ยังคงอยู่ห่างจากทุกระบบในแต่ละหมวด

นักวิจัยยังทดสอบยุทธวิธีการกระตุ้น เชน-ออฟ-ทอท สองแบบต่อการตั้งค่าคำถามมาตรฐานของเอกสาร เชน-ออฟ-ทอทแบบไม่มีตัวอย่าง ขอให้โมเดลอธิบายคำตอบของตนอย่างเป็นขั้นตอน ในขณะที่ การรักษาความสอดคล้องด้วยเชน-ออฟ-ทอท สร้างคำตอบที่เป็นไปได้ห้าแบบก่อนที่จะเลือกคำตอบสุดท้ายผ่านการลงคะแนนเสียงส่วนใหญ่ อย่างไรก็ตาม ทั้งสองแนวทางไม่ได้ปรับปรุงผลลัพธ์บนชุดข้อมูล Flat Pack Bench

โค้ดชีท

เพื่อทดสอบว่า LVLMs จริงๆ แล้วเรียนรู้จากวิดีโอประกอบหรือไม่ หรือเพียงแค่เอาชนะสัญญาณภาพคงที่ ผู้วิจัยได้สร้างเวอร์ชันภาพเท่านั้นของการบัญชีใหม่ ซึ่งไม่มีวิดีโอ โดยเหลือไว้เพียงข้อความคำถามและคำแนะนำภาพ

ประสิทธิภาพของมนุษย์ลดลงมากกว่า 50% ในเงื่อนไขเหล่านี้ โดยแสดงให้เห็นว่างานเหล่านี้ต้องใช้ความเข้าใจเชิงกาลเวลาในการประกอบจริงๆ

ในทางกลับกัน โมเดลเหล่านี้เสื่อมลงไม่มากนัก โดยมีบางงานที่ยังคงเสถียรหรือแม้กระทั่งดีขึ้นโดยไม่มีวิดีโอเข้ามาเกี่ยวข้อง

สิ่งนี้ชี้ให้เห็นว่าเอกสารแนะนำว่าโมเดล LVLM หลายตัวไม่ได้ใช้ข้อมูลทางกาลเวลาในวิดีโอ เลย แต่ขึ้นอยู่กับทางลัดภาพและสมมติฐานทั่วไปเพื่ออนุมานคำตอบที่เป็นไปได้*:

ประสิทธิภาพของ LVLM บนเวอร์ชันภาพเท่านั้นของ Flat-Pack Bench เมื่อเปรียบเทียบกับการตั้งค่ามาตรฐานวิดีโอและภาพ โดยมีผลลัพธ์เพิ่มเติมหลังการสลับ ID ของชิ้นส่วนเพื่อทดสอบว่าโมเดลใช้ทางลัดของลำดับป้ายกำกับแทนความเข้าใจวิดีโอทางกาลเวลา

ประสิทธิภาพของ LVLM บนเวอร์ชันภาพเท่านั้นของ Flat-Pack Bench เมื่อเปรียบเทียบกับการตั้งค่ามาตรฐานวิดีโอและภาพ โดยมีผลลัพธ์เพิ่มเติมหลังการสลับ ID ของชิ้นส่วนเพื่อทดสอบว่าโมเดลใช้ทางลัดของลำดับป้ายกำกับแทนความเข้าใจวิดีโอทางกาลเวลา

‘[ภาพด้านบน] แสดงประสิทธิภาพของ LVLM ในเวอร์ชันภาพเท่านี้ และการเปลี่ยนแปลงในประสิทธิภาพของพวกมันจากการประเมินเบื้องต้น พร้อมทั้งประสิทธิภาพของมนุษย์’

‘การลดลงอย่างรุนแรงของประสิทธิภาพของมนุษย์ (>50%) แสดงให้เห็นว่าคำถามเหล่านี้ต้องใช้วิดีโอเพื่อตอบ’

‘เรายังพบด้วยว่าประสิทธิภาพโดยรวมของโมเดลลดลงอย่างรุนแรง (8.80%) แต่ส่วนใหญ่เนื่องมาจากงานย่อย TRACK ความแม่นยำในงานอื่นๆ ยังคงเท่าเดิมหรือดีขึ้น ซึ่งบ่งชี้ว่า LVLM ไม่ใช้วิดีโออย่างมีประสิทธิภาพ ในขณะที่มนุษย์ใช้วิดีโอเพื่อตอบ’

การวิเคราะห์ที่ลึกกว่าของเอกสารชี้ให้เห็นว่าความท้าทายหลักไม่ใช่แค่การเรียงลำดับทางกาลเวลาเท่านั้น แต่ยังรวมถึงความล้มเหลวในการยึดวัตถุและให้เหตุผลเชิงพื้นที่-เวลา: โมเดลมักจะดิ้นรนในการติดตามชิ้นส่วนเฟอร์นิเจอร์ที่คล้ายกันทางภาพผ่านการเคลื่อนไหว การเปลี่ยนกล้อง และการเปลี่ยนแปลงฉาก แม้ว่าจะดูเหมือนว่าระบุกระบวนการประกอบโดยรวมได้อย่างถูกต้อง

สรุป

การรักษาความเข้าใจที่ยั่งยืนของแนวคิดและวัตถุเป็นศูนย์กลางของทั้งประสบการณ์การเติบโตของมนุษย์และพัฒนาการรับรู้ และในงานเฉพาะที่ไม่ซ้ำกันซึ่งการพัฒนานี้ได้เตรียมเราไว้

การวิจัยการมองเห็นของคอมพิวเตอร์กำลังต่อสู้กับการท้าทายที่ยังคงดำเนินอยู่ในการได้คืนและรับรู้วัตถุและบุคคลที่ออกและกลับเข้าไปในเฟรม การเปลี่ยนแปลงมุมมอง POV ที่น่าหงุดหงิดมากกว่านี้ในวิดีโอแบบ egocentric อาจทำให้ความพยายามของ AI ในการประกอบเฟอร์นิเจอร์ยิ่งซับซ้อนขึ้น

 

* รูปแบบดั้งเดิมของผู้เขียน ถูกแก้ไขโดยฉันตามความจำเป็นเพื่อรักษาผลกระทบภายใต้การกำหนดรูปแบบคำพูด/

เผยแพร่ครั้งแรกวันจันทร์ที่ 25 พฤษภาคม 2026 แก้ไขวันพุธที่ 27 พฤษภาคม 2026 เพื่อแก้ไขการอ้างอิงวันที่นี้ (!)

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai