มุมมองของ Anderson
AI มีความสามารถต่ำกว่ามนุษย์อย่างมากในการประกอบเฟอร์นิเจอร์

ChatGPT และ Google Gemini ยังคงไม่สามารถเข้าใจวิดีโอประกอบเฟอร์นิเจอร์ IKEA ได้อย่างน่าเชื่อถือ โดยมีระบบ AI อื่นๆ ที่มีชื่อเสียงหลายระบบสับสนกับชิ้นส่วน ละเว้นการเชื่อมต่อ และแทบจะไม่ใช้วิดีโอเพื่อทำความเข้าใจสิ่งที่เกิดขึ้น
มีมีมวัฒนธรรมที่ยั่งยืนเกี่ยวกับความยากในการประกอบเฟอร์นิเจอร์ IKEA สไตล์แฟลตแพ็ค ทำให้หัวข้อนี้เป็นเป้าหมายที่น่าสนใจสำหรับการวิจัยด้านการมองเห็นของคอมพิวเตอร์ — ไม่ต้องสงสัยเลยว่าเนื่องจากลำดับเหตุการณ์ที่ยาวนาน การติดตามวัตถุ และการให้เหตุผลด้านพื้นที่ที่เกี่ยวข้องจะทำให้ระบบการควบคุมหุ่นยนต์ไปไกลเกินรูปร่างที่เรียบง่ายและสภาพแวดล้อมที่ควบคุมซึ่งพวกมันคุ้นเคย
ดังนั้นการทำงานเกี่ยวกับขั้นตอนการประกอบเฟอร์นิเจอร์แฟลตแพ็คที่ใช้ AI จึงกลายเป็นสาขาย่อยที่น่านับถือในวรรณกรรม โดยมีการออกตัวเช่น สภาพแวดล้อมการประกอบเฟอร์นิเจอร์ IKEA ของ USC ในปี 2019 ซึ่งเป็นหนึ่งในชุดข้อมูลและบริบทการวิจัยที่มุ่งหมายเพื่อการประกอบเฟอร์นิเจอร์เป็นหลัก:
คลิกเพื่อเล่น ตัวอย่างการฝึกอบรมการประกอบหุ่นยนต์ จากเว็บไซต์โครงการสำหรับโครงการสภาพแวดล้อมการประกอบเฟอร์นิเจอร์ IKEA ในปี 2019 แหล่งที่มา
ในปี 2024 การร่วมมือระหว่าง Stanford และ J.P. Morgan ที่เรียกว่า คู่มือ IKEA ที่ทำงาน เป็นครั้งแรกที่สำรวจความสามารถของ AI ในการดำเนินการนี้ ซึ่งดูเหมือนจะเป็นกระบวนการที่น่าเบื่อ (แต่บ่อยครั้งที่น่าหงุดหงิด) โดยอาศัยชุดข้อมูลใหม่ของภาพจากคู่มือคำแนะนำ และใช้วิดีโอคำแนะนำ:

วิธีการและรายละเอียดจากโครงการ IKEA Manuals at Work ในปี 2024 แหล่งที่มา
ผู้เขียนของเอกสารปี 2024 — ซึ่งใช้ DGCNN, CNOS, SAM-6D, MegaPose, MiDaS, SAM2 Hiera-L, Cutie-base, และ GPT-4o — สรุปว่างานนี้ให้ผล ‘ความท้าทายที่สำคัญในการยึดวิดีโอประกอบคำแนะนำ รวมถึงการแยกส่วนและท่าทางของชิ้นส่วน การสร้างแผนการประกอบระดับสูง และการตรวจจับขั้นตอนการประกอบที่สำคัญในวิดีโอ’
วอกซ์ ออน วอกซ์ ออฟ
ต้องชัดเจนว่าการทำให้ AI อัตโนมัติออกจากงานที่ไม่ค่อยมีใครชื่นชมจะดี แต่ไม่ใช่ดาวนำทางทางวิทยาศาสตร์ หรือสูงในรายการลำดับความสำคัญของภาคการวิจัยการมองเห็นของคอมพิวเตอร์
คุณค่าของงานนี้อยู่ที่ความจริงที่ว่าสิ่งที่ระบบ AI ต้องเรียนรู้ เพื่อให้เชี่ยวชาญในเรื่องนี้ จะทำให้พวกมันพร้อมสำหรับงานที่ร้ายแรงกว่าซึ่งเท่าเทียมกันหรือท้าทายมากกว่าในเกษตรกรรม อุตสาหกรรม ภาคบริการ และสาขาอื่นๆ
ในลักษณะนี้ โครงการ LEGO-Puzzles และชุดข้อมูล ตรวจสอบว่าโมเดลภาษา-ภาพ (VLMs) จัดการเหตุผลเชิงพื้นที่หลายขั้นตอนได้ดีเพียงใด โดยพิจารณาจากสถาปัตยกรรมต่างๆ เนื่องจากระบบการประกอบขึ้นอยู่ไม่เพียงแต่การคู่ชิ้นส่วนที่ถูกต้องในขณะที่ถูกต้อง — กระบวนการที่เรียกว่า การคู่ — แต่ยังต้องปฏิบัติตามคำแนะนำที่อาจเป็นนามธรรมมากกว่าฉากภาพที่มองเห็นได้สำหรับโมเดลในแต่ละขั้นตอน:

คำถามที่ท้าทายจากโครงการ LEGO-Puzzles แหล่งที่มา
โครงการล่าสุดที่พยายามท้าทายการประกอบเฟอร์นิเจอร์ใช้โมเดล AI ที่ทันสมัยและสามารถใช้ได้มากกว่า รวมถึง Google Gemini 2.5/3.1 และ OpenAI’s GPT-5 — แต่ยังคงไม่สามารถทำได้ดีกว่า AI ในงาน โดยมีการปรับปรุงที่ดีเพียงเล็กน้อยเหนือโอกาส และประสิทธิภาพ ‘ต่ำกว่าระดับมนุษย์’
ผู้เขียนระบุว่า:
‘การทดลองของเราพบว่าโมเดล LVLM ที่มีประสิทธิภาพสูงสุดต้องดิ้นรนกับการให้เหตุผลเชิงพื้นที่-เวลาอย่างละเอียด โดยเน้นถึงข้อจำกัดในการใช้ข้อมูลทางกาลเวลาจากวิดีโออย่างมีประสิทธิภาพ ความสามารถในการติดตามที่จำกัด และความเข้าใจเกี่ยวกับการโต้ตอบทางกายภาพ เช่น การสัมผัสกันทางกายภาพ’
ปัญหาที่กำลังแก้ไขในแนวทางนี้ของการวิจัยมีความเกี่ยวข้องทางทฤษฎีกับหุ่นยนต์เชิงปฏิบัติเพียงเล็กน้อยในขณะนี้ แม้ว่าจะมีการท้าทายเพิ่มเติมเมื่อประเด็นทางทฤษฎีกลายเป็น AI ที่มีรูปร่างในอนาคต
เอกสารใหม่ชื่อ Flat-Pack Bench: การประเมินความเข้าใจเชิงพื้นที่-เวลาในโมเดลภาษา-ภาพขนาดใหญ่ผ่านการประกอบเฟอร์นิเจอร์ มาจากผู้เขียนแปดคนจาก Cornell University, Cornell Tech, MBZUAI และ UC Berkeley เอกสารนี้มาพร้อมกับ เว็บไซต์โครงการ
วิธีการ
ผู้เขียนของงานใหม่นี้เน้นย้ำถึงความยากที่ AI ต้องเผชิญในการเข้าใจกระบวนการประกอบผ่านการสังเกต เช่น ผ่านวิดีโอคำแนะนำสไตล์ YouTube ที่ผู้คนจำนวนมากหันไปใช้เพื่อประโยชน์จากความรู้ของชุมชน:

คำถามบางส่วนที่งานประกอบเฟอร์นิเจอร์แฟลตแพ็คทำให้เกิดขึ้น พร้อมทั้งความสามารถที่จำเป็นสี่ประการในการเอาชนะความท้าทาย แหล่งที่มา
พวกเขาได้สร้างชุดข้อมูลที่กรองจากชุดข้อมูล IKEA-Manuals-at-Work (IMaW) ที่กล่าวถึงก่อนหน้านี้ ซึ่งมีวิดีโอด้านนอกของคนกำลังประกอบเฟอร์นิเจอร์ IKEA การบンチมาร์กใหม่จะลบการ์ดคำแนะนำเฉพาะข้อความออกจากวิดีโอเดิม โดยมีรูปแบบวิดีโอที่ตัดและเฟรมหลักแยกจากกัน และยังเพิ่มคำแนะนำภาพที่มีเครื่องหมายกำกับพาร์ทชิ้นส่วนเฟอร์นิเจอร์สำหรับงานให้เหตุผลแบบหลายตัวเลือก
การบンチมาร์กนี้มีศูนย์กลางอยู่ที่ประเภทคำถามสี่ประเภท: คู่ เพื่อกำหนดว่าชิ้นส่วนสองชิ้นเชื่อมต่อกันในเฟอร์นิเจอร์ที่ประกอบเสร็จแล้ว; ติดตาม ซึ่งจำเป็นต้องให้โมเดลฟื้นฟูการเชื่อมโยงที่ถูกต้องระหว่าง ID ชิ้นส่วนที่สับเปลี่ยนไปทั่วเฟรมที่มีเครื่องหมายกำกับโดยใช้วิดีโอ; TOdr เพื่อประเมินว่าโมเดลสามารถอนุมานลำดับการเชื่อมต่อที่ถูกต้องได้หรือไม่; และ TLoc เพื่อทดสอบว่าโมเดลสามารถระบุกิจกรรมที่เกิดขึ้นในทันทีก่อนหรือหลังสถานะที่แสดงในคำแนะนำภาพได้หรือไม่ ซึ่งต้องใช้การระบุตำแหน่งและให้เหตุผลเกี่ยวกับเหตุการณ์ที่อยู่ใกล้ๆ

ตัวอย่างจากการบัญชีใหม่ โดยแสดงประเภทงานหลักสี่ประเภทที่ออกแบบมาเพื่อทดสอบการให้เหตุผลเชิงพื้นที่-เวลาในวิดีโอประกอบเฟอร์นิเจอร์: การระบุตำแหน่งทางกาลเวลา; การเรียงลำดับทางกาลเวลา; การติดตาม; และการคู่ การทำงานแต่ละงานรวมวิดีโอประกอบกับคำแนะนำภาพที่มีเครื่องหมายกำกับหนึ่งหรือหลายรายการและคำถามให้เหตุผลแบบหลายตัวเลือก
แบบจำลองที่แสดงในภาพสคีมาบoven ถูกสร้างจากแบบจำลองคำถามสี่แบบนี้
ผู้เขียนยังระบุด้วยว่าพวกเขาได้เพิ่มการกำกับพาร์ทชิ้นส่วนประกอบที่ละเอียดลงในแต่ละวิดีโอ IMaW เดิม โดยระบุว่าชิ้นส่วนใดเชื่อมต่อกับชิ้นส่วนอื่น — รายละเอียดที่ไม่มีอยู่ในคอลเลกชันเดิม
การหลบหลีก
คำถามที่เอกสารระบุว่าต้องคัดเลือกด้วยมือ เนื่องจากคำถามที่สร้างอัตโนมัติ经常ให้โอกาส AI เพื่อเพิกเฉยต่อวิดีโอและอาศัยความเข้าใจที่ฝึกฝนมา — สถานการณ์ที่ผู้ใช้ LLM/VLM ทั่วไปอาจรู้จักดี เนื่องจากการเพิ่มประสิทธิภาพและลำดับความสำคัญขององค์กรอื่นๆ ทำให้โมเดลแนวหน้าเพิกเฉยต่อข้อมูลที่ส่งมา เช่น PDF หรือภาพ และอาศัยความเข้าใจของตนเองแทน*:
‘[เรา] พบว่าการสร้างอัตโนมัติสร้างคำถามที่สามารถตอบได้โดยการเพิกเฉยต่อวิดีโอและใช้ทางลัด ตัวอย่างเช่น คำถาม การคู่ ที่สร้างอัตโนมัติเกี่ยวกับชิ้นส่วนที่ถูกวางไว้สำหรับการเชื่อมต่อ หรือรวมตัวเลือกที่เบี่ยงเบนความสนใจที่มีรูปร่างหรือสีที่แตกต่างกันอย่างชัดเจน ทำให้สามารถกำจัดได้ง่าย [การกำจัด] เพื่อแก้ไขปัญหานี้ เราคัดเลือกคำถามด้วยมือโดยใช้แบบจำลองคำถามที่ตายตัว
‘ผู้กำกับได้รับวิดีโอประกอบที่สมบูรณ์ เฟรมที่มีเครื่องหมายกำกับสำหรับคำแนะนำภาพ แบบจำลองคำถาม และคำแนะนำที่ละเอียดสำหรับการหลีกเลี่ยงทางลัดตามสัญญาณคงที่จากคำแนะนำภาพ’
การบัญชีใหม่ประกอบด้วยคำถามแบบหลายตัวเลือก 602 คำถามใน 50 วิดีโอประกอบเฟอร์นิเจอร์ที่แตกต่างกัน
ข้อมูลและการทดสอบ
โมเดลที่ประเมินสำหรับการทดสอบรอบนี้รวมถึง ChatGPT และรุ่น Gemini ที่กล่าวถึงก่อนหน้านี้ เช่นเดียวกับ Video-LLaVA; LLaVA-NeXT-Vid; LLaVA-OneVision; LLaVA-Video; Qwen 2.5/Qwen 3-VL; InternVL3; ArrowRL; PerceptionLM; และ Video-Refer
GenS ถูกใช้เพื่อเลือกเฟรมที่เกี่ยวข้องกับคำถามในวิดีโอที่ยาวสำหรับโมเดล Gemini 2.5 Pro และโมเดลส่วนใหญ่ถูกทดสอบใน แบบหนึ่งวินาที ภายใต้ การถอดรหัสแบบ Greedy (ไม่รองรับใน GPT-5)
แบบคำถามสามแบบถูกสร้างขึ้นสำหรับการบัญชีใหม่: แบบคำถาม สื่อผสม ให้คำแนะนำภาพเป็นภาพแยกต่างหากข้างวิดีโอประกอบ; แบบคำถาม คอลลาژ ใส่คำแนะนำภาพไว้ตรงกลางวิดีโอแต่ละเฟรมเป็นส่วนหนึ่งของการวางแนวตาราง; และแบบคำถาม ต่อท้าย ใส่คำแนะนำภาพไว้ที่จุดเริ่มต้นของวิดีโอ
ทั้งรูปแบบวิดีโอที่ตัดและรูปแบบเฟรมหลักถูกทดสอบในแบบคำถามเหล่านี้ เพื่อวัดว่าโครงสร้างคำถามและความกดดันทางกาลเวลาอาจส่งผลต่อประสิทธิภาพของโมเดลอย่างไร
ความเป็นไปได้ของโอกาสที่พิจารณาในการทดสอบยังรวมถึง ‘โอกาสความถี่’ ซึ่งเลือกตัวเลือกที่พบบ่อยที่สุด (ไม่ใช่ตัวเลือกแบบสุ่ม) เป็นตัวเลือก
ปัจจัยมนุษย์
ประสิทธิภาพของมนุษย์ถูกประเมินโดยผู้เข้าร่วมที่มาจากโปรแกรมคอมพิวเตอร์ศาสตร์ ตั้งแต่ระดับอุดมศึกษาถึงระดับ 박사 ผู้เข้าร่วมแต่ละคนได้รับวิดีโอประกอบ คำแนะนำภาพ และคำถามแบบหลายตัวเลือกที่เกี่ยวข้อง เช่นเดียวกับคำแนะนำงาน ก่อนที่จะเลือกคำตอบ
มีการรวบรวมคำตอบสามคำตอบต่อคำถามและแก้ไขผ่านการลงคะแนนเสียงส่วนใหญ่ ในขณะที่การศึกษาที่ได้รับการสนับสนุนจากฝูงชนยังได้รับการดำเนินการในแบบสุ่มจากชุดการบัญชีใหม่
ความแม่นยำ ถูกใช้เป็นมาตราสำหรับการทดสอบ:
| โมเดล | อันดับ | ค่าเฉลี่ย Micro | TOrd | TLoc | ติดตาม | คู่ |
|---|---|---|---|---|---|---|
| ประสิทธิภาพของมนุษย์ | – | 94.18 | 93.54 | 93.20 | 93.77 | 97.70 |
| โอกาสพื้นฐาน | ||||||
| โอกาสสุ่ม | – | 26.41 | 25.00 | 25.00 | 25.49 | 33.33 |
| โอกาสความถี่ | – | 26.74 | 27.74 | 30.10 | 26.46 | 36.78 |
| โมเดลที่มีลิขสิทธิ์ | ||||||
| GPT-5 | 1 | 37.71 | 40.65 | 53.40 | 25.68 | 49.43 |
| Gemini 2.5 Pro | 2 | 33.72 | 40.65 | 44.66 | 23.35 | 39.08 |
| Gemini 3.1 Pro | 3 | 32.89 | 34.84 | 43.69 | 21.79 | 49.43 |
| Gemini 2.5 Flash | 4 | 31.06 | 31.61 | 41.75 | 23.35 | 40.23 |
| Gemini 2.5 Pro + GenS | 5 | 25.58 | 33.55 | 32.04 | 13.23 | 40.23 |
| โมเดลแบบเปิด | ||||||
| Video-LLaVA-7B | 26 | 23.75 | 21.29 | 35.92 | 10.89 | 51.72 |
| InternVL3-14B | 5 | 37.71 | 42.58 | 21.36 | 37.74 | 48.28 |
| InternVL3-38B | 12 | 36.05 | 42.58 | 37.86 | 25.68 | 52.87 |
| InternVL3-78B | 1 | 41.03 | 43.87 | 39.81 | 42.02 | 34.48 |
| Qwen2.5-VL-7B | 22 | 30.23 | 27.10 | 18.45 | 33.07 | 41.38 |
| Qwen2.5-VL-32B | 13 | 35.88 | 34.84 | 29.13 | 33.07 | 54.02 |
| Qwen2.5-VL-72B | 2 | 40.37 | 41.29 | 30.10 | 45.14 | 36.78 |
| Qwen3-VL-4B | 11 | 36.54 | 34.19 | 33.01 | 32.68 | 56.32 |
| Qwen3-VL-4B-Think | 9 | 37.21 | 31.61 | 25.24 | 37.74 | 59.77 |
| Qwen3-VL-8B | 15 | 33.72 | 36.13 | 30.10 | 33.85 | 33.33 |
| Qwen3-VL-8B-Think | 17 | 31.73 | 34.19 | 33.01 | 25.29 | 44.83 |
| Qwen3-VL-32B | 6 | 37.71 | 38.71 | 46.60 | 31.91 | 42.53 |
| Qwen3-VL-32B-Think | 3 | 40.03 | 38.71 | 22.33 | 45.53 | 47.13 |
| Qwen3-VL-30B-A3B | 10 | 36.71 | 30.32 | 22.33 | 42.02 | 49.43 |
| Qwen3-VL-235B-A22B | 8 | 37.21 | 37.42 | 25.24 | 39.69 | 43.68 |
| LLaVA-NeXT-Vid-7B | 25 | 25.08 | 33.55 | 24.27 | 16.73 | 35.63 |
| LLaVA-NeXT-Vid-34B | 21 | 30.40 | 30.32 | 24.27 | 32.68 | 31.03 |
| LlaVA-OneVision-7B | 16 | 32.89 | 26.45 | 30.10 | 34.24 | 43.68 |
| LlaVA-OneVision-72B | 4 | 38.37 | 35.48 | 25.24 | 38.91 | 57.47 |
| LLaVA-Video-7B | 19 | 30.73 | 30.97 | 24.27 | 25.68 | 52.87 |
| LLaVA-Video-72B | 7 | 37.54 | 36.77 | 27.18 | 35.80 | 56.32 |
| Perception-LM-1B | 24 | 27.74 | 28.39 | 26.21 | 25.29 | 35.63 |
| Perception-LM-3B | 18 | 31.40 | 28.39 | 32.04 | 29.96 | 40.23 |
| Perception-LM-8B | 14 | 35.38 | 26.45 | 26.21 | 44.75 | 34.48 |
| VideoRefer | 23 | 28.57 | 32.90 | 30.10 | 17.51 | 51.72 |
| ArrowRL-7B | 20 | 30.56 | 30.97 | 24.27 | 29.18 | 41.38 |
ผลลัพธ์ประสิทธิภาพบน FLAT-PACK BENCH โดยเปรียบเทียบโมเดลหลายรูปแบบที่มีลิขสิทธิ์และแบบเปิดทั่ว TOrd, TLoc, ติดตาม และการคู่ โดยประสิทธิภาพของมนุษย์ยังคงอยู่ห่างจากทุกระบบที่ทดสอบ แม้จะมีการปรับปรุงที่ดีในโมเดลแนวหน้าที่ใหญ่กว่า
ตามการทดสอบเบื้องต้น (ภาพด้านบน) มนุษย์ทำคะแนนได้มากกว่า 90% ในทุกหมวดคำถาม โดยมีความเห็นพ้องกัน 80% ซึ่งยืนยันว่าคำถามถูกกำหนดไว้อย่างชัดเจนและไม่มีข้อขัดแย้ง
GPT-5 และ Gemini 2.5/3.1 Pro ต้องดิ้นรนบนชุดข้อมูลนี้ โดยทำได้เพียงเล็กน้อยเหนือโอกาสพื้นฐาน และยังคงอยู่ห่างจากประสิทธิภาพของมนุษย์
ในหมวดแบบเปิด ผลลัพธ์ที่ดีที่สุดมาจากตระกูล InternVL และ Qwen แม้ว่าประสิทธิภาพจะแตกต่างกันอย่างมากในหมวด และโมเดลหลายตัวเพียงเล็กน้อยที่ทำได้ดีกว่าโอกาส ในขณะที่ระบบเฉพาะ เช่น PerceptionLM และ VideoRefer ก็ยังต้องดิ้นรนบนการบัญชีใหม่ของงานประกอบที่ซับซ้อน และผู้เข้าร่วมมนุษย์ยังคงอยู่ห่างจากทุกระบบในแต่ละหมวด
นักวิจัยยังทดสอบยุทธวิธีการกระตุ้น เชน-ออฟ-ทอท สองแบบต่อการตั้งค่าคำถามมาตรฐานของเอกสาร เชน-ออฟ-ทอทแบบไม่มีตัวอย่าง ขอให้โมเดลอธิบายคำตอบของตนอย่างเป็นขั้นตอน ในขณะที่ การรักษาความสอดคล้องด้วยเชน-ออฟ-ทอท สร้างคำตอบที่เป็นไปได้ห้าแบบก่อนที่จะเลือกคำตอบสุดท้ายผ่านการลงคะแนนเสียงส่วนใหญ่ อย่างไรก็ตาม ทั้งสองแนวทางไม่ได้ปรับปรุงผลลัพธ์บนชุดข้อมูล Flat Pack Bench
โค้ดชีท
เพื่อทดสอบว่า LVLMs จริงๆ แล้วเรียนรู้จากวิดีโอประกอบหรือไม่ หรือเพียงแค่เอาชนะสัญญาณภาพคงที่ ผู้วิจัยได้สร้างเวอร์ชันภาพเท่านั้นของการบัญชีใหม่ ซึ่งไม่มีวิดีโอ โดยเหลือไว้เพียงข้อความคำถามและคำแนะนำภาพ
ประสิทธิภาพของมนุษย์ลดลงมากกว่า 50% ในเงื่อนไขเหล่านี้ โดยแสดงให้เห็นว่างานเหล่านี้ต้องใช้ความเข้าใจเชิงกาลเวลาในการประกอบจริงๆ
ในทางกลับกัน โมเดลเหล่านี้เสื่อมลงไม่มากนัก โดยมีบางงานที่ยังคงเสถียรหรือแม้กระทั่งดีขึ้นโดยไม่มีวิดีโอเข้ามาเกี่ยวข้อง
สิ่งนี้ชี้ให้เห็นว่าเอกสารแนะนำว่าโมเดล LVLM หลายตัวไม่ได้ใช้ข้อมูลทางกาลเวลาในวิดีโอ เลย แต่ขึ้นอยู่กับทางลัดภาพและสมมติฐานทั่วไปเพื่ออนุมานคำตอบที่เป็นไปได้*:

ประสิทธิภาพของ LVLM บนเวอร์ชันภาพเท่านั้นของ Flat-Pack Bench เมื่อเปรียบเทียบกับการตั้งค่ามาตรฐานวิดีโอและภาพ โดยมีผลลัพธ์เพิ่มเติมหลังการสลับ ID ของชิ้นส่วนเพื่อทดสอบว่าโมเดลใช้ทางลัดของลำดับป้ายกำกับแทนความเข้าใจวิดีโอทางกาลเวลา
‘[ภาพด้านบน] แสดงประสิทธิภาพของ LVLM ในเวอร์ชันภาพเท่านี้ และการเปลี่ยนแปลงในประสิทธิภาพของพวกมันจากการประเมินเบื้องต้น พร้อมทั้งประสิทธิภาพของมนุษย์’
‘การลดลงอย่างรุนแรงของประสิทธิภาพของมนุษย์ (>50%) แสดงให้เห็นว่าคำถามเหล่านี้ต้องใช้วิดีโอเพื่อตอบ’
‘เรายังพบด้วยว่าประสิทธิภาพโดยรวมของโมเดลลดลงอย่างรุนแรง (8.80%) แต่ส่วนใหญ่เนื่องมาจากงานย่อย TRACK ความแม่นยำในงานอื่นๆ ยังคงเท่าเดิมหรือดีขึ้น ซึ่งบ่งชี้ว่า LVLM ไม่ใช้วิดีโออย่างมีประสิทธิภาพ ในขณะที่มนุษย์ใช้วิดีโอเพื่อตอบ’
การวิเคราะห์ที่ลึกกว่าของเอกสารชี้ให้เห็นว่าความท้าทายหลักไม่ใช่แค่การเรียงลำดับทางกาลเวลาเท่านั้น แต่ยังรวมถึงความล้มเหลวในการยึดวัตถุและให้เหตุผลเชิงพื้นที่-เวลา: โมเดลมักจะดิ้นรนในการติดตามชิ้นส่วนเฟอร์นิเจอร์ที่คล้ายกันทางภาพผ่านการเคลื่อนไหว การเปลี่ยนกล้อง และการเปลี่ยนแปลงฉาก แม้ว่าจะดูเหมือนว่าระบุกระบวนการประกอบโดยรวมได้อย่างถูกต้อง
สรุป
การรักษาความเข้าใจที่ยั่งยืนของแนวคิดและวัตถุเป็นศูนย์กลางของทั้งประสบการณ์การเติบโตของมนุษย์และพัฒนาการรับรู้ และในงานเฉพาะที่ไม่ซ้ำกันซึ่งการพัฒนานี้ได้เตรียมเราไว้
การวิจัยการมองเห็นของคอมพิวเตอร์กำลังต่อสู้กับการท้าทายที่ยังคงดำเนินอยู่ในการได้คืนและรับรู้วัตถุและบุคคลที่ออกและกลับเข้าไปในเฟรม การเปลี่ยนแปลงมุมมอง POV ที่น่าหงุดหงิดมากกว่านี้ในวิดีโอแบบ egocentric อาจทำให้ความพยายามของ AI ในการประกอบเฟอร์นิเจอร์ยิ่งซับซ้อนขึ้น
* รูปแบบดั้งเดิมของผู้เขียน ถูกแก้ไขโดยฉันตามความจำเป็นเพื่อรักษาผลกระทบภายใต้การกำหนดรูปแบบคำพูด/
เผยแพร่ครั้งแรกวันจันทร์ที่ 25 พฤษภาคม 2026 แก้ไขวันพุธที่ 27 พฤษภาคม 2026 เพื่อแก้ไขการอ้างอิงวันที่นี้ (!)












