Anderson’un Açısı
Yapay Zeka, İnsanlardan Daha Kötü Şekilde Mobilya Montajında

ChatGPT ve Google Gemini hala güvenilir bir şekilde IKEA montaj videolarını anlamlandıramıyor, diğer birçok nổi bật AI sistemi parçaları karıştırıyor, bağlantıları kaçırıyor ve videonun kendisinden ne olduğu hakkında anlamak için neredeyse videoyu kullanmıyor.
İnsanların IKEA tarzı düz paket mobilya monte etmesinin zorluğu etrafındaki kalıcı kültürel mizah bilgisayar vizyonu araştırmaları için bir hedef haline geliyor – en azından uzun eylem dizileri, nesne takibi ve uzaysal akıl yürütme dahil olduğu için robotik manipülasyon sistemlerini alışık oldukları basitleştirilmiş şekillerden ve kontrol edilen ortamlardan çok daha uzağa götürecek.
Bu nedenle, düz paket mobilya için AI destekli robotik montaj rutinlerinin çalışması, literatürde küçük ama saygın bir dal haline geldi, USC’nin 2019 IKEA Mobilya Montaj Ortamı gibi çıkışlar, mobilya montajına yönelik ilk benchmark veri setleri ve araştırma bağlamlarından biri olarak ortaya çıktı:
Tıklayın ve oynatın Projeden örnekler, 2019 IKEA Mobilya Montaj Ortamı girişiminin web sitesinden. Kaynak
2024’te Stanford/J.P. Morgan işbirliği IKEA Talimatları İş başında ilk olarak bu apparently mundane (ancak souvent frustrant) prosedürü gerçekleştirmek için AI’nın yeteneğini önemli ölçüde araştıran, talimat videoları kullanılarak ve bir dizi resimden oluşan yeni bir veri seti kullanılarak:

Veri seti yöntemi ve ayrıntıları, 2024 IKEA Talimatları İş başında girişiminden. Kaynak
Makalenin yazarları – DGCNN, CNOS, SAM-6D, MegaPose, MiDaS, SAM2 Hiera-L, Cutie-base, ve GPT-4o – görevin ‘talimatlı montaj videolarını zemine indirme, parça segmentasyonlarını ve pozlarını çıkarma, yüksek seviyeli montaj planlarını oluşturma ve videolardaki ana montaj adımlarını tespit etme konularında önemli zorluklar içerdiğini’ sonucuna vardılar.
Balmumu Üzerine, Balmumu Dışına
Şüphesiz ki, bu görevi otomasyonla gerçekleştirmek güzel olurdu, ancak bu, bilimsel bir rehber veya Bilgisayar Vizyonu araştırma sektörünün öncelikli bir konusu değil.
Bu görevin değeri, AI sistemlerinin bu görevi gerçekleştirmek için öğrenmeleri gereken şeyin, onları daha ciddi ve zorlu görevler için hazırlayacağı gerçeğinde yatıyor – tarım, endüstri, hizmet sektörü ve diğer alanlarda.
Bu bağlamda, LEGO-Puzzles projesi ve veri seti Vision Language Modellerinin (VLM) çok adımlı uzaysal akıl yürütme yeteneklerini çeşitli mimarilerde nasıl işlediğini inceliyor, çünkü montaj görevleri yalnızca doğru nesneleri doğru anda birleştirmekle ilgili değil, aynı zamanda soyut talimatlara uymakla ilgili – bu, mating olarak bilinen bir süreç:

LEGO-Puzzles projesinden zorlu sorular. Kaynak
En son proje, mobilya montajı zorluğunu ele almak için daha güncel ve yetenekli AI modellerini kullanıyor – Google Gemini 2.5/3.1 ve OpenAI’nin GPT-5 – ancak yine de AI için görevde bir zafer elde edemiyor, yalnızca temel şansın üzerinde hafif iyileştirmeler ve “insan seviyesinin çok altında” performans gösteriyor.
Yazarlar şöyle diyor:
‘Deneyimlerimiz, son teknoloji LVLM’lerin ince uzaysal-zamansal akıl yürütmede önemli ölçüde mücadele ettiğini gösteriyor, bu da videolardan zaman bilgisi kullanımındaki sınırlamalarını, sınırlı takip yeteneklerini ve fiziksel temas gibi uzaysal etkileşimlerin anlaşılma konusundaki yetersizliklerini vurguluyor.’
Bu araştırmada ele alınan sorunlar, şu anda teorik olarak robotiğe bağlı değil, ancak teorik konular nihayet somut AI’ye dönüşünce ek zorluklar ortaya çıkabilir.
Yeni makale Flat-Pack Bench: Büyük Görüntü-Dil Modellerinde Uzaysal-Zamansal Anlama Değerlendirmesi için Mobilya Montajı olarak adlandırıldı ve Cornell Üniversitesi, Cornell Tech, MBZUAI ve UC Berkeley’den sekiz yazar tarafından yazıldı. Makale, proje sitesini de içeriyor.
Yöntem
Yeni çalışmanın yazarları, AI asistanlarının montaj sürecini gözlemleyerek anlamakta yaşadıkları zorluğu vurguluyor – örneğin, birçok insanın topluluk bilgisinden yararlanmak için başvurduğu YouTube tarzı talimat videoları gibi:

Flat-pack montaj görevinin ortaya çıkardığı bazı sorular ve dört temel beceri. Kaynak
Önceki çalışmalardan daha önce bahsedilen IKEA-Manuals-at-Work (IMaW) veri setini filtrelediler, bu veri seti IKEA mobilyasını monte eden insanların vahşi videolarını içeriyor. Revize edilen benchmark, orijinal videoları metin-only talimat kartlarını çıkarmak için kısalttı, ayrıca ayrı ana kare ve tam video varyantları sağladı ve ayrıca multiple-choice akıl yürütme görevlerini desteklemek için segmente mobilya parçaları ile elle işaretlenmiş görsel ipuçları ekledi.
Benchmark, dört soru türüne odaklanıyor: MATE, iki parçanın nihai montajda bağlı olup olmadığını belirleme; TRACK, modellere video itself kullanarak karıştırılmış parça kimliklerini geri yüklemelerini isteme; TOrd, modellere bağlantı olaylarının doğru sıralamasını çıkarabilme yeteneğini değerlendirme; ve TLoc, modellere görsel ipucunda gösterilen durumdan hemen önce veya sonra meydana gelen olayları belirleme yeteneğini test etme.

Yeni benchmark’tan örnekler, mobilya montajı videolarında uzaysal-zamansal akıl yürütme test etmek için tasarlanan dört temel görev türü: Zamansal Yerelleştirme; Zamansal Sıralama; İzleme; ve Eşleştirme.
Üstteki şema görüntüsünden türetilen şablonlar, bu dört soru modelinden oluşuyor.
Yazarlar ayrıca, her bir orijinal IMaW videosuna, hangi parçaların hangi diğer parçalara bağlı olduğunu belirten ince parça-montaj注释larını eklediler – bu, orijinal koleksiyonda eksik olan ayrıntılar.
Kaçınma
Makaleye göre, soruların elle küratörlüğü gerekiyordu, çünkü otomatik olarak oluşturulan sorular genellikle AI’ın videonun kendisine bakmak yerine kendi eğitilmiş anlayışına başvurmasına izin veriyordu – bu, herhangi bir LLM/VLM kullanıcısının tanıdığı bir senaryo, çünkü optimizasyon ve diğer gizemli kurumsal öncelikler genellikle sınır AI modellerinin sunulan bilgileri, chẳng hạn PDF’ler veya resimler, görmezden gelmelerine ve kendi anlayışlarına dayanmalarına neden oluyor*:
‘[Biz] sık sık otomatik olarak oluşturulan soruların, AI’ın videonun kendisine bakmak yerine kısayolları kullanarak cevaplayabileceğini gördük. Örneğin, otomatik olarak oluşturulan eşleştirme soruları, zaten bağlantı için konumlandırılmış parçalar hakkında veya açıkça farklı şekillerde veya renklerde distraktör seçenekleri içeren sorular hakkında.
‘Annotatörler, tam montaj videosu, segmente kareler için görsel ipuçları, soru şablonları ve görsel ipuçlarından statik ipuçlarını kullanarak kısayollardan kaçınmak için ayrıntılı rehberlik aldı.’
Tamamlanan benchmark, 50 farklı mobilya montaj videosu boyunca 602 multiple-choice sorusunu içeriyor.
Veri ve Testler
Test edilen modeller, yukarıda bahsedilen ChatGPT ve Gemini varyantlarını ve ayrıca Video-LLaVA; LLaVA-NeXT-Vid; LLaVA-OneVision; LLaVA-Video; Qwen 2.5/Qwen 3-VL; InternVL3; ArrowRL; PerceptionLM; ve Video-Refer içeriyordu.
GenS temel Gemini 2.5 Pro modeli için soru ile ilgili kareleri uzun videolarda seçmek için kullanıldı ve çoğu model tek atış bağlamında açgözlü decoding altında test edildi (GPT-5’te desteklenmedi).
Üç farklı uyandırma formatı benchmark için tasarlandı: karışık medya uyandırması, görsel ipucunu ayrı bir resim olarak montaj videosunun yanında sağladı; collage uyandırması, görsel ipucunu her video karesine ızgara düzeni olarak yerleştirdi; ve concat uyandırması, görsel ipuçlarını videosunun başına ekledi.
Hem kısaltılmış hem de ana kare video varyantları, bu formatlar boyunca test edildi, böylece uyandırma yapısı ve zamanlı sıkıştırmanın model performansı üzerinde nasıl etkili olabileceği ölçülebildi.
Testlerde dikkate alınan şans bazları, “sıklık şansı”nı da içeriyordu, burada en yaygın seçenek (gerçekten rastgele bir seçenek yerine) seçiliyordu.
İnsan Faktörü
İnsan performansı, bilgisayar bilimlerinden lisansüstü seviyeye kadar çeşitli katılımcılar kullanılarak değerlendirildi. Her katılımcı, bir montaj videosu, ilgili görsel ipucu ve multiple-choice soru ile görev talimatı gösterildi ve cevap seçti.
Her soru için üç cevap toplandı ve çoğunluk oylaması ile çözüldü, ayrıca benchmark’ın rastgele örnekleme alt kümesinde bir halka açık çalışma da yürütüldü.
Doğruluk denemeler için kullanılan metrikti:
| Model | Sıra | Micro Avg. | TOrd | TLoc | İzleme | Eşleştirme |
|---|---|---|---|---|---|---|
| İnsan Performansı | – | 94.18 | 93.54 | 93.20 | 93.77 | 97.70 |
| Şans Bazları | ||||||
| Rastgele Şans | – | 26.41 | 25.00 | 25.00 | 25.49 | 33.33 |
| Sıklık Şansı | – | 26.74 | 27.74 | 30.10 | 26.46 | 36.78 |
| Ticari Modeller | ||||||
| GPT-5 | 1 | 37.71 | 40.65 | 53.40 | 25.68 | 49.43 |
| Gemini 2.5 Pro | 2 | 33.72 | 40.65 | 44.66 | 23.35 | 39.08 |
| Gemini 3.1 Pro | 3 | 32.89 | 34.84 | 43.69 | 21.79 | 49.43 |
| Gemini 2.5 Flash | 4 | 31.06 | 31.61 | 41.75 | 23.35 | 40.23 |
| Gemini 2.5 Pro + GenS | 5 | 25.58 | 33.55 | 32.04 | 13.23 | 40.23 |
| Açık Modeller | ||||||
| Video-LLaVA-7B | 26 | 23.75 | 21.29 | 35.92 | 10.89 | 51.72 |
| InternVL3-14B | 5 | 37.71 | 42.58 | 21.36 | 37.74 | 48.28 |
| InternVL3-38B | 12 | 36.05 | 42.58 | 37.86 | 25.68 | 52.87 |
| InternVL3-78B | 1 | 41.03 | 43.87 | 39.81 | 42.02 | 34.48 |
| Qwen2.5-VL-7B | 22 | 30.23 | 27.10 | 18.45 | 33.07 | 41.38 |
| Qwen2.5-VL-32B | 13 | 35.88 | 34.84 | 29.13 | 33.07 | 54.02 |
| Qwen2.5-VL-72B | 2 | 40.37 | 41.29 | 30.10 | 45.14 | 36.78 |
| Qwen3-VL-4B | 11 | 36.54 | 34.19 | 33.01 | 32.68 | 56.32 |
| Qwen3-VL-4B-Think | 9 | 37.21 | 31.61 | 25.24 | 37.74 | 59.77 |
| Qwen3-VL-8B | 15 | 33.72 | 36.13 | 30.10 | 33.85 | 33.33 |
| Qwen3-VL-8B-Think | 17 | 31.73 | 34.19 | 33.01 | 25.29 | 44.83 |
| Qwen3-VL-32B | 6 | 37.71 | 38.71 | 46.60 | 31.91 | 42.53 |
| Qwen3-VL-32B-Think | 3 | 40.03 | 38.71 | 22.33 | 45.53 | 47.13 |
| Qwen3-VL-30B-A3B | 10 | 36.71 | 30.32 | 22.33 | 42.02 | 49.43 |
| Qwen3-VL-235B-A22B | 8 | 37.21 | 37.42 | 25.24 | 39.69 | 43.68 |
| LLaVA-NeXT-Vid-7B | 25 | 25.08 | 33.55 | 24.27 | 16.73 | 35.63 |
| LLaVA-NeXT-Vid-34B | 21 | 30.40 | 30.32 | 24.27 | 32.68 | 31.03 |
| LlaVA-OneVision-7B | 16 | 32.89 | 26.45 | 30.10 | 34.24 | 43.68 |
| LlaVA-OneVision-72B | 4 | 38.37 | 35.48 | 25.24 | 38.91 | 57.47 |
| LLaVA-Video-7B | 19 | 30.73 | 30.97 | 24.27 | 25.68 | 52.87 |
| LLaVA-Video-72B | 7 | 37.54 | 36.77 | 27.18 | 35.80 | 56.32 |
| Perception-LM-1B | 24 | 27.74 | 28.39 | 26.21 | 25.29 | 35.63 |
| Perception-LM-3B | 18 | 31.40 | 28.39 | 32.04 | 29.96 | 40.23 |
| Perception-LM-8B | 14 | 35.38 | 26.45 | 26.21 | 44.75 | 34.48 |
| VideoRefer | 23 | 28.57 | 32.90 | 30.10 | 17.51 | 51.72 |
| ArrowRL-7B | 20 | 30.56 | 30.97 | 24.27 | 29.18 | 41.38 |
FLAT-PACK BENCH’te performans sonuçları, ticari ve açık çoklu model modellerini karşılaştırıyor, Temporal Ordering (TOrd), Temporal Localization (TLoc), İzleme ve Eşleştirme görevleri için, tüm test edilen sistemlerin insan performansı gerisinde kaldığı görülüyor.
İlk testlerde (yukarıdaki resim), insanlar tüm soru kategorilerinde %90’ın üzerinde puan aldı, %80 birlik içinde, makaleye göre, bu önermelerin iyi tasarlandığını ve açık olduğunu gösteriyor.
GPT-5 ve Gemini 2.5/3.1 Pro, veri setinde mücadele etti, yalnızca şansa göre hafif iyileştirmeler elde etti ve insan performansının çok altında kaldı. GenS’i kullanarak Gemini 2.5 Pro’nun soru ile ilgili karelerini seçmesi, sonuçlarını iyileştirmedi, yazarları, ticari LVLM’lerin görevin gerektirdiği uzaysal-zamansal anlama ile mücadele ettiğine ikna etti.
Açık sistemler arasında, en güçlü sonuçlar InternVL3 ve Qwen ailelerinden geldi, ancak kategori genelinde performans önemli ölçüde değişti; bazı modeller yalnızca şansa biraz üstün performans gösterdi ve PerceptionLM ve VideoRefer gibi uzman sistemler de benchmark’un karmaşık montaj görevlerinde mücadele etti; tüm model kategorilerinde insan katılımcılar önemli ölçüde önde kaldı.
Araştırmacılar ayrıca makalenin standardı uyandırma kurulumuna karşı iki zincir-düşünce uyandırma stratejilerini test etti. Sıfır-atış Zincir-Düşünce uyandırması, modellere cevaplarını adım adım açıklamalarını istedi, mentre Zincir-Düşünce ile Kendi İçinde Tutma beş aday cevap üretti ve sonra çoğunluk oylaması ile nihai cevabı seçti. Ancak, bu yaklaşımların hiçbiri, benchmark’un varsayılan uyandırma kurulumunda daha iyi sonuçlar elde edemedi.
Hile Kodu
Araştırmacılar, LVLM’lerin gerçekten montaj videolarından mı öğreniyor, yoksa yalnızca statik görsel ipuçlarını mu kullanıp, makul cevaplar çıkarıyor, Bunu test etmek için, videonun kendisinin hariç tutulduğu, yalnızca soru metni ve görsel ipuçlarının korunduğu bir benchmark sürümü oluşturdular.
İnsan performansı, bu koşullar altında %50’den fazla düşüş gösterdi, bu da görevlerin gerçekten zamansal montaj süreci anlayışını gerektirdiğini gösteriyor. Modeller, video girişinin olmaması durumunda çok daha az bozuldu, bazı görevlerde performansları aynı kaldı veya hatta iyileşti.
Bu, makaleye göre, birçok LVLM’nin hiçbir zaman gerçekten zamansal bilgileri videolardan kullanmadığını, bunun yerine görsel ipuçlarından çıkarılan kısayolları ve genel anlama dayalı varsayımları kullanarak makul cevaplar çıkardığını gösteriyor*:

LVLM’nin yalnızca resim olan benchmark sürümünde performansı, video ve resim kurulumuna kıyasla, ayrıca parça kimliklerini karıştırarak zamanlı video anlama yerine etiket-sıra kısayollarını kullanıp kullanmadıklarını test etmek için.
‘[Yukarıdaki resim] bu resim-sadece sürümünde LVLM’nin performansı ve tam değerlendirmeden performanstaki değişimi gösterir, ayrıca insan performansı.
‘İnsan performansı (%50’den fazla) düşüşü, soruların gerçekten videoları gerektirdiğini gösterir.
‘Ayrıca, modelin genel performansı (%8.80) düşüşünü gözlemliyoruz, ancak bu principalmente İzleme alt-görevinden kaynaklanıyor. Diğer görevlerdeki doğruluk aynı kalıyor veya iyileşiyor, bu da LVLM’nin videodan etkili bir şekilde yararlanmadığını gösterirken, insanlar videodan yararlanıyor.’
Makalenin daha derin analizi, ana engelin yalnızca basit zamanlı sıralama olmadığını, nesne zemini ve uzaysal-zamansal akıl yürütme konusundaki başarısızlıkları gösteriyor: Modeller, görsel olarak benzer mobilya parçalarını hareket, kamera değişiklikleri ve sahne değişiklikleri boyunca takip etmekte zorlanıyor, hatta montaj sürecini genel olarak doğru bir şekilde tanımladıkları durumlarda bile.
Daha fazla deney, aracı bir AI’nın görevi gerçekleştirmesini içeriyordu ve bu, yazarlara göre “kötü performans” gösterdi – ancak diğer yaklaşımların kaçırdığı 11.48% daha fazla soruyu doğru cevaplayabildi.
SONUÇ
Kavramları ve nesneleri sürekli olarak içselleştirmek, hem insan deneyiminde büyüme ve algısal gelişme hem de bireysel, genellikle yeni görevler için bu gelişme tarafından hazırlanan görevler için merkezi bir öneme sahiptir.
Bilgisayar Vizyonu araştırmaları, already, karelerin dışında kalan ve yeniden giren nesneleri ve insanları yeniden kazanma ve yeniden tanıma konusunda süregelen bir mücadeleye sahiptir. Bu sorunlar, bir YouTube talimat videosunda olduğu gibi, görüş ve duruşun sürekli değiştiği durumlarda daha da büyür. Egocentric videolardaki daha da şaşırtıcı POV değişikliklerinin, AI’nin mobilya montajı girişimlerini nasıl daha da karıştırdığını hayal edebilirsiniz.
* Yazarların orijinal biçimlendirmesi, gerekli olduğunda quote-formatting altında etkisini koruması için bana göre değiştirildi.
İlk olarak 25 Mayıs 2026 Pazartesi günü yayınlandı. 27 Mayıs 2026 Çarşamba günü bu tarih atfını düzeltmek için değiştirildi (!).












