Sudut Anderson

AI yang Menggunakan Citra dalam Penalaran Chain-of-Thought (CoT)

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google
Derived from René Magritte, La condition humaine (The Human Condition), 1933. © Photothèque R. Magritte / ADAGP / DACS Images. Collection: National Gallery of Art, Washington. Extended laterally by GPT Image 2.

Kita sering berpikir dalam gambar — setidaknya sebagian besar dari kita: pada manusia, berkurangnya kemampuan untuk berimajinasi secara visual telah ditunjukkan oleh penelitian berkaitan dengan prestasi akademik yang lebih rendah. Dalam hal menghafal — kebutuhan kita untuk mengingat sesuatu, bukan momok dalam AI — kekuatan semantik yang besar dari citra yang kuat atau jelas telah digunakan selama ribuan tahun sebagai alat bantu belajar:

“Temple of Time” karya Emma Willard (1846), sebuah visualisasi pendidikan yang mengubah kronologi menjadi ruang fisik dengan menata periode dan tokoh sejarah dalam perspektif arsitektur yang menjauh. Willard merancang gambar semacam itu sebagai alat bantu ingatan visual, karena percaya bahwa representasi grafis dapat membantu siswa membentuk gambaran mental sejarah yang koheren. Sumber - https://publicdomainreview.org/essay/emma-willard-maps-of-time/

“Temple of Time” karya Emma Willard (1846), sebuah visualisasi pendidikan yang mengubah kronologi menjadi ruang fisik dengan menata periode dan tokoh sejarah dalam perspektif arsitektur yang menjauh. Willard merancang gambar semacam itu sebagai alat bantu ingatan visual, karena percaya bahwa representasi grafis dapat membantu siswa membentuk gambaran mental sejarah yang koheren. Sumber

Namun, bidang mnemonik berkaitan dengan penyerapan data, bukan pemrosesan atau penafsirannya, yang menunjukkan perbedaan besar di antara manusia dalam “gaya” berpikir yang mereka gunakan.

Secara pribadi, saya berpikir dalam bentuk, dan telah melakukannya sejak saya mulai berpikir — dengan dekade, tahun, gagasan, dan orang direpresentasikan dalam suatu cara melalui geometri relatif serta blok volume yang dinamis. Sebagian orang terutama berpikir dalam angka; yang lain berpikir dalam bau atau rasa.

Untuk AI, rentang metode sinestesia yang mungkin lebih terbatas. Secara alami, Model Bahasa Besar (LLM) dapat berpikir dalam teks, karena inilah jenis pengodean aslinya, di atas tingkat embedding; dan LLM telah terbukti mengodekan angka sebagai konsep, bukan sekadar nilai variabel, yang menunjukkan kecenderungan untuk “berpikir dalam angka”.

Namun, sejauh mana LLM dapat dikatakan “berpikir dalam bentuk” atau “berpikir dalam gambar” seperti yang cenderung dilakukan manusia?

Fakta bahwa seseorang mendapat respons berbeda dari LLM untuk pertanyaan yang sama dalam bahasa berbeda menunjukkan bahwa hubungan tersebut dapat sangat spesifik dan rapuh, serta dikodekan secara kaku pada teks tertentu dalam suatu ranah bahasa (misalnya, “bahasa Spanyol”), alih-alih merujuk pada ranah tingkat tinggi yang melampaui tetapi sekaligus mencakup bahasa*.

Karena itu, LLM multimodal — yaitu Model Bahasa-Visual atau VLM — yang dapat menghasilkan gambar semata-mata untuk Chain of Thought internalnya sendiri (COT) secara logis mungkin memiliki keunggulan, atau setidaknya sudut pandang alternatif secara harfiah.

Sudut Pandang Baru

Dengan gagasan tersebut, sebuah kolaborasi penelitian baru-baru ini dari Jerman mengajukan VLM yang berfokus pada gambar bernama ReImaGin, yang memanfaatkan pembuatan gambar sebagai mekanisme penalaran yang lentur.

Meskipun penelitian terdahulu telah “menempelkan” komponen berbasis gambar, fasilitas itu tidak bersifat intrinsik maupun penting bagi alur kerja inti. Sebaliknya, sistem baru para peneliti dirancang untuk memanfaatkan kemampuan VLM yang sangat baru guna mengambil alih fungsi alat khusus dan metode, seperti persepsi kedalaman.

Dalam contoh di bawah dari makalah baru yang berjudul Reasoning with Image Generation, AI harus menafsirkan dua sudut pandang — gambar paling kiri — yang masing-masing tidak memuat seluruh informasi yang diperlukan untuk menyelesaikan tugas. Karena itu, model dapat menggunakan informasi yang dimilikinya untuk menafsirkan gambaran pemandangan yang lebih luas dan lengkap — peta dengan subjudul “Generated Visualization”, gambar ketiga dari kiri di bawah.

Contoh dari makalah baru ketika ReImaGin menghasilkan peta tampak atas dari dua sudut pandang yang tidak lengkap, sehingga memberi model representasi visual terpadu untuk digunakan dalam penalaran. Sumber - https://arxiv.org/pdf/2609.16409

Contoh dari makalah baru ketika ReImaGin menghasilkan peta tampak atas dari dua sudut pandang yang tidak lengkap, sehingga memberi model representasi visual terpadu untuk digunakan dalam penalaran. Sumber

ReImaGin tidak terikat pada satu jenis transformasi visual tertentu. Sistem ini dapat melengkapi bagian teka-teki yang hilang, menghapus halangan untuk penghitungan, menggambar lintasan untuk prediksi tabrakan, menggabungkan beberapa sudut pandang menjadi peta spasial, mengubah jalur putus-putus menjadi garis utuh untuk ditelusuri, dan menghasilkan peta kedalaman untuk penalaran kedalaman.

Yang lebih penting, sistem dapat mengatur sendiri penggunaan perangkat internal tersebut, sejalan dengan kemampuan baru VLM untuk secara otomatis menangani tantangan tertentu dengan alat yang sesuai, seperti estimasi kedalaman. Sebagian besar fungsi ReImaGin yang dijelaskan dipanggil melalui alat generate_image, sebuah fungsi yang dapat melakukan intervensi visual sesuai kebutuhan, tanpa pengawasan atau perintah manusia.

Para penulis menyatakan:

“Karena generate_image menerima instruksi bahasa alami apa pun, agen dapat melakukan sangat banyak transformasi; pertanyaannya adalah transformasi mana yang benar-benar membantu untuk tugas tertentu.

“Praktik [standar] adalah menentukan transformasi melalui contoh dalam konteks yang dibuat secara manual dan menunjukkan strategi yang diinginkan (misalnya, menghasilkan peta kedalaman untuk penalaran kedalaman). Hal ini membutuhkan upaya manual untuk setiap tugas dan membatasi generalisasi ke tugas baru.”

“[Kami] bertanya apakah strategi semacam itu dapat ditemukan secara otomatis. Karena strategi disampaikan kepada agen melalui prompt, menemukan strategi dapat direduksi menjadi pengoptimalan prompt: kami menerapkan sebuah putaran iteratif ketika model pengusul menghasilkan kandidat prompt, mengevaluasinya pada sekumpulan kecil data pengembangan, lalu menyempurnakannya berdasarkan keberhasilan dan kegagalan yang diamati.”

Ketika diuji pada tiga VLM dan enam tugas penalaran visual, ReImaGin secara umum mengungguli penalaran tanpa bantuan maupun alat visual khusus, hanya dengan menggunakan satu alat.

Pendekatan

ReImaGin bekerja sebagai sebuah putaran: pada setiap langkah, VLM mempertimbangkan pertanyaan, gambar asli, dan segala sesuatu yang sudah dihasilkannya, lalu memutuskan tindakan berikutnya. Tindakan itu dapat mencakup operasi gambar biasa, seperti memotong atau menumpuk gambar, atau memanggil generate_image, yang membuat gambar baru secara khusus agar masalah lebih mudah dianalisis:

Ilustrasi langkah demi langkah tentang cara ReImaGin menalar masalah spasial dan teka-teki visual. Dalam kedua contoh, model menghasilkan gambar baru selama penalaran, lalu memakai gambar itu sebagai masukan tambahan untuk langkah berikutnya menuju jawaban.

Ilustrasi langkah demi langkah tentang cara ReImaGin menalar masalah spasial dan teka-teki visual. Dalam kedua contoh, model menghasilkan gambar baru selama penalaran, lalu memakai gambar itu sebagai masukan tambahan untuk langkah berikutnya menuju jawaban.

Gambar yang dihasilkan kemudian diberikan kembali kepada VLM dan menjadi bagian dari materi yang tersedia untuk langkah penalaran berikutnya, sehingga proses dapat diulang. Pada gambar di atas, kita dapat melihat aspek-aspek ini untuk tugas spasial: model terlebih dahulu menggabungkan dua foto menjadi satu sudut pandang, lalu mengubah hasilnya menjadi peta tampak atas sebelum menjawab pertanyaan.

Untuk tugas teka-teki, model menghasilkan versi teka-teki yang telah diubah guna mengisolasi bagian yang hilang, kemudian menggunakan pengurangan gambar konvensional untuk menentukan jawabannya.

Dengan demikian, pembuatan gambar menjadi bagian dari proses penalaran itu sendiri, bukan produk akhir bagi pengguna. Gambar-gambar perantara tersebut memang dimaksudkan semata-mata untuk proses COT AI, bukan untuk dilihat langsung oleh pengguna akhir.

Pada setiap giliran, VLM memilih sendiri tindakan berikutnya berdasarkan konteks yang terkumpul hingga saat itu. Tindakan ini dapat berupa langkah penalaran lain, operasi gambar konvensional, atau instruksi bahasa alami untuk generate_image. Apa pun yang dikembalikan oleh alat pilihan itu ditambahkan ke konteks, sehingga model dapat memeriksa hasilnya dan memutuskan apakah akan mengubahnya lagi, memakai alat lain, atau melanjutkan ke jawaban akhir.

Memperoleh Agensi

Masalah utama adalah menentukan jenis gambar yang benar-benar akan mempermudah tugas tertentu. ReImaGin menentukannya dengan mencoba berbagai instruksi kepada agen, menguji kandidat prompt pada contoh dengan jawaban yang telah diketahui, serta menggunakan upaya yang berhasil dan gagal untuk memperoleh prompt yang lebih baik. Iterasi lebih lanjut dari putaran ini akhirnya menghasilkan strategi dengan kinerja terbaik.

Model penalaran dan generator gambar itu sendiri tidak dilatih ulang selama proses ini; hanya instruksi yang mengatur cara agen menggunakan alatnya yang dioptimalkan. Karena itu, para peneliti menyebut proses tersebut sebagai “penemuan otomatis” strategi penalaran visual, tanpa mereka sendiri memberikan strategi khusus tugas atau contoh penalaran.

Konfigurasi dan Pengujian

ReImaGin dievaluasi pada enam tugas penalaran visual: penalaran kedalaman (Blink — menentukan mana dari dua titik yang lebih dekat dengan kamera); penyelesaian teka-teki (Mira — memilih bagian yang benar untuk daerah gambar yang hilang); penghitungan dengan oklusi (CAPTURe — menghitung objek, termasuk yang tersembunyi); prediksi tabrakan (Spatial457 — memprediksi objek mana yang akan ditabrak oleh target bergerak); penalaran spasial (MMSI — menentukan hubungan antarobjek dari sudut pandang berbeda); dan penelusuran jalur — tolok ukur baru yang mengharuskan model mengikuti garis putus-putus yang menghubungkan angka dengan huruf.

Dari makalah 'MIRA, a Benchmark for Visual Chain-of-Thought', contoh-contoh mencolok dari citra visual dalam proses chain-of-thought. Sumber - https://arxiv.org/pdf/2511.02779

Dari makalah “MIRA, a Benchmark for Visual Chain-of-Thought”, contoh-contoh mencolok dari citra visual dalam proses chain-of-thought. Sumber

Tulang punggung VLM yang diuji adalah Gemini-3.1-Pro, GPT-5, dan model berbobot terbuka Qwen-3.5-27B. Pembuatan gambar terutama ditangani oleh Nano-Banana-Pro, sedangkan model berbobot terbuka FLUX.2 [dev] dan Qwen-Image-Edit-2511 juga diuji. Gemini-3.1-Pro digunakan sebagai pemilih untuk penskalaan waktu pengujian dalam pembuatan gambar.

Dari dua baseline yang digunakan sebagai pembanding, VLM “vanilla” yang disebut “No Tools” oleh para penulis makalah menjawab langsung dari kueri dan gambar, tanpa alat atau eksekusi kode. Sementara itu, sistem Visual Sketchpad dari tahun 2024 menawarkan seperangkat tetap alat visi dan manipulasi gambar khusus dalam pengujian ini, tetapi tanpa pembuatan gambar terbuka.

Untuk tugas spasial MMSI, kedua baseline diberi daya komputasi yang sebanding dengan ReImaGin, dengan menghasilkan 20 jawaban dari setiap baseline dan menggunakan jawaban yang paling sering muncul.

Kinerja diukur melalui akurasi pilihan ganda untuk semua tugas, kecuali penghitungan dengan oklusi, yang dinilai memakai symmetric mean absolute percentage error dengan membandingkan jumlah objek yang diprediksi dan jumlah sebenarnya. Hasil dirata-ratakan dari tiga kali pengujian, dan standard error juga dilaporkan.

Hasil pengujian yang membandingkan ReImaGin dengan No Tools dan Visual Sketchpad pada tiga VLM dan enam tugas penalaran visual. Skor lebih tinggi berarti lebih baik, kecuali untuk Penghitungan dengan Oklusi, ketika kesalahan yang lebih rendah berarti lebih baik. ReImaGin memperoleh hasil terbaik pada sebagian besar kombinasi model dan tugas.

Hasil pengujian yang membandingkan ReImaGin dengan No Tools dan Visual Sketchpad pada tiga VLM dan enam tugas penalaran visual. Skor lebih tinggi berarti lebih baik, kecuali untuk Penghitungan dengan Oklusi, ketika kesalahan yang lebih rendah berarti lebih baik. ReImaGin memperoleh hasil terbaik pada sebagian besar kombinasi model dan tugas.

Contoh strategi yang sama dan ditentukan oleh manusia digunakan pada ketiga model. ReImaGin menghasilkan kinerja lebih baik daripada kedua baseline untuk sebagian besar tugas, dengan peningkatan yang sangat jelas pada penyelesaian teka-teki, penghitungan dengan oklusi, dan penelusuran jalur.

Dengan GPT-5, misalnya, akurasi teka-teki meningkat dari 29,5% dengan No Tools dan 16,7% dengan Visual Sketchpad menjadi 44,9% dengan ReImaGin. Uji ablasi menegaskan bahwa komponen pembuatan gambar sangat penting bagi kinerja sistem.

Generator gambar berbobot terbuka juga diuji sebagai pengganti Nano-Banana-Pro. FLUX.2 [dev] dan Qwen-Image-Edit-2511 menghasilkan kinerja yang sebanding untuk beberapa tugas yang lebih sederhana, terutama inpainting, tetapi kurang konsisten pada transformasi yang lebih menuntut seperti estimasi kedalaman dan penelusuran jalur. Hasil serupa diperoleh ketika Qwen-3.5-27B digunakan sebagai VLM:

Hasil pengujian yang membandingkan generator gambar dengan Qwen-3.5-27B sebagai VLM. Nano-Banana-Pro memperoleh hasil terbaik pada lima dari enam tugas, sedangkan FLUX.2 [dev] dan Qwen-Image-Edit-2511 meningkatkan kinerja dibandingkan No Tools pada beberapa tugas.

Hasil pengujian yang membandingkan generator gambar dengan Qwen-3.5-27B sebagai VLM. Nano-Banana-Pro memperoleh hasil terbaik pada lima dari enam tugas, sedangkan FLUX.2 [dev] dan Qwen-Image-Edit-2511 meningkatkan kinerja dibandingkan No Tools pada beberapa tugas.

Para penulis juga melakukan pengujian kualitatif pada empat tugas:

Contoh kualitatif pada empat tugas menunjukkan bagaimana ReImaGin digunakan untuk memperkuat penalaran Gemini-3.1-Pro. Dalam setiap kasus, representasi visual yang dihasilkan dimasukkan ke dalam proses penalaran guna membantu menyelesaikan tugas.

Contoh kualitatif pada empat tugas menunjukkan bagaimana ReImaGin digunakan untuk memperkuat penalaran Gemini-3.1-Pro. Dalam setiap kasus, representasi visual yang dihasilkan dimasukkan ke dalam proses penalaran guna membantu menyelesaikan tugas.

ReImaGin tidak selalu dapat diandalkan: dalam beberapa keadaan, generator gambar menghasilkan transformasi yang tidak akurat, seperti denah dengan objek di posisi yang salah; dalam keadaan lain, gambar yang dihasilkan dengan akurat kemudian dibaca secara keliru oleh VLM.

Dalam audit manual terhadap 120 gambar yang dihasilkan, 75% terbukti setia melakukan transformasi yang diminta. Ketika hal itu tercapai, jawaban akhir benar dalam 87% kasus, dibandingkan 43% ketika gambar yang dihasilkan tidak akurat.

Para penulis menyimpulkan:

“Hasil kami menunjukkan dua kesimpulan yang lebih luas. Pertama, pembuatan gambar dapat bertindak sebagai mekanisme imajinasi visual umum dalam penalaran multimodal, sehingga mengurangi kebutuhan untuk merancang alat terpisah bagi setiap transformasi baru.

“Kedua, efektivitas pendekatan ini tidak hanya bergantung pada model dasarnya, tetapi juga pada strategi penalaran yang digunakan untuk memutuskan apa yang harus divisualisasikan dan bagaimana hasilnya digunakan.

“Peningkatan dari penemuan strategi otomatis menunjukkan bahwa model dapat memanfaatkan pemahamannya tentang transformasi visual untuk menemukan strategi yang relevan tanpa strategi khusus tugas atau contoh penalaran yang ditulis manusia.”

Kesimpulan

Keputusan menggunakan alat secara mandiri seperti yang diteliti dalam studi ini merupakan perkembangan yang menarik, terutama karena pengembangan VLM tampaknya memang berevolusi secara alami ke arah pendekatan ini. Saya ingin mengetahui apakah VLM serbaguna semacam itu pada akhirnya akan berkinerja sebaik alat dan kerangka khusus seperti ekosistem Segment, dan apakah mereka yang secara eksklusif menangani “tugas sampingan” tersebut akhirnya akan memakai palu godam untuk memecahkan kacang.

Agak sulit dipercaya bahwa VLM dapat mengembangkan disiplin yang diperlukan untuk menyalip dan mempertahankan keunggulan atas solusi khusus seperti fine-tuning lokal, ketika seluruh model dikhususkan untuk satu tugas dan dalam prosesnya sering menjadi tidak berguna untuk hal lain. Waktu yang akan menjawabnya.

 

* Salah satu definisi yang dapat diperdebatkan untuk ranah citra, yang kita pelajari jauh sebelum memperoleh keterampilan bahasa apa pun.

Pertama kali diterbitkan pada Senin, 28 September 2026

Penulis tentang pembelajaran mesin, spesialis domain dalam sintesis gambar manusia. Mantan kepala konten riset di Metaphysic.ai, hingga dibubarkannya menjadi Brahma.ai milik DNEG.
Website: martinanderson.ai
Kontak: martin@martinanderson.ai