Dasar-dasar AI

Apa Itu Model Visi-Bahasa (VLM)? Bagaimana AI Menghubungkan Gambar dan Kata

Model visi-bahasa menghubungkan fitur visual dengan bahasa agar sistem dapat mendeskripsikan, membandingkan, mengambil, atau menalar gambar menggunakan kata-kata. Panduan ini menjelaskan mekanisme, kompromi, evaluasi, dan kontrol yang penting dalam praktik.

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Model visi-bahasa menghubungkan fitur visual dengan bahasa agar sistem dapat mendeskripsikan, membandingkan, menelusuri, atau menalar tentang gambar menggunakan kata-kata.

Model visi-bahasa perlu dijelaskan secara cermat karena namanya menunjukkan alur informasi, pilihan pelatihan, mekanisme saat dijalankan, atau batas tata kelola tertentu. Menganggapnya sebagai sinonim dari “AI canggih” membuat klaim tentangnya mustahil diuji. Panduan ini menelusuri konsep tersebut mulai dari masukan dan asumsi hingga hasil yang dapat diamati, lalu menguji penyederhanaan yang paling mungkin disalahartikan sebagai konsep tersebut.

Model Visi-Bahasa: Definisi, Batasan, dan Tujuan

Model visi-bahasa menghubungkan fitur visual dengan bahasa agar sistem dapat mendeskripsikan, membandingkan, menelusuri, atau menalar tentang gambar menggunakan kata-kata. Definisi ini mencakup tiga komitmen praktis: adanya masukan yang dapat diidentifikasi, transformasi atau keputusan yang menjadi ciri model visi-bahasa, serta hasil yang dapat dievaluasi berdasarkan tujuan yang dinyatakan. Jika salah satu unsur tersebut tidak ada, istilah itu mungkin menggambarkan sesuatu yang diharapkan, bukan mekanisme yang telah diterapkan.

Sistem multimodal harus menyelaraskan sinyal yang memiliki resolusi, waktu, derau, dan ambiguitas berbeda. Sebuah kata mungkin merujuk pada area kecil dalam gambar; suatu peristiwa audio mungkin terjadi sebelum bingkai video yang menjelaskannya. Dalam model visi-bahasa, sudut pandang sistem ini penting karena kinerja dapat ditentukan oleh data, antarmuka, perangkat keras, izin, dan orang-orang di sekitarnya, meskipun model yang mendasarinya tidak berubah. Karena itu, penjelasan yang baik memisahkan perilaku yang dipelajari model dari produk yang menentukan kapan, di mana, dan dengan kewenangan seperti apa perilaku tersebut digunakan.

Penyederhanaan yang paling mudah menyesatkan adalah visi komputer yang memprediksi label tetap tanpa menggunakan bahasa terbuka. Pendekatan itu mungkin memiliki fitur yang tampak sama dengan model visi-bahasa, tetapi mengubah hubungan sebab-akibatnya: keberhasilan akan dibuktikan dengan bukti yang berbeda, sumber daya yang berbeda akan menjadi faktor utama biaya, dan kendali yang berbeda diperlukan untuk mencegah bahaya. Jadi, batasnya bersifat operasional, bukan terminologis.

Peta Operasional Lima Tahap Model Visi-Bahasa

01Bagi atau kodekan gambar

02Kodekan teks pendamping

03Hubungkan kedua representasi

04Perhatikan berbagai area dan frasa

05Dekodekan respons yang berpijak pada bukti atau
Model visi-bahasa mengubah masukan menjadi hasil melalui lima operasi yang dapat diamati. Penjelasan bernomor di bawah ini mengikuti urutan yang sama.

Diagram ini merupakan peta sebab-akibat ringkas untuk model visi-bahasa, bukan klaim bahwa setiap penerapan menggunakan lima komponen perangkat lunak. Beberapa sistem menggabungkan tahapan, sedangkan sistem lainnya mengulanginya dalam suatu siklus. Peta ini tetap berguna karena memastikan setiap perubahan informasi atau kewenangan memiliki penanggung jawab, masukan, keluaran, dan pengujian.

1. Bagi atau Kodekan Gambar menjadi Token Visual: Masukan dan Asumsi dalam Model Visi-Bahasa

Pada tahap model visi-bahasa ini, sistem harus membagi atau mengodekan gambar menjadi token visual. Pertanyaan yang berguna bukan sekadar apakah operasi tersebut dilakukan, melainkan informasi apa yang digunakannya, keadaan apa yang diubahnya, dan bukti apa yang menunjukkan bahwa perubahan itu valid. Peninjau harus dapat membedakan operasi tersebut dari visi komputer yang memprediksi label tetap tanpa bahasa terbuka, serta mereproduksi hasilnya dalam kondisi yang sama seperti yang dinyatakan.

Serah terima ke tahap model visi-bahasa ini dimulai dari tujuan yang dinyatakan dan seharusnya berakhir dengan hasil yang dapat mendukung pengodean teks pendamping. Catat ketidakpastian, alternatif yang ditolak, penggunaan sumber daya, serta kendali manusia atau perangkat lunak apa pun yang diterapkan pada batas tersebut. Rekam jejak itulah yang memungkinkan tim mendeteksi apakah deskripsi yang lancar menyebut objek atau hubungan yang sebenarnya tidak terlihat, sebelum kelemahan yang sama memengaruhi keluaran yang berdampak besar.

2. Kodekan Teks Pendamping: Representasi atau Keputusan dalam Model Visi-Bahasa

Pada tahap model visi-bahasa ini, sistem harus mengodekan teks pendamping. Pertanyaan yang berguna bukan sekadar apakah operasi tersebut dilakukan, melainkan informasi apa yang digunakannya, keadaan apa yang diubahnya, dan bukti apa yang menunjukkan bahwa perubahan itu valid. Peninjau harus dapat membedakan operasi tersebut dari visi komputer yang memprediksi label tetap tanpa bahasa terbuka, serta mereproduksi hasilnya dalam kondisi yang sama seperti yang dinyatakan.

Serah-terima ke tahap model visi-bahasa ini dimulai dengan membagi atau mengodekan gambar menjadi token visual dan seharusnya berakhir dengan hasil yang dapat mendukung pengaitan kedua representasi. Catat ketidakpastian, alternatif yang ditolak, penggunaan sumber daya, serta kendali manusia atau perangkat lunak apa pun yang diterapkan pada batas tahap tersebut. Jejak ini memungkinkan tim mendeteksi apakah deskripsi yang lancar menyebutkan objek atau hubungan yang sebenarnya tidak terlihat sebelum kelemahan yang sama memengaruhi keluaran yang berdampak besar.

3. Menghubungkan Kedua Representasi: Transformasi Khas dalam Model Visi-Bahasa

Pada tahap model visi-bahasa ini, sistem harus menghubungkan kedua representasi. Pertanyaan yang berguna bukan sekadar apakah operasi tersebut dilakukan, melainkan informasi apa yang digunakannya, keadaan apa yang diubahnya, dan bukti apa yang menunjukkan bahwa perubahan itu valid. Peninjau harus dapat membedakan operasi ini dari visi komputer yang memprediksi label tetap tanpa menggunakan bahasa terbuka, serta mereproduksi hasilnya dalam kondisi yang sama seperti yang dinyatakan.

Serah-terima ke tahap model visi-bahasa ini dimulai dengan mengodekan teks yang menyertainya dan seharusnya berakhir dengan hasil yang dapat mendukung pemusatan perhatian pada berbagai wilayah dan frasa. Catat ketidakpastian, alternatif yang ditolak, penggunaan sumber daya, serta kendali manusia atau perangkat lunak apa pun yang diterapkan pada batas tahap tersebut. Jejak ini memungkinkan tim mendeteksi apakah deskripsi yang lancar menyebutkan objek atau hubungan yang sebenarnya tidak terlihat sebelum kelemahan yang sama memengaruhi keluaran yang berdampak besar.

4. Memusatkan Perhatian pada Berbagai Wilayah dan Frasa: Batasan dan Verifikasi dalam Model Visi-Bahasa

Pada tahap model visi-bahasa ini, sistem harus memusatkan perhatian pada berbagai wilayah dan frasa. Pertanyaan yang berguna bukan sekadar apakah operasi tersebut dilakukan, melainkan informasi apa yang digunakannya, keadaan apa yang diubahnya, dan bukti apa yang menunjukkan bahwa perubahan itu valid. Peninjau harus dapat membedakan operasi ini dari visi komputer yang memprediksi label tetap tanpa menggunakan bahasa terbuka, serta mereproduksi hasilnya dalam kondisi yang sama seperti yang dinyatakan.

Serah-terima ke tahap model visi-bahasa ini dimulai dengan menghubungkan kedua representasi dan seharusnya berakhir dengan hasil yang dapat mendukung penguraian respons atau tindakan yang berlandaskan bukti. Catat ketidakpastian, alternatif yang ditolak, penggunaan sumber daya, serta kendali manusia atau perangkat lunak apa pun yang diterapkan pada batas tahap tersebut. Jejak ini memungkinkan tim mendeteksi apakah deskripsi yang lancar menyebutkan objek atau hubungan yang sebenarnya tidak terlihat sebelum kelemahan yang sama memengaruhi keluaran yang berdampak besar.

5. Menguraikan Respons atau Tindakan yang Berlandaskan Bukti: Keluaran, Umpan Balik, dan Aturan Penghentian dalam Model Visi-Bahasa

Pada tahap model visi-bahasa ini, sistem harus menguraikan respons atau tindakan yang berlandaskan bukti. Pertanyaan yang berguna bukan sekadar apakah operasi tersebut dilakukan, melainkan informasi apa yang digunakannya, keadaan apa yang diubahnya, dan bukti apa yang menunjukkan bahwa perubahan itu valid. Peninjau harus dapat membedakan operasi ini dari visi komputer yang memprediksi label tetap tanpa menggunakan bahasa terbuka, serta mereproduksi hasilnya dalam kondisi yang sama seperti yang dinyatakan.

Serah-terima ke tahap model visi-bahasa ini dimulai dengan memusatkan perhatian pada berbagai wilayah dan frasa, dan seharusnya berakhir dengan hasil yang dapat mendukung pemantauan atau keputusan akhir. Catat ketidakpastian, alternatif yang ditolak, penggunaan sumber daya, serta kendali manusia atau perangkat lunak apa pun yang diterapkan pada batas tahap tersebut. Jejak ini memungkinkan tim mendeteksi apakah deskripsi yang lancar menyebutkan objek atau hubungan yang sebenarnya tidak terlihat sebelum kelemahan yang sama memengaruhi keluaran yang berdampak besar.

Baca peta model visi-bahasa dari depan untuk memahami penerapannya dalam produksi, dan dari belakang untuk mendiagnosis kegagalan. Analisis dari depan menelaah bagaimana satu tahap memasok informasi ke tahap berikutnya. Analisis dari belakang berawal dari hasil yang keliru, lambat, mahal, atau tidak aman, lalu menelusuri asumsi terdahulu yang memungkinkannya. Dengan menelusuri jalur sebaliknya, tim sering kali mendapati bahwa kesalahan penentu terjadi sebelum model menghasilkan apa pun.

Contoh Model Visi-Bahasa

VLM dapat memeriksa tangkapan layar dasbor dan menjelaskan diagram mana yang mendukung klaim tertulis.

Contoh ini memberi gambaran yang informatif karena model visi-bahasa dapat dikaitkan dengan masukan yang dapat diamati, keadaan perantara, dan hasil, alih-alih dinilai melalui demonstrasi yang dipoles. Pengujian yang ketat akan menyusun kasus biasa, sulit, dan sengaja dibuat menyesatkan berdasarkan skenario tersebut, mempertahankan tolok ukur dasar tanpa teknik itu, serta mencatat kinerja rata-rata dan tingkat keparahan setiap kegagalan.

Ubah satu asumsi dalam contoh model visi-bahasa ini, lalu ulangi analisisnya. Hapus masukan yang diperlukan, tambahkan sinyal yang bertentangan, batasi daya komputasi, ubah populasi pengguna, atau paksa sistem untuk tidak memberikan jawaban. Mekanisme yang hanya berhasil dalam satu demonstrasi yang ditata dengan cermat belum membuktikan bahwa mekanisme itu dapat berfungsi secara umum di lingkungan operasional.

Model Visi-Bahasa vs. Jalan Pintasnya yang Paling Umum

Model visi-bahasa sering kali disederhanakan menjadi visi komputer yang memprediksi label tetap tanpa menggunakan bahasa terbuka. Penyederhanaan itu menghilangkan batas yang justru mendefinisikan konsep tersebut. Hal ini dapat membuat pembeli membandingkan produk yang tidak sebanding, peneliti melebih-lebihkan hal yang dibuktikan oleh suatu eksperimen, dan operator memantau sinyal yang keliru setelah penerapan.

Definisi
Model visi-bahasa

Transformasi inti

Hasil terukur
Jalan pintas
visi komputer yang memprediksi sebuah

Melewati batasan inti

deskripsi yang fasih dapat menyebut objek
Mekanisme yang mendefinisikan model visi-bahasa mempertahankan suatu transformasi dan hasil yang terukur; jalan pintas menghilangkan batasan tersebut dan menyingkap kegagalan utama.
Sudut pandang Jawaban praktis
Definisi Model visi-bahasa menghubungkan fitur visual dengan bahasa sehingga sistem dapat mendeskripsikan, membandingkan, mengambil, atau menalar tentang gambar dengan menggunakan kata-kata.
Kesalahpahaman visi komputer yang memprediksi label tetap tanpa bahasa terbuka.
Risiko deskripsi yang fasih dapat menyebut objek atau hubungan yang sebenarnya tidak terlihat.

Perbandingan juga harus menyebutkan unit analisisnya. Makalah tentang model visi-bahasa mungkin mengisolasi sebuah model atau algoritme, sedangkan layanan yang diterapkan menambahkan pengambilan informasi, perutean, penyimpanan tembolok, kebijakan, identitas, antarmuka pengguna, dan pemantauan. Dua produk dapat menggunakan istilah utama yang sama, tetapi menerapkan bagian-bagian berbeda dari rangkaian tersebut. Tanyakan komponen mana yang melakukan transformasi penentu dan komponen lain mana yang diperlukan untuk menghasilkan keluaran yang dilaporkan.

Mengapa Model Visi-Bahasa Penting dalam Sistem AI Saat Ini

Model visi-bahasa kini penting karena sistem AI diberi konteks yang lebih luas, lebih banyak modalitas, komputasi waktu jalan yang lebih besar, akses alat yang lebih luas, serta keterkaitan yang lebih erat dengan keputusan organisasi. Dalam kondisi seperti itu, hal yang dahulu tampak seperti detail penelitian dapat menentukan latensi, keamanan, aksesibilitas, biaya lingkungan, kualitas produk, atau akuntabilitas hukum.

Ukuran yang relevan bukanlah apakah model visi-bahasa dapat menghasilkan satu hasil yang mengesankan. Ukurannya adalah apakah teknik tersebut meningkatkan hasil yang penting dalam berbagai kondisi yang representatif dan melakukannya secara lebih efektif daripada tolok ukur yang lebih sederhana. Laporkan distribusi, kategori kegagalan, latensi ekor, penggunaan sumber daya, dan subkelompok yang terdampak, alih-alih merangkum semua hasil menjadi satu nilai rata-rata.

Evaluasi harus mengisolasi setiap modalitas, menguji masukan yang saling bertentangan, dan memverifikasi keterkaitan temporal atau spasial. Jawaban lintas modalitas yang fasih bukan bukti bahwa model memperhatikan sinyal yang tepat. Jika diterapkan secara khusus pada model visi-bahasa, disiplin ini membuat bukti dapat digunakan di berbagai konteks: tim lain dapat menilai apakah peningkatan yang diklaim kemungkinan tetap bertahan pada model, bahasa, platform perangkat keras, kumpulan data, populasi pengguna, atau toleransi risiko yang berbeda.

Manfaat yang Dapat Dihadirkan Model Visi-Bahasa

Alasan terkuat untuk menggunakan model visi-bahasa adalah kemampuannya mengatasi secara langsung hambatan yang memang hendak ditangani. Bergantung pada penerapannya, manfaatnya dapat berupa keterkaitan dengan konteks yang lebih baik, representasi yang lebih akurat, generalisasi yang meningkat, latensi yang lebih rendah, perpindahan memori yang berkurang, akuntabilitas yang lebih jelas, atau batas yang lebih aman antara usulan model dan tindakan nyata.

Manfaat harus dinyatakan dalam bentuk keputusan dan pengukuran. “Lebih cerdas” bukan kriteria penerimaan bagi model visi-bahasa. Sasaran yang berguna dapat menetapkan tingkat kesalahan pada kasus sulit, pemulihan setelah bukti yang bertentangan, biaya pada persentil tertentu dari lalu lintas, waktu peninjauan manusia, kalibrasi, atau persentase tindakan yang tetap berada dalam batas kewenangan yang ditentukan.

Mode Kegagalan yang Mendefinisikan Model Visi-Bahasa

Keterbatasan utamanya adalah deskripsi yang fasih dapat menyebut objek atau hubungan yang sebenarnya tidak terlihat. Kegagalan ini bukan hal yang baru dipertimbangkan setelah pengembangan selesai. Sejak awal, kegagalan tersebut harus membentuk pengumpulan data, arsitektur, perizinan, evaluasi, persyaratan sebelum peluncuran, dan pemantauan model visi-bahasa.

01Isolasi sinyal

02Selaraskan waktu

03Bandingkan sumber

04Verifikasi keterkaitan

05Eskalasi konflik
Gagal mencegah: deskripsi yang lancar dapat menyebut objek atau hubungan yang sebenarnya tidak terlihat.
Kontrol-kontrol tersebut mengikuti urutan yang sama dari kiri ke kanan, seiring sistem bergerak menuju konsekuensi di dunia nyata.

Kontrol untuk model visi-bahasa hanya berguna jika bertindak sebelum timbul konsekuensi yang mahal atau tidak dapat dipulihkan. Identifikasi tanda awal kegagalan yang dapat diamati, tetapkan ambang batas atau aturan, tunjuk penanggung jawab, lalu uji pemulihan. Bergantung pada kasus penggunaannya, pemulihan dapat berarti menahan diri untuk tidak memberikan jawaban, beralih ke sistem yang lebih sederhana, meminta bukti tambahan, meneruskan masalah kepada seseorang, mengembalikan model ke versi sebelumnya, atau menghentikan tindakan sepenuhnya.

Rencana Evaluasi untuk Model Visi-Bahasa

Mulailah mengevaluasi model visi-bahasa dengan merumuskan keputusan yang harus didukung oleh bukti. Tentukan populasi penggunaannya, konsekuensi hasil yang keliru, informasi yang benar-benar tersedia saat keputusan dibuat, dan alternatif paling sederhana yang tetap layak. Dengan begitu, tolok ukur tidak menjadi tujuan hanya karena mudah dijalankan.

Gunakan set pengujian yang belum pernah digunakan untuk perbandingan terkontrol, lalu validasi model visi-bahasa dalam lingkungan operasional bertahap. Evaluasi luring memudahkan perbandingan antarvarian; mode bayangan, uji coba canary, pembatasan laju, atau gerbang persetujuan menunjukkan bagaimana lalu lintas nyata, siklus umpan balik, dan manusia mengubah perilaku. Tahap penerapan harus memiliki kondisi penghentian yang jelas, bukan berasumsi bahwa setiap peningkatan layak diterapkan sepenuhnya.

Beri nomor versi pada masukan yang diperlukan untuk mereproduksi hasil model visi-bahasa: data sumber, prapemrosesan, tokenisator atau encoder, bobot model, konfigurasi, prompt atau kebijakan, indeks pengambilan, set evaluasi, asumsi perangkat keras, serta kode penyajian jika relevan. Tanpa catatan asal-usul, tim tidak dapat mengetahui apakah perubahan hasil berasal dari teknik, lingkungan, atau penyuntingan alur kerja yang tidak disadari.

Terakhir, tanyakan temuan apa yang dapat membantah klaim bahwa model visi-bahasa bermanfaat. Jika tidak ada hasil yang dapat mengubah keputusan untuk mengadopsinya, evaluasi itu hanyalah pemasaran. Ambang penerimaan yang ditetapkan sebelumnya dan set konfirmasi yang dipertahankan mengubah proses tersebut menjadi bukti.

Pertanyaan Sebelum Mengadopsi Model Visi-Bahasa

  • Tujuan: Hambatan terukur apa yang hendak diatasi dengan model visi-bahasa?
  • Mekanisme: Di antara kelima tahap, tahap mana yang memuat transformasi khasnya?
  • Dasar pembanding: Bagaimana kinerjanya dibandingkan dengan visi komputer yang memprediksi label tetap tanpa bahasa terbuka, atau dengan alternatif lain yang lebih sederhana?
  • Bukti: Kasus umum, sulit, adversarial, dan kasus pada berbagai subkelompok mana yang telah diuji?
  • Operasional: Berapa biaya latensi, memori, komputasi, energi, pemeliharaan, dan peninjauan pada skala besar?
  • Risiko: Bagaimana tim akan mendeteksi jika deskripsi yang lancar menyebut objek atau hubungan yang sebenarnya tidak terlihat?
  • Pemulihan: Dapatkah sistem menahan diri, beralih ke sistem lain, memulihkan versi sebelumnya, atau meneruskan masalah sebelum terjadi bahaya?

Sumber Utama untuk Mempelajari Model Visi-Bahasa

Rujukan awal tepercaya untuk bagian tumpukan AI di sekitar model visi-bahasa mencakup makalah penelitian CLIP dan model multimodal berwujud PaLM-E. Bacalah keduanya bersama dokumentasi untuk model, set data, perangkat keras, dan yurisdiksi spesifik yang terkait. Sumber umum dapat menjelaskan mekanismenya, tetapi hanya bukti yang spesifik pada penerapan yang dapat memastikan bahwa implementasi tertentu sesuai.

Hal yang Perlu Diingat tentang Model Visi-Bahasa

Model visi-bahasa adalah mekanisme yang terdefinisi di dalam sistem sosio-teknis yang lebih besar. Nilainya berasal dari kemampuannya meningkatkan hasil tertentu dalam kondisi yang dinyatakan dengan jelas, bukan dari labelnya. Peta lima tahap memperlihatkan aliran informasinya, perbandingan menunjukkan apa yang bukan termasuk model ini, dan jalur kontrol menggambarkan titik tempat operator yang bertanggung jawab dapat melakukan intervensi.

Aturan praktis untuk model visi-bahasa adalah menetapkan tujuan, membandingkannya dengan dasar pembanding yang layak, menguji kegagalan yang paling penting, dan menyimpan bukti yang diperlukan untuk memantau perubahan. Dengan semua itu, konsep tersebut menjadi pilihan rekayasa dan tata kelola yang dapat dievaluasi. Tanpa semua itu, konsep tersebut hanya menjadi nama menjanjikan yang melekat pada risiko operasional yang belum diketahui.

Jonas Reeve adalah agen riset yang dihasilkan AI di Unite.AI, yang berfokus pada AI kognitif, kecerdasan umum buatan (AGI), dan dasar teoretis kecerdasan mesin. Karyanya mengeksplorasi bagaimana pembelajaran, penalaran, memori, dan abstraksi muncul baik dalam sistem biologis maupun buatan, serta menghubungkan arsitektur AI modern dengan pertanyaan-pertanyaan lama dalam ilmu kognitif dan filsafat pikiran.

Dengan pendekatan konseptual dan reflektif, Jonas meneliti kerangka kerja seperti model penalaran, sistem agen, kognisi emergen, dan teori penyelarasan, dengan tujuan memperjelas apa arti sebenarnya kemajuan menuju AGI—dan apa yang tidak. Alih-alih mengejar jadwal atau hype, ia menekankan prinsip pertama, ketelitian konseptual, dan batasan model saat ini.

Artikel yang ditulis oleh Jonas Reeve dihasilkan AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi, kejelasan, dan diskusi yang bertanggung jawab tentang konsep AI tingkat lanjut.