Model dan platform AI
Lihat, Pikir, Jelaskan: Munculnya Model Bahasa Visi di AI
Sekitar satu dekade yang lalu, kecerdasan buatan dibagi antara pengenalan gambar dan pemahaman bahasa. Model visi dapat mendeteksi objek tetapi tidak dapat menjelaskannya, dan model bahasa dapat menghasilkan teks tetapi tidak dapat “melihat.” Hari ini, perbedaan itu mulai menghilang. Model Bahasa Visi (VLM) sekarang menggabungkan keterampilan visual dan bahasa, memungkinkan mereka untuk menafsirkan gambar dan menjelaskannya dengan cara yang terasa hampir seperti manusia. Apa yang membuat mereka benar-benar luar biasa adalah proses penalaran langkah demi langkah mereka, yang dikenal sebagai Rantai Pemikiran, yang membantu mengubah model ini menjadi alat yang kuat dan praktis di berbagai industri seperti kesehatan dan pendidikan. Dalam artikel ini, kita akan menjelajahi bagaimana VLM bekerja, mengapa penalaran mereka penting, dan bagaimana mereka mengubah bidang dari kedokteran hingga mobil self-driving.
Mengenal Model Bahasa Visi
Model Bahasa Visi, atau VLM, adalah jenis kecerdasan buatan yang dapat memahami baik gambar maupun teks secara bersamaan. Tidak seperti sistem AI yang lebih lama yang hanya dapat menangani teks atau gambar, VLM menggabungkan kedua keterampilan tersebut. Ini membuat mereka sangat fleksibel. Mereka dapat melihat gambar dan menjelaskan apa yang terjadi, menjawab pertanyaan tentang video, atau bahkan membuat gambar berdasarkan deskripsi tertulis.
Sebagai contoh, jika Anda meminta VLM untuk menjelaskan foto anjing yang berlari di taman. VLM tidak hanya mengatakan, “Ada anjing.” Ini dapat mengatakan, “Anjing itu sedang mengejar bola di dekat pohon oak besar.” Ini melihat gambar dan menghubungkannya dengan kata-kata dengan cara yang masuk akal. Kemampuan untuk menggabungkan pemahaman visual dan bahasa menciptakan berbagai kemungkinan, dari membantu Anda mencari foto online hingga membantu dalam tugas yang lebih kompleks seperti pemindaian medis.
Pada intinya, VLM bekerja dengan menggabungkan dua komponen kunci: sistem visi yang menganalisis gambar dan sistem bahasa yang memproses teks. Bagian visi mendeteksi detail seperti bentuk dan warna, sedangkan bagian bahasa mengubah detail tersebut menjadi kalimat. VLM dilatih pada dataset besar yang berisi miliaran pasangan gambar-teks, memberi mereka pengalaman luas untuk mengembangkan pemahaman yang kuat dan akurat.
Apa yang Dimaksud dengan Rantai Pemikiran dalam VLM
Rantai Pemikiran, atau CoT, adalah cara untuk membuat AI berpikir langkah demi langkah, seperti cara kita menyelesaikan masalah dengan memecahnya. Dalam VLM, ini berarti AI tidak hanya memberikan jawaban ketika Anda bertanya tentang gambar, tetapi juga menjelaskan bagaimana ia sampai pada jawaban tersebut, menjelaskan setiap langkah logis di sepanjang jalan.
Sebagai contoh, jika Anda menunjukkan VLM gambar kue ulang tahun dengan lilin dan bertanya, “Berapa umur orang itu?” Tanpa CoT, mungkin hanya menebak angka. Dengan CoT, ia berpikir: “Baik, saya melihat kue dengan lilin. Lilin biasanya menunjukkan umur seseorang. Mari kita hitung, ada 10. Jadi, orang itu mungkin berusia 10 tahun.” Anda dapat mengikuti penalaran saat ia terbentuk, yang membuat jawaban lebih dapat dipercaya.
Demikian pula, ketika diperlihatkan adegan lalu lintas ke VLM dan ditanya, “Apakah aman untuk menyeberang?” VLM mungkin berpikir: “Sinyal pejalan kaki merah, jadi Anda tidak boleh menyeberang. Ada mobil yang berbelok di dekatnya, dan itu bergerak, tidak berhenti. Itu berarti tidak aman sekarang.” Dengan berjalan melalui langkah-langkah ini, AI menunjukkan kepada Anda apa yang ia perhatikan dalam gambar dan mengapa ia memutuskan apa yang dilakukannya.
Mengapa Rantai Pemikiran Penting dalam VLM
Integrasi penalaran CoT ke dalam VLM membawa beberapa keuntungan utama.
Pertama, membuat AI lebih mudah dipercaya. Ketika ia menjelaskan langkah-langkahnya, Anda mendapatkan pemahaman yang jelas tentang bagaimana ia mencapai jawaban. Ini penting dalam bidang seperti kesehatan. Sebagai contoh, ketika melihat pemindaian MRI, VLM mungkin mengatakan: “Saya melihat bayangan di sisi kiri otak. Daerah itu mengontrol ucapan, dan pasien mengalami kesulitan berbicara, jadi mungkin itu tumor.” Seorang dokter dapat mengikuti logika itu dan merasa percaya diri dengan input AI.
Kedua, membantu AI menangani masalah yang kompleks. Dengan memecahnya, ia dapat menangani pertanyaan yang memerlukan lebih dari sekadar pandangan singkat. Sebagai contoh, menghitung lilin adalah sederhana, tetapi menentukan keamanan di jalan sibuk memerlukan beberapa langkah, termasuk memeriksa sinyal, mendeteksi mobil, dan menilai kecepatan. CoT memungkinkan AI menangani kompleksitas tersebut dengan membaginya menjadi langkah-langkah.
Terakhir, membuat AI lebih adaptif. Ketika ia berpikir langkah demi langkah, ia dapat menerapkan apa yang ia ketahui ke situasi baru. Jika ia belum pernah melihat jenis kue tertentu sebelumnya, ia masih dapat mengetahui koneksi antara lilin dan umur karena ia berpikir secara logis, bukan hanya mengandalkan pola yang diingat.
Bagaimana Rantai Pemikiran dan VLM Mengubah Industri
Kombinasi CoT dan VLM membuat dampak signifikan di berbagai bidang:
- Kesehatan: Dalam kedokteran, VLM seperti Google’s Med-PaLM 2 (GOOGL ) menggunakan CoT untuk memecah pertanyaan medis yang kompleks menjadi langkah-langkah diagnostik yang lebih kecil. Sebagai contoh, ketika diberikan sinar-X dada dan gejala seperti batuk dan sakit kepala, AI mungkin berpikir: “Gejala-gejala ini bisa jadi pilek, alergi, atau sesuatu yang lebih serius. Tidak ada kelenjar getah bening yang membengkak, jadi tidak mungkin infeksi serius. Paru-paru tampak jernih, jadi mungkin tidak pneumonia. Pilek umum paling cocok.” Ini berjalan melalui opsi-opsi dan sampai pada jawaban, memberikan dokter penjelasan yang jelas untuk bekerja sama.
- Mobil Self-Driving: Untuk kendaraan otonom, VLM yang ditingkatkan dengan CoT memperbaiki keamanan dan pengambilan keputusan. Sebagai contoh, mobil self-driving dapat menganalisis adegan lalu lintas langkah demi langkah: memeriksa sinyal pejalan kaki, mengidentifikasi kendaraan yang bergerak, dan memutuskan apakah aman untuk melanjutkan. Sistem seperti Wayve’s LINGO-1 menghasilkan komentar bahasa alami untuk menjelaskan tindakan seperti memperlambat untuk sepeda. Ini membantu insinyur dan penumpang memahami proses penalaran kendaraan. Logika langkah demi langkah juga memungkinkan penanganan kondisi jalan yang tidak biasa dengan menggabungkan input visual dengan pengetahuan kontekstual.
- Analisis Geospasial: Model Gemini dari Google menerapkan penalaran CoT ke data spasial seperti peta dan citra satelit. Sebagai contoh, dapat menilai kerusakan badai dengan mengintegrasikan citra satelit, prakiraan cuaca, dan data demografi, lalu menghasilkan visualisasi yang jelas dan jawaban untuk pertanyaan yang kompleks. Kemampuan ini mempercepat respons krisis dengan memberikan pengambil keputusan dengan wawasan yang tepat dan bermanfaat tanpa memerlukan keahlian teknis.
- Robotika: Dalam robotika, integrasi CoT dan VLM memungkinkan robot untuk merencanakan dan melaksanakan tugas multi-langkah dengan lebih baik. Sebagai contoh, ketika robot ditugaskan untuk mengambil objek, VLM yang ditingkatkan dengan CoT memungkinkan robot untuk mengidentifikasi cangkir, menentukan titik genggam yang terbaik, merencanakan jalur yang bebas tabrakan, dan melaksanakan gerakan, semuanya sambil “menjelaskan” setiap langkah prosesnya. Proyek seperti RT-2 menunjukkan bagaimana CoT memungkinkan robot untuk beradaptasi dengan tugas baru dan merespons perintah yang kompleks dengan penalaran yang jelas.
- Pendidikan: Dalam pembelajaran, tutor AI seperti Khanmigo menggunakan CoT untuk mengajar dengan lebih baik. Untuk soal matematika, mungkin membimbing siswa: “Pertama, tulis persamaan. Selanjutnya, dapatkan variabel dengan mengurangi 5 dari kedua sisi. Sekarang, bagilah dengan 2.” Alih-alih memberikan jawaban, ia berjalan melalui proses, membantu siswa memahami konsep langkah demi langkah.
Bagian Bawah Garis
Model Bahasa Visi (VLM) memungkinkan AI untuk menafsirkan dan menjelaskan data visual menggunakan penalaran langkah demi langkah yang seperti manusia melalui proses Rantai Pemikiran (CoT). Pendekatan ini meningkatkan kepercayaan, adaptabilitas, dan pemecahan masalah di berbagai industri seperti kesehatan, mobil self-driving, analisis geospasial, robotika, dan pendidikan. Dengan mengubah cara AI menangani tugas yang kompleks dan mendukung pengambilan keputusan, VLM menetapkan standar baru untuk teknologi cerdas yang dapat diandalkan dan praktis.












