Model dan platform AI

Evolusi AI Multimodal dengan Kemampuan Penglihatan GPT-4V

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Dalam upaya membuat AI lebih seperti manusia, model GPT dari OpenAI terus mendorong batas-batasnya. GPT-4 sekarang dapat menerima prompt teks dan gambar.

Multimodalitas dalam AI generatif menunjukkan kemampuan model untuk menghasilkan output yang beragam seperti teks, gambar, atau audio berdasarkan input. Model-model ini, yang dilatih pada data tertentu, belajar pola-pola dasar untuk menghasilkan data baru yang serupa, memperkaya aplikasi AI.

Langkah Terbaru dalam AI Multimodal

Loncatan terbaru yang cukup mencolok dalam bidang ini terlihat dengan integrasi DALL-E 3 ke dalam ChatGPT, yaitu peningkatan signifikan dalam teknologi teks-ke-gambar OpenAI. Kombinasi ini memungkinkan interaksi yang lebih lancar di mana ChatGPT membantu dalam membuat prompt yang tepat untuk DALL-E 3, mengubah ide pengguna menjadi karya seni AI yang hidup. Jadi, sementara pengguna dapat berinteraksi langsung dengan DALL-E 3, memiliki ChatGPT dalam kombinasi membuat proses pembuatan seni AI menjadi lebih ramah pengguna.

Periksa lebih lanjut tentang DALL-E 3 dan integrasinya dengan ChatGPT di sini. Kolaborasi ini tidak hanya menunjukkan kemajuan dalam AI multimodal tetapi juga membuat pembuatan seni AI menjadi lebih mudah bagi pengguna.

Google’s health pada lainnya memperkenalkan Med-PaLM M pada Juni tahun ini. Ini adalah model generatif multimodal yang mahir dalam mengkodekan dan menafsirkan data biomedis yang beragam. Hal ini dicapai dengan fine-tuning PaLM-E, model bahasa, untuk menyesuaikan dengan domain medis menggunakan benchmark sumber terbuka, MultiMedBench. Benchmark ini terdiri dari lebih dari 1 juta sampel di seluruh 7 jenis data biomedis dan 14 tugas seperti menjawab pertanyaan medis dan membuat laporan radiologi.

Berbagai industri mengadopsi alat AI multimodal inovatif untuk memacu ekspansi bisnis, mempermudah operasi, dan meningkatkan keterlibatan pelanggan. Kemajuan dalam kemampuan suara, video, dan teks AI mendorong pertumbuhan AI multimodal.

Perusahaan mencari aplikasi AI multimodal yang dapat mengubah model bisnis dan proses, membuka jalur pertumbuhan di seluruh ekosistem AI generatif, dari alat data hingga aplikasi AI yang muncul.

Setelah peluncuran GPT-4 pada Maret, beberapa pengguna mengamati penurunan kualitas responsnya seiring waktu, kekhawatiran yang juga diungkapkan oleh pengembang terkenal dan di forum OpenAI. Awalnya, OpenAI menolaknya, tetapi studi kemudian membenarkan masalah tersebut. Studi itu mengungkapkan penurunan akurasi GPT-4 dari 97,6% menjadi 2,4% antara Maret dan Juni, menunjukkan penurunan kualitas jawaban dengan pembaruan model berikutnya.

chatgpt-ai

ChatGPT (Biru) & Kecerdasan Buatan (Merah) Google Search Trend

Heboh sekitar Open AI’s ChatGPT kembali sekarang. Sekarang dilengkapi dengan fitur penglihatan GPT-4V, memungkinkan pengguna untuk menganalisis gambar yang diberikan. Ini adalah fitur terbaru yang dibuka untuk pengguna.

Menambahkan analisis gambar ke model bahasa besar (LLM) seperti GPT-4 dianggap oleh beberapa pihak sebagai langkah besar dalam penelitian dan pengembangan AI. Jenis LLM multimodal ini membuka kemungkinan baru, membawa model bahasa melampaui teks untuk menawarkan antarmuka baru dan memecahkan jenis tugas baru, menciptakan pengalaman baru bagi pengguna.

Pelatihan GPT-4V selesai pada 2022, dengan akses awal diluncurkan pada Maret 2023. Fitur visual di GPT-4V ditenagai oleh teknologi GPT-4. Proses pelatihan tetap sama. Awalnya, model dilatih untuk memprediksi kata berikutnya dalam teks menggunakan dataset besar teks dan gambar dari berbagai sumber, termasuk internet.

Kemudian, dilakukan fine-tuning dengan lebih banyak data, menggunakan metode yang disebut pembelajaran penguatan dari umpan balik manusia (RLHF), untuk menghasilkan output yang disukai manusia.

Mekanika Penglihatan GPT-4

Kemampuan bahasa penglihatan GPT-4 yang luar biasa, meskipun mengesankan, memiliki metode yang mendasarinya yang masih di permukaan.

Untuk mengeksplorasi hipotesis ini, model bahasa penglihatan baru, MiniGPT-4, diperkenalkan, yang menggunakan LLM canggih bernama Vicuna. Model ini menggunakan pengkode visual dengan komponen pra-latih untuk persepsi visual, menyelaraskan fitur visual yang dikodekan dengan model bahasa Vicuna melalui satu lapisan proyeksi. Arsitektur MiniGPT-4 sederhana namun efektif, dengan fokus pada menyelaraskan fitur visual dan bahasa untuk meningkatkan kemampuan percakapan visual.

MiniGPT-4

Arsitektur MiniGPT-4 mencakup pengkode visual dengan pra-latih ViT dan Q-Former, satu lapisan proyeksi linier, dan model bahasa besar Vicuna yang canggih.

Tren model bahasa autoregresif dalam tugas penglihatan-bahasa juga tumbuh, memanfaatkan transfer cross-modal untuk berbagi pengetahuan antara domain bahasa dan multimodal.

MiniGPT-4 menjembatani domain visual dan bahasa dengan menyelaraskan informasi visual dari pengkode visual pra-latih dengan model bahasa besar yang canggih. Model ini menggunakan Vicuna sebagai dekoder bahasa dan mengikuti pendekatan pelatihan dua tahap. Awalnya, dilatih pada dataset besar pasangan gambar-teks untuk memahami pengetahuan penglihatan-bahasa, diikuti dengan fine-tuning pada dataset yang lebih kecil dan berkualitas tinggi untuk meningkatkan keandalan dan kenyamanan generasi.

Untuk meningkatkan kealamiannya dan kenyamanan bahasa yang dihasilkan dalam MiniGPT-4, peneliti mengembangkan proses penyelarasan dua tahap, menangani kekurangan dataset penyelarasan penglihatan-bahasa yang memadai. Mereka membuat dataset khusus untuk tujuan ini.

Awalnya, model menghasilkan deskripsi rinci dari gambar input, meningkatkan detail dengan menggunakan prompt percakapan yang selaras dengan format model bahasa Vicuna. Tahap ini bertujuan untuk menghasilkan deskripsi gambar yang lebih komprehensif.

Prompt Deskripsi Gambar Awal:

###Human: <Img><ImageFeature></Img>Deskripsikan gambar ini secara rinci. Berikan sebanyak mungkin detail. Katakan semua yang Anda lihat. ###Assistant:

Untuk pemrosesan data pasca, ketidakkonsistenan atau kesalahan dalam deskripsi yang dihasilkan diperbaiki menggunakan ChatGPT, diikuti dengan verifikasi manual untuk memastikan kualitas tinggi.

Prompt Fine-tuning Tahap Kedua:

###Human: <Img><ImageFeature></Img><Instruction>###Assistant:

Eksplorasi ini membuka jendela untuk memahami mekanika AI generatif multimodal seperti GPT-4, memberikan gambaran tentang bagaimana modalitas penglihatan dan bahasa dapat diintegrasikan secara efektif untuk menghasilkan output yang kohesif dan kaya konteks.

Menggali GPT-4 Vision

Menentukan Asal Gambar dengan ChatGPT

GPT-4 Vision meningkatkan kemampuan ChatGPT untuk menganalisis gambar dan menentukan asal geografisnya. Fitur ini beralih dari interaksi teks murni ke kombinasi teks dan visual, menjadi alat yang berguna bagi mereka yang ingin tahu tentang tempat-tempat melalui data gambar.

Chatgpt-vision-GPT-4

Menanyakan ChatGPT tentang asal gambar landmark

Konsep Matematika Kompleks

GPT-4 Vision unggul dalam menganalisis konsep matematika kompleks dengan menganalisis ekspresi grafis atau tulisan tangan. Fitur ini berfungsi sebagai alat yang berguna bagi individu yang ingin memecahkan masalah matematika kompleks, menjadikan GPT-4 Vision sebagai bantuan yang signifikan dalam bidang pendidikan dan akademis.

Chatgpt-vision-GPT-4

Menanyakan ChatGPT untuk memahami konsep matematika kompleks

Mengubah Input Tulisan Tangan ke Kode LaTeX

Salah satu kemampuan luar biasa GPT-4V adalah kemampuannya untuk menerjemahkan input tulisan tangan ke dalam kode LaTeX. Fitur ini merupakan berkah bagi peneliti, akademisi, dan siswa yang sering perlu mengubah ekspresi matematika tulisan tangan atau informasi teknis lainnya ke dalam format digital. Transformasi dari tulisan tangan ke LaTeX memperluas cakrawala digitalisasi dokumen dan mempermudah proses penulisan teknis.

Kemampuan GPT-4V untuk mengubah input tulisan tangan ke kode LaTeX

Kemampuan GPT-4V untuk mengubah input tulisan tangan ke kode LaTeX

Mengambil Detail Tabel

GPT-4V menunjukkan kemampuan dalam mengambil detail dari tabel dan menjawab pertanyaan terkait, aset penting dalam analisis data. Pengguna dapat menggunakan GPT-4V untuk menyaring tabel, mengumpulkan wawasan kunci, dan menjawab pertanyaan, menjadikannya alat yang kuat bagi analis data dan profesional lainnya.

GPT-4V memahami detail tabel dan menjawab pertanyaan terkait

GPT-4V memahami detail tabel dan menjawab pertanyaan terkait

Memahami Penunjukan Visual

Kemampuan unik GPT-4V untuk memahami penunjukan visual menambahkan dimensi baru pada interaksi pengguna. Dengan memahami petunjuk visual, GPT-4V dapat merespons pertanyaan dengan pemahaman kontekstual yang lebih tinggi.

GPT-4V menunjukkan kemampuan unik untuk memahami penunjukan visual

GPT-4V menunjukkan kemampuan unik untuk memahami penunjukan visual

Membangun Situs Web Mock-Up Sederhana Menggunakan Gambar

Terinspirasi oleh tweet ini, saya mencoba membuat mock-up untuk situs web unite.ai.

Sementara hasilnya tidak sepenuhnya sesuai dengan visi awal saya, berikut adalah hasil yang saya capai.

Output HTML Frontend berbasis ChatGPT Vision

Output HTML Frontend berbasis ChatGPT Vision

Keterbatasan & Kelemahan GPT-4V(ision)

Untuk menganalisis GPT-4V, tim Open AI melakukan penilaian kualitatif dan kuantitatif. Penilaian kualitatif mencakup pengujian internal dan tinjauan ahli eksternal, sedangkan penilaian kuantitatif mengukur penolakan model dan akurasi dalam berbagai skenario seperti mengidentifikasi konten berbahaya, pengenalan demografis, kekhawatiran privasi, geolokasi, keamanan siber, dan jailbreak multimodal.

Namun, model ini tidak sempurna.

Makalah ini menyoroti keterbatasan GPT-4V, seperti inferensi yang salah dan teks atau karakter yang hilang dalam gambar. Ini dapat menghasilkan halusinasi atau mengarang fakta. Terutama, tidak cocok untuk mengidentifikasi zat berbahaya dalam gambar, sering salah mengidentifikasinya.

Dalam pencitraan medis, GPT-4V dapat memberikan respons yang tidak konsisten dan kekurangan kesadaran akan praktik standar, yang dapat menyebabkan diagnosis yang salah.

Kinerja tidak dapat diandalkan untuk tujuan medis.

Kinerja tidak dapat diandalkan untuk tujuan medis (Sumber)

Ini juga gagal memahami nuansa simbol kebencian tertentu dan dapat menghasilkan konten yang tidak pantas berdasarkan input visual. OpenAI menyarankan agar GPT-4V tidak digunakan untuk interpretasi kritis, terutama dalam konteks medis atau sensitif.

Mengakhiri

Dibuat menggunakan Fast Stable Diffusion XL

Dibuat menggunakan Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl

Kedatangan GPT-4 Vision (GPT-4V) membawa sejumlah kemungkinan baru dan tantangan yang harus diatasi. Sebelum diluncurkan, banyak upaya telah dilakukan untuk memastikan risiko, terutama yang berkaitan dengan gambar orang, telah dipertimbangkan dan dikurangi. Mengesankan melihat seberapa besar GPT-4V telah maju, menunjukkan banyak janji dalam bidang yang sulit seperti kedokteran dan sains.

Sekarang, ada beberapa pertanyaan besar di meja. Misalnya, apakah model ini seharusnya dapat mengidentifikasi orang terkenal dari foto? Apakah mereka harus menebak jenis kelamin, ras, atau perasaan seseorang dari gambar? Dan, apakah harus ada penyesuaian khusus untuk membantu orang dengan disabilitas visual? Pertanyaan-pertanyaan ini membuka kaleng cacing tentang privasi, keadilan, dan bagaimana AI harus masuk ke dalam kehidupan kita, yang merupakan sesuatu yang harus dibicarakan oleh semua orang.

Saya telah menghabiskan lima tahun terakhir dengan membenamkan diri dalam dunia Machine Learning dan Deep Learning yang menarik. Minat dan keahlian saya telah memimpin saya untuk berkontribusi pada lebih dari 50 proyek rekayasa perangkat lunak yang beragam, dengan fokus khusus pada AI/ML. Rasa ingin tahu saya yang terus-menerus juga telah menarik saya ke arah Natural Language Processing, sebuah bidang yang saya ingin jelajahi lebih lanjut.