Yapay zeka modelleri ve platformları

Çok Modlu AI Gelişir: ChatGPT GPT-4V ile Görmeye Başlar

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

İnsanlara benzer AI yaratma çabaları kapsamında OpenAI’nin GPT modelleri sürekli olarak sınırları zorluyor. GPT-4 şimdi metin ve resim gibi iki farklı türde girdi kabul edebiliyor.

Yaratıcı AI’de çok modallik, bir modelin metin, resim veya ses gibi çeşitli çıktılar üretebilme yeteneğini ifade eder. Bu tür modeller, belirli verilerle eğitilir ve benzer yeni veriler oluşturmak için altta yatan kalıpları öğrenir, böylece AI uygulamalarını zenginleştirir.

Son zamanlarda bu alanda önemli bir ilerleme, DALL-E 3’ün ChatGPT’ye entegrasyonu ile görüldü. Bu, OpenAI’nin metin-resim teknolojisinde önemli bir güncelleme oldu. Bu birleşim, ChatGPT’nin DALL-E 3 için precisa promt’lar oluşturmasına olanak tanır, böylece kullanıcı fikirlerini canlı AI-sanatına dönüştürür. Böylece, kullanıcılar doğrudan DALL-E 3 ile etkileşime girebilir, ancak ChatGPT’nin karışması, AI-sanatını yaratma sürecini çok daha kullanıcı dostu hale getirir.

DALL-E 3 ve ChatGPT entegrasyonu hakkında daha fazla bilgi edinmek için buraya bakın. Bu işbirliği, sadece çok modlu AI’deki ilerlemeyi değil, aynı zamanda AI-sanatının yaratılmasını kullanıcılar için kolaylaştırmayı da gösterir.

Google’ın sağlık bölümü, bu yıl Haziran ayında Med-PaLM M’i tanıttı. Bu, çeşitli biyomedikal verilerini kodlayabilen ve yorumlayabilen çok modlu bir generatif modeldir. Bu, PaLM-E adlı bir dil modelinin tıbbi alanlara uyarlanmasıyla ve MultiMedBench adlı açık kaynaklı bir benchmark kullanarak gerçekleştirildi. Bu benchmark, 7 farklı biyomedikal veri türünden oluşan 1 milyondan fazla örnek ve tıbbi soru-cevap gibi 14 görevden oluşur.

Çeşitli endüstriler, iş genişlemesini hızlandırmak, operasyonları düzeltmek ve müşteri etkileşimini artırmak için yenilikçi çok modlu AI araçlarını benimsemektedir. Ses, video ve metin AI yeteneklerinde ilerleme, çok modlu AI’nin büyümesini hızlandırıyor.

Şirketler, iş modellerini ve süreçlerini dönüştürebilecek, büyüme fırsatları açabilecek çok modlu AI uygulamalarını aramaktadır. Bu, veri araçlarından ortaya çıkan AI uygulamalarına kadar tüm generatif AI ekosistemini kapsar.

GPT-4’ün Mart ayında piyasaya sürülmesinden sonra, bazı kullanıcılar zaman içinde yanıt kalitesinde bir düşüş gözlemledi. Bu endişe,著名 geliştiriciler ve OpenAI forumlarında da yankı buldu. OpenAI başlangıçta bu endişeyi reddetti, ancak daha sonra yapılan bir çalışma, bu sorunun gerçek olduğunu doğruladı. Çalışma, Mart ve Haziran arasında GPT-4’ün doğruluğunun %97.6’dan %2.4’e düştüğünü gösterdi, bu da model güncellemeleriyle birlikte yanıt kalitesinde bir düşüşü işaret etti.

ChatGPT hakkında daha fazla bilgi edinmek için Open AI’nin bloguna bakın. Şimdi, GPT-4V adlı bir vizyon özelliği ile geliyor, bu da kullanıcıların GPT-4’ü analiz etmesi için resimler vermesine olanak tanır. Bu, AI araştırması ve geliştirmesinde büyük bir adımdır ve dil modellerini metnin ötesine taşıyarak yeni arayüzler sunar ve yeni tür görevleri çözer.

GPT-4V’nin eğitimi 2022’de tamamlandı ve erken erişim Mart 2023’te sunuldu. GPT-4V’deki görsel özellik, GPT-4 teknolojisini kullanır ve eğitim süreci aynı kaldı. İlk olarak, model büyük bir metin ve resim verisi kümesinden sonraki kelimeyi tahmin etmek için eğitildi.

Daha sonra, insanların tercih ettiği çıktıları üretmek için insan geribildirimi pekiştirme yöntemi (RLHF) kullanarak daha fazla veri ile fine-tune edildi.

GPT-4’ün görme-dil yeteneklerinin mekanikleri, etkileyici olsa da, yüzeyde kalan temel yöntemlere sahiptir. Bu hipotezi keşfetmek için, MiniGPT-4 adlı yeni bir görme-dil modeli tanıtıldı. Bu model, Vicuna adlı gelişmiş bir büyük dil modeli kullanarak, önceden eğitilmiş bileşenleri olan bir görme kodlayıcısı kullanır. MiniGPT-4’ün mimarisi basit ancak etkilidir ve görsel ve dil özelliklerini hizalamaya odaklanır.

Görsel ve dil bilgilerini birleştirmek için MiniGPT-4, görsel algı için önceden eğitilmiş ViT ve Q-Former gibi bileşenleri kullanır. Model, görsel ve dil bilgilerini birleştirmek için tek bir lineer proje katmanını takip eden gelişmiş bir Vicuna büyük dil modeli kullanır.

Görsel ve dil alanları arasında bilgi paylaşımını sağlayan otoregresif dil modelleri de görsel-dil görevlerinde büyümektedir. MiniGPT-4, önceden eğitilmiş bir görme kodlayıcısından görsel bilgileri Vicuna dil modeliyle hizalayarak görsel ve dil alanlarını köprüler.

Araştırmacılar, doğal ve kullanılabilirlik açısından üretilen dili geliştirmek için MiniGPT-4’de iki aşamalı bir hizalama süreci geliştirdiler. İlk olarak, model büyük bir resim-metin çiftleri verisi üzerinde eğitilir, daha sonra daha küçük, yüksek kaliteli bir veri kümesinde fine-tune edilir.

Görsel-dil hizalaması için yeterli veri setlerinin eksikliğini gidermek için araştırmacılar özel bir veri seti oluşturdular. İlk olarak, model girdi resimlerinin ayrıntılı açıklamalarını üretir, daha sonra bu açıklamaları geliştirir. Bu aşamada, model daha kapsamlı resim açıklamaları üretmeyi amaçlar.

İlk Resim Açıklama İsteği:

###İnsan: <Resim><Resim Özellikleri></Resim>Bu resmi detaylı olarak açıklar mısınız? Gördüğünüz her şeyi söyleyin. ###Asistan:

Veri işleme için, üretilen açıklamalardaki tutarsızlıklar veya hatalar, ChatGPT ile düzeltilir ve ardından yüksek kaliteli garantisi için manuel olarak doğrulanır.

İkinci Aşama İyileştirme İsteği:

###İnsan: <Resim><Resim Özellikleri></Resim><Talimat>###Asistan:

Bu keşif, GPT-4 gibi çok modlu generatif AI’nin mekanizmalarını anlamaya bir pencere açar ve görme ve dil modellerinin nasıl etkili bir şekilde entegre edilebileceğini gösterir.

GPT-4 Görme’yi Keşfetmek

ChatGPT ile Resim Kökenini Belirleme

GPT-4 Görme, ChatGPT’nin resimleri analiz etme ve coğrafi kökenlerini belirleme yeteneğini geliştirir. Bu özellik, kullanıcı etkileşimlerini metinden görsellere taşır ve görüntü verilerini merak edenler için kullanışlı bir araç haline gelir.

Chatgpt-vision-GPT-4

ChatGPT’ye bir yerin nerede olduğunu sormak

Karmaşık Matematik Kavramları

GPT-4 Görme, grafik veya el yazısı ifadeleri analiz ederek karmaşık matematiksel kavramlara dalmaya exceller. Bu özellik, karmaşık matematiksel sorunları çözmeye çalışan bireyler için faydalı bir araçtır ve GPT-4 Görme’yi eğitim ve akademik alanlarda önemli bir yardımcı haline getirir.

Chatgpt-vision-GPT-4

ChatGPT’ye karmaşık bir matematik kavramı hakkında sormak

El Yazısı Girişini LaTeX Kodlarına Dönüştürme

GPT-4V’nin dikkat çekici yeteneklerinden biri, el yazısı girişlerini LaTeX kodlarına çevirebilmesidir. Bu özellik, sık sık el yazısı matematiksel ifadeleri veya diğer teknik bilgileri dijital forma dönüştürmesi gereken araştırmacılar, akademisyenler ve öğrenciler için bir nimettir. El yazısından LaTeX’e dönüşüm, belge dijitalleştirmesinin ufuklarını genişletir ve teknik yazma sürecini basitleştirir.

GPT-4V'nin el yazısı girişini LaTeX kodlarına dönüştürme yeteneği

GPT-4V’nin el yazısı girişini LaTeX kodlarına dönüştürme yeteneği

Tablo Ayrıntılarını Çıkarmak

GPT-4V, tablolardan ayrıntıları çıkarmak ve ilgili soruları yanıtlamak konusunda beceri gösterir, bu da veri analizi için önemli bir varlıktır. Kullanıcılar, GPT-4V’yi kullanarak tabloları tarayabilir, önemli içgörüler toplayabilir ve soruları çözebilir, böylece veri analistleri ve diğer profesyoneller için güçlü bir araç haline gelir.

GPT-4V'nin tablo ayrıntılarını anlaması ve ilgili soruları yanıtlaması

GPT-4V’nin tablo ayrıntılarını anlaması ve ilgili soruları yanıtlaması

Görsel İşaret Anlama

GPT-4V’nin görsel işaretleri anlama yeteneği, kullanıcı etkileşimine yeni bir boyut katar. Görsel ipuçlarını anlayan GPT-4V, sorulara daha yüksek bağlamsal anlayışla yanıt verebilir.

GPT-4V'nin görsel işaretleri doğrudan anlama yeteneği

GPT-4V’nin görsel işaretleri doğrudan anlama yeteneği

Çizim Kullanarak Basit Mock-Up Web Siteleri Oluşturmak

Bu tweet tarafından motive edildim ve unite.ai web sitesinin bir mock-up’ını oluşturmaya çalıştım.

Sonuçtam, ilk vizyonuma tam olarak uymasa da, ulaştığım sonucu burada paylaşıyorum.

ChatGPT Görme tabanlı çıktı HTML Ön yüzü

ChatGPT Görme tabanlı çıktı HTML Ön yüzü

GPT-4V(ision)’in Sınırlılıkları ve Hataları

GPT-4V’yi analiz etmek için Open AI ekibi, nitel ve nicel değerlendirmeler yaptı. Nitel değerlendirmeler, dahili testleri ve dış uzman incelemelerini içerirken, nicel değerlendirmeler model reddetmeleri ve çeşitli senaryolardaki doğruluğu ölçtü.

Model hala mükemmel değil.

Makale, GPT-4V’nin sınırlılıklarını vurguluyor, bunlar arasında resimlerdeki yanlış çıkarımlar ve metin veya karakterlerin eksikliği yer alıyor. Model, gerçekleri uydurabilir veya icat edebilir. Özellikle, resimlerdeki tehlikeli maddeleri tanımlamak için uygun değildir ve bunları thường yanlış tanımlar.

Tıbbi görüntüleme konusunda, GPT-4V tutarlı olmayan yanıtlar verebilir ve standard uygulamalara aşinadır, bu da potansiyel yanlış teşhislere yol açabilir.

Tıbbi amaçlar için güvenilir performans

Tıbbi amaçlar için güvenilir performans (Kaynak)

Ayrıca, belirli nefret sembollerinin nüanslarını kavramakta başarısız olabilir ve görsel girdilere dayalı uygun olmayan içerik oluşturabilir. OpenAI, GPT-4V’yi özellikle tıbbi veya hassas bağlamlarda kritik yorumlar için kullanmamayı önerir.

Sonuç

Fast Stable Diffusion XL kullanılarak oluşturuldu

Fast Stable Diffusion XL kullanılarak oluşturuldu https://huggingface.co/spaces/google/sdxl

GPT-4 Görme (GPT-4V) ile gelen yeni olanaklar ve yeni engeller, AI’nin geleceğini şekillendirmeye devam ediyor. Bu özelliği sunmadan önce, özellikle resimlerdeki insanların görüntülerini dikkate alarak riskleri azaltmaya yönelik çok çaba sarf edildi. GPT-4V’nin, özellikle tıp ve bilim gibi zorlu alanlarda büyük bir potansiyel göstermesi etkileyici.

Şimdi, büyük sorular gündeme geliyor. Örneğin, bu modellerin ünlü kişileri resimlerinden tanımlamaları mı gerekiyor? Bir kişinin cinsiyetini, ırkını veya duygularını bir resimden tahmin etmeleri mi gerekiyor? Görme engelliler için özel ayarlamalar mı yapılmalı? Bu sorular, gizlilik, adalet ve AI’nin hayatlarımızda nasıl yer alması gerektiği hakkında herkesin söz sahibi olduğu bir tartışmayı başlatıyor.

Son beş yıldır Makine Öğrenimi ve Derin Öğrenme dünyasına kendimi adamış bulunuyorum. Tutkum ve uzmanlığım, özellikle AI/ML'ye odaklanarak 50'den fazla çeşitli yazılım mühendisliği projesine katkıda bulunmama yol açtı. Süregelen meraklılığım da beni Doğal Dil İşleme alanına yöneltti, bu alana daha da derinlemesine girmeye hevesliyim.