Yapay zeka modelleri ve platformları

Mobil Ejentler: Özerk Çoğul Modlu Mobil Cihaz Ejenti ile Görsel Algı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Çok Modlu Büyük Dil Modelleri (MLLM) ortaya çıkışıyla birlikte, metin, resim ve ses aracılığıyla dünya ile etkileşime giren mobil cihaz ejentleri için yeni bir dönem başladı. Bu ejentler, geleneksel AI’ın üzerine önemli bir ilerleme kaydetmiş ve kullanıcıların cihazlarıyla daha zengin ve daha sezgisel bir şekilde etkileşime girmelerine olanak tanıyan bir yol sunuyor. MLLM’yi kullanarak, bu ejentler çeşitli modellerden gelen büyük miktarda bilgiyi işleyip sentezleyerek, kişiselleştirilmiş yardım sunma ve kullanıcı deneyimini önceden düşünülenden daha fazla geliştirme yeteneğine sahip.

Bu ejentler, state-of-the-art makine öğrenimi teknikleri ve gelişmiş doğal dil işleme yetenekleri tarafından desteklenmektedir. Bu sayede, insan benzeri metin oluşturabilir ve görsel ve işitsel verileriremarkable bir doğrulukla yorumlayabilirler. Resimlerdeki nesneleri ve sahneleri tanıyarak, konuşma komutlarını anlar ve metin duygusunu analiz ederken, bu çok modlu ejentler geniş bir girdi yelpazesini sorunsuz bir şekilde işleyebilir. Bu teknolojinin potansiyeli çok büyük ve daha sofistike, bağlamsal olarak daha fazla farkındalıklı hizmetler sunma yeteneğine sahip. Sanal asistanlar, insan duygularına duyarlı ve bireysel öğrenme stillerine adapte olan eğitim araçları gibi. Ayrıca, teknolojiye erişimi dil ve duyusal engeller üzerinden daha da kolaylaştıracak.

Bu makalede, Mobil Ejentler hakkında konuşacağız. Mobil Ejentler, bir mobil uygulamanın arayüzündeki görsel ve metinsel öğeleri doğru bir şekilde tanımlamak için görsel algı araçlarını kullanan özerk, çok modlu bir mobil cihaz ejentidir. Algılanan bu görsel bağlamı kullanarak, Mobil Ejentler frameworkü, karmaşık işlemleri otomatik olarak planlar ve adım adım mobil uygulamaları gezinir. Mobil Ejentler frameworkü, mevcut çözümlerden farklı olarak, mobil sistem meta verilerine veya mobil uygulamaların XML dosyalarına bağlı değildir. Bu, çeşitli mobil işletim sistemleri arasında daha fazla esneklik sağlar ve görsel odaklı işleme odaklanır. Mobil Ejentler frameworkü tarafından kullanılan yaklaşım, sistem özgü uyarlamalara olan ihtiyacı ortadan kaldırır, verimliliği artırır ve hesaplamalı talepleri azaltır.

Mobil Ejentler: Özerk Çoğul Modlu Mobil Cihaz Ejenti

Mobil teknoloji dünyasında, bir öncü kavram ortaya çıkıyor: Büyük Dil Modelleri, özellikle çok modlu büyük dil modelleri veya MLLM’ler, çeşitli dillerde metin, resim, video ve konuşma üretebiliyor. MLLM frameworklerinin son birkaç yılda hızlı gelişimi, MLLM’lerin yeni ve güçlü bir uygulamasına yol açtı: özerk mobil ejentler. Özerk mobil ejentler, direkt insan komutlarına gerek kalmadan bağımsız olarak hareket eden, görevleri gerçekleştiren, bilgi toplayan veya sorunları çözen yazılımlardır.

Mobil Ejentler, kullanıcı talimatlarına ve ekran görsellerine dayanarak mobil cihazları çalıştırmak üzere tasarlanmıştır. Bu, ejentlerin hem anlamsal anlam hem de görsel algı yeteneklerine sahip olmasını gerektirir. Ancak mevcut mobil ejentler mükemmel değildir, çünkü çok modlu büyük dil modellerine dayanır ve hatta GPT-4V gibi güncel MLLM frameworkleri bile etkili bir mobil ejent olarak görev yapmak için gerekli görsel algı yeteneklerine sahip değildir. Ayrıca, mevcut frameworkler etkili işlemler üretebilir, ancak bu işlemlerin ekran上的 konumlarını doğru bir şekilde belirleyemez, bu da mobil ejentlerin mobil cihazlarda çalıştırma yeteneklerini sınırlar.

Bu sorunu çözmek için bazı frameworkler, kullanıcı arayüzü düzen dosyalarını GPT-4V veya diğer MLLM’lerle birlikte kullanmayı seçti. Bazı frameworkler, uygulamaların XML dosyalarına erişerek ekrandaki konumları belirleyebildi, diğerleri ise web uygulamalarından HTML kodunu kullandı. Bu frameworklerin çoğu, yerel ve yerel uygulama dosyalarına erişime dayanmaktadır, bu da bu yöntemin bu dosyaları erişemezse neredeyse etkisiz olacağı anlamına gelir. Bu sorunu çözmek ve yerel ejentlerin altındaki dosyalarına bağımlılığını ortadan kaldırmak için, geliştiriciler Mobil Ejentler üzerinde çalıştı. Mobil Ejentler frameworkü, görsel algı yeteneklerine sahip bir özerk mobil ejenti kullanır. Görsel algı modülü, ekrandaki metni tanımlamak ve belirli bir bölgedeki içeriği açıklamak için OCR ve algılama modellerini barındırır. Mobil Ejentler frameworkü, araçlar ve ejentler arasında verimli etkileşimi sağlayan özenle hazırlanmış promtleri kullanır ve böylece mobil cihaz işlemlerini otomatikleştirir.

Ayrıca, Mobil Ejentler frameworkü, GPT-4V gibi state-of-the-art MLLM frameworklerinin bağlamsal yeteneklerini kullanarak, işlemleri talimat geçmişine, kullanıcı talimatlarına ve ekran görüntülerine dayanarak planlama yeteneği kazanmayı amaçlar. Mobil Ejentler frameworkü, ayrıca ejentin eksik talimatları ve yanlış işlemleri tanımlama yeteneğini artırmak için bir self-reflection yöntemi tanır. Özenle hazırlanmış promtlerin rehberliğinde, ejent yanlış ve geçersiz işlemler üzerinde sürekli olarak düşünür ve görev veya talimat tamamlandığında işlemleri durdurur.

Genel olarak, Mobil Ejentler frameworkünün katkıları aşağıdaki gibi özetlenebilir:

  1. Mobil Ejentler, görsel algı araçlarını kullanarak işlemleri yerelleştiren özerk bir mobil cihaz ejentidir. Her adımda planlar veintrospeksiyon yapar. Özellikle, Mobil Ejentler yalnızca cihaz ekran görüntülerine dayanır, sistem kodunu kullanmaz, bu da bir çözümün tamamen görsel tekniklere dayandığını gösterir.
  2. Mobil Ejentler, mobil cihaz ejentlerini değerlendirmek için tasarlanmış bir benchmark olan Mobile-Eval’i tanır. Bu benchmark, en sık kullanılan on mobil uygulamayı ve bu uygulamalar için üç seviyede zorluk kategorisine ayrılmış akıllı talimatları içerir.

Mobil Ejentler: Mimarisi ve Yöntemi

Mobil Ejentler frameworkünün temelinde, bir state-of-the-art Multimodal Large Language Model, GPT-4V ve metin algılama modülü bulunmaktadır. GPT-4V ile birlikte, Mobil Ejentler frameworkü ayrıca bir simge algılama modülünü de kullanır.

Görsel Algı

Önceden bahsedildiği gibi, GPT-4V MLLM talimatlar ve ekran görüntüleri için tatmin edici sonuçlar verir, ancak işlemlerin konumunu etkili bir şekilde belirlemede başarısız olur. Bu sınırlamaya rağmen, GPT-4V modelini uygulayan Mobil Ejentler frameworkü, işlemleri yerelleştirmeye yardımcı olmak için dış araçlara dayanmak zorundadır.

Metin Yerelleştirme

Mobil Ejentler frameworkü, ekrandaki metnin konumunu belirlemek için bir OCR aracı uygular. Mobil ekranında belirli bir metne dokunmak istediğinde, ejent bu metni tanıyarak işlemleri gerçekleştirebilir. Metin yerelleştirme için üç benzersiz senaryo vardır.

Senaryo 1: Belirtilen Metin Tespit Edilemedi

Sorun: OCR, belirtilen metni tanımlayamaz, bu durum karmaşık resimlerde veya OCR sınırlamaları nedeniyle oluşabilir.

Cevap: Ejenti, ya metni yeniden seçmeye ya da alternatif bir işlem seçmeye yönlendirin.

  • OCR’nin eksikliğini düzeltmek için metni yeniden seçin veya farklı bir girdi yöntemi kullanın.
  • Alternatif bir işlem seçin, örneğin farklı bir girdi yöntemi kullanın veya görevle ilgili başka bir eylem gerçekleştirin.

Neden: Bu esneklik, GPT-4V’nin olası yanlışlıklarını veya hayal powerini yönetmek için gereklidir.

Senaryo 2: Belirtilen Metin Tek Bir Kere Tespit Edildi

İşlem: Otomatik olarak, tespit edilen metin kutusunun merkez koordinatlarına tıklatma işlemini üretin.

Açıklama: Sadece bir instance tespit edildiğinde, doğru tanımlama olasılığı yüksektir, bu nedenle doğrudan bir eylem gerçekleştirmek verimlidir.

Senaryo 3: Belirtilen Metin Birden Fazla Kez Tespit Edildi

Değerlendirme: İlk olarak, tespit edilen instance sayısını değerlendirin:

Çoklu Instance: Ekranın benzer içeriklerle dolu olduğunu gösterir, bu da seçimi zorlaştırır.

İşlem: Ejenti, metni yeniden seçmeye veya arama parametrelerini ayarlamaya yönlendirin.

Az Instance: İşlemi basitleştirmek için daha az instance bulunur.

İşlem: Bu instance’lerin etrafındaki bölgeleri kırpın ve metin algılama kutularını dışarıya doğru genişletin. Bu, daha fazla bağlamın korunmasını sağlar ve karar verme sürecini kolaylaştırır.

Sonraki Adım: Kırpılmış resimlere algılama kutularını çizerek ejente sunun. Bu, ejentin görev veya işlem gereksinimlerine göre hangi instance ile etkileşime gireceğine karar vermesine yardımcı olur.

Bu yapılandırılmış yaklaşım, OCR sonuçları ve ejent işlemleri arasındaki etkileşimi optimize eder, sistemi daha güvenilir ve çeşitli senaryolarda daha uyumlu hale getirir. Tüm süreç aşağıdaki resimde gösterilmektedir.

Simge Yerelleştirme

Mobil Ejentler frameworkü, simge algılama aracını kullanarak, ejentin mobil ekranında bir simgeye tıklaması gerektiğinde simgenin konumunu belirler. Daha spesifik olarak, framework önce ejenden simgenin özelliklerini ister, ardından Grounding DINO yöntemini uygular ve CLIP frameworkünü kullanarak simge tanımlamasını gerçekleştirir.

Talimat İcrası

Ejent tarafından ekranda gerçekleştirilecek işlemleri üretmek için, Mobil Ejentler frameworkü 8 farklı işlemi tanımlar.

  • Uygulamayı Başlat (Uygulama Adı): Belirtilen uygulamayı masaüstü arayüzünden başlatın.
  • Metne Dokun (Metin Etiketi): Ekranın “Metin Etiketi” gösteren kısmıyla etkileşime girin.
  • Simgeyle Etkileşime Gir (Simge Tanımı, Konum): Belirtilen simge alanını hedefleyin ve tıklatın, “Simge Tanımı”nda simgenin renk ve şekil gibi özelliklerini belirtin. “Konum” için üst, alt, sol, sağ veya merkez gibi seçeneklerden birini seçin.
  • Metin Gir (Giriş Metni): Verilen “Giriş Metni”ni aktif metin alanına girin.
  • Yukarı ve Aşağı Kaydır: Mevcut sayfanın içeriğini yukarı veya aşağı kaydırın.
  • Geri Dön: Önceki sayfaya geri dönün.
  • Kapat: Mevcut ekranın direkt masaüstü ekranına dönün.
  • Dur: İşlem tamamlanınca işlemi sonlandırın.

Kendiliğinden Planlama

Her işlemin her adımı framework tarafından iteratif olarak gerçekleştirilir ve her iterasyonun başlangıcında, kullanıcıdan bir girdi talimatı istenir ve Mobil Ejentler modeli bu talimata dayanarak tüm süreci üretmek için bir sistem promt’u oluşturur. Ayrıca, her iterasyonun başlangıcında, framework bir ekran görüntüsü alır ve ejente sunar. Ejent, ekran görüntüsünü, işlem geçmişini ve sistem promt’larını göz önünde bulundurarak bir sonraki adımın işlemlerini üretir.

Kendiliğinden Yansıtma

İşlemleri gerçekleştirirken, ejent hatalarla karşılaşabilir ve bir komutu başarılı bir şekilde gerçekleştiremeyebilir. Talimatların yerine getirilme oranını artırmak için, self-reflection yöntemi uygulanır. Özenle hazırlanmış promtlerin rehberliğinde, ejent yanlış veya geçersiz bir işlem gerçekleştirdiğinde veya ekran görüntüsü değişmediğinde, alternatif işlemler veya mevcut işlemin parametrelerini ayarlamaya yönlendirilir. Ejent, bir dizi işlemi gerçekleştirdikten sonra, son ekran görüntüsünü ve kullanıcı talimatlarını göz önünde bulundurarak görevin tamamlanıp tamamlanmadığını değerlendirir. Uygun değilse, ejent otomatik olarak yeni işlemler üretir.

Mobil Ejentler: Deneyimler ve Sonuçlar

Kabiliyetlerini kapsamlı bir şekilde değerlendirmek için, Mobil Ejentler frameworkü, 10 yaygın kullanılan uygulamayı içeren Mobile-Eval benchmark’unu tanır ve her uygulama için üç talimat tasarlar. İlk işlem basittir ve yalnızca temel uygulama işlemlerini kapsar, ikinci işlem ise biraz daha karmaşıktır ve ek gereksinimleri içerir. Son olarak, üçüncü işlem en karmaşıktır ve soyut kullanıcı talimatlarını içerir, kullanıcı açıkça hangi uygulamayı kullanacağını veya hangi işlemi gerçekleştireceğini belirtmez.

Ayrıca, performansını farklı açılardan değerlendirmek için, Mobil Ejentler frameworkü dört farklı metric tasarlar ve uygular.

  • Başarı veya Success: Mobil ejent talimatları tamamlarsa, bu bir başarı olarak kabul edilir.
  • İşlem Puanı veya PS: İşlem Puanı metrici, talimatların yürütülmesi sırasında her adımın doğruluğunu ölçer ve doğru adımların toplam adımlara bölünmesiyle hesaplanır.
  • Göreceli Verimlilik veya RE: Göreceli verimlilik puanı, bir insan tarafından manuel olarak bir talimatı gerçekleştirmek için gereken adımlarla, ejentin aynı talimatı gerçekleştirmek için gereken adımlar arasındaki bir karşılaştırmadır.
  • Tamamlanma Oranı veya CR: Tamamlanma oranı metrici, framework tarafından başarılı bir şekilde tamamlanan insan tarafından işletilen adımların sayısını, bir talimatı tamamlamak için bir insan tarafından gerçekleştirilen toplam adımların sayısına böler. CR değeri 1’dir quando ejent talimatı başarılı bir şekilde tamamlar.

Sonuçlar aşağıdaki figürde gösterilmektedir.

İlk olarak, üç verilen görev için, Mobil Ejentler sırasıyla %91, %82 ve %82’lik tamamlanma oranlarına ulaştı. Tüm görevler mükemmel bir şekilde gerçekleştirilmedi, ancak her görev kategorisi için başarı oranları %90’ın üzerine çıktı. Ayrıca, PS metrici, Mobil Ejentler’in üç görev için de doğru işlemleri gerçekleştirmede yüksek bir olasılığa sahip olduğunu gösterdi, başarı oranları yaklaşık %80’dir. Ek olarak, RE metrici, Mobil Ejentler’in insan optimalliğine benzer bir düzeyde işlemleri gerçekleştirmede %80’lik bir verimlilik gösterdiğini ortaya koydu. Bu sonuçlar birlikte, Mobil Ejentler’in mobil cihaz asistanı olarak yeteneklerini vurgulamaktadır.

Aşağıdaki figür, Mobil Ejentler’in kullanıcı komutlarını anlama ve bağımsız olarak eylemlerini planlama yeteneğini göstermektedir. Talimatlarda açık işlem detayları olmasa bile, Mobil Ejentler kullanıcıların gereksinimlerini etkili bir şekilde yorumlayabilmiş ve bunları işlemler haline getirebilmiştir. Bu anlaşılırlık之后, ejent talimatları sistematik bir planlama süreci aracılığıyla gerçekleştirmiştir.

Son Düşünceler

Bu makalede, Mobil Ejentler hakkında konuştuk. Mobil Ejentler, görsel algı teknolojilerini kullanarak mobil uygulamasının arayüzündeki görsel ve metinsel öğeleri doğru bir şekilde tanımlayan özerk, çok modlu bir mobil cihaz ejentidir. Bu görsel bağlamı kullanarak, Mobil Ejentler frameworkü, karmaşık işlemleri otomatik olarak planlar ve adım adım mobil uygulamaları gezinir. Mobil Ejentler frameworkü, mevcut çözümlerden farklı olarak, mobil sistem meta verilerine veya mobil uygulamaların XML dosyalarına bağlı değildir, bu da çeşitli mobil işletim sistemleri arasında daha fazla esneklik sağlar ve görsel odaklı işleme odaklanır. Mobil Ejentler frameworkü tarafından kullanılan yaklaşım, sistem özgü uyarlamalara olan ihtiyacı ortadan kaldırır, verimliliği artırır ve hesaplamalı talepleri azaltır.

Mesleği mühendis, kalbi yazar. Kunal, AI ve ML'ye derin bir sevgi ve anlayışla technical writer, bu alanlardaki karmaşık kavramları etkileyici ve bilgilendirici belgelerle basitleştirmeye adanmış.