Anderson’un Açısı

Bilgisayarlı Görü Datasetsi için Tarayıcı Tabanlı Resim İşaretleme Aracı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Finlandiya’dan araştırmacılar, bilgisayar görü datasetsi için zahmetli resim işaretleme süreçlerinin kolaylığını ve hızını artırmak amacıyla bir tarayıcı tabanlı resim etiketleme aracı geliştirdiler. En popüler tarayıcı motorları için OS-bağımsız bir uzantı olarak kurulan bu yeni araç, kullanıcıların bir etiketleme oturumunu özel bir kurulum bağlamına koymak veya istemci tarafı kodu çalıştırmak zorunda kalmadan “serbestçe gezinirken etiketleme” yapmalarını sağlar.

BRIMA (Düşük-Örtülü Tarayıcı-Sadece Resim Etiketleme Aracı) olarak adlandırılan sistem, Jyväskylä Üniversitesi’nde geliştirilmiştir. Kullanıcıların yerel veya uzaktaki dizinlere veri toplamak ve derlemek zorunda kalmadan, çeşitli veri parametrelerinden yararlı verileri türetmek için yapılandırılabilir.

BRIMA çalışır durumda. Kaynak: https://arxiv.org/pdf/2107.06351.pdf

BRIMA çalışır durumda. Kaynak: https://arxiv.org/pdf/2107.06351.pdf

Bu şekilde BRIMA (ki 2021 ICIP’de sunulacak ve kod da o zaman kullanılabilir olacak), otomatik web kazıma sistemlerinin IP aralıkları veya diğer yöntemlerle engellenmesi ve veri toplamakta engellenmesi olasılığını ortadan kaldırır – bu, IP korumasının giderek daha fazla odaklandığı ve son olarak Microsoft’un AI ile çalışan kod oluşturma aracı Copilot ile yaptığı gibi daha yaygın hale gelecek bir senaryo.

BRIMA, yalnızca insan tabanlı etiketleme için tasarlandığından, diğer tür engelleri tetikleme olasılığı da daha düşük, örneğin CAPTCHA zorlukları veya veri toplama algoritmalarını engellemek amacıyla tasarlanmış diğer otomatik sistemler.

Uyarlanabilir Veri Toplama Özellikleri

BRIMA, Windows, OSX veya Linux için Firefox eklentisi veya Chrome uzantısı olarak uygulanır ve bir platformun maruz bırakabileceği veri noktalarına dayalı olarak önemli verileri işlemek için yapılandırılabilir. Örneğin, Google Street View’de resimleri etiketlerken, sistem lensin yönünü ve görüş açısını hesaba katabilir ve kullanıcı tarafından belirtilen nesnenin tam coğrafi konumunu kaydedebilir.

BRIMA, Eylül 2020’de yaratıcıları tarafından, halka açık alanlarda veya halka açık alanlardan görülebilen video gözetim kameraları için bir nesne algılama veri seti oluşturmak amacıyla bir işbirliği çalışması sırasında test edildi.

Sistem, bir tarayıcı uzantısı olarak hafif bir JavaScript istemci tarafı kurulumundan ve etiketleme verilerini alan ve derleyen bir sunucu tarafı bileşeninden oluşur. Sunucu tarafı kurulumunun referans uygulamaları Python ve PHP ile Flask ve Swagger/OpenAPI kullanılarak yazılmıştır, ancak araştırmacılar merkezi işlem mimarisinin kolayca diğer dillere ve yapılandırmalara taşınabileceğini vurgulamaktadır.

Tarayıcı uzantısı ve sunucu, RESTful API istekleri ve HTTP/XHR aracılığıyla iletişim kurar ve istemci tarafı verileri JSON formatında, MS COCO ile uyumlu bir şekilde gönderilir. Bu, verilerin çeşitli popüler nesne algılama çerçeveleriyle, örneğin Facebook’un Detectron2 ve CenterMask2 gibi TensorFlow’un çeşitli arka uçları ile hemen kullanılabilir olmasını sağlar.

Proje-Spesifik Araçlar

BRIMA’nın genel doğası olmasına rağmen, yüksek olarak spesifik veri toplama yapılandırmalarına dönüştürülebilir, bu da belirli bir alanla ilgili açılır menüler ve diğer tür kontekstüel girişlerin dayatılmasını içerir. Aşağıdaki resimde, kamera bilgileriyle ilgili bir açılır menüsünün BRIMA’ya yazıldığını görüyoruz, böylece bir grup etiketleyici, proje ile ilgili ayrıntılı ve ilgili bilgileri sağlayabilir.

Bu ekstra araçlar yerel olarak yapılandırılabilir. Uzantı, ayrıca kolay kurulum ve yapılandırılabilir klavye kısayolları sunar ve renkli UI öğeleri içerir.

Çalışma, son yıllarda web-obtained veya halka açık veri için resim etiketleme kolaylığını iyileştirmeye yönelik çeşitli girişimlerin üzerine inşa edilmiştir. DARPA tarafından desteklenen PhotoStuff aracı, bir web portalı aracılığıyla çevrimiçi etiketleme sunar ve semantic web veya bağımsız bir uygulama olarak çalıştırılabilir; 2004 yılında UC Berkeley, Kamera Telefonunda Fotoğraf Etiketleme önerisini sundu, bu, o dönemin ağ kapsama alanı sınırlamaları ve görünüm sınırlamaları nedeniyle büyük ölçüde meta verileri kullanıyordu; MIT’nin 2005 LabelMe projesi de tarayıcı tabanlı etiketlemeye yaklaştı, MATLAB araçlarına güveniyordu;

2015’te yayınlanan FOSS Python/QT çerçevesi LabelImg, halka açık kaynaklı etiketleme çabalarında popülerlik kazanmıştır, ancak BRIMA araştırmacıları, LabelImg’nin PascalVOC ve YOLO standartlarına odaklandığını, MS COCO JSON formatını desteklemediğini ve basit dikdörtgen yakalama bölgelerini tercih ettiğini, bu da sonraki segmentasyonu gerektirecektir.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai