Anderson’un Açısı

Makine Öğrenimi ile Yasaklanan Sosyal Medya Yorumcularını Yeniden Tanımlama

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Johns Hopkins Üniversitesi’nden araştırmacılar, daha önce hesapları askıya alınmış olan veya astroturfing veya diğer manipülasyonlar için birden fazla hesap kullanan çevrimiçi yorumcuları tanımlamak için Derin Ölçü yaklaşımı geliştirdiler.

Yaklaşım, NLP araştırmacısı Aleem Khan’ın liderliğindeki yeni bir makalede sunuldu ve girdileri otomatik veya manuel olarak etiketlemeye gerek duyulmuyor ve yalnızca küçük metin örnekleri mevcut olduğunda veya metin eğitim zamanında veri setinde mevcut olmadığında önceki girişimlerin sonuçlarını geliştiriyor.

Sistem, farklı boyutlarda eğitimli gömme yöntemleri ile yüksek hacimli bir veri setine dayalı basit bir veri artırma şeması sunuyor. Veri seti, 300 milyondan fazla yorumu içeren bir milyondan fazla farklı kullanıcı hesabını kapsıyor.

Johns Hopkins yeniden tanımlama sisteminin model mimarisi, temel bileşenler 1) metin içeriği, 2) bir sub-Reddit özelliği ve 3) yayın zamanı/tarihi. Kaynak: https://arxiv.org/pdf/2105.07263.pdf

Johns Hopkins yeniden tanımlama sisteminin model mimarisi, temel bileşenler 1) metin içeriği, 2) bir sub-Reddit özelliği ve 3) yayın zamanı/tarihi. Kaynak: https://arxiv.org/pdf/2105.07263.pdf

Çerçeve, Reddit kullanım verilerine dayalı olarak metin içeriği, sub-Reddit yerleştirme ve yayın zamanını dikkate alıyor. Üç faktör, çeşitli gömme yöntemleri ile birleştiriliyor, bunlar arasında bir boyutlu konvolüsyonlar ve lineer projeksiyonlar yer alıyor ve bir dikkat mekanizması ve bir max pooling katmanı ile destekleniyorlar.

Sistem, metin alanına odaklansa da, araştırmacılar, yaklaşımın video veya resim analizi için de uygulanabileceğini savunuyorlar, çünkü türetilen algoritma, yüksek düzeyde frekans oluşumlarına dayalı olarak çalışıyor, eğitim veri noktalarının çeşitli girdi uzunluklarına rağmen.

Konuya Sapma’yı Önleme

Bu tür bir araştırmada düşülebilecek bir tuzak, farklı hesapların yorumlarındaki belirli konuların veya temaların tekrarlanmasına aşırı önem vermek ve bu nedenle bu konuların kimlik anahtarı olarak değerini düşürmektir. Araştırmacılar, bu potansiyel tuzağı, ‘yanlış nedenlerle doğru olmak’ olarak nitelendiriyorlar – daha önce Johns Hopkins’te çalışılmış bir konu.

Eğitim Metodolojisi

Sistem, 2018’de Baidu ve NVIDIA (NVDA ) tarafından sunulan karışık hassasiyetli eğitim kullanıyor, bu da bellek gereksinimlerini yarıya indiriyor, 32 bitlik değerlerin yerine 16 bitlik kayan nokta değerleri kullanıyor. Veriler, iki V100 GPU’da eğitim görüyor ve ortalama eğitim süresi 72 saat.

Şema, basitleştirilmiş metin kodlamasını kullanıyor, konvolüsyonlu kodlayıcılar 2-4 alt kelime ile sınırlı. Bu tür çerçeveler için ortalama uzunluk beş alt kelime olsa da, araştırmacılar, bu ekonomisinin sıralama performansına hiçbir etkisi olmadığını, hatta alt kelimelerin sayısını beşe çıkarmanın sıralama doğruluğunu kötüleştirdiğini buldular.

Veri Seti

Araştırmacılar, 2020 Pushshift Reddit Corpus veri setinden türetilen 300 milyondan fazla Reddit yorumunu içeren bir milyon kullanıcı veri seti oluşturdular.

Veri seti, Temmuz 2015 ile Haziran 2016 arasında 100-1000 yorum yayımlayan Reddit yazarlarının tüm yorumlarını içeriyor. Bu şekilde zaman içinde örneklem, çalışmanın amaçlarına uygun bir tarih uzunluğu sağlıyor ve araştırmaların amaçlarının dışında olan geçici spam yorumlarının etkisini azaltıyor.

Johns Hopkins yeniden tanımlama projesi için türetilen veri setinin istatistikleri.

Johns Hopkins yeniden tanımlama projesi için türetilen veri setinin istatistikleri.

Sonuçlar

Aşağıdaki resim, eğitim sırasında bir saatlik aralıklarla sıralama doğruluğunun test edildiği birikimli iyileşmeyi gösteriyor. Altı saat sonra, sistem, ilgili önceki girişimlerin temel başarılarını aşiyor.

Bir abolisyon çalışmasında, araştırmacılar, iş akışından sub-Reddit özelliğini kaldırmanın sıralama doğruluğuna sürpriz bir şekilde çok az etki ettiğini buldular, bu da sistemin çok etkili bir şekilde genelleme yaptığını ve güçlü öznitelik araçlarına sahip olduğunu gösteriyor.

Yorum Sıklığı as a Yeniden Tanımlama İmzası

Bu ayrıca, çerçevenin, yalnızca metin içeriği ve yayın zamanı/tarihi mevcut olduğunda, diğer yorum veya yayın sistemlerine kolayca aktarılabilir olduğunu gösteriyor ve esasen yayın sıklığının kendisi, metin içeriğinin gerçek içeriğine ek bir değerli işareti olduğunu gösteriyor.

Araştırmacılar, aynı tahmini, tek bir sub-Reddit’in içeriğinde gerçekleştirmenin daha büyük bir zorluk oluşturabileceğini not ediyorlar, çünkü sub-Reddit kendisi bir konu vekili olarak hizmet ediyor ve bu rolü doldurmak için ayrıca bir şema gerekli olabilir.

Çalışma, bu kısıtlamalar içinde umut verici sonuçlar elde etmeyi başardı, tek şart, sistemin yüksek hacimli verilerde daha iyi çalıştığı ve düşük hacimli verilerde kullanıcıları yeniden tanımlamada artan zorluklar yaşayabileceği.

Çalışmanın Geliştirilmesi

Denetimli öğrenme girişimlerinin çoğuna trái olarak, Hopkins yeniden tanımlama şemasındaki özellikler, sistem performansı veri hacmi arttıkça önemli ölçüde iyileşen şekilde rời ve güçlüdür.

Araştırmacılar, yayın zamanlarının analizine daha ayrıntılı bir yaklaşım benimsemekle ilgileniyorlar, çünkü otomatik veya diğer spam göndericilerinin thường öngörülebilir zamanlamaları, bu tür bir yaklaşım tarafından belirlenebilir ve bu, ya robot içeriğini daha etkili bir şekilde ortadan kaldırmak veya otomatik içeriği tanımlamaya yardımcı olmak için kullanılabilir.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai