Anderson’un Açısı
MIT: Büyük Haber Ajanslarında Medya Yanlılığını Makine Öğrenimi ile Ölçme

MIT’ten yapılan bir çalışma, makine öğrenimi tekniklerini kullanarak ABD ve ötesindeki en büyük ve en etkili 100 haber ajansında yanlı ifadeleri belirlemek için kullandı. Bu, potansiyel olarak otomatik olarak bir yayının siyasi karakterini sınıflandırabilen ve okuyuculara ilgi duydukları konularda bir ajansın etik duruşuna daha derin bir bakış açısı sunabilen bir araştırma çalışmasıdır.
Çalışma, belirli bir şekilde ele alınan konulara dikkat çekiyor, örneğin belgesiz göçmen | yasal olmayan göçmen, döllenmiş yumurta | doğmamış bebek, göstericiler | anarşistler.
Proje, Doğal Dil İşleme (NLP) tekniklerini kullanarak bu tür “yüklenmiş” dil örneklerini (görünüşte daha “nötr” terimlerin de bir siyasi duruşu temsil ettiği varsayımıyla) yaklaşık 3 milyon makaleden oluşan bir harita oluşturdu. Bu harita, 100 haber ajansının sol ve sağ eğilimli yanlılığını ortaya koyuyor.
Makale, MIT Fizik Bölümü’nden Samantha D’Alonzo ve Max Tegmark tarafından yazıldı. Makale, “gerçeklik kontrolü” etrafındaki çeşitli girişimlerin, birçok “sahte haber” skandalının ardından, belirli çıkarlara hizmet etmek amacıyla yorumlanabileceğini gözlemliyor. Proje, bir haber bağlamında yanlılık ve “etkileme” dilinin kullanımını incelemek için daha veri odaklı bir yaklaşım sunmayı amaçlıyor.

Çalışmadan elde edilen sol-sağ ifadeleri spektrumu. Kaynak: https://arxiv.org/pdf/2109.00024.pdf
NLP İşleme
Çalışmanın kaynak verileri, 100 medya haber kaynağından alınan 3.078.624 makaleyi içeren açık kaynaklı Newspaper3K veritabanından elde edildi. Gazeteler, erişimlerine göre seçildi ve çevrimiçi medya kaynakları arasında Savunma Bir ve Bilimsel gibi askeri haber analizi siteleri de yer aldı.

Çalışmada kullanılan kaynaklar.
Makale, indirilen metnin “minimum” ön işleme tabi tutulduğunu bildiriyor. Doğrudan alıntılar çıkarıldı, çünkü çalışma, gazetecilerin seçtiği dili incelemekle ilgileniyor (her ne kadar alıntı seçimlerinin kendileri de ilgili bir araştırma alanı olsa da).
İngilizce yazım, Amerikan İngilizcesine standardize etmek için değiştirildi, tüm noktalama işaretleri kaldırıldı ve tüm sıralı sayılar dışında diğer tüm sayılar da kaldırıldı. İlk cümle büyük harfleri küçük harfe dönüştürüldü, ancak diğer tüm büyük harfler korunuldu.
İlk 100.000 en yaygın ifade belirlendi ve sonunda sıralandı, arındırıldı ve bir ifade listesine birleştirildi. Tüm冗antı dili (örneğin “Bu makaleyi paylaş” ve “makale yeniden yayımlandı”) benzer şekilde silindi. Esasen aynı anlama gelen ifadelerin varyasyonları (örneğin “büyük teknoloji” ve “Büyük Teknoloji”, “siber güvenlik” ve “siber güvenlik”) standardize edildi.
‘Fındık Toplama’
İlk test, “Siyah Hayatlar Önemlidir” konusundaydı ve veri üzerinden ifade yanlılığı ve valent eşanlamları belirleyebildi.

Siyah Hayatlar Önemlidir (BLM) hakkında yazıların genel ilke bileşenleri. Soldan sağa, göstericiler, anarşistler ve sağdaki en uç noktasında ‘isyancılar’ olarak karakterize edilen sivil eyleme katılan insanları görüyoruz. Gazetelerin kökeni, sağ panelde temsil ediliyor.
“Protestocular” ifadesi, ajansın siyasi duruşuna göre “anarşistler”den “isyancılar”a doğru geçiş yapıyor, makale, NLP çıkarma ve analiz duruşunun, bir medya ajansının, farklı bir siyasi segment tarafından geçerli kabul edilen bir ifadeyi alıntıladığı ve okuyucularının bu ifadeyi olumsuz olarak görmesine güvenebileceği “fındık toplama” uygulamasıyla engellendiğini belirtiyor. Makale, “polisleri финansal olarak destekleme” ifadesini bu tür bir örnekleme olarak gösteriyor.
Doğal olarak, bu, bir “sol eğilimli” ifadenin otherwise sağcı bir bağlamda ortaya çıkması ve kodlanmış ifadeleri siyasi duruşların göstergesi olarak kullanan bir NLP sistemi için alışılmadık bir zorluk teşkil ediyor.
Bu tür ifadeler “iki değerlilik” (SIC), bazı diğer ifadelerin evrensel olarak olumsuz bir çağrışımı vardır (örneğin “çocuk katliamı”) ve bu nedenle çeşitli ajanslar boyunca her zaman olumsuz olarak temsil edilir.
Araştırma, kürtaj, teknoloji sansürü, ABD göçmenlik ve silah kontrolü gibi “sıcak” konular için benzer haritalamaları da ortaya koyuyor.
Hobi Atları
Bazı tartışmalı siyasi eğilimler, medyada öngörülebilir bir şekilde bölünmüyor, Örneğin askeri harcama konusu. Makale, “sol eğilimli” CNN’nin bu konuda sağ eğilimli Ulusal İnceleme ve Fox News’a yakın olduğunu buldu.
Genel olarak, siyasi duruş, “askeri-sanayi kompleksi” ifadesini “savunma endüstrisi” ifadesine tercih etme gibi diğer ifadelerle belirlenebilir. Sonuçlar, ilk ifadenin Kanarya ve Amerikan Muhafazakar gibi kuruluşlara eleştirel ajanslar tarafından kullanıldığını, ikincisinin ise Fox ve CNN tarafından daha sık kullanıldığını gösteriyor.
Araştırma, “kurşunla öldürülmüş” ile “öldürülme” arasındaki geçiş gibi diğer bazı ilerlemeleri de kurdu; “mahkum suçlular” ile “hapsedilen insanlar” ve “petrol üreticileri” ile “büyük petrol” arasında.

Kuruluşa bağlı yanlılığı olan valent eşanlamları, üstten alta.
Araştırma, ajansların “kendi temel siyasi duruşundan” uzaklaşabileceğini, ya dil düzeyinde (örneğin, iki değerli ifadelerin kullanımı) ya da çeşitli diğer nedenlerle kabul ediyor. Örneğin, saygın sağcı İngiliz yayını The Spectator, 1828’de kuruldu ve sık sık ve belirgin bir şekilde solcu düşünceleri barındırıyor. Bu, tarafsız raporlama duygusundan mı yoksa periyodik olarak çekirdek okuyucularını trafik oluşturan yorum fırtınalarına sürüklemek için mi yapıldığı, bir tür spekülasyon konusudur ve makine öğrenimi sistemlerinin aradığı net ve tutarlı tokenler için kolay bir durum değildir.
Bu belirli “hobi atları” ve bireysel haber ajansları arasındaki belirsiz ve çelişkili görüşler, araştırmanın sonunda sunduğu geniş sol-sağ haritalamayı biraz karıştırıyor, ancak genel bir siyasi aidiyet göstergesi sunuyor.

Gizli Anlam
2 Eylül tarihinde tarihli ve Ağustos 2021 sonunda yayımlanan makale, nispeten az ilgi gördü. Kısmen bu, ana akım medyanın itselfe yönelik eleştirel araştırmaları coşkuyla karşılamamasından kaynaklanabilir; ancak yazarların sonuçların potansiyel yangın etkisini azaltmak için çaba sarf etmesi de olabilir.
Araştırmadan elde edilen yayımlanan veriler, kelime ve ifade sıklık sayılarını gösteriyor, ancak anonimleştirilmiş gibi görünüyor, bu da incelenen yayınlarda medya yanlılığını net bir şekilde görmek zorlaştırıyor. Proje, bir şekilde işlevselleştirilmedikçe, yalnızca makalede sunulan seçili örnekler kalıyor.
Gelecekteki benzer araştırmalar, konuların nasıl ele alındığına ek olarak, bir konunun vůbec ele alınıp alınmadığına da dikkat etmelidir, çünkü suskunluk da bir siyasi karaktere sahip ve genellikle yalnızca bütçe kısıtlamaları veya haber seçimini etkileyen diğer pratik faktörlerden daha fazlasını ifade ediyor.
Bununla birlikte, MIT çalışması, bugüne kadar yapılan en büyük çalışma gibi görünüyor ve gelecekteki sınıflandırma sistemleri için bir çerçeve oluşturabilir, hatta tarafsızlık renklerini okuyuculara bildiren tarayıcı eklentileri gibi ikincil teknolojilere de yol açabilir.
Köpükler, Yanlılık ve Geri Tepme
Ayrıca, böyle bir sistemin, algoritmik öneri sistemlerinin en tartışmalı yönlerinden biri olan, bir okuyucunun karşıt veya zorlayıcı bir görüşle hiç karşılaşmadığı ortamlara sürüklenme eğilimini daha da artırıp artırmayacağı düşünülmelidir.
Böyle bir içerik köpüğü, “güvenli bir ortam” mı, entelektüel büyüme için bir engel mi, yoksa kısmi propaganda karşıtı bir koruma mı olduğu, bir değer yargısı – mekanik, istatistiksel makine öğrenimi sistemlerinden ziyade felsefi bir meseledir.
Daha fazla olarak, MIT çalışması, verilerin sonuçları tanımlamasına izin vermeye çalışırken, bir ifadenin siyasi değerini sınıflandırmak da bir tür değer yargısıdır ve dilin, toksik veya tartışmalı içeriği yeni ifadeler olarak yeniden kodlayabilme yeteneğine karşı kolayca dayanamaz.
Eğer bu tür bir kodifikasyon, popüler çevrimiçi sistemlere gömülürse, büyük haber ajanslarının etik ve siyasi sıcaklığını haritalamak için sürekli bir çaba, makine öğrenimi sistemlerinin yanlılığı anlamak ve yayıncıların görüşlerini ifade etme yeteneği arasında bir soğuk savaşa dönüşebilir.
14/09/21 – 1.41 GMT+2 – ‘100 gazete’ ifadesi ‘100 haber ajansı’ olarak değiştirildi.
4:58 pm – Makale alıntısına Samantha D’Alonzo eklendi ve ilgili düzeltmeler yapıldı.












