Anderson’un Açısı
Hatta Temel AI Şimdiden İnsan Tarafından Yazılan Haberleri Yazabilir

Yeni araştırmalar, küçük yerel AI modellerinin artık insanlardan ayırt edilemeyen haberleri yazabileceğini, en iyi sistemlerle eşleşerek ve okuyucuların kimin yazdığını anlayamayacağı şekilde gösteriyor.
Almanya ve Fransa arasındaki yeni bir araştırma işbirliği uyarınca, insanlar bir haber makalesinin AI tarafından mı yoksa insan tarafından mı yazıldığını söyleyemez – hatta açık kaynaklı modeller tarafından yazılmış olsa bile, nispeten ortalama tüketici seviyesindeki masaüstü bilgisayarlarda indirilebilecek ve çalıştırılabilecek şekilde.
AI’nin yükselişinin başka bir göstergesi olarak, 1.054 katılımcıdan 2.318 yargı toplandığı bir akademik çalışma portalında yapılan bir anket, insan okuyucuların bir makalenin kökenini şansın üzerinde bir seviyede tanımlayamadığını buldu, hatta nispeten mütevazi modeller tarafından üretilmiş olsa bile, yalnızca yedi milyar parametre ile, küçük AI yükseliyor ve Mistral ve Llama varyantları dahil olmak üzere.

Test edilen LLM’ler için ortalama kaynak ve kimlik puanları. GPT-4o’nun 200 milyar parametresi, listedeki küçük modellerin 7B parametrelerini önemli ölçüde aşmıyor. Çalışmada test edilenler Gemma 7B, Phi-3 Mini, LLaMA-2 13B, Mistral 7B, GPT-4o ve GPT-3.5 idi. Kaynak
Yazarlar, ilk olarak 2024 yayını Yaratıcı AI’nin Sahte Haberler Üzerindeki Etkisi Hakkında Bir Anket konularına geri dönüyorlar. Buluntular kendileri, ilk olarak Ocak ayında duyurulan daha büyük bir projeden yeni yayınlanan sonuçlar ve yazarların kendi JudgeGPT online katılımcı çerçevesini kullanıyor.
Hafif Güç
İnsanların Söylediğini Söyleyebiliyor mu? LLM Oluşturulan Haberlerin İnsanların Algılaması Üzerine Çift Eksenli Bir Çalışma adlı ve Frankfurt Uygulamalı Bilimler Üniversitesi ve Nantes’teki IRISA araştırma birimi’nden üç araştırmacı tarafından yapılan yeni çalışmanın metodolojisi, ‘sahte haber’ ve ‘AI tarafından yazılmış haber’ arasında önemli bir ayrım yapıyor (çünkü sahte haberler insanlar tarafından da AI tarafından da yazılabilir ve bu iki yön birbirinin yerine geçmez).
Ancak belki de en ilginç yön, küçük modellerin, Mistral 7B ve Gemma 7B dahil olmak üzere, yalnızca yedi milyar parametre ile, 200 milyar parametreli bir ChatGPT modeli (4o) ile self-garantili bir şekilde yarışabileceğidir:
‘7B parametreli açık ağırlıklı modeller, GPT-4o çıkışından farklı şekilde değerlendirilen metinler üretmiyor, bu da insanlardan ayırt edilemeyen metin oluşturma yetisinin artık yalnızca ön cephe modelleriyle sınırlı olmadığını gösteriyor.’
Ancak, ‘AI tarafından üretilen haber’ birçok farklı türde insan/AI işbirliğini temsil edebilir, yazım denetimi yoluyla tam, çaba aktarmasına kadar ve çalışma, testler için üretilen AI içeriğinin tam olarak ne olduğunu açıklamıyor (ancak bunu üretme metodolojisini açıklıyor – aşağıya bakınız).
Yöntem
JudgeGPT platformuyla ilgilenen katılımcılar, her haber parçasını, kaynak atıfını, kimlik doğrulama ve konu aşinalığını değerlendirdikleri çift eksenli bir çerçevede değerlendirdiler;

Katılımcıların malzeme hakkında kaynak atfı, kimlik ve konu aşinalığı hakkında yargılar verdikleri JudgeGPT portalı GUI. Daha iyi bir çözünürlük için lütfen kaynak makaleye başvurun.
Kaynak yargısı, bir pasajın makine tarafından yazılmış gibi görünüp görünmediğini veya insan tarafından yazılmış gibi görünüp görünmediğini yakaladı; kimlik yargısı, bunun sahte veya meşru olarak algılandığını; ve konu aşinalığı, okuyucunun konuyu ne kadar iyi bildiğini.
Sürekli ölçekler, daha kesin olarak güven dereelerini yakalamak ve istatistiksel analizleri desteklemek için Likert ölçeği yerine kullanıldı, bu da Pearson korelasyonu ve kümeleme dahil.
Makine tarafından oluşturulan metin parçaları, yazarların kendi RogueGPT çerçevesi tarafından üretildi, bu da JudgeGPT için besleme mimarisidir. RogueGPT, altı Büyük Dil Modeli’nden (LLM) katkıları düzenler: ChatGPT-4; ChatGPT-3.5; ChatGPT-4o; LLaMA-2 13B; Gemma 7B; ve Mistral 7B.
Kişisel tabanlı.prompting metinleri üretmek için kullanıldı ve AI üretimleri, gerçek haber konularına dayanıyordu ve insanlar tarafından kontrol ediliyordu.
Tersine, insan tarafından yazılmış parçalar, ‘kuruluş haber ajansları’ndan ve belirsiz ‘bilgi veritabanları’ndan örneklenmiştir.
Yazarlar gözlemliyor:
‘Uyarıcı seti, makine kökenli parçalara (∼98%) doğru bir şekilde eğiliyor ve insan kökenli öğeler, kalibrasyon bağlantıları olarak hizmet ediyor. ‘
‘Bu tasarım seçimi, çalışmanın AI içi varyasyon (modeller arasında) üzerine odaklanmasını yansıtıyor; katılımcılar temel oran hakkında bilgilendirilmez ve neredeyse şansa yakın algılama sonuçları, yalnızca insan kökenli alt küme üzerinde analiz edildiğinde de geçerlidir.’
Katılımcılar önce bilgilendirilmiş onay verdiler ve yaş, eğitim, siyasi yönelim ve AI ile aşinalık hakkında bir demografik anketi tamamladıktan sonra haber parçalarını değerlendirdiler.
Her kişi 5 ila 87 parça arasında, ortalamada 12 parça inceledi, sunum sırası rasgeleleştirildi ve model ataması katılımcılar arasında dengelendi, böylece yanlılık azaltıldı. Platform, üç sürgü puanının yanı sıra tepki süresini ve anonim bir tanımlayıcıyı kaydetti, bu da bireysel yargıların arka plan faktörleriyle bağlantılı olmasını sağladı.
Yazarlar, örneğin, eğitimli Avrupa katılımcılarına doğru eğildiğini, %68’inin üniversite eğitimi olduğunu ve %74’ünün Avrupa’da olduğunu, makale tarafından sınırlama olarak not edilen bir yanlılık olduğunu belirtiyorlar.
Testler
Testler beş bulgu türüne ayrılmıştır: makine tarafından oluşturulan metni insan tarafından yazılmış metinden ayırt etmek; farklı LLM’ler arasında algılama karşılaştırmak; etki alanındaki uzmanlık ve siyasi yönelim üzerindeki etkisini incelemek; katılımcılar arasında farklı yanıt stratejilerini belirlemek ve tekrarlanan değerlendirmelerdeki doğruluğun nasıl değiştiğini izlemek, yorgunluk nedeniyle:

1.054 katılımcıdan 2.318 yargıya dayalı beş temel bulgunun özeti, insanların AI tarafından yazılmış metni tüm modellerde şansa göre daha yüksek bir düzeyde tanımlayamadığını, doğruluğun etki alanındaki uzmanlıkla ilişkili olduğunu, katılımcıların farklı güvenirlik profillerine ayrıldığını ve performansı yaklaşık 30 değerlendirmeden sonra düştüğünü gösteriyor. yorgunluk nedeniyle
Test, katılımcıların AI tarafından oluşturulan metni insan tarafından yazılmış metinden ayırt edemediğini, koşullar arasında önemli bir fark olmadığını gösterdi:

Makine ve insan kökenli parçalar için kaynak ve kimlik puanı dağılımları, iki koşul arasında önemli bir ayrım olmadan önemli bir örtüşme gösterir ve istatistiksel test – insan tarafından yazılmış içerikten AI tarafından oluşturulan metni güvenilir bir şekilde ayırt edemediğini gösterir.
İkinci yön için, makale başlangıcındaki grafikte gösterildiği gibi, algılama hatası modelden modele değişmedi, çünkü tüm LLM’lerin çıktıları şansa yakın yargılara yaklaştı ve aralarında önemli bir fark yoktu. Hatta Mistral 7B ve Gemma 7B gibi daha küçük açık ağırlıklı sistemler, GPT-4o’dan farklı şekilde değerlendirilmedi, bu da insanlardan ayırt edilemeyen metinlerin artık en büyük modellere özgü olmayabileceğini gösteriyor.
Üçüncü yön için, doğruluk, siyasi yönelimden daha çok etki alanındaki uzmanlıkla bağlantılıydı, çünkü sahte haberlerle aşinalık, her iki eksen boyunca da daha iyi yargılarla ilişkiliydi, ancak siyasi görüşler önemli bir etkiye sahip değildi, bu da analitik becerilerin ideolojiden daha önemli olabileceğini gösteriyor:

Üçüncü araştırma hattına ilişkin sonuçlar: siyasi yönelimin kaynak atfı veya kimlik puanlaması üzerinde önemli bir etkiye sahip olmadığını, ancak sahte haberlerle aşinalığın her iki eksen boyunca da daha yüksek doğrulukla tutarlı olarak ilişkili olduğunu gösteriyor. Lütfen daha iyi bir çözünürlük için kaynak makaleye başvurun.
Dördüncü bulgu, katılımcıların iki farklı yanıt stratejisi olarak tanımlanan ‘Kuşkucular’ ve ‘İnananlar’ olarak ayrıldığını gösterdi – ‘Kuşkucular’, içeriğin kökenine bakılmaksızın düşük güven seviyesine sahip olanlar ve ‘İnananlar’, daha yüksek bir güven seviyesine sahip olanlar.
Son olarak, beşinci hedefe ilişkin olarak, ardışık yargıların bir analizinin, katılımcıların ilk olarak görevde daha iyi hale geldiğini, yaklaşık 15-20 değerlendirme sonra görev formatına uyum sağladıkları gibi gösterdi:

Katılımcı değerlendirmelerinin dizisi boyunca kaynak atfı ve kimlik puanlarının yuvarlak ortalamaları, ilk 15-20 öğe boyunca görev formatına uyum sağladıkları gibi kısa bir ilk iyileştirme aşaması gösterir. Lütfen daha iyi bir çözünürlük için kaynak makaleye başvurun.
Ancak bu etki kısa sürdü, çünkü yaklaşık 30 öğe sonra performans düşmeye başladı ve katılımcılar giderek daha fazla içeriği sahte olarak etiketlemeye başladı – bir değişiklik, bilişsel yorgunluk olarak yorumlandı ve algılama temelli yaklaşımların ne kadar süreyle etkili kalabileceğine dair açık sınırlar gösterdi.
Bu, yalan haberlerden gerçek haberleri, AI haberlerinden insan haberlerini ayırt edemediğimiz için, güvende olmak için AI ve/veya sahte haber olduğunu varsayma eğiliminde olabileceğimiz bazı Ampirik kanıtları temsil edebilir. Bulabiliriz Bu, những who consider bu ‘tembel’ ve insanların kendi araştırmalarını yapmaları gerektiğini düşünenler, insanların potansiyel bir sahte haber hikayesini doğrulamak için kendi araştırmalarını yapmalarının aslında sorunları daha da kötüleştirdiğini gösteren 2024 yılında yapılan bir çalışmaya ilgi duyabilirler.
Yazarlar, sonuçlardaki insan yargısı hatasının, bu konuları kriptografik köken teknolojilerine, örneğin Adobe liderliğindeki C2PA girişimine bırakmamız gerektiğini gösterdiğini öne sürüyorlar. Diğer olası çözümler arasında yazarların kendi OriginLens çerçevesi ve yazarların dahil olduğu başka bir proje olan CRED-1 bulunur.
Yazarlar sonuç olarak şunları söylüyor:
‘İnsanlar söyleyebilir mi? Altı LLM ailesi boyunca 2.318 yargıya dayanan çift eksenli çalışmamız, net bir ampirik cevap veriyor: yapamazlar. ‘
‘Makine tarafından oluşturulan metin, model büyüklüğüne veya ailesine bakılmaksızın insan yazımından ayırt edilemez, etki alanındaki uzmanlık, algılama doğruluğunu siyasi yönelimden daha güçlü bir şekilde öngörür, katılımcılar farklı güvenirlik stratejileri benimser ve bilişsel yorgunluk, sürdürülebilir algılamayı sınırlar.’
‘Bu bulgular, kullanıcı düzeyindeki algılamadan sistem düzeyindeki karşı önlemlere, içerik kökeni, uyarlanabilir güven göstergeleri ve sınırlı aşı önlemlerini içeren bir kaymaya destek veriyor.’
Sonuç
Bu makalenin endişe verici yönü, yazarların (veya bazı yazarların, işe bağlı olarak) ortaya koyduğu veya elinde tuttuğu projeler ve makalelerin altyapısı destek ağıdır ve gerçekten de, bu sonuçları üreten AI ve insan tarafından yazılmış metin örneklerini incelemek mümkün olsaydı, üretilen çıkış metodolojisinin türünü daha iyi anlamak için aydınlatıcı olurdu.
Her şeye rağmen, açık ağırlıklı, açık kaynaklı modellerin API ile çalışan devlere, ChatGPT serisine kıyaslanabileceği ilginçtir – görev gerçekten o kadar zor değil mi ve 200 milyar parametreli bir model bu görevler için gereksiz mi? Bu soruyu cevaplamak için AI ve insan tarafından yazılmış kaynak örneklerini biraz daha iyi anlamamız gerekiyor.
Şimdilik, canirun.ai web sitesine göre, testlerde ChatGPT -4o ile yaklaşık olarak aynı seviyede olan Mistral 7B, 16GB VRAM ile donatılmış bir NVIDIA RTX 3080’de ‘harika’ çalışıyor ve 6GB VRAM ile donatılmış bir 3060’da ‘decent’ çalışıyor – oynanan en yeni veya en büyük grafik kartları değil*. Dolayısıyla, bu deneylere katılmak isteyen herkes, kendi örnek gönderme metodolojisini oluşturabilir.
* Gemma 7B sitesine listelenmiyor.
İlk olarak 9 Nisan 2026 Perşembe günü yayımlandı












