Yapay zeka modelleri ve platformları
Sentetik Veri Nasıl AI Hallüsinasyonlarını Etkiler?
Sentetik veri güçlü bir araç olmasına rağmen, yalnızca belirli koşullar altında yapay zeka hallüsinasyonlarını azaltabilir.几乎 her diğer durumda, onları amplifiye edecektir. Bunun neden böyle olduğu ve bu olgunun sentetik veriye yatırım yapanlar için ne anlama geldiği konusunda merak ediyor olabilirsiniz.
Sentetik Veri Gerçek Veriden Nasıl Farklıdır?
Sentetik veri, yapay zeka tarafından oluşturulan bilgidir. Gerçek dünya olaylarından veya gözlemlerden değil, yapay olarak üretilir. Ancak, orijinalin yeterli benzerliğini sağlar ve doğru, ilgili çıktılar üretir. En azından teoride böyle olması beklenir.
Bir yapay veri seti oluşturmak için, yapay zeka mühendisleri bir gerçek ilişkisel veritabanına dayalı olarak bir üretken algoritma eğitirler. İstendiğinde, ilkine yakın bir şekilde ikinci bir set üretir, ancak gerçek bilgi içermez. Genel eğilimler ve matematiksel özellikler intact kalırken, orijinal ilişkileri maskelemek için yeterli gürültü bulunur.
Bir AI tarafından oluşturulan veri seti, yalnızca alanları eşdeğer alternatiflerle değiştirmek yerine, alanlar arasındaki ilişkilerin altındaki mantığı taklit eder. Tanımlayıcı detaylar içermediğinden, şirketler bunu kullanarak gizlilik ve telif hakkı düzenlemelerini atlayabilir. Daha da önemlisi, endişe verici bir veri ihlali olmadan serbestçe paylaşabilir veya dağıtabilirler.
Ancak, sahte bilgiler daha çok takviye için kullanılır. İşletmeler, etkili bir şekilde AI sistemlerini eğitmek için yeterli büyüklüğe sahip olmayan örnek boyutlarını zenginleştirmek veya genişletmek için bunları kullanabilir.
Sentetik Veri AI Hallüsinasyonlarını Azaltır mı?
Bazen algoritmalar var olmayan olaylara atıfta bulunabilir veya mantıksal olarak imkansız önerilerde bulunabilir. Bu hallüsinasyonlar genellikle anlamsız, yanıltıcı veya yanlıştır. Örneğin, büyük bir dil modeli, aslanları evcilleştirme veya 6 yaşında doktor olma hakkında bir nasıl yapılır makalesi yazabilir. Ancak hepsi bu kadar aşırı değildir, bu da onları tanımayı zorlaştırabilir.
Eğer uygun bir şekilde küratelenirse, sentetik veri bu olayları azaltabilir. Her model için gerçek ve güvenilir bir eğitim veritabanı temelidir, bu nedenle jemandın ne kadar fazla detaya sahip olduğu, modelinin çıktısının ne kadar doğru olacağı ile ilgili olduğu söylenebilir. Bir takviye veri seti, sınırlı kamu bilgisine sahip niş uygulamalar için bile ölçeklenebilirlik sağlar.
Önyargı giderme, bir sentetik veritabanının AI hallüsinasyonlarını azaltabileceği başka bir yoldur. MIT Sloan Yönetim Okulu’na göre, önyargıları gidermeye yardımcı olabilir çünkü orijinal örnek boyutuyla sınırlı değildir. Uzmanlar, gerçekçi detayları kullanarak, seçilen alt popülasyonların under veya over-represented olduğu boşlukları doldurabilir.
Yapay Veri Hallüsinasyonları Nasıl Kötüleştirir
Zeki algoritmalar bilgiyi neden veya bağlamlaştıramaz, bu nedenle hallüsinasyonlara eğilimlidir. Üretken modeller, özellikle büyük dil modelleri, daha da savunmasızdır. Yapay gerçekler bu sorunu bir şekilde artırabilir.
Önyargı Amplifikasyonu
İnsanlar gibi, AI de önyargıları öğrenebilir ve tekrarlayabilir. Eğer bir yapay veritabanı bazı grupları över değerlendirecek ve diğerlerini under temsil edecek şekilde tasarlanırsa – ki bu endişe verici bir şekilde kolayca yapılabilir – karar verme mantığı eğilir ve çıktı doğruluğunu olumsuz etkiler.
Benzer bir sorun, şirketlerin gerçek dünya önyargılarını ortadan kaldırmak için sahte verileri kullandıklarında ortaya çıkabilir, çünkü artık gerçekliği yansıtmayabilir. Örneğin, meme kanserlerinin %99’u kadınlarda ortaya çıkar, bu nedenle temsil edilenliği dengelemek için takviye bilgisi kullanmak tanıları eğebilir.
Kesişimsel Hallüsinasyonlar
Kesişimlilik, yaş, cinsiyet, ırk, meslek ve sınıf gibi demografik özelliklerin nasıl kesiştiğini açıklayan bir sosyolojik çerçeve olarak tanımlanabilir. Bu, grupların chồnglanan sosyal kimliklerinin nasıl benzersiz ayrımcılık ve ayrıcalık kombinasyonlarına yol açtığını analiz eder.
Bir üretken model, eğitim aldığı verilere dayalı olarak yapay detaylar üretmesi istendiğinde, orijinalinde var olmayan veya mantıksal olarak imkansız kombinasyonlar üretebilir.
Linköping Üniversitesi’nde cinsiyet ve toplum profesörü olan Ericka Johnson, bir makine öğrenimi bilimcisi ile birlikte bu olguyu göstermek için çalıştı. Amerika Birleşik Devletleri nüfus sayımı figürlerinin 1990 yılından sentetik sürümlerini üretmek için bir üretken karşıt ağ kullandılar.
Hemen bir problemle karşılaştılar. Yapay versiyonunda “evli ve bekar” ve “evlenmemiş kocalar” gibi kategoriler vardı, bunlar kesişimsel hallüsinasyonlardı.
Uygun kürasyon olmadan, kopya veritabanı her zaman veri setlerindeki baskın alt popülasyonları över temsil ederken, under temsil edilen veya hatta dışlanan grupları under temsil edecektir. Kenar vakalar ve aykırı değerler tamamen baskın eğilimlerin lehine ihmal edilebilir.
Model Çöküşü
Yapay desen ve eğilimlere aşırı bağımlılık, model çöküşüne yol açar – burada bir algoritmanın performansı, gerçek dünya gözlemleri ve olaylarına adaptasyon yeteneği azalırken dramatik olarak bozulur.
Bu olgu, özellikle next-generation üretken AI’de belirgindir. Onları tekrar tekrar bir yapay versiyonla eğitmek, self-consuming bir döngüye yol açar. Bir çalışmada, kalite ve geri çağırma progressif olarak, her nesilde yeterli güncel, gerçek figürler olmadan düşer.
Aşırı Uyum
Aşırı uyum, eğitim verilerine aşırı bağımlılıktır. Algoritma başlangıçta iyi performans gösterir, ancak yeni veri noktaları sunulduğunda hallüsinasyonlara yol açar. Sentetik bilgi, gerçekliği doğru bir şekilde yansıtmazsa, bu sorunu artırabilir.
Sentetik Veri Kullanımının Devam Eden Sonuçları
Sentetik veri pazarı patlama yaşamaktadır. Bu niş endüstrinin şirketleri, 2022’de yaklaşık 328 milyon dolar topladı, bu 2020’de 53 milyon doların üzerine çıkarak sadece 18 ayda %518’lik bir artışa karşılık geliyor. Bu, sadece kamu tarafından bilinen fon olduğunu not etmek önemlidir, bu nedenle gerçek rakam daha yüksek olabilir. Şirketlerin bu çözüme karşı oldukça yatırım yaptıkları söylenebilir.
Şirketler, uygun kürasyon ve önyargı giderme olmadan bir yapay veritabanını kullanıma devam ederse, model performansları progressif olarak düşecektir, bu da AI yatırımlarını bozacaktır. Sonuçlar, uygulamaya bağlı olarak daha ciddi olabilir. Örneğin, sağlık hizmetlerinde, hallüsinasyonlardaki bir artış, yanlış teşhis veya uygun olmayan tedavi planlarına yol açabilir, bu da hasta sonuçlarını kötüleştirebilir.
Çözüm Gerçek Veriye Dönme Olmayacak
AI sistemleri, eğitim için milyonlarca, hatta milyarlarca resim, metin ve videoya ihtiyaç duyar, bunların çoğu kamu web sitelerinden kazınır ve devasa, açık veri setlerinde derlenir. Ne yazık ki, algoritmalar bu bilgileri, insanların üretebileceğinden daha hızlı tüketirler. Ne olur khi onlar her şeyi öğrenirler?
İş liderleri, veri duvarına ulaşma konusunda endişe duyuyorlar – internet üzerindeki tüm kamu bilgisinin tükenme noktası. Bu, düşündüklerinden daha hızlı yaklaşabilir.
Hem ortalama ortak tarama web sayfasındaki düz metin miktarı hem de internet kullanıcılarının sayısı yılda %2 ila %4 arasında büyüyor, ancak algoritmalar kaliteli veri tükenmesi yaşıyor. Sadece %10 ila %40’u performansını bozmadan eğitim için kullanılabilir. Eğilimler devam ederse, insan tarafından üretilen kamu bilgi stoğu 2026’ya kadar tükenebilir.
AI sektörü muhtemelen daha da önce veri duvarına ulaşacaktır. Son birkaç yılın üretken AI patlaması, bilgi mülkiyeti ve telif hakkı ihlali konusunda gerilimleri artırdı. Daha fazla web sitesi sahibi, Web Crawlers’ı engelleme Protokolü – web tarama botlarını engellemek için kullanılan bir standart – kullanıyor veya sitelerinin erişime kapalı olduğunu belirtiyor.
2024’te yayınlanan bir MIT liderliğindeki araştırma grubu çalışması, Colossal Cleaned Common Crawl (C4) verisetinin – büyük ölçekli bir web tarama korpusu – kısıtlamaların arttığını gösterdi. C4’ün en aktif, kritik %28’i tamamen kısıtlandı. Ayrıca, C4’ün %45’i hizmet şartları tarafından engelleniyor.
Şirketler bu kısıtlamalara uyarsa, gerçek dünya kamu gerçeklerinin tazelik, alaka ve doğruluğu düşecektir, bu da onları yapay veritabanlarına bağımlı hale getirecektir. Mahkemeler herhangi bir alternatifin telif hakkı ihlali olduğuna karar verirse, çok fazla seçeneğe sahip olmayabilirlar.
Sentetik Veri ve AI Hallüsinasyonlarının Geleceği
Telif hakkı yasaları modernize edildiğinde ve daha fazla web sitesi sahibi web tarama botlarından içeriğini gizlediğinde, yapay veri seti oluşturma giderek daha popüler hale gelecektir. Kuruluşlar, hallüsinasyon tehdidine karşı hazırlıklı olmalılar.












