Düşünce Liderleri
Sentetik Veri Yükselişi ve Neden Gerçek Veriyi Değiştirmek Yerine Tamamlayıcı Olacağı

Elon Musk最近 olarak, yapay zeka modellerini eğitmek için kullanılabilir insan verilerinin tükenmiş olduğunu açıkladı. Uyarısı, yapay zeka devam eden hızlı ilerlemesini sürdürmek için yeni veri kaynaklarına ihtiyaç duyulmasına ilişkin en son yorumdur. Sağlık ve finans gibi endüstrilerde, sıkı veri gizliliği düzenlemeleri veri kıtlığını daha da belirgin hale getirmektedir.
Sentetik veri – bu kıtlığa olası bir çözüm – yeni değil, ancak önemi devam etmektedir. Son zamanlarda bu alanda birleşmeler ve yatırımların patlamasıyla birlikte, sentetik verinin kullanımı da hızla artmaktadır. Ancak sentetik verinin kullanımı etrafında, özellikle model çökmesi riski gibi bazı derin belirsizlikler bulunmaktadır. Model çökmesi, çok modelli büyük dil modellerinin (LLM) gerçek dünya verisi olmadan çıktılarının kalitesinin düşmesi veya çeşitliliğinin azalmasıdır. Bu sorunun çözülmesi veya çözülememesi, yapay zeka geleceğini önemli ölçüde etkileyebilir.
Sentetik Veri Nedir ve Nasıl Oluşturulur?
Sentetik veri, gerçek olaylardan değil, yapay olarak oluşturulur. Şu anda en yaygın sentetik veri türü, gerçek dünya verilerine dayalı kalıpları ve korelasyonları tespit etmek için eğitilen modelleri kullanarak oluşturulan sentetik veridir. Daha sonra bu modeller, bu istatistiksel özelliklere benzer yeni veri oluşturur.
LLM’ler, yapısal veri gibi tablo verileri ve serbest metinler, videolar ve resimler gibi yapılandırılmamış veri türleri de dahil olmak üzere çeşitli sentetik veri türlerini oluşturmak için kullanılmaktadır. Üretilen veri türüne bağlı olarak, farklı yöntemler kullanılmaktadır.
Örneğin, sentetik görüntü verilerini oluşturmak için kullanılan iki yaygın yöntem, GAN’ler ve difüzyon modelleridir. GAN’ler, gerçek verilerle karşılaştırıldığında hangilerinin gerçek hangilerinin oluşturulduğunu belirleyen bir ayırıcı ve yapay versiyonlar oluşturan bir üretici olmak üzere iki sinir ağı kullanır. Sürekli olarak birlikte çalışan üretici, ayırıcıyı “kandırmaya” çalışır ve yapay verilerin gerçekçiliğini ve çeşitliliğini sürekli olarak geliştirir. Difüzyon modelleri ise farklı bir yaklaşım benimser, gerçek verilerin bozulmasını öğrenir ve daha sonra bu bozulmayı “gürültüsüzleştirerek” tersine çevirir. Etkili bir şekilde eğitildiklerinde, yüksek kaliteli sentetik ses ve görsel veri oluşturabilirler.
Sentetik Verinin Artan Önemi
Sentetik veriye karşı uzun süredir ilgi vardır. Ancak son 5 yılda, LLM’lerin hızlı gelişimi hem sentetik veriye olan talebi artırmış hem de onu büyük ölçekte üretmek için daha etkili bir moyen oluşturmuştur. Sonuç olarak, sentetik veri kullanımı hızla artmıştır.
Gartner, sentetik verinin 2024 yılına kadar LLM’ler için kullanılan tüm verilerin %60’ını oluşturacağını öngördü, bu oran 2021 yılında yalnızca %1 idi. Bu tahminin genel olarak doğru olduğuna inanmak için her türlü neden vardır. Örneğin, Microsoft’un Phi-4 modeli, diğer LLM’lerden daha küçük olmasına rağmen daha iyi performans gösteriyor ve çoğunlukla sentetik verilerle eğitilmiştir. Ayrıca, Amazon’un Alexa mühendisleri, “öğretmen/öğrenci” modelini keşfetmektedir, burada “öğretmen” modeli sentetik veri oluşturur ve daha sonra bu veri, daha küçük bir “öğrenci” modelini ince ayarlamak için kullanılır.
Bu yaygın benimseme, pazarın büyük hamleleriyle yansıtılıyor. Sentetik veri sektörü, 2021-22 yıllarında yatırım patlaması yaşadı. Gretel AI ve Tonic.ai, sırasıyla 50 milyon dolarlık ve 35 milyon dolarlık B Serisi tur yatırımlarını güvence altına aldı. Bunları, MOSTLY AI’nin 25 milyon dolarlık B Serisi turunu ve Synthesis AI’nin A Serisi finansmanında 17 milyon doları güvence altına alması izledi.
Daha yakın zamanda, eğilim büyük ölçekli satın almalar yönünde oldu. NVIDIA’nın Gretel’i satın alması bu yıl, teknoloji devinin bu alandaki kendi çalışmalarını destekleyecek. Aynı şekilde, AI çözümleri şirketi SAS, sentetik veri başlangıç şirketini Hazy’i Kasım 2024’te satın aldı.
Analitik firması Cognilytica, 2021 yılında sentetik veri oluşturma pazarının yaklaşık 110 milyon dolar değerinde olduğunu tahmin etti. Şirket, bu pazarın 2027 yılına kadar 1,15 milyar dolara ulaşacağını öngörüyor. Diğer tahminler, sektörün %31’lik bir bileşik yıllık büyüme oranına sahip olacağını ve 2030 yılında 2,33 milyar dolarlık bir değere ulaşacağını öngörüyor.
Model Çökmesi
Ancak sentetik verinin heyecan verici potansiyeli, önemli bir downside ile birlikte geliyor: model çökmesi. Bu, yalnızca sentetik verilerle eğitilen LLM’lerin daha az precisa veya daha az çeşitli çıktılar üretmeye başladığı bir fenomendir.
Gerçek dünya verileri genellikle karmaşıktır, sentetik veriler ise genellikle modeller tarafından basitleştirilir ve yoğunlaştırılır. Örneğin, araştırmacılar, bir modelin fotoğraflardan kanserli benleri tespit etme doğruluğunun, sentetik eğitim verilerinin miktarıyla ters orantılı olduğunu buldular. Oxford, Cambridge, Imperial College ve Toronto Üniversitesi’nden akademisyenler tarafından yapılan bir çalışma, model tarafından oluşturulan verileri ayrım gözetmeksizin kullanmanın, “sonuçta oluşan modelde geri dönülmez kusurlara” yol açabileceğini buldu.
Daha da kötüsü, çoğu LLM “kara kutu” olarak kabul edilir, bu da sentetik verilere nasıl tepki vereceklerini anlamayı zorlaştırır. Rice Üniversitesi ve Stanford’dan araştırmacılar, taze gerçek dünya verisi olmadan, “gelecek nesil oluşturucu modellerin kalitesinin (doğruluk) veya çeşitliliğinin (hatırlama) ilerleyici olarak azalacağı” sonucuna vardılar.
Gerçek dünya verisine devam eden ihtiyaç
Açıkça, sentetik veriye olan talebin artmasına rağmen, gerçek dünya verisine olan ihtiyaç devam etmektedir. Aslında, yüksek kaliteli gerçek dünya verisine olan talep даже artabilir. Bunun nedeni iki katlıdır. İlk olarak, gerçek dünya verisi her zaman sentetik veri oluşturan AI modellerini eğitmek için gerekli olacaktır. İkincisi, model çökmesini önlemek için sentetik veriyi sürekli olarak gerçek dünya verisiyle senkronize etmek gerekli olacaktır.
Gerçek Veri ile Sentetik Veri Oluşturan AI Modellerini Eğitmek
Daha önce de bahsedildiği gibi, günümüzde kullanılan sentetik verilerin çoğu, Gen AI ile oluşturulmaktadır. Ve bu Gen AI modelleri, kullanılabilir sentetik veri oluşturmak için gerçek dünya verilerine ihtiyaç duyarlar. Çünkü yalnızca gerçek dünya veri setlerinin kalıplarını ve istatistiksel özelliklerini taklit ederek sentetik veri oluşturabilirler.
Örneğin, bir sigorta şirketinin sentetik veri kullanarak farklı satıcıları test edebildiği recent bir örneği düşünün. Bu sentetik veri setini, gerçekliği taklit eden bir şekilde oluşturmak için, şirketin kendi gerçek dünya verilerini sentetik veri oluşturan AI modelini eğitmek için kullanması gerekti.
Model Çökmesini Önlemek için Gerçek Veri
Model çökmesini önlemek için birden fazla strateji bulunmaktadır. Bunlar, sentetik veri kümelerini doğrulamak ve ardından düzenli olarak gözden geçirmek ve sentetik verinin kalitesini, oluşturucu modellerde kullanılmadan önce kontrol etmek gibi yöntemleri içerir. Ancak, en yaygın yaklaşım, veriyi çeşitlendirmektir, sentetik veri ile insan verisini birleştirmek gibi. Gartner’ın araştırması, katılımcıların %63’ünün kısmen sentetik bir veri kümesi kullanmayı tercih ettiğini, yalnızca %13’ünün tamamen sentetik veri kullandığını buldu.
Gerçek dünya verilerinin even küçük miktarlarını eklemek, bir modelin performansını önemli ölçüde iyileştirebilir. Güney Kaliforniya Üniversitesi’nden araştırmacılar, şirketlerin gerçek verilerinin %90’ını sentetik verilerle değiştirebileceğini, ancak bu son %10’lik insan verisini değiştirmenin önemli bir performans düşüşüne yol açabileceğini buldu.
Kalite de önemlidir, Microsoft’un Phi-4 başarısı gibi. Bu LLM, GPT-4o tarafından oluşturulan çoğunlukla sentetik verilerle eğitilmiştir. Ancak, ilk aşama eğitimi için kullanılan genel veri kümesinin büyük bir kısmı, kitaplar ve araştırma makaleleri gibi yüksek kaliteli, dikkatlice seçilmiş gerçek dünya verisiydi.
Sentetik Verinin Getirebileceği Potansiyel Yararlar
Sentetik veri akıllıca kullanıldığında ve gerçek dünya verisiyle etkili bir şekilde birleştirildiğinde, AI eğitim verilerine ilişkin altı özel sorunu çözebilir: kıtlık, erişilebilirlik, homojenlik, önyargı, gizlilik sorunları ve maliyet.
Veri Kıtlığı
AI şirketleri pazar payı kazanmak ve yeni rekorlar kırmak için yarıştıkça, LLM’lerini eğitmek için gereken veri miktarı da artmaktadır. Sentetik veri, bu açığı kapatma potansiyeline sahiptir, en azından Gartner’ın araştırması göre. Ancak, ön eğitim veri kümelerinde önemli miktarda gerçek verinin kullanılması ve model çökmesini önlemek için senkronizasyon yapılması gerekeceği unutulmamalıdır.
Veri Erişilebilirliği
Büyük teknoloji şirketleri, veri konusunda giderek daha fazla kapı bekçisi gibi davranmakta ve küçük oyuncular için bir engel oluşturmaktadır. Sentetik veri, büyük miktarlarda eğitim verilerini ucuz ve erişilebilir hale getirerek Gen AI’yi demokratikleştirebilir. Bununla birlikte, büyük teknoloji şirketlerinin gerçek dünya verilerine erişimini iyileştirmekten sorumlu olmaya devam edeceği unutulmamalıdır, çünkü bu veri hala sentetik veri oluşturan modelleri eğitmek için gereklidir.
Veri Homojenliği
Bazı niş kullanım durumlarında, örneğin otonom sürüş için AI’leri eğitmek, gerçek dünya veri kümeleri çok homojen olabilir. Sürüş durumunda, geliştiriciler, sentetik veri oluşturarak veri için boşlukları doldurabilir, bu da modellerin yolda nadir olaylar için eğitim almasına olanak tanır.
Önyargı
Bazı gerçek dünya veri kümeleri, içkin önyargılar içerebilir, bu nedenle sentetik veri, AI modellerinin daha dengeli bir resim almasını sağlayabilir. Örneğin, finans sektöründe, İngiltere’nin Finansal Hizmetler Otoritesi (FCA), sentetik verinin, insan veri kümelerindeki belirli grupların temsil edilmemesi nedeniyle oluşan potansiyel önyargıları karşı koyabileceğini savunmuştur.
Gizlilik
Sağlık ve finans gibi sektörlerde, gizlilik gereksinimleri veri kıtlığını daha da belirgin hale getirmektedir. Sentetik veri ile şirketler, müşterilerinin gizliliğini ihlal etmeden modelleri için niş veri kümeleri oluşturabilir. Ancak, Birleşik Krallık’ın Royal Society’nin tıbbi araştırmada sentetik veriye ilişkin bir raporunda belirtildiği gibi, sentetik verinin “doğal olarak özel” olduğu varsayımı bir “yanılgı”dır. Araştırmacılar, sentetik verinin türetilmiş olduğu veri hakkında bilgi sızdırabileceğini belirtiyorlar.
Örneğin, hassas verilerle eğitilen modeller, model tersine çevirme saldırılarına karşı savunmasızdır, burada saldırganlar orijinal veri kümesinin parçalarını yeniden oluşturabilir.
Maliyet
Genel olarak, sentetik veri, gerçek dünya verisinden daha düşük bir maliyetle üretilir. Ayrıca, etiketlenmiş olarak gelir, bu da zaman ve maliyet tasarrufu sağlar. Bazı AI eğitim projelerinde, veri hazırlama işlemleri, etiketleme dahil, projenin %80’ini oluşturabilir. Bu, Silikon Vadisi devlerinin veri işleme ihtiyaçlarını karşılamak için düşük maliyetli işgücü kaynağı sağlayan şirketlerin ortaya çıkmasının nedenidir.
Gerçek Veriyi Değiştirmek Yerine Tamamlayıcı Olmak
Sentetik verinin bu faydaları, yalnızca gerçek veri yerine değil, onu tamamlayıcı olarak kullanıldığında elde edilebilir. Rolü, gerçek veri kümelerini büyütmek ve kullanılabilir veri noktalarının sayısını artırmaktır.
Örneğin, Meta’nın yeni LLM’si LLAMA Behemoth, 30 trilyon veri noktasıyla eğitiliyor. Açıkça, bu ölçekte gerçek dünya verisi bulmak zor, eğer değilse imkansız. Ancak, sentetik verinin gerçek dünya verisini değiştirmek yerine tamamlayıcı olarak kullanılması gerektiği unutulmamalıdır, bu ya sentetik veri oluşturan modelleri eğitmek için ya da model çökmesini önlemek için sentetik veriyle senkronizasyon için gereklidir. LLM’ler şu anda çalıştığı ölçekte, sentetik verinin eğitim verilerinin önemli bir kısmını oluşturduğu durumlarda bile, gerçek dünya verisine önemli bir talep olacaktır. Ve bu, kapı bekçiliği, erişim, önyargı, maliyet ve zaman gibi konularda karmaşık sorunların çözülmesi gerekeceği anlamına gelir.












