Yapay zeka modelleri ve platformları
DataGen 18 Milyon Dolar Yatırım ile Yapay Zeka için Sentetik Veri Oluşturuyor
İsrail merkezli startup şirket DataGen, yapay zeka şirketleri için sentetik veri üretecek bir platform oluşturmak için 18,5 milyon dolar yatırım aldı.
Her yapay zeka şirketi, yapay zeka modellerini eğitmek için gerekli verilerin toplanması konusunda aynı temel zorluğu yaşamaktadır. Yüksek kaliteli eğitim verilerine duyulan ihtiyaç o kadar büyüktür ki, yapay zeka şirketlerine gerekli verileri sağlamak için bir alt endüstri oluşmuştur. Yapay zeka ve yapay zeka ile ilgili şirketler, eğitim verilerini elde etmek için yeni yollar aramaktadır. Bu eğitim verilerini elde etmenin bir yolu, verileri simplemente üretmektir.
Fortune’ın haberine göre, DataGen kendi makine öğrenimi modellerini kullanarak diğer şirketlerin modellerini eğitmek için sentetik veri oluşturmaktadır, özellikle de görüntü ve video verileri. Şirket tarafından oluşturulan veriler, müşterileri tarafından kendi yapay zeka modellerini eğitmek için kullanılmaktadır. DataGen’in CEO’su ve kurucusu Ofir Chakon, şirketin bir客户 şirket için tamamen sentetik bir veri setini sadece birkaç saat içinde oluşturabileceğini belirtmiştir. Bu, genellikle haftalar veya aylar süren veri etiketleme işleminin çok daha kısa bir süresidir.
Sentetik verilerin şirketler için çekici olmasının başka nedenleri de vardır. Sentetik veriler, gerçek verilerle ilgili olan gizlilik endişeleri taşımaz. Veri gizliliği koruma yasaları oluşturuldukça, sentetik eğitim verilerine sahip olmak daha da çekici hale gelmektedir. Teknoloji analitiği firması Gartner’ın yaptığı bir tahmin, 2023 yılına kadar dünya nüfusunun %65’inin verilerinin bazı türden veri gizliliği yasaları tarafından korunacağını öngörmektedir.
Sentetik verilerin gerçek kişiler temel alınarak oluşturulmadığı halde,仍 de önyargılı olabilir. Sentetik veri modeli tarafından oluşturulan veriler, orijinal eğitim verilerinin aynı kalıplarını taşır, yani veri setindeki önyargılar yeni oluşturulan verilerde de mevcut olacaktır. DataGen, oluşturulan verilerdeki önyargıları azaltmak için stratejilere sahiptir. Sentetik verilerdeki önyargıları azaltmak için bir yöntem, nadir olayların oluşma oranını artırmaktır, yani veri setindeki bir sınıfın temsil oranını daha eşit bir seviyeye çıkarmaktır.
Nadir olayların oluşma oranını artırmak, özellikle potansiyel olarak tehlikeli senaryolar içeren veri setleri oluştururken son derece önemlidir. Örneğin, bir otonom araç için eğitim verisi seti düşünün. Araç, nadir olaylara güvenilir bir şekilde tepki vermelidir, örneğin yolun açılması gibi. Ancak bu tür olaylar çok nadirdir ve eğitim verilerini elde etmek zordur. Bu nedenle, bu nadir olaylar için eğitim verilerinin genellikle oluşturulması gerekir.
Chakon, Fortune’a şöyle demiştir:
“Müşterilerimiz, oluşturdukları verilerin tüm parametreleri üzerinde tam kontrol sahiptir. Gerçek dünya uygulaması, bir kez dağıtıldığında, farklı alanlarda, farklı etnik gruplarda, farklı coğrafi konumlarda veya hayal edebileceğiniz herhangi bir ortamda iyi çalışacağından emin olabilirsiniz.”
DataGen, gerçekçi simülasyonlar oluşturmak için Generative Adversarial Networks (GAN’ler) kullanmaktadır. Chakon, şirketin iç mekanlar veya insan algısı ile ilgili her şeyi güvenilir bir şekilde oluşturabileceğini belirtmiştir. Örneğin, DataGen tarafından oluşturulan bir görüntü veri seti, depo lojistiği için kullanılan bir robotik kolun eğitimi için kullanılan nesnelerin örneklerini içerebilir ve oluşturulan görüntüler gerçek şeyden ayırt edilemez. DataGen’in yazılımı, görsel bir ağework ile bir fizik simülasyon sistemi birleştirerek 3D nesneler oluşturabilir.
DataGen’de yatırımcılar arasında, Nvidia’nın yapay zeka araştırma bölümünün direktörleri ve Max Plank Enstitüsü için Akıllı Sistemler, serta Kaggle’ın CEO’su Anthony Goldbloom gibi yüksek profilli kişiler ve şirketler bulunmaktadır.












