Düşünce Liderleri
AI/ML Stratejinizi Öldürecek Önyargı ve Buna Karşı Nasıl Davranacağınız
‘Önyargı’, herhangi bir modelde, modelin doğru olmayan yanıtlar vermesi veya girdi verilerine doğru şekilde yanıt verememesi durumunu tanımlar. Bu, modelin yeterli yüksek kaliteli, çeşitli veri ile eğitilmemesi nedeniyle oluşur. Bir örnek, Apple’ın yüz tanıma telefon kilidini açma özelliğidir, bu özellik daha koyu cilt tonlarına sahip kişilerde daha yüksek oranda başarısız olmuştur. Model, daha koyu cilt tonlu insanların yeterli sayıda görüntüsü ile eğitilmemişti. Bu, önyargının比較 düşük riskli bir örneğiydi, ancak AB AI Yasası’nın model etkinliğini (ve kontrollerini) piyasaya sürmeden önce kanıtlama gerekliliğini ortaya koyması bu nedenle önemlidir. İş, finans, sağlık veya kişisel durumları etkileyen çıktılara sahip modellerin güvenilir olması gerekir, aksi takdirde kullanılmazlar.
Veri ile Önyargı ile Başa Çıkma
Yüksek Kaliteli Büyük Veri Hacimleri
AI/ML modellerindeki önyargıyı aşmak ve minimize etmek için önemli veri yönetimi uygulamalarından biri, büyük miktarda yüksek kaliteli, çeşitli veri edinmektir. Bu, böyle veri sahip olan birden fazla organizasyonla işbirliği yapmayı gerektirir. Geleneksel olarak, veri edinimi ve işbirlikleri, gizlilik ve/veya IP koruma endişeleri nedeniyle zorlanmaktadır – hassas veri model sahibi tarafından gönderilemez ve model sahibi IP’sini veri sahibine sızdırma riskini taşıyamaz. Bir çözüm, sentetik veya yapay veri ile çalışmaktır, bu yararlı olabilir ancak gerçek, tam bağlam verisi kullanmaya kıyasla sınırlamaları vardır. İşte burada gizlilik güçlendirici teknolojiler (PET’ler) gerekli cevapları sağlar.
Sentetik Veri: Yakın, ancak Tam Olarak Değil
Sentetik veri, gerçek veriyi taklit etmek için yapay olarak oluşturulur. Bu zor bir iştir, ancak AI araçları ile biraz daha kolay hale gelmektedir. İyi kaliteli sentetik verinin, gerçek verinin aynı özelliklerine sahip olması gerekir, aksi takdirde yararlı olmayacaktır. Kaliteli sentetik veri, eğitim verilerinin çeşitliliğini artırarak küçük, marjinal popülasyonlar için veya AI sağlayıcısının yeterli verisi olmayan popülasyonlar için boşlukları doldurmak için kullanılabilir. Sentetik veri, gerçek dünyada yeterli miktarda bulunması zor olan kenar durumları ele almak için de kullanılabilir. Ayrıca, organizasyonlar, gerçek verilere erişimini engelleyen veri ikametgahı ve gizlilik gereksinimlerini karşılamak için sentetik bir veri kümesi oluşturabilir. Bu iyi görünüyor, ancak sentetik veri sadece bir parçadır, çözüm değildir.
Sentetik verinin bir sınırı, gerçek dünyadan kopuk olmasıdır. Örneğin, yalnızca sentetik veri ile eğitilen otonom araçlar, gerçek ve öngörülmesi zor yol koşullarıyla başa çıkmakta zorlanacaktır. Ayrıca, sentetik veri, onu oluşturmak için kullanılan gerçek dünya verisinden önyargıyı miras alır – bu, tartışmamızın amacını neredeyse ortadan kaldırır. Sonuç olarak, sentetik veri, ince ayar yapmak ve kenar durumları ele almak için yararlı bir seçenektir, ancak model etkinliğini ve önyargıyı minimize etmek için gerçek dünya verisine erişmek hala gereklidir.
Daha İyi Bir Yol: PET’ler ile Gerçek Veri
PET’ler, veri kullanılırken onu korur. AI/ML modelleri için, aynı zamanda çalıştırılan modelin IP’sini de koruyabilir – “iki kuş, bir taş”. PET’ler kullanan çözümler, daha önce erişilemeyen hassas veri kümeleri üzerinde model eğitimi yapma olanağı sağlar. Bu, gerçek verilere erişim kilidini açar ve önyargıyı en aza indirir. Ancak nasıl çalışır?
Şu anda lider seçenekler, bir gizli hesaplama ortamıyla başlar. Ardından, PET’ler tabanlı bir yazılım çözümü ile entegre olur ve veri yönetimi ve güvenlik gereksinimlerini karşılar. Bu çözümle, modeller ve veriler, güvenli bir hesaplama ortamına gönderilmeden önce şifrelenir. Ortam herhangi bir yerde barındırılabilir, bu da belirli veri yerelleştirme gereksinimlerini ele almak için önemlidir. Bu, model IP’sinin ve girdi verilerinin güvenliğinin hesaplamalar sırasında korunması anlamına gelir – hatta güvenilen yürütme ortamı sağlayıcısı bile ortam içindeki modellere veya verilere erişemez. Şifreli sonuçlar sonra gözden geçirilmek üzere geri gönderilir ve günlükler gözden geçirme için kullanılabilir.
Bu akış, nerede olursa olsun en iyi kalitede verilere kilidi açar, önyargı minimizasyonuna ve güvenilecek yüksek etkinlikte modellere yol açar. Bu akış, AB AI Yasası’nın AI düzenleyici kum havuzları için öngördüğü şeydir.
Etik ve Yasal Uyumun Sağlanması
İyi kaliteli, gerçek veri edinmek zordur. Veri gizliliği ve yerelleştirme gereksinimleri, organizasyonların erişebileceği veri kümelerini hemen sınırlar. İnovasyon ve büyüme için, verilerin değerini çıkaranlara akması gerekir.
AB AI Yasası’nın 54. maddesi, “yüksek risk” model türleri için, piyasaya sürülmeden önce neler kanıtlanması gerektiğini düzenler. Kısa olarak, ekiplerin, bir AI Düzenleyici Kum Havuzu içinde gerçek dünya verilerini kullanarak yeterli model etkinliğini ve tüm kontrollerle uyumu göstermeleri gerekir. Kontroller, izleme, şeffaflık, açıklanabilirlik, veri güvenliği, veri koruması, veri asgarileştirme ve model korumasını içerir – düşünün DevSecOps + Data Ops.
İlk zorluk, böyle bir model türü için gerçek dünya veri kümesini bulmaktır – bu, doğası gereği hassas verilerdir. Teknik garantiler olmadan, birçok organizasyon, verilerini model sağlayıcısına güvenmek isteyebilir veya bunu yapmasına izin verilmeyebilir. Ayrıca, yasa, bir “AI Düzenleyici Kum Havuzu”nun tanımını kendisi bir zorluktur. Bazı gereksinimler, verilerin model çalıştırıldıktan sonra sistemden kaldırılmasını garantiler ve governance kontrollerini, zorlamayı ve raporlamayı içerir.
Çok sayıda organizasyon, kutudan çıkan veri temizleme odaları (DCR’ler) ve güvenilen yürütme ortamları (TEE’ler) kullanmaya çalıştı. Ancak, bu teknolojiler kendi başlarına, önemli uzmanlık ve iş gerektirir ve veri ve AI düzenleyici gereksinimlerini karşılamak için çalıştırılır. DCR’ler daha kolay kullanılır, ancak daha güçlü AI/ML ihtiyaçları için henüz faydalı değildir. TEE’ler güvende olan sunuculardır ve vẫn bir entegre işbirliği platformuna ihtiyaç duyarlar, hızlı bir şekilde faydalı olmak için. Bu, TEE’lerle entegre olan gizlilik güçlendirici teknoloji platformları için bir fırsat tanımlar, kurulumu ve AI düzenleyici kum havuzunun kullanımını basitleştirir ve böylece hassas verilerin edinilmesini ve kullanılmasını kolaylaştırır.
Bu teknolojiler, daha çeşitli ve kapsamlı veri kümelerinin gizlilik koruma mannerinde kullanılmasını sağlayarak, AI ve ML uygulamalarının veri gizliliği ile ilgili etik standartlara ve yasal gereksinimlere (örneğin, AB’de GDPR ve AI Yasası) uymasını sağlar. Özetle, gereksinimlere genellikle sesli homurtular ve iç çekmelerle karşılık verilir, ancak bu gereksinimler, sadece önemli veri odaklı karar almada güvenebileceğimiz ve veri konularının gizliliğini koruyarak model geliştirme ve özelleştirme için kullanılan daha iyi modeller oluşturmaya yol açar.












