Röportajlar
Amy Steier, Gretel.ai’de Baş Makine Öğrenimi Bilimcisi – Röportaj Serisi

Amy Steier, dünyanın en gelişmiş gizlilik mühendisliği platformu olan Gretel.ai‘de Baş Makine Öğrenimi Bilimcisidir. Gretel, veri odaklı teknolojilerin dokusuna gizliliği tasarlayarak entegre etmeyi kolaylaştırır. AI tabanlı, açık kaynaklı kütüphaneleri, hassas bilgileri dönüştürmek, anonimleştirmek ve sentezlemek için tasarlanmıştır.
Amy, 20 yılı aşkın deneyime sahip, üstün yetenekli bir makine öğrenimi ve veri bilimcisidir. Büyük veri ve makine öğrenimi, veri madenciliği, yapay zeka ve istatistik tekniklerini kullanarak gizli zekayı ortaya çıkarmaya olan tutkusu vardır. Tahminsel modelleme, sınıflandırma, kümeleme, anomali algılama, veri görselleştirme, toplu yöntemler, bilgi geri kazanımı, siber güvenlik analitiği, NLP, öneri modelleri ve kullanıcı davranışsal analitiği konularında uzmanlaşmıştır.
Sizce bilgisayar bilimi ve makine öğrenimi alanlarına kariyer yapmak için neler sizi çekmiştir?
Veri sevgim. Verinin gücü, gizemi, çekiciliği ve potansiyeli her zaman beni etkilemiştir. Bilgisayar bilimi ve makine öğrenimi, bu potansiyeli kullanmak için araçlardır. Ayrıca, araştırma ve ürünün kesiştiği bir alanda çalışmak çok keyiflidir. Kanıtlanmış fikirleri biraz daha ileri götürmek ve sonra onları mevcut, somut ürün ihtiyaçlarına uyarlamak çok tatmin edicidir.
Okuyucuların çoğu sentetik veri kavramından habersiz olabilir. Sentetik veri nedir?
Sentetik veri, orijinal verinin aynı şekilde davranan ve görünen ancak farklı enough olan veridir. En yaygın kullanım durumu, orijinal verideki bilgilerin gizliliğini korumaktır. Bir başka kullanım durumu, orijinal verisetinin boyutunu artırmak için ek veri oluşturmaktır. Bir başka kullanım durumu, orijinal verisetindeki sınıf dengesizliğini veya demografik önyargıyı gidermektir.
Sentetik veri, gerekli verilerin mevcut olmadığı veya erişilemediği durumlarda yeni ve yenilikçi ürünler ve çözümler geliştirmemize olanak tanır.
Gretel platformu, API’ler aracılığıyla sentetik veri oluşturmayı nasıl sağlar?
Gretel gizlilik mühendisliği API’leri, verilerinizi Gretel’e aktarmayı ve çıkarılan verileri keşfetmeyi sağlar. Bu API’ler, Konsol tarafından kullanılan aynı API’lerdir. API’leri açığa çıkarmak, geliştiricilerin ve veri bilimcilerin kendi iş akışlarını Gretel etrafında oluşturmalarına olanak tanır.
Konsol, sentetik veri oluşturmayı çok kolaylaştırır, ancak API’ler, sentetik verilerin oluşturulmasını iş akışınıza entegre etmenize olanak tanır. API’leri kullanmayı severim, çünkü sentetik verilerin oluşturulmasını çok özel bir kullanım durumuna göre özelleştirebiliyorum.
Sentetik verilerin kalitesini değerlendirmeye yardımcı olan araçlar hakkında konuşabilir misiniz?
Sentetik verilerin oluşturulmasından sonra, Gretel bir Sentetik Rapor oluşturur. Bu raporda, Sentetik Veri Kalite Puanı (SQS) ve Gizlilik Koruma Düzeyi notunu görebilirsiniz.
SQS puanı, oluşturulan sentetik verilerin orijinal verisetinin aynı istatistiksel özelliklerini koruduğu ölçüde bir tahmindir. Bu sentido, SQS puanı, sentetik veriden elde edilen bilimsel sonuçların orijinal veriden elde edilen sonuçlarla aynı olacağına dair bir güven puanı olarak görülebilir.
Sentetik Veri Kalite Puanı, bireysel kalite metriklerinin birleşiminden hesaplanır: Alan Dağılımı İstikrarı, Alan Korelasyon İstikrarı ve Derin Yapı İstikrarı.
Alan Dağılımı İstikrarı, sentetik verilerin orijinal verinin aynı alan dağılımını koruduğu ölçüde bir ölçektir. Alan Korelasyon İstikrarı, sentetik verilerin orijinal verideki alanlar arasındaki korelasyonu koruduğu ölçüde bir ölçektir. Son olarak, Derin Yapı İstikrarı, çoklu alan dağılımı ve korelasyonların istatistiksel bütünlüğünü ölçer. Bunu tahmin etmek için, Gretel, orijinal veride önce bir İlke Bileşen Analizi (PCA) hesaplar, ardından sentetik veride tekrar hesaplar.
Gretel gizlilik filtreleri nasıl çalışır?
Gretel Gizlilik Filtreleri, sentetik verilere karşı advers saldırıların doğasını araştırmamızın sonucudur. Gizlilik Filtreleri, sentetik verilerin zayıflıklarını önler. İki Gizlilik Filtremiz vardır: Benzerlik Filtresi ve Aykırı Filtre. Benzerlik Filtresi, sentetik kayıtların orijinal kayıtlara çok benzer olmasını önler. Bunlar, orijinal verilere dair ipuçları elde etmeye çalışan advers saldırıların hedefleridir. İkinci Gizlilik Filtresi, Aykırı Filtredir. Bu, sentetik kayıtların orijinal verinin uzayında aykırı olarak değerlendirilmesini önler. Aykırı kayıtlar, sentetik bir verisetinde ortaya çıkabilir ve Üyelik Tahmini Saldırıları, Öznitelik Tahmini ve diğer birçok advers saldırı tarafından sömürülebilir. Bunlar ciddi bir gizlilik riskidir.
Sentetik veri, AI yanlılığını azaltmada nasıl yardımcı olabilir?
En yaygın teknik, AI sistemine giren verilerin temsilci yanlılığını gidermektir. Örneğin, verinizde güçlü bir sınıf dengesizliği veya demografik önyargı varsa, Gretel, bu dengesizliği ölçmek ve sentetik veride gidermek için araçlar sunar. Verideki yanlılığı gidererek, genellikle AI sistemini de düzeltebilirsiniz.
Yeni makine öğrenimi teknolojileri hakkında öğrenmeye olan sevginiz açık. Bunları nasıl takip ediyorsunuz?
Okumak, okumak ve daha fazla okumak! Yeni ML teknolojileri hakkında okumaya başlamaktan keyif alıyorum. Medium, Towards Data Science, Analytics Vidhya ve The Sequence gibi blogları ve Facebook (META ) AI, Google (GOOGL ) AI ve OpenMined gibi kaynakları takip ediyorum.
Ayrıca, citação izleme araçlarını, benzer makaleleri bulma araçlarını ve ilgi alanlarımı takip eden araçları severim. Zeta Alpha gibi araçlar, ilgi alanlarımı takip eder ve bana uygun makaleler önerir.
Son olarak, benzer ilgi alanlarına sahip meslektaşlarınızın faydalarını küçümsemeyin. Gretel’de, ML ekibi, araştırdığımız alanlarla ilgili araştırma makalelerini takip ediyor ve ilginç makaleleri tartışmak için bir araya geliyoruz.
Makine öğreniminin geleceği hakkında vizyonunuz nedir?
Verilere kolay erişim, makine öğreniminde büyük bir yenilik çağını tetikleyecek ve sonra da sağlık, finans, üretim ve biyobilim gibi birçok alanda yenilikleri hızlandıracaktır. Tarih boyunca, birçok önemli makine öğrenimi ilerlemesi, büyük ve zengin verilerin erişilebilir olmasına bağlanmıştır. Ancak, birçok araştırma, verilere erişilememesi veya paylaşılamaması nedeniyle engellenmiştir. Gretel gibi araçlar bu engeli kaldırdıkça, verilere erişim demokratikleşecektir. Tüm makine öğrenimi topluluğu, sadece birkaç büyük şirketin erişebildiği zengin ve büyük verilere erişebilecek.
Gretel hakkında paylaşmak istediğiniz başka bir şey var mı?
Eğer veri seviyorsanız, Gretel’i seveceksiniz (ben açıkça Gretel’i seviyorum!). Verilere erişimin her veri bilimcisinin canını sıkan bir sorun olduğunu biliyorum. Gretel’de, özel, paylaşılabilecek verilerin oluşturulmasını mümkün kılacak bir konsol ve API seti oluşturduğumuz için gurur duyuyoruz. Verilerin paylaşıldığında daha değerli olduğuna inaniyoruz.
Harika röportaj için teşekkür ederiz ve okuyucuların daha fazla bilgi edinmek için Gretel.ai‘yi ziyaret etmelerini öneririz.












