Röportajlar
Wilson Pang, The Real World of AI Kitabının Eş Yazarı – Röportaj Serisi

Wilson Pang, Kasım 2018’de Appen’e CTO olarak katıldı ve şirketin ürünlerinden ve teknolojisinden sorumludur. Wilson, yazılım mühendisliği ve veri bilimi alanında on dokuz yıldan fazla deneyime sahiptir. Appen’e katılmadan önce, Wilson, dünyanın ikinci büyük online seyahat acentesi şirketinin Çin’deki baş veri sorumlusuydu ve burada veri mühendisleri, analistler, veri ürün yöneticileri ve bilim adamlarına liderlik ederek kullanıcı deneyimini iyileştirdi ve operasyonel verimliliği artırdı ve işi büyüttü. Daha önce, Kaliforniya’daki eBay’de mühendislik direktörü olarak görev yaptı ve çeşitli alanlarda,包括 veri hizmetleri ve çözümleri, arama bilimi, pazarlama teknolojisi ve faturalama sistemleri gibi konularda liderlik sağladı. IBM’de mimar olarak çalışmadan önce, çeşitli müşteriler için teknoloji çözümleri geliştirdi. Wilson, Çin’deki Zhejiang Üniversitesi’nden elektrik mühendisliği alanında yüksek lisans ve lisans derecelerini aldı.
Yeni kitabımız hakkında konuşuyoruz: The Real World of AI: Responsible Machine Learning için Pratik Bir Kılavuz
Makine öğrenimi ile ilgili ilk derslerden birinin, ölçülmesi gereken metriklerin önemini anlamak olduğunu söylüyorsunuz. “Oturum başına satın alma” metriğinin, bir öğenin parasal değerini hesaba katmadığını gösteren örnek veriliyor. Şirketler, benzer sorunları tránh etmek için hangi metriklerin ölçülmesi gerektiğini en iyi şekilde nasıl anlayabilirler?
AI modeline atfedilen hedeflerinizle başlayın – bizim durumumuzda, makine öğrenimi ile daha fazla gelir elde etmek istedik. Hedeflere metrikler eklediğinizde, bu metriklerin ürettiği mekanikleri düşünün, modeli yayınladığınızda ve insanlar onunla etkileşime girdiğinde, ayrıca varsayımlarınızı not alın. Bizim durumumuzda, modelin geliri optimize edeceğini varsaydık, ancak oturum başına satın alma sayısı buna karşılık gelmedi, çünkü model yüksek sayıda düşük biletli satışları optimize ediyordu ve günün sonunda daha fazla para kazanmıyorduk. Bunu fark ettiğimizde, metrikleri değiştirebildik ve modeli doğru yöne yönlendirebildik. Böylece, granül metrikleri belirlemek ve varsayımları not etmek, bir projenin başarısı için kritik öneme sahiptir.
Kitabı araştırırken ve yazarken kişisel olarak neler öğrendiniz?
Farklı şirketlerden ve sektörlerden çok çeşitli sorunları çözebilecek AI uygulamaları var. Kullanım örnekleri çok farklı olabilir, AI çözümü farklı olabilir, AI çözümünü eğitmek için kullanılan veriler farklı olabilir. Ancak, tüm bu farklılıklara rağmen, insanların AI yolculukları sırasında yaptıkları hatalar oldukça benzer. Bu hatalar, tüm sektörlerden ve endüstrilerden şirketlerde tekrar tekrar meydana geliyor.
AI projelerini uygularken paylaştığımız bazı ortak en iyi uygulamaları, insanların ve şirketlerin bu hataları tránh etmelerine ve sorumlu AI’yi dağıtmaya güvenmelerine yardımcı olmak umuduyla paylaşıyoruz.
Kitaptan insanların alması gereken en önemli dersler nelerdir?
İnanıyoruz ki, makine öğrenimi teknolojisini düşünceli, sorumlu ve etik bir şekilde kullanmak, dünyayı daha adil, daha adil ve daha kapsayıcı bir yer haline getirebilir. Makine öğrenimi teknolojisi, iş dünyasını her şeyi yeniden şekillendirmeye söz veriyor, ancak bu zor değil. Takımların güvenle üretim dağıtmak için takip edebileceği denenmiş ve test edilmiş yöntemler ve süreçler var.
Diğer bir önemli ders, iş sahiplerinin (ürün yöneticileri gibi) ve daha teknik taraftaki takım üyelerinin (mühendisler ve veri bilimcileri gibi) ortak bir dil konuşmaları gerektiğidir. AI’yi başarıyla dağıtmak için, liderler, iş uzmanları ve C-seviyesi yöneticilere yeterli bağlamı sağlayarak, teknik uygulayıcılarla verimli bir şekilde iletişim kurmalarını sağlamalıdır.
İnsanlar AI’yi düşündüğünde, ilk önce kod hakkında düşünürler. Kitaptaki önemli bir ders, verilerin AI modelinin başarısı için kritik olduğudur. Veri toplama, etiketleme, depolama ve her adımda modelin başarısını etkileyen çok şey vardır. En başarılı AI dağıtımları, verilere yüksek önem veren ve bu yönünü sürekli olarak geliştirmeye çalışanlardır.
Gerçek dünya AI’si için gereken tek şey, çapraz fonksiyonel bir takım ve yenilikçi bir ruhtur.
Kitapta, bir AI modelinin yeterince doğru olup olmadığını belirlemenin gerekliliği tartışılıyor. Gerekli doğruluğun türünü değerlendirmenin en kolay yolu nedir?
Bu, kullanım örneklerinize ve risk toleransınıza bağlıdır. AI geliştiren takımlar, her zaman bir test aşamasına sahip olmalıdır, burada doğruluk seviyelerini ve organizasyonları ve paydaşları için kabul edilebilir eşiklerini belirlerler. Yaşam veya ölüm kullanım örnekleri için – yanlış giden AI’nin potansiyel zararı olan, self-driving arabalar, tıbbi kullanım örnekleri gibi durumlarda – eşik çok, çok yüksektir ve takımlar yanlış giden modeller için önlemler koymalıdır. Daha fazla hata toleransına sahip kullanım örnekleri için – içeriğin, arama veya reklamların alaka düzeyinin subjektif olduğu durumlarda – takımlar, kullanıcı geri bildirimi ile üretim sırasında modellerini ayarlamaya güvenebilir. Tabii ki, burada da yasadışı veya ahlaksız materyalin kullanıcıya gösterilebileceği yüksek riskli kullanım örnekleri vardır, bu nedenle burada da güvence ve geri bildirim mekanizmaları olmalıdır.
Proje için başarıyı önceden tanımlamanın önemi nedir?
İş problemi ile başlamaktan, başarıyı önceden tanımlamaktan eşit derecede önemlidir, çünkü ikisi el ele gider. Kitaptaki otomotiv bayisinin AI kullanarak resimleri etiketleme örneğinde, başarıyı neye benzeyeceğini belirlemediler, çünkü bir iş problemi çözme hedefi belirlemediler. Başarı, onlara göre birçok farklı şey olabilirdi, bu da bir problemi, hatta bir makine öğrenimi modelini, sabit bir kapsamla çözmeyi zorlaştırır. Eğer %80’de kullanılan araçlardaki hasarları doğru bir şekilde etiketleme olarak başarıyı tanımlasalar ve %85 doğru etiketlemeyi başarsalardı, takım bunu bir başarı olarak adlandıracaktı. Ancak başarı, iş problemine ve doğrudan iş etkisine bağlı değilse, projenin başarısını, etiketleme doğruluğunun odaklanmış tanımından başka şekilde değerlendirmek zor olur. Burada, iş problemi daha karmaşıktı ve hasarları etiketleme, bunun sadece bir parçasıydı. Onlar, başarıyı, claims sürecinde zaman/money tasarrufu veya onarım sürecini X% optimize etme olarak tanımlayarak daha iyi durumda olabilirdi ve etiketleme etkisini gerçek iş sonuçlarına çevirebilirdi.
Üretim dağıtımı sırasında ortaya çıkabilecek tüm kullanım örneklerini kapsayan eğitim veri örneklerinin sağlanması ne kadar önemlidir?
Modeli, üretim sırasında karşılaşacağı tüm kullanım örneklerine karşı eğitmek, önyargıdan kaçınmak için çok önemlidir. Ancak, üretimdeki tüm kullanım örneklerini kapsamak imkansızdır, AI’yi geliştiren takımların üretim verilerini ve eğitim verilerini anlamaları önemlidir, böylece AI’yi üretim sırasında karşılaşacağı şeylere karşı eğitebilirler. Büyük, çeşitli gruplardan ve çeşitli kullanım örneklerinden gelen eğitim verilerine erişmek, modelin başarısı için kritik olacaktır. Örneğin, bir resimdeki bir kişinin evcil hayvanını tanıyan bir model, köpekler, kediler, kuşlar, küçük memeliler, sürüngenler gibi tüm evcil hayvan türleri ile eğitilmelidir. Eğer model sadece köpekler, kediler ve kuşlar ile eğitilirse, jemand bir guinea pig resmini yüklediğinde, model bunu tanımlayamayacaktır. Bu, basit bir örnek, ancak üretim sırasında karşılaşılacak kullanım örneklerine karşı eğitmenin önemini göstermektedir.
Kitapta, iyi veri hijyeni alışkanlıklarını geliştirmenin gerekliliği tartışılıyor. Bu alışkanlığı geliştirmek için ilk adımlar nelerdir?
İyi veri hijyeni alışkanlıkları, iç verilerin kullanılabilirliğini artıracaktır ve bunları ML kullanım örnekleri için hazırlayacaktır. Tüm şirketin, verilerini organize etme ve takip etme konusunda iyi olması gerekir. Bunu başarmak için bir yol, bunu bir iş gereksinimi haline getirmek ve uygulamayı takip etmektir, böylece çok az rapor özel işlere dönüşür ve takımlar, merkezi bir depoya yönlendirilen veri boru hatları ile daha fazla çalışır, açık bir ontoloji ile. İyi bir başka uygulama, verilerin ne zaman ve nerede toplandığını ve veritabanına yerleştirilmeden önce neye uğradığını kaydetmek ve kullanılmayan veya eskimiş verilerin periyodik olarak temizlenmesi için prosedürler oluşturmaktır.
Harika röportaj için teşekkür ederiz, daha fazla bilgi almak isteyen okuyucular için, The Real World of AI: Responsible Machine Learning için Pratik Bir Kılavuz kitabını okumalarını öneririz.












