Yapay zeka modelleri ve platformları
LightAutoML: Finansal Hizmetler için AutoML Çerçevesi
AutoML birkaç yıl önce popülerlik kazanmasına rağmen, AutoML üzerine yapılan ilk çalışmalar 90’ların başlarına dayanmaktadır. Bilim adamları, ilk hyperparameter optimizasyon üzerine makalelerini yayınladıklarında, AutoML üzerine ilk çalışmalar yapılmaya başlanmıştır. 2014 yılında ICML, ilk AutoML atölyesini düzenledi ve AutoML, ML geliştiricilerinin dikkatini çekti. AutoML’nin yıllarca süren çalışmalarının odak noktalarından biri, hyperparameter arama problemidir. Burada model, belirli bir makine öğrenimi modeli için en iyi performans gösteren hyperparametreleri belirlemek amacıyla çeşitli optimizasyon yöntemlerini uygular. AutoML modelleri tarafından uygulanan bir diğer yöntem, belirli bir hyperparametrenin optimal hyperparameter olma olasılığını tahmin etmektir. Model, bu amaçla Bayesian yöntemleri uygular ve geleneksel olarak daha önce tahmin edilen modellerden elde edilen histórik veriler ve diğer veri setlerini kullanır. Hyperparameter optimizasyonuna ek olarak, diğer yöntemler, modeling alternatifleri uzayından en iyi modelleri seçmeye çalışır.
Bu makalede, finans sektöründe faaliyet gösteren bir Avrupa şirketinin ekosistemi için geliştirilen bir AutoML sistemi olan LightAutoML’yi ele alacağız. LightAutoML çerçevesi, çeşitli uygulamalarda dağıtılmış ve sonuçlar, veri bilimcileri düzeyinde yüksek kaliteli makine öğrenimi modelleri oluştururken üstün performans göstermiştir. LightAutoML çerçevesi, aşağıdaki katkıları yapmaya çalışmaktadır. İlk olarak, LightAutoML çerçevesi, büyük bir Avrupa finans ve bankacılık kurumunun ekosistemi için geliştirilmiştir. Çerçevesi ve mimarisi nedeniyle, LightAutoML çerçevesi, çeşitli açık benchmarklarda ve ekosistem uygulamalarında mevcut AutoML çerçevelerini geçebilir. LightAutoML çerçevesinin performansı, ayrıca veri bilimcileri tarafından elle ayarlanan modellerle karşılaştırılmış ve sonuçlar, LightAutoML çerçevesinin daha güçlü performans gösterdiğini belirtmiştir.
Bu makale, LightAutoML çerçevesini derinlemesine ele almayı amaçlamaktadır ve mekanizmasını, metodolojisini, mimarisini ve diğer çerçevelerle karşılaştırmalarını inceleyeceğiz. Başlayalım.
LightAutoML: Finansal Hizmetler için AutoML Çerçevesi
Araştırmacılar ilk olarak 90’ların başlarında AutoML üzerine çalışmaya başlasalar da, AutoML son birkaç yıldır önemli bir ilgi görmüştür. Bazı nổi bật endüstriyel çözümler, otomatik olarak makine öğrenimi modelleri geliştiren Amazon’un AutoGluon, DarwinAI, H20.ai, IBM Watson AI, Microsoft (MSFT ) AzureML gibi şirketler bulunmaktadır. Bu çerçevelerin çoğu, finansal hizmetler, sağlık, eğitim ve daha fazlası gibi farklı uygulama sınıfları boyunca otomatik olarak makine öğrenimi modelleri geliştiren genel amaçlı bir AutoML çözümü uygulamaktadır. Bu genel ve yatay yaklaşımın temel varsayımı, otomatik modelleri geliştirme sürecinin tüm uygulamalar boyunca aynı kalmasıdır. Ancak LightAutoML çerçevesi, bireysel uygulamaların ihtiyaçlarına cevap veren, genel olmayan bir AutoML çözümü geliştirmek için dikey bir yaklaşım uygulamaktadır. LightAutoML çerçevesi, büyük bir finans kurumunun kompleks ekosisteminin gereksinimlerine ve özelliklerine odaklanan dikey bir AutoML çözümüdür. İlk olarak, LightAutoML çerçevesi, hızlı ve neredeyse optimal hyperparameter araması sağlar. Model, bu hyperparametreleri doğrudan optimize etmez, ancak tatmin edici sonuçlar sağlar. Ayrıca, model, hız ve hyperparameter optimizasyonu arasındaki dengeyi korur, böylece model küçük problemlerde optimal ve büyük problemlerde yeterince hızlıdır. İkinci olarak, LightAutoML çerçevesi, makine öğrenimi modellerinin kapsamını, lineer modeller ve GBM’ler veya gradient boosted karar ağaçları olmak üzere yalnızca iki türe sınırlar. Makine öğrenimi modellerinin kapsamının sınırlanmasının temel nedeni, LightAutoML çerçevesinin yürütme süresini, belirli bir problem ve veri türü için performansını olumsuz etkilemeden hızlandırmaktır. Üçüncü olarak, LightAutoML çerçevesi, modellerde kullanılan farklı özellikler için ön işleme şemalarını seçmek amacıyla benzersiz bir yöntem sunar. LightAutoML çerçevesi, çeşitli uygulamalar boyunca geniş bir açık veri kaynağı üzerinden değerlendirilir.
LightAutoML: Metodoloji ve Mimarisi
LightAutoML çerçevesi, tipik makine öğrenimi görevleri için uçtan uca model geliştirme için adanmış modüllere sahiptir. Şu anda, LightAutoML çerçevesi, Preset modüllerini desteklemektedir. İlk olarak, TabularAutoML Preset, tablo verilerine dayalı klasik makine öğrenimi problemlerini çözmeye odaklanır. İkinci olarak, White-Box Preset, WoE veya Weight of Evidence kodlaması ve ayrık özellikler yerine basit yorumlanabilir algoritmaları uygulayarak, binary sınıflandırma görevlerini çözmek için tasarlanmıştır. Üçüncü olarak, NLP Preset, önceden eğitilmiş derin öğrenme modelleri ve özel özellik çıkarıcılar dahil olmak üzere NLP araçlarıyla birlikte tablo verilerini birleştirebilir. Son olarak, CV Preset, bazı temel araçlar yardımıyla görüntü verisiyle çalışır. LightAutoML modelinin tüm dört Preset’i desteklemesine rağmen, çerçeve yalnızca üretim düzeyindeki sistemde TabularAutoML’yi kullanmaktadır.
LightAutoML çerçevesinin tipik işlem hattı aşağıdaki görüntüde gösterilmektedir.

Her işlem hattı üç bileşenden oluşur. İlk olarak, Reader, görev türünü ve ham veriyi girdi olarak alır, kritik metadata hesaplamaları gerçekleştirir, ilk veriyi temizler ve farklı modelleri uyarlama öncesi gerçekleştirilecek veri manipülasyonlarını belirler. İkincisi, LightAutoML iç veri kümesi, CV iteratörleri ve metadata içerir ve veri kümeleri için doğrulama şemalarını uygular. Üçüncü bileşen, tek bir tahmin elde etmek için yığılan ve/veya karıştırılan birden fazla makine öğrenimi işlem hattıdır. LightAutoML mimarisindeki bir makine öğrenimi işlem hattı, tek bir veri doğrulama ve ön işleme şemasını paylaşan birden fazla makine öğrenimi modelidir. Ön işleme adımı, iki özellik seçimi adımı, bir özellik mühendisliği adımı veya ön işleme gerekmezse boş olabilir. Makine öğrenimi işlem hatları, aynı veri kümesi üzerinde bağımsız olarak hesaplanabilir ve ardından averaging (veya ağırlıklı averaging) kullanılarak birleştirilebilir. Alternatif olarak, bir yığma toplama şeması kullanılarak çok seviyeli toplama mimarileri oluşturulabilir.
LightAutoML Tabular Preset
LightAutoML çerçevesi içinde, TabularAutoML varsayılan işlem hattıdır ve binary sınıflandırma, regresyon ve çoklu sınıf sınıflandırma gibi üç tür görevi çözmek için tablo verilerine uygulanır. TabularAutoML bileşenine girdi olarak, kategorik özellikler, numerik özellikler, zaman damgaları ve sınıf etiketleri veya sürekli değerler içeren tek bir hedef sütunu ile bir tabla verilir. LightAutoML çerçevesinin tasarımındaki primary amaçlardan biri, hızlı hipotez testi için bir araç tasarlamaktır, bu nedenle çerçeve, pipeline optimizasyonu için brute-force yöntemlerini kullanmaktan kaçınır ve yalnızca geniş bir veri kümesi boyunca çalışan verimlilik teknikleri ve modellere odaklanır.
Oto-Tipi ve Veri Ön İşleme
Farklı özelliklere farklı şekillerde davranmak için, model her özellik türünü bilmelidir. Tek bir görev ve küçük bir veri kümesi durumunda, kullanıcı her özellik türünü manuel olarak belirleyebilir. Ancak, yüzlerce görev ve binlerce özellik içeren veri kümeleri içeren durumlarda, her özellik türünü manuel olarak belirtmek artık uygulanabilir bir seçenek değildir. TabularAutoML Preset için, LightAutoML çerçevesi, özellikleri üç sınıfa ánhatabilir: numerik, kategorik ve datetime. Basit ve açık bir çözüm, sütun dizisi veri türlerini gerçek özellik türleri olarak kullanmaktır, yani float/int sütunlarını numerik özelliklere, timestamp veya string’i datetime’ye ve diğerlerini kategorik özelliklere ánhatabilir. Ancak bu eşleme en iyisi değildir, çünkü kategorik sütunlarda numerik veri türlerinin sık sık ortaya çıkması nedeniyle.
Doğrulama Şemaları
Doğrulama şemaları, AutoML çerçevelerinin temel bir bileşenidir, çünkü endüstri verilerinde zaman içinde değişiklikler olabilir ve bu değişiklik, model geliştirirken IID veya Bağımsız ve Aynı Dağılım varsayımlarının geçersiz olmasını sağlar. AutoML modelleri, performanslarını tahmin etmek, hyperparametreleri aramak ve dış折 tahmin üretimi için doğrulama şemalarını kullanır. TabularAutoML işlem hattı, üç doğrulama şemasını uygular:
- KFold Cross Validation: KFold Cross Validation, TabularAutoML işlem hattı için varsayılan doğrulama şemasıdır ve davranışsal modeller için GroupKFold ve sınıflandırma görevleri için stratified KFold içerir.
- Tutma Doğrulaması: Tutma doğrulama şeması, tutma kümesi belirtilirse uygulanır.
- Özel Doğrulama Şemaları: Özel doğrulama şemaları, kullanıcıların bireysel gereksinimlerine göre oluşturulabilir. Özel doğrulama şemaları, çapraz doğrulama ve zaman serisi bölme şemalarını içerir.
Özellik Seçimi
Özellik seçimi, endüstri standartlarına göre modeller geliştirmek için önemli bir adımdır, çünkü bu, çıkarım ve model uygulaması maliyetlerini azaltmaya yardımcı olur. Ancak çoğu AutoML çözümü, bu problema fazla odaklanmaz. Buna karşılık, TabularAutoML işlem hattı, üç özellik seçimi stratejisi uygular: Seçim yok, Önemlilik kesme seçimi ve Önemlilik temelinde ileri seçimi. Bunlardan, Önemlilik kesme seçimi stratejisi varsayılan stratejidir. Ayrıca, özellik önemliliği tahmin etmek için iki primary yöntem vardır: split-based ağaç önemliliği ve GBM modelinin veya gradient boosted karar ağaçlarının permütasyon önemliliği. Önemlilik kesme seçiminin primary amacı, model için yardımcı olmayan özellikleri reddetmektir, bu da modelin özellik sayısını azaltmasına yardımcı olur ve performansı olumsuz etkilemeden model çıkarımını ve eğitimini hızlandırabilir.

Yukarıdaki görüntü, binary bank veri kümesi üzerinde farklı seçim stratejilerini karşılaştırır.
Hyperparameter Ayarı
TabularAutoML işlem hattı, hyperparametreleri ayarlamak için farklı yaklaşımlar uygular.
- Erken Durdurma Hyperparameter Ayarı: eğitim aşamasında tüm modeller için iterasyon sayısını seçer.
- Uzman Sistem Hyperparameter Ayarı: modeller için hyperparametreleri tatmin edici bir şekilde ayarlamak için basit bir yöntemdir. Bu, final modelin, zorla ayarlanmış modellere kıyasla puanında önemli bir düşüşü önler.
- Ağaç Yapılı Parzen Tahmini veya TPE: GBM veya gradient boosted karar ağaçları modelleri için. TPE, LightAutoML işlem hattında varsayılan ayar stratejisi olan karma bir ayar stratejisidir. Her GBM çerçevesi için, LightAutoML çerçevesi iki modeli eğitir: ilki uzman hyperparametreleri alır, ikincisi zaman bütçesine uymak için ayarlanır.
- İzgara Arama Hyperparameter Ayarı: TabularAutoML işlem hattında, lineer modelin düzenleme parametrelerini erken durdurma ve sıcak başlangıç ile birlikte ayarlamak için uygulanır.
Model, tüm parametreleri, kullanıcı tarafından tanımlanan veya görev için varsayılan olan metric fonksiyonunu maksimize ederek ayarlar.

LightAutoML: Deney ve Performans
Performansı değerlendirmek için, LightAutoML çerçevesi içindeki TabularAutoML Preset, çeşitli görevler boyunca mevcut açık kaynak çözümlerle karşılaştırılır ve LightAutoML çerçevesinin üstün performansını kanıtlar. İlk olarak, karşılaştırma, 35 binary ve çoklu sınıf sınıflandırma görevi veri kümesi üzerinden değerlendirilen OpenML benchmarkında yapılır. Aşağıdaki tablo, LightAutoML çerçevesini mevcut AutoML sistemleriyle karşılaştırır.

Görüldüğü gibi, LightAutoML çerçevesi, benchmarktaki 20 veri kümesinde diğer tüm AutoML sistemlerini geçer. Aşağıdaki tablo, veri kümesi bağlamında ayrıntılı bir karşılaştırma içerir ve LightAutoML’nin farklı görev sınıflarında farklı performans gösterdiğini belirtir. Binary sınıflandırma görevleri için, LightAutoML performansı geride kalır, ancak yüksek miktarda veri içeren görevlerde, LightAutoML çerçevesi üstün performans gösterir.

Aşağıdaki tablo, LightAutoML çerçevesinin performansını, çeşitli binary sınıflandırma görevleri içeren 15 bankacılık veri kümesinde mevcut AutoML sistemleriyle karşılaştırır. Görüldüğü gibi, LightAutoML, 15 veri kümesinin 12’sinde diğer tüm AutoML çözümlerini geçer, bu da %80’lik bir kazanma yüzdesidir.

Son Düşünceler
Bu makalede, finans sektöründe faaliyet gösteren bir Avrupa şirketinin ekosistemi için geliştirilen bir AutoML sistemi olan LightAutoML’yi ele aldık. LightAutoML çerçevesi, çeşitli uygulamalarda dağıtılmış ve sonuçlar, veri bilimcileri düzeyinde yüksek kaliteli makine öğrenimi modelleri oluştururken üstün performans göstermiştir. LightAutoML çerçevesi, aşağıdaki katkıları yapmaya çalışmaktadır. İlk olarak, LightAutoML çerçevesi, büyük bir Avrupa finans ve bankacılık kurumunun ekosistemi için geliştirilmiştir. Çerçevesi ve mimarisi nedeniyle, LightAutoML çerçevesi, çeşitli açık benchmarklarda ve ekosistem uygulamalarında mevcut AutoML çerçevelerini geçebilir. LightAutoML çerçevesinin performansı, ayrıca veri bilimcileri tarafından elle ayarlanan modellerle karşılaştırılmış ve sonuçlar, LightAutoML çerçevesinin daha güçlü performans gösterdiğini belirtmiştir. LightAutoML çerçevesi, çeşitli görevlerde üstün performans göstererek, finansal hizmetler için AutoML çözümlerinde önemli bir katkı sağlar.












