Düşünce Liderleri

Model Geliştirme Otomasyonuna Kritik Yol

mm mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
A stylized digital landscape showing illuminated lines connecting data structures. A cluster representing

AI araştırmaları için bir sonraki önemli kilometre taşı, model geliştirmeyi otomatikleştirmektir. Mantık, dil ve algı alanındaki her ilerleme,某 anlamda, bu hedefe doğru bir adımdır. Ancak, model otomasyonuna giden yol, önce çözülmesi gereken temel zorlukları gerektirir.

Bu hedefe giden köprü, doğrudan makine öğrenimi (ML) mühendisliğine geçer. Bir yanlış anlama, ML’nin modern AI’nin bir öncü teknolojisi olduğunu ve temel modellerin bunu değiştirdiğini varsayar. Bu, ilişkinin yanlış anlaşılmasıdır. Bir akademik disiplin olarak ML, model eğitimi dahil tüm yönlerini kapsar, bu da güncel AI anının merkezindeki temel modellerin eğitimi de dahil olmak üzere her şeyi içerir. Ancak, ölçek ve veri karmaşıklığı açısından anlamlı bir fark vardır.

Geleneksel ML modelleri genellikle dikkatlice oluşturulmuş, alan spesifik veri setleri üzerinde eğitilir ve bu veri setleri binlerce veya milyonlarca örnek içerir. Temel modeller ise, tersine, aynı anda binlerce veri seti üzerinde eğitilir ve bu veri setleri çok farklı kaynaklardan gelir, tutarlı olmayan formatlara, kökenlere ve kalitelere sahiptir. Veri ölçeği ve heterojenliği arasındaki bu fark, veri yönetiminin daha güçlü ve önemli hale gelmesinin temel nedenidir.

Bu, model geliştirme otomasyonunda veri anlama konusunun merkezi bir engel haline gelmesini sağlar. Veri yorumlama ve etrafındaki iş akışlarını iyileştirebilen bir AI sistemi, teorik olarak kendi eğitim sürecini iyileştirebilir ve daha iyi modeller oluşturabilir. AI, kendi eğitim sürecini iyileştirebildiğinde, bu iyileştirmeler AI’nin uygulandığı her alana doğru akar.

Engel Olarak Duran Üç Barier

İlk engel, bağlam parçalanmasıdır.几乎 her organizasyonda, belirli bir modelleme problemine ilişkin sinyaller, deneyler, özellik tanımları ve kurumsal bilgiler, birbirleriyle iletişim kurmak için tasarlanmayan veri ambarları, defterler ve iş akışları arasında dağılmıştır. Bir sağlık sistemi sepsis algılama modeli oluşturuyor olsun. Bu problemle ilgili klinik kriterler, such as vital eşik değerleri, laboratuvar değerleri ve belgeleme standartları, tamamen ayrı modüllerde sống olabilir. elektronik sağlık kaydı sistemi.

İkinci engel, anlamsal belirsizliktir. Anlam, verinin içinde değil, bağlamsal ve kurumsaldır. İki farklı veritabanındaki aynı alan adı, ince farklı anlamlara işaret edebilir. Gelir, aktif kullanıcı ve terk gibi kavramlar, tek bir şirket içinde birden fazla geçerli tanıma sahip olabilir. Hatta “gelir” gibi görünüşte basit bir kavram bile sorunlara neden olabilir. Satış ekibi, geliri bu çeyrekte imzalanan sözleşmelerin toplam değerini olarak tanımlayabilir, mali ekip ise gerçekten alınan nakit olarak tanımlayabilir. Ürün ekibi ise tanınan geliri abonelik dönemi boyunca dağıtmış olarak tanımlar. Hepsi de “gelir” adlı alanlardan çekiyor, ancak farklı sistemlerdeki bu alanlar birbirleriyle uyumsuz değerlere işaret edebilir.

Üçüncü ve en sistemik engel, belgelenmiş kurumsal hafızanın yokluğudur. Binlerce kaynaktan gelen veri setlerinin kökenini izlemek, tutarsızlıkları çözmek ve kalite sinyallerini korumak, insan ekipleri için bile çözülmemiş bir sorundur. Kurumsal bir hafıza olmadan, model otomasyon mekanizması, aynı çıkmazları yeniden keşfeder, zaman ve kaynakları boşa harcar.

Bir perakende şirketindeki bir veri bilimcisi ekibinin talep tahmini modeli oluşturduğunu düşünün. Üç yıl boyunca, on iki analist, her biri bağımsız olarak, ham hava verilerinin tatil haftalarında model performansını bozduğunu, belirli bir tedarikçinin stok beslemesinin sistematik bir gecikme içerdiğini ve standarda uygun promosyon olaylarının hedef sızıntısına neden olduğunu keşfetti. Orijinal analistler diğer takımlara geçti veya şirketten ayrıldığında, bilgi de onlarla birlikte gitti. Deneyimler ve nedenlerinden oluşan bir kurumsal kayıt olmadan, model otomasyon mekanizması, biriktirilmiş deneyimi üzerine inşa edemez. Sadece sıfırdan başlar, tekrar tekrar, gereksiz yere zaman harcayarak.

Gerçek Bir Çözümün Gerektirdikleri

ML otomasyonunun tarihi, kısmi çözümlerin tarihidir. AutoML, dar bir problem olan hiperparametre ayarlamasını ele aldı, ancak organizasyonel amaç veya niyet hakkında akıl yürütme konusunda başarısız oldu. MLOps, üretim iş akışlarını daha güçlü ve daha kolay izlenebilir hale getirdi, ancak MLOps araçları bir stratejiyi uyguladı, tanımlamadı. Daha recent kodlama ajanları, gerçek bir ilerlemeyi temsil ediyor, ancak aynı kör noktasını miras aldılar. Kod oluştururken, kurumsal bağlam veya kurumsal hafızadan yoksun olarak çalışıyorlar.

Gerçekten otonom ML mühendisliği yapabilen bir sistem, mevcut hiçbir araçta bir arada bulunmayan yeteneklere ihtiyaç duyacaktır. İş hedeflerini model hedeflerine çevirebilmeli, bu da veriden alone çıkarılamayan bir çeviri olmalıdır. Ayrıca, uyumlu şemalara sahip olmayan ve tutarlı olmayan kaynaklardan gelen binlerce verisetini keşfedebilmeli, otomatik olarak uyumluluk, yönetim ve güvenlik kısıtlamalarına uymalıdır, bunları ayrı bir süreç olarak insanlara bırakmamalıdır. Ayrıca, mevcut çalışmaları ortaya çıkarmak, neden geçmiş deneylerin terk edildiğini anlamak ve meslektaşların zaten bildiği şeyleri üzerine inşa etmek için kurumsal hafızaya ihtiyaç duyacaktır.

Veri sürümleri, özellik tanımları ve kod taahhütleri boyunca kökeni izleyen katı denetim izleri, sistemin gerçekten neler olduğu temelinde yer alması gereken bir mekanizma olmalıdır. Ayrıca, her karar noktasındaki görev, risk ve sistemin güvenine bağlı olarak değişen düzeylerde insan etkileşimi için tasarlanmış bir insan-çevrimiçi tasarım gerektirecektir. Tam otomasyon ve tam manuel kontrol arasında ikili bir seçim değil, bu tür bir AI’nin iyi tasarlanmış bir özelliği değil, bir arızasıdır.

Henüz hiçbir laboratuvar, kurumsal verilerin anlamsal anlaşmasını çözmeyi, yani verilerin belirli bir kurumsal bağlamda ne anlama geldiğini çözmedi. MCP, bağlantı sorununu çözüyor, ancak anlamsal sorunu henüz çözmedi. Bu, açık bir araştırma cephesi olarak kalıyor.

Ne Olabilir

Bu sorunları çözmelerin ekonomik etkileri önemli olacaktır. Güncel ML geliştirme, uzman uygulayıcılar ve iyi tanımlanmış sorunlar için bile haftalarca süren iterasyonları gerektirir. Problemin tanımlanmasından veri keşfine, model geliştirmeye ve model değerlendirmesine kadar tüm iş akışını otonom olarak gezerek bir sistem, bu denklemini dramatik bir şekilde değiştirecektir, zaman çizelgesini sıkıştırarak, şu anda kaynak yoğun olduğu için takip edilemeyen yüksek değerli kullanım durumlarını açacaktır. Uzman ML uzmanlarının zamanını boşa harcamadan günlerce tamamlanabilecek projeler, önce uzman ekiplerin haftalarca çalışmasını gerektiriyordu.

Baglam parçalanması, anlamsal belirsizlik ve kurumsal hafızanın yokluğu, kurumsal ML’ye özgü değildir. Farklı kısıtlamalar altında, binlerce heterojen veri setlerinin birleştirilmesi, filtrelenmesi ve yinelemeli olarak rafine edilmesi gereken temel model eğitim.pipeline’lerinin oluşturulmasında da ortaya çıkarlar. İki ortam yapı ve amaç bakımından farklı olsa da, her ikisi de aynı temel engelle sınırlıdır: bağlamı güvenilir bir şekilde geri yükleyebilen, kökeni izleyebilen ve yinelemeler boyunca önceki çalışmalara dayanabilen sistemlerin yokluğu. Dolayısıyla, kurumsal ML model geliştirme otomasyonu, AI sistemlerinin kendilerini iyileştirebilmeleri yolundaki kritik bir adımdır.

Doris Xin, Disarray'ın CEO'su ve kurucu ortağıdır. UC Berkeley RISELab'de PhD ve NSF Graduate Research Fellow olarak ve daha sonra LinkedIn'de erken bir ML mühendisi olarak, Doris makineler öğrenimi konusunda uzmanlaşmıştır.

Moustafa AbdelBaky Disarray'in CTO'su ve kurucu ortağıdır. Üç kez IBM PhD Bursu sahibi olan Moustafa, neredeyse iki thập kỷdır dağıtılmış sistemler, edge ML ve NASA'nın otonom havacılık ve uzay görevleri için gerçek zamanlı AI alanında araştırma yapmaktadır.