Düşünce Liderleri

Kurumsal AI Neden Bitiş Çizgisini Geçemiyor ve Bunu Nasıl Çözebilirsiniz

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Kurumsal AI etrafındaki heyecana rağmen, çoğu kurumsal AI projesi deney aşamasını geçemez. Son IDC araştırmasına göre, AI proof-of-concept (POC) projelerinin %88’i tam üretim aşamasına ulaşamaz. Bu, büyük bir düşüş ve明 bir şeylerin yanlış gittiğini gösteren açık bir işarettir. Bu projelerin çoğu, bitiş çizgisine yakın bir noktaya gelir, eğitilmiş bir modelle birlikte takım tarafından belirlenen standartları karşılar, ancak sonra son kullanıcılar tarafından yayınlanmaz veya benimsenmez.

Peki, ne yanlış gidiyor? Çoğu durumda, üç büyük sorun nedeniyle olur:

  1. Kurumsal AI ekipleri, ana performans açıklarını yakalayamayan yüzey düzeyinde teşhis araçlarına ve standartlara güveniyorlar
  2. Modeller, gerçek dünya sorunlarını çözmek yerine standart benchmarks’e göre ayarlanıyor
  3. Model kullanımının ölçeklendirilmesinin maliyeti, şirket çapında benimsenmesi için çok yüksek oluyor

Bu makalede, her birini ayrıntılandıracağız ve AI projelerini bitiş çizgisini geçirmek ve kullanıcıların eline ulaştırmak için neler gerektiğini ele alacağız.

Sorun #1: Ana performans sorunlarını kaçıran standart teşhisler

Kurumsal AI projelerinin proof-of-concept aşamasından sonra neden tökezlediğini anlamak için, iç teşhis araçları ve standartların genellikle model performansını yeterince derinlemesine incelememesi ve kullanıcı dostu olmayan, güvenilmez ve benimsenmeyen sorunları kaçırması gerekir. Takımlar kağıt üzerinde tüm kutuları işaretleyebilir, ancak bu kontroller her zaman modelin gerçek dünyada nasıl performans göstereceğini yansıtmaz.

Örneğin: Bir AI takımı, her iç testi geçen bir modeli vardı. Tüm doğruluk ölçümlerine ve güvenlik eşiğine ulaştı ve yayın için hazırlanıyorlardı. Ancak, modeli amaçlanan kullanım durumu için üçüncü bir tarafça değerlendirildiğinde, gerçek kullanıcıların sistemi nasıl etkileşime gireceğini yansıtmak için, büyük bir kör nokta bulundu. Model, belirli bir şekilde sorulduğunda sorulara kaçamak cevaplar verme olasılığı dokuz kat daha yüksekti. Örneğin, “ABD başkanı kim?” sorusuna doğru cevap verebilirdi, ancak “Bana başkan hakkında bilgi verebilir misin?” sorusuna güvenlik riski olarak davranıp cevap vermezdi.

Sorun, modelin temel bilgisinde değildi – nasıl niyeti anladığıyla ilgiliydi. Takım, güvenlik için çok fazla optimize etmişti ve kazara normal, makul soruları engellenmişti.

Sorun #2: Gerçek dünyayı yansıtmayan benchmarks’e göre ayarlanan modeller

Kurumsal AI için başka bir yaygın engel, AI takımlarının modellerini endüstri standardı benchmarks’e göre ayarlamalarıdır. Kağıt üzerinde, bir model üst düzey görünebilir, standardize edilmiş değerlendirmelerde doğruluk, alaka veya güvenlik için yüksek puanlar alabilir. Ancak uygulamada, tutarlı ve faydalı sonuçlar üretmek için ağır kullanıcı müdahalesi gerekebilir.

Bu, takımların modelleri dar, benchmark-spesifik görevler için optimize ettiğinde olur. Model, bu test durumlarında üstün performans gösterir, ancak daha az yapılandırılmış, daha çeşitli gerçek dünya girdileriyle karşılaştığında tökezler. Sonuç olarak, kullanıcıların doğru cevapları almak için modelin dilini konuşmak zorunda kalırlar. Eğer AI ürününüzün son kullanıcıların precisa promtları oluşturmasına bağlı olduğu bir sistem ise, benimsenmesini yavaşlatan ve faydasını azaltan sürtüşme yaratmış olursunuz.

Bu tür benchmark odaklı eğitim, aşırı uyarlama ile sonuçlanabilir. Model, değerlendirme veri kümeleri üzerinde iyi performans göstermek için o kadar ince ayarlanır ki, genellemeyi kaybeder. İç testlerde başarılı olabilir, ancak gerçek dünyada dağıtıldığında, özellikle de gerçek kullanım durumları eğitimde kullanılanlardan biraz farklıysa, düşüş yaşayabilir.

Şirket içi AI çözümünüzün başarılı olmasını istiyorsanız, modelinizin gerçek dünyada, laboratuvarda değil, çalışması gerekir.

Sorun #3: AI benimsenmesini ölçeklendirme, hesaplama maliyetlerini ölçeklendirme anlamına gelir

Çoğu AI POC’sinin ölçeklenememesinin üçüncü nedeni mali: Takımlar genellikle modeli üretim aşamasına getirmenin maliyetini hesaba katmazlar. Geliştirme aşamasında, özellikle testler küçük veri kümeleri veya sınırlı kullanım ortamlarında yapıldığında, büyük bir modelin hesaplama taleplerini göz ardı etmek kolaydır. Ancak bir kez dağıtıldığında, bu maliyetler patlayabilir.

Şirket düzeyinde AI, yalnızca gerçek zamanlı yanıtlar sunmak için değil, aynı zamanda sürekli iyileştirme, izleme, günlüğe kaydetme ve yeniden eğitim için önemli hesaplama kaynakları gerektirir. Bu maliyetler erken aşamada hesaplanmazsa, çözümün iş durumu, gerçek dünya kullanımı başladığında çökebilir. Kontrollü bir testte vaat edilen bir model, binlerce kullanıcı sisteme günlük olarak başladığında nhanh chóng sürdürülemez hale gelebilir.

Şirket İçi AI’de Son Mil Engellerini Aşmak

Çok sayıda kurumsal AI projesini raydan çıkaran yaygın tuzaklardan kaçınmak için, takımların alışılmış oyun planının ötesine gitmesi gerekir. İşte AI ekibinizin gerçekten çalışan ve ölçeklenebilen bir şey inşa etmesine yardımcı olacak adımlar:

İlk olarak, modelinizi değerlendirmek için üçüncü bir taraf getirin. İç testler önemlidir, ancak genellikle çok geneldir. Taze bir bakış açısı, kullanım durumunuza özgü bir değerlendirme çerçevesi ile birleştirildiğinde, takımınızın kaçırabileceği sorunları ortaya çıkarabilir, özellikle de gerçek kullanıcıların sistemi nasıl etkileşime gireceği konusunda.

İkinci olarak, gerçek dünya promtlarıyla test edin. Çoğu benchmark, gerçek dünyayı yansıtmayan “temiz” verilerle test edilir, özellikle de son kullanıcılarınızın modelinizi nasıl çağıracakları konusunda. Modelinizi gerçek, belirsiz veya tuhaf şekilde ifade edilmiş girdilerle test etmek, dağıtımdan sonra nasıl performans göstereceğini göstermede uzun bir yol kat edecektir ve bu da benimsenmesini etkileyebilecek sorunları ortaya çıkaracaktır.

Üçüncü olarak, güvenlik protokollerinizi yeniden değerlendirin. Güvenlik için çok fazla aşırı düzenleme yapmak kolaydır ve güvenlik önemlidir, ancak kullanım kolaylığını engelleme maliyetine değmez. Model, basit, zararsız sorulara cevap vermemektedir, kullanışlılık karşılığında yanlış bir güvenlik duygusuyla ticaret yapıyorsunuz.

Son olarak, hesaplama maliyetlerinizi izleyin. Benimsenme hedefleriniz binlerce kullanıcı ve milyonlarca isteği içeriyorsa, bu giderler hızlı bir şekilde artabilir. Bir çözüm, daha küçük modelleri düşünmektir. Boosted.ai bunu yaptı – özel bir küçük dil modeline geçtiler ve hesaplama maliyetlerini %90 azaltırken hız ve performansı iyileştirdiler. Gerçek zamanlı sonuçlar, daha iyi kullanıcı deneyimi ve pahalı donanım ihtiyacı yok.

Değerlendirme, kullanım kolaylığı ve ölçeklenebilirliği baştan ele alırsanız, ekipleriniz AI projesine uzun vadeli başarı şansı verebilir. Sadece laboratuvarda çalışmasını sağlamakla kalmaz, dünyadaki gerçek kullanıcılar için de çalışmasını sağlarsınız.

Matt Fitzpatrick, Invisible Technologies'in CEO'sudur, dünyanın önde gelen AI model sağlayıcılarının %80'ini eğiten bir AI yazılım platformu sağlayıcısıdır. Invisible, herhangi bir endüstri, fonksiyon veya kullanım durumu için AI'yi gerçek dünyada çalıştırmak için uzmanlık sağlar. Şirketin yönetim kuruluna katılmadan önce Matt, McKinsey'de QuantumBlack Labs'ın kıdemli ortağı ve küresel lideriydi ve burada 1.000 mühendisi denetledi ve GenAI ve tüm sektörlerde şirketin yazılım geliştirmesini denetledi. Princeton ve Wharton mezunudur.