Düşünce Liderleri

AI çıkışı: Gelişmiş Teknikler ve En İyi Uygulamalar

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Gerçek zamanlı AI uygulamaları gibi self-driving arabalar veya sağlık izleme gibi uygulamalar için, bir girdi işlemede fazla bir saniye bile ciddi sonuçlar doğurabilir. Gerçek zamanlı AI uygulamaları güvenilir GPU’lar ve işlem gücüne ihtiyaç duyar, bu da çok pahalı ve birçok uygulama için maliyetli olmuştur – ancak şimdi değil.

AI çıkışı işlemini optimize ederek, işletmeler yalnızca AI verimliliğini en üst düzeye çıkarabilirler, aynı zamanda enerji tüketimini ve işletme maliyetlerini azaltabilirler (yüzde 90’a kadar); gizliliği ve güvenliği artırabilirler ve hatta müşteri memnuniyetini artırabilirler.

Yaygın çıkışı sorunları

Şirketlerin AI verimliliğini yönetirken karşılaştığı en yaygın sorunlar arasında, kullanılmayan GPU kümeleri, genel amaçlı modellere varsayılan olarak dönme ve maliyetlerle ilgili iç görülerin eksikliği yer alır.

Takımlar genellikle zirve yük için GPU kümelerini tahsis eder, ancak iş akışlarının düzensiz olması nedeniyle, bunların %70 ila %80’i boşta kalır.

Ek olarak, takımlar, daha küçük, daha ucuz açık kaynaklı modellerde çalışabilecek görevler için bile, büyük genel amaçlı modellere (GPT-4, Claude) varsayılan olarak döner. Nedeni, özel modeller oluşturmanın zorluğu ve öğrenme eğrisidir.

Son olarak, mühendisler her istek için gerçek zamanlı maliyet hakkında bilgi sahibi değildir, bu da büyük faturalara yol açar. PromptLayer, Helicone gibi araçlar bu konuda bilgi sağlayabilir.

Model seçimi, toplu işleme ve kullanım üzerinde kontrollerin olmaması, çıkışı maliyetlerinin üssel olarak artmasına (10 kata kadar), kaynak israfına, doğruluğun azalmasına ve kullanıcı deneyiminin bozulmasına neden olabilir.

Enerji tüketimi ve işletme maliyetleri

Büyük LLM’ler gibi GPT-4, Llama 3 70B veya Mixtral-8x7B çalıştırmak için daha fazla güç gerektirir. Ortalama olarak, bir veri merkezinde kullanılan enerjinin %40 ila %50’si bilgisayar donanımını çalıştırmak için, %30 ila %40’ı da donanımı soğutmak için kullanılır.

Dolayısıyla, bir şirket sürekli olarak büyük ölçekli çıkışı için çalışıyorsa, bir bulut sağlayıcı yerine yerel bir sağlayıcıyı tercih etmek daha yararlıdır, böylece prim maliyetlerden kaçınılabilir ve daha fazla enerji tüketilmez.

Gizlilik ve güvenlik

Cisco’nun 2025 Veri Gizliliği Referans Çalışmasına göre, Katılımcıların %64’ü, hassas bilgileri yanlışlıkla kamuoyu veya rakiplerle paylaşma konusunda endişe duyuyor, ancak neredeyse yarısı, kişisel çalışan veya kamuya açık olmayan verileri GenAI araçlarına girdiğini kabul ediyor.” Bu, verilerin yanlış şekilde kaydedilmesi veya önbelleğe alınması durumunda uyumsuzluk riskini artırır.

Bir başka risk de, farklı müşteri organizasyonları arasında paylaşılan altyapıda modelleri çalıştırmaktır; bu, veri ihlallerine ve performans sorunlarına neden olabilir ve bir kullanıcının eylemlerinin diğer kullanıcıları etkileme riski vardır. Dolayısıyla, şirketler genellikle hizmetlerin kendi bulutlarında dağıtılmasını tercih eder.

Müşteri memnuniyeti

Cevaplar birkaç saniyeden fazla sürerse, kullanıcılar genellikle bırakır, mühendislerin sıfır gecikme için aşırı optimize etmeye çalışmasına neden olur. Ayrıca, uygulamalar, “sanrılara ve doğruluğu sınırlayabilecek yanlışlıklara” neden olabilir, bu da geniş çapta etki ve benimsenmeyi sınırlar, Gartner basın açıklamasına göre.

Bu sorunları yönetmenin işletme faydaları

Toplu işleme, doğru boyutlu modelleri seçme (örneğin, Llama 70B veya kapalı kaynaklı modeller gibi GPT’den Gemma 2B’ye geçmek) ve GPU kullanımını iyileştirme, çıkışı faturalarını %60 ila %80 oranında azaltabilir. vLLM gibi araçlar yardımcı olabilir ve ayrıca bir sunucusuz ödeme yapısı için.spikey iş akışları için geçmek de yardımcı olabilir.

Örneğin, Cleanlab. Cleanlab, güvenilirlik puanı eklemek için Güvenilir Dil Modeli (TLM)‘yi lanç etti. Yüksek kaliteli çıktılar ve gelişmiş güvenilirlik için tasarlanmıştır, bu da kurumsal uygulamalar için kritiktir ve denetimsiz sanrılara karşı korunmayı sağlar. Inferless’ten önce, Cleanlabs, GPU maliyetlerinin artmasıyla karşılaştı, çünkü GPU’lar aktif olarak kullanılmadıkları zaman bile çalışıyordu. Problemleri geleneksel bulut GPU sağlayıcıları için tipikti: yüksek gecikme, verimsiz maliyet yönetimi ve yönetim için karmaşık bir ortam. Sunucusuz çıkışı ile, maliyetleri %90 oranında azaltırken performans seviyelerini korudular. Daha da önemlisi, iki haftalık bir süre içinde hiçbir ek mühendislik gideri olmaksızın canlı olarak yayınlandı.

Model mimarilerini optimize etme

Temel modeller gibi GPT ve Claude genellikle genel amaçlar için eğitilir, verimlilik veya özel görevler için değil. Açık kaynaklı modelleri özel kullanım durumları için özelleştirmeyerek, işletmeler, gerektirmediği durumlarda büyük ölçekli modelleri çalıştırmak için zaman ve bellek israfeder.

Yeni GPU çipleri gibi H100 hızlı ve verimlidir. Bunlar, büyük ölçekli operasyonlar gibi video oluşturma veya AI ile ilgili görevler çalıştırırken özellikle önemlidir. Daha fazla CUDA çekirdeği, işleme hızını artırır ve daha küçük GPU’ları geride bırakır; NVIDIA’ nın Tensor çekirdekleri, bu görevleri büyük ölçekte hızlandırmak için tasarlanmıştır.

GPU belleği de model mimarilerini optimize etmede önemlidir, çünkü büyük AI modelleri önemli alan gerektirir. Bu ek bellek, GPU’nun daha büyük modelleri çalıştırmasına olanak tanır ve hızını düşürmez. Buna karşılık, daha küçük GPU’ların performansı, daha az VRAM nedeniyle yavaş sistem RAM’ine veri taşındığı için olumsuz etkilenir.

Model mimarilerini optimize etmenin birkaç faydası vardır. İlk olarak, yoğun dönüştürme yerine LoRA-optimized veya FlashAttention-based varyantlara geçmek, her sorgu için 200 ila 400 milisaniye arasında yanıt süresini kısaltabilir, bu da sohbet botları ve oyun gibi uygulamalar için kritiktir. Ek olarak, nicemli modeller (örneğin, 4-bit veya 8-bit) daha az VRAM gerektirir ve daha ucuz GPU’lar üzerinde daha hızlı çalışır.

Uzun vadeli olarak, model mimarilerini optimize etmek, çıkışı azaltır, çünkü optimize edilmiş modeller daha küçük çipler üzerinde çalışabilir.

Model mimarilerini optimize etme adımları şunları içerir:

  • Kuantizasyon — doğruluğu azaltma (FP32 → INT4/INT8), belleği tasarruf etme ve hesaplama süresini hızlandırma
  • İlgisizleştirme — daha az yararlı ağırlıkları veya katmanları kaldırma (yapılandırılmış veya yapılandırılmamış)
  • Damıtma — daha küçük bir “öğrenci” modeli, daha büyük bir modelin çıktısını taklit etmek için eğitme

Model boyutunu sıkıştırma

Küçük modeller, daha hızlı çıkışı ve daha ucuz altyapıyı sağlar. Büyük modeller (13B+, 70B+), pahalı GPU’lar (A100’ler, H100’ler), yüksek VRAM ve daha fazla güç gerektirir. Bunları sıkıştırarak, daha ucuz donanımlar üzerinde (A10’lar, T4’ler) çalıştırılabilir ve gecikme süresi önemli ölçüde azaltılabilir.

Sıkıştırılmış modeller, cihazlarda (telefonlar, tarayıcılar, IoT) çıkışı çalıştırmak için de kritiktir, çünkü daha küçük modeller, altyapıyı ölçeklendirmeden daha fazla eşzamanlı isteği destekler. 1.000’den fazla eşzamanlı kullanıcıya sahip bir sohbet botunda, 13B’den 7B’ye sıkıştırılmış modele geçmek, bir GPU’da iki kat daha fazla kullanıcıya hizmet verilmesini sağladı.

Özel donanımı kullanma

Genel amaçlı CPU’lar, tensor işlemleri için tasarlanmamıştır. NVIDIA A100’ler, H100’ler, Google TPUs veya AWS Inferentia gibi özel donanım, LLM’ler için daha hızlı çıkışı (10 ila 100 kata kadar) ve daha iyi enerji verimliliği sunabilir. Bir istek için 100 milisaniye bile kazanıldığında, milyonlarca isteği günlük olarak işlerken fark yaratılabilir.

Bunu varsayımsal bir örnekle düşünün:

Bir ekip, iç RAG sistemi için LLaMA-13B’yi standard A10 GPU’lar üzerinde çalıştırıyor. Gecikme yaklaşık 1,9 saniyedir ve VRAM sınırları nedeniyle çok fazla toplu işleme yapamazlar. Bu nedenle, H100’lere geçer, TensorRT-LLM’yi etkinleştirir, FP8’i etkinleştirir ve optimize edilmiş dikkat çekirdeğini artırır, toplu işleme boyutunu 8’den 64’e çıkarır. Sonuç, gecikmeyi 400 milisaniyeye düşürür ve beş kat daha fazla işleme kapasitesi sağlar.
Böylece, aynı bütçeyle beş kat daha fazla isteği karşılayabilir ve mühendisleri altyapı tıkanıklıklarından kurtarabilir.

Dağıtım seçeneklerini değerlendirme

Farklı süreçler, farklı altyapılara ihtiyaç duyar; 10 kullanıcıya sahip bir sohbet botu ve günde bir milyondan fazla sorgu çeken bir arama motoru, farklı gereksinimlere sahiptir. Bulutta (örneğin, AWS Sagemaker) veya DIY GPU sunucularında tüm süreci tamamlamadan maliyet performans oranlarını değerlendirmemek, israf edilen harcamalara ve kötü kullanıcı deneyimine yol açar. Bir bulut sağlayıcısına erken taahhüt vermek, daha sonra çözümün taşınmasını zorlaştırır. Ancak, erken değerlendirmek ve ödeme yapma yapısı ile seçeneklere sahip olmak, gelecekteki yollara açıklık sağlar.

Değerlendirme aşağıdaki adımları içerir:

  • Model gecikmesini ve maliyetini platformlar arasında karşılaştırma: AWS, Azure, yerel GPU kümeleri veya sunucusuz araçlar üzerinde A/B testleri çalıştırma.
  • Soğuk başlangıç performansı ölçme: Bu, özellikle sunucusuz veya olaya dayalı iş yükleri için önemlidir, çünkü modeller daha hızlı yüklenir.
  • Gözlemleme ve ölçeklendirme sınırlarını değerlendirme: Kullanılabilir metriklere bakın ve sorgu başına maksimum sorgu sayısını belirleyin.
  • Uyumluluk desteğini kontrol etme: Coğrafi veri kurallarını veya denetim günlüklerini zorlayıp zorlayamayacağınızı belirleme.
  • Toplam sahip olma maliyetini tahmin etme. Bu, GPU saatleri, depolama, bant genişliği ve ekipler için genel giderleri içermelidir.

Alt çizgi

Çıkış, işletmelerin AI performansını optimize etmesine, enerji kullanımını ve maliyetlerini azaltmasına, gizliliği ve güvenliği korumasına ve müşterileri mutlu etmesine olanak tanır.

Aishwarya Goel, Inferless'in kurucu ortak ve CEO'sudur, Inferless, düşük soğuk başlangıçlar ve verimli otomatik ölçeklendirme ile özel ve açık kaynaklı modelleri dağıtmaya yardımcı olan bir durum bilgisi sunucusuz platformdur.