Yapay zeka modelleri ve platformları
Büyük Dil Modelleri için Sunucusuz Çıkarma’nın Geleceği
Büyük dil modelleri (LLM) gibi GPT-4, PaLM’de近年の進歩, doğal dil görevlerinde dönüştürücü yetenekler sağlamıştır. LLM’ler, sohbet botları, arama motorları ve programlama asistanları gibi çeşitli uygulamalara entegre edilmektedir. Ancak, LLM’leri ölçeklendirme, önemli bir zorluk oluşturmaktadır.
Bu zorluğu aşmak için genellikle iki ana yaklaşım uygulanmaktadır:
- Model Sıkıştırma Teknikleri
Bu teknikler, modelin boyutunu azaltırken doğruluğunu korumayı hedefler. Common approaches include:
- Pruning – Modelden gereksiz veya menos önemli parametreleri kaldırma. Bu, daha az parametreyle bir model oluşturur.
- Quantization – Ağırlıkları temsil etmek için daha düşük hassasiyetli sayılar (int8 veya bfloat16) kullanma. Bu, bellek ayak izini azaltır.
- Bilgi Distilasyonu – Daha küçük bir “öğrenci” modeli, büyük bir “öğretmen” modelini taklit etmek için eğitme. Daha sonra daha küçük model, çıkarım için kullanılır.
- Seçimli Çalışma
Bu teknikler, her bir çıkarım için modelin yalnızca belirli kısımlarını çalıştırır:
- Sparse Aktivasyonlar – Sıfır aktivasyonlarına karşılık gelen hesaplamaları atlamak.
- Koşullu Hesaplama – Belirli katmanları, girdiye bağlı olarak çalıştırmak.
Yazılım mimarı açısından, LLM’lerin daha hızlı dağıtımı için araştırmacılar sunucusuz çıkarım sistemleri önermiştir. Sunucusuz mimarilerde, LLM’ler paylaşılan GPU kümelerine barındırılır ve talebe göre dinamik olarak atanır. Bu, GPU’lerin verimli kullanımını sağlar ve geliştiriciler için maliyetleri azaltır. Önemli uygulamalar arasında Amazon (AMZN ) SageMaker, Microsoft Azure ML ve KServe gibi açık kaynaklı seçenekler bulunur.
Mevcut sistemlerin rağmen, sunucusuz LLM’ler yüksek gecikme overheads sergiler, bu da etkileşimli uygulamalarda kullanıcı deneyimini bozar:
- Pahalı Kontrol Noktası İndirme: LLM’ler büyük bellek ayak izlerine sahiptir, genellikle gigabayt veya terabayt boyutlarında. Uzak depolamadan kontrol noktalarını indirme zaman alıcıdır, optimize edilmiş ağlarla birlikte 20 saniyeden fazla sürer.
- Verimsiz Kontrol Noktası Yüklemesi: Yerel SSD depolaması ile bile, kontrol noktalarını GPU belleğine yüklemek, tensör seri hale getirme ve tahsis gibi faktörler nedeniyle on saniyelik gecikmelere neden olur. Bu, kap konteynır başlangıç zamanının ötesinde önemli gecikmeler ekler.
Bu sorunları çözmek için, MIT CSAIL’deki araştırmacılar ServerlessLLM adlı bir sistem önerdiler. ServerlessLLM, LLM’ler için düşük gecikme sunucusuz çıkarım sağlar. Sistem, LLM dağıtımı için çok katmanlı sunucu depolama kapasitesini ve bant genişliğini kullanır.
ServerlessLLM’deki Ana Yenilikler: ServerlessLLM, sunucusuz ortamlarda LLM yükleme sürelerini azaltmak için çeşitli yeni tasarımlar içerir:
- Hızlı Kontrol Noktası Yüklemesi
- Hızlı sıralı okuma ve verimli tensör adreslemesine olanak tanıyan, yükleme için optimize edilmiş kontrol noktası formatı.
- Ağ, SSD’ler, DRAM ve GPU belleği arasında bant genişliğini en üst düzeye çıkaran, doğrudan I/O, sabitlenmiş bellek transferi ve paralellik gibi teknikleri kullanan çok katmanlı kontrol noktası yükleme pipeline.
- Canlı Göç için Yerellik Sürücülü Çıkarım
- Yalnızca gerekli.prompt tokenlerini ağ üzerinden ileten, yavaş anlık görüntü aktarımını önleyen token tabanlı göç.
- Hedef sunucuda önbellek durumlarını asenkron olarak yeniden hesaplayan, kesintisiz çıkarımı sağlayan iki aşamlı göç.
- Gecikme Optimizli Sunucu Ataması
- Her sunucu için kontrol noktası yükleme süreleri ve göç süreleri için doğru modeller.
- Beklenen başlangıç gecikmesini en aza indirgeyerek sunucu seçen, yerellik farkında planlayıcı.
Bu optimizasyonlar, ServerlessLLM’nin LLM yükleme sürelerini 4-8 kat ve uçtan uca başlangıç sürelerini 25 kat azaltmasını sağlar.
Kontrol Noktası Yüklemesinin Hızlandırılması
ServerlessLLM tarafından ele alınan ilk büyük engel, depolamadan GPU belleğine LLM kontrol noktalarının yüklenmesinin yüksek gecikmesidir.
Hızlı kontrol noktası yüklemesini sağlamak için, ServerlessLLM:
- Yükleme için Optimize Edilmiş Kontrol Noktası Formatı
PyTorch gibi çerçeveler tarafından kullanılan standart kontrol noktaları, model eğitimi ve hata ayıklama için tasarlanmıştır. Ancak sunucusuz çıkarım için, kontrol noktaları salt okunur ve tekrar tekrar erişilir.
Okuma yoğunluşturulmuş kullanım için optimize etmek amacıyla, ServerlessLLM kontrol noktalarını iki ana özelliğe sahip bir formata dönüştürür:
- Sıralı parça tabanlı okuma: Tensörler, büyük sıralı okumaları kolaylaştıran per-GPU ikili dosyalarına gruplandırılır.
- Verimli tensör adreslemesi: Tensör adlarına bellek ofsetlerine haritalayan bir dizin, tensörleri seri hale getirmeden doğrudan bellekte geri yüklemeye olanak tanır.
- Çok Katmanlı Kontrol Noktası Yüklemesi Pipeline
ServerlessLLM, GPU sunucularının katmanlı mimarisini, depolama medya gibi SSD’ler ve ağ ile GPU’ler arasında PCIe, NVMe gibi bağlantıları kullanır.
Sistem, tüm katmanlar boyunca bant genişliğini en üst düzeye çıkaran bir çok aşamlı pipeline içerir:
- Bellekteki veri parçaları, hızlı GPU transferi için sabitlenmiş bellek kullanılarak atanır.
- Önbellek overheads olmadan verimli SSD okumaları için doğrudan I/O kullanılır.
- Birden çok iş parçacığı, farklı depolama parçalarını paralel olarak okur.
- Ara aşamalar, asenkron görev kuyrukları aracılığıyla koordine edilir.
Bu, hatta en hızlı katmanların (NVMe RAID gibi) bant genişliği kapasitesini doygunluğa ulaştırmayı sağlar. Deneyimler, ServerlessLLM’nin PyTorch/TensorFlow’dan 6-8 kat daha hızlı yükleme sağladığını, büyük LLM’lerin başlangıç sürelerini bir dakikadan fazla olan süreden 10 saniyenin altına düşürdüğünü gösterir.
Yerellik Sürücülü LLM Çıkarımı için Canlı Göç
Hızlandırılmış yükleme ile, ServerlessLLM şimdi bir yeni zorlukla karşı karşıyadır – nasıl yerel kontrol noktalarını kullanırken devam eden çıkarımları bozmadan sunucularda göçü sağlayabilir?
ServerlessLLM, LLM çıkarımını GPU sunucuları arasında canlı göçü sağlayan yeni bir teknik sunar. Bu, yerel kontrol noktaları bulunan sunucularda çalıştırmayı sorunsuz bir şekilde sağlar.
Canlı LLM göçünün ana sağlayıcıları:
- Token Tabanlı Göç
Tüm model durumunu anlık görüntü olarak kaydetmek yerine, ServerlessLLM yalnızca gerekli.prompt tokenlerini ağ üzerinden göç ettirir. Bu, anlık görüntü aktarımına kıyasla çok daha az veri aktarır.
- İki Aşamlı Göç
Hedef sunucu, prompt tokenlerinden önbellek durumlarını asenkron olarak önceden hesaplar. Hazır olduğunda, kaynak sunucu nihai tokenleri aktarır ve kaynakları serbest bırakır. Bu, çıkarım duraklamalarını önler.
Deneyimler, token tabanlı göçün göç sürelerini uzun diziler için bile 10 saniyeden weniger bir süreye düşürdüğünü gösterir. Canlı göç, yerellik sürücülü atamayı gerçekleştirirken kuyruk gecikmelerini önlemek için kritiktir.
Gecikme Optimizli Model Ataması
Uçtan uca gecikmeyi en aza indirmek için, ServerlessLLM planlayıcısını yerellik dikkate alarak optimize eder. Bu, aşağıdaki adımları içerir:
- İnce Gecikme Tahmin Edicisi
Modeller, her sunucu için kontrol noktası yükleme süreleri ve göç sürelerini, kuyruk gecikmeleri, model boyutları ve ölçülen bant genişliği gibi ölçütlere dayanarak tahmin eder.
- Doğru Göç Süresi Tahmin Edicisi
Planlayıcı, her sunucu için göç sürelerini, prompt ve çıktı tokenlerinin sayısı temelinde tahmin eder. Çıkarım ilerlemesini asenkron olarak takip eder, bu da ek yük oluşturmaz.
- Yerellik Farkında Atama
Her bir çıkarım isteği için, planlayıcı tahmin edilen yükleme ve göç sürelerini tüm sunucular arasında değerlendirir. Beklenen başlangıç gecikmesini en aza indiren sunucuyu seçer.
Planlayıcı ayrıca sunucu görev kuyruklarını korur ve güçlü olarak tutarlı bir depolama için hata toleransı sağlar. Bu yenilikler, planlama overheadsını azaltırken yerellik avantajlarını en üst düzeye çıkarır.
ServerlessLLM Performansının Değerlendirilmesi
Kapsamlı deneyler, ServerlessLLM’nin uçtan uca etkinliğini, gerçek dünya modelleri (OPT-175B gibi) ve Azure izlerine benzeyen iş yükleri kullanarak mevcut sistemlerle karşılaştırır.
Ana sonuçlar:
- Mikro Benchmarklar: ServerlessLLM, PyTorch/TensorFlow’dan 3.6-8.2 kat daha hızlı kontrol noktası yüklemesi sağlar. Depolama bant genişliğini, hatta en yeni NVMe RAID için bile doygunluğa ulaştırmayı başarır.
- Planlama: ServerlessLLM, rastgele planlamayla karşılaştırıldığında atama gecikmesini 4-12 kat azaltır, bu da yerellik bilincinin avantajlarını vurgular. Canlı göç, kuyruk gecikmelerini önler.
- Uçtan Uca Hizmet: Büyük modeller (OPT-30B gibi) için, ServerlessLLM 99. persentil gecikmesini KServe ve Ray Serve gibi sistemlere kıyasla 28-200 kat iyileştirir. Ayrıca kaynak verimliliğini artırır.
Bu önemli kazanımlar, ServerlessLLM’nin mevcut sunucusuz uygulamalardaki engelleri aşma ve etkileşimli hizmetler için LLM’lerin gücünü açığa çıkarma yeteneğini gösterir.
ServerlessLLM’de tanıtılan optimizasyonlar, çok katmanlı yükleme, canlı göç ve gecikme sürücülü planlama gibi, gelecekteki sunucusuz mimarilerin tasarımını bilgilendirmeye yardımcı olabilir. Sistem, yükleme ve başlangıç sürelerini azaltarak büyük dil modellerinin ölçeklenebilir dağıtımını engelleyen kilitleri açar.
İleriye Bakmak: Devam Eden Zorluklar
Büyük bir adım atılmış olsa da, ServerlessLLM büyük LLM’ler için sunucusuz çıkarımı optimize etmenin yalnızca ilk adımı temsil eder. Birkaç açık problem hala devam etmektedir:
- Gerçek zamanlı model talebini öngörerek tahsis ve ön yükleme rehberliği
- Ön bellek vuruşlarını en üst düzeye çıkarmak için kontrol noktalarını sunucular arasında akıllıca yerleştirme
- Daha büyük kümeler için planlama algoritmalarını verimli bir şekilde ölçeklendirme
- Modeller ve geliştiriciler arasında kaynak tahsisinde adil olması
- Canlı göç gibi yenilikleri diğer sunucusuz iş yüklerine genelleştirme
Bu alanlara çözüm bulmak, sunucusuz LLM’lerin yeteneklerine erişimi daha da kolaylaştıracaktır. Sistem düzeyindeki optimizasyonların ötesinde, büyük modellerin kötü şöhretli karbon ayak izini ve potansiyel zararlarını azaltmak da acil bir öncelik olmaya devam etmektedir.
ServerlessLLM, AI iş yükleri için next-gen sunucusuz mimarilerde inovasyon için büyük bir potansiyel olduğunu göstermektedir. LLM’ler büyüdükçe ve popülerlik kazandıkça, bunların ölçeklenebilirliğini kilitleyen çözümler gibi ServerlessLLM, daha da önemli hale gelecektir. Sistemler ve makine öğrenimi araştırmalarının birleşmesi, AI modellerinin güvenli ve sürdürülebilir bir şekilde hizmet verilmesi, paylaşılması ve ölçeklendirilmesi için yeni paradigmalara yol açabilir.













