Yapay zeka modelleri ve platformları
En Güçlü Açık Kaynaklı LLM: Meta LLAMA 3.1-405B
Llama 3.1-405B, Meta AI tarafından geliştirilmiştir ve açık kaynaklı dil modellerinde önemli bir ilerlemeyi temsil etmektedir. 405 milyar parametreye sahip olarak, şimdiye kadar mevcut olan en büyük halka açık dil modeli olarak durmakta ve bazı gelişmiş özel modellerle çeşitli benchmark’lerde rekabet etmektedir.
Ana Özellikler:
- 405 milyar parametre
- 128K token bağlam uzunluğu
- Çok dilli destek (8 dil)
- Talimat-tüneli sürüm mevcuttur
- Açık kaynaklı ve esnek bir lisansla
Bu güçlü modelin açık kaynaklı olarak yayınlanması, state-of-the-art AI yeteneklerine erişimi demokratikleştirmekte ve endüstri genelinde inovasyonu teşvik etmektedir.
Model Mimarisi ve Eğitim
Süreç, girdi metin token’lerinin token gömme olarak dönüştürülmesiyle başlar. Bu gömmeler, kendi kendine dikkat ve besleme ileri ağlarından oluşan birden fazla katmandan geçer, böylece model metin içinde karmaşık ilişkileri ve bağımlılıkları yakalayabilir. Otomatik olarak kod çözme mekanizması daha sonra çıktı metin token’lerini üretir ve işlemi tamamlar.

-
Gruplu Sorgu Dikkati (GQA)
Llama 3.1, Gruplu Sorgu Dikkatini kullanır, bu da önemli bir optimizasyon tekniğidir. Detaylı olarak inceleyelim:
Gruplu Sorgu Dikkati (GQA), çok başlı dikkatin bir varyantıdır ve hesaplamalı maliyetleri ve bellek kullanımını azaltmayı amaçlar. Llama 3.1 405B modelinde GQA, 8 anahtar-değer başıyla uygulanır.
GQA nasıl çalışır:
- Her bir dikkat başı için ayrı anahtar ve değer projeksiyonları yerine, GQA, birden fazla sorgu başını aynı anahtar ve değer başlarını paylaşmaya yönlendirir.
- Bu gruplama, anahtar ve değer projeksiyonlarındaki parametre sayısını önemli ölçüde azaltır, bu da daha küçük model boyutlarına ve daha hızlı çıkarıma yol açar.
- Dikkat hesaplama şu şekilde ifade edilebilir:
Dikkat(Q, K, V) = softmax(QK^T / sqrt(d_k))VBurada Q, g gruplarına ayrılır ve K ile V, Q’dan daha az başlığa sahiptir.
Llama 3.1 405B’de GQA’nın faydaları:
- Bellek ayak izini azaltma: Daha az anahtar ve değer projeksiyonu, model parametrelerini depolamak için gereken belleğin azalması anlamına gelir.
- Çıkarım hızını artırma: Anahtar ve değer projeksiyonları için gereken hesaplamaların azalmasıyla, çıkarım hızı artar.
- Performansı koruma: Parametrelerin azaltılmasına rağmen, GQA, birçok görevde standart çok başlı dikkatle karşılaştırılabilir performans göstermiştir.
-
İki Aşamalı Ön Eğitim için Genişletilmiş Bağlam
Makale, 128K token bağlam penceresini elde etmek için iki aşamalı ön eğitim sürecinden bahseder. Bu, Llama 3.1 405B’nin yeteneklerinin kritik bir yönüdür:
1. Aşama: İlk 8K token için ön eğitim
- Model ilk olarak 8K tokenlik dizilere eğitim görür.
- Bu aşama, modelin genel dil anlama ve üretim yeteneklerini öğrenmesini sağlar.
2. Aşama: Bağlam uzatma için devam eden ön eğitim
- İlk eğitimden sonra, model 128K tokenlik bağlam uzunluğuna ulaşmak için devam eden ön eğitime tabi tutulur.
- Bu aşama, modelin daha uzun dizilerle başa çıkabilmesini sağlamak için dikkatli bir şekilde tasarlanmış eğitim rejimlerini içerir.
-
Çoklu Ortam Yetenekleri
Önceki yanıttan sonra, Llama 3.1 405B’nin çoklu ortam yeteneklerini daha da genişletebiliriz:
Bileşik Yaklaşım:
- Llama 3.1 405B, farklı ortamlar için (örneğin, resimler, konuşma) ayrı kodlayıcılar kullanır.
- Bu kodlayıcılar, farklı ortamlardan girişi, dil modelinin anlayabileceği paylaşılan bir gömme alanına dönüştürür.
Dil Modeliyle Entegrasyon:
- Bu özel kodlayıcıların çıktıları, daha sonra ana dil modeline beslenir.
- Bu, Llama 3.1 405B’nin birden fazla veri türünü aynı anda işleyerek, birden fazla ortamı içeren görevleri gerçekleştirmesini sağlar.
Çapraz Dikkat Mekanizmaları:
- Farklı ortamların entegrasyonu için, Llama 3.1 405B muhtemelen çapraz dikkat mekanizmalarını kullanır.
- Bu mekanizmalar, metin üretirken veya diğer görevleri gerçekleştirirken, modelin farklı ortamlardan ilgili bilgilere dikkat etmesini sağlar.
Llama 3.1 405B’nin çoklu ortam yetenekleri, aşağıdaki gibi bir dizi uygulamayı mümkün kılar:
- Görüntü altyazısı ve görsel soru cevabı
- Konuşma metne dökme ve bağlamsal anlama
- Metin, resim ve potansiyel olarak diğer veri türlerinin birleştirildiği çoklu ortamlı akıl yürütme görevleri
Eğitim Ayrıntıları
- 15 trilyonun üzerinde tokenle eğitilmiştir
- Özel olarak oluşturulmuş bir GPU kümesiyle, 405B modeli için 39.3M GPU saati
- Çok dilli yetenek için çeşitli veri setleri
Talimat-tüneli sürüm, ek eğitimden geçti:
- Halka açık talimat veri setleriyle ince ayarlandı
- 25M’den fazla sentetik olarak üretilen örnek
- Gözetimli İnce Ayar (SFT) ve İnsan Geribildirimi ile Peşinden Takip (RLHF)
Performans Benchmark’leri
Tablo, Llama 3.1 405B, Nemotron 4 340B Instruct, GPT-4 (0125), GPT-4 Omni ve Claude 3.5 Sonnet’i karşılaştırır. Ana benchmark’ler arasında MMLU ve IFEval gibi genel görevler, HumanEval ve GSM8K gibi kod görevleri ve ARC Challenge gibi akıl yürütme görevleri bulunur. Her bir benchmark puanı, modelin insan benzeri metin anlayabilme ve üretme, karmaşık sorunları çözme ve kodu çalıştırma yeteneklerini yansıtır. Llama 3.1 405B ve Claude 3.5 Sonnet, birçok benchmark’te ileri düzey yeteneklerini gösterir.
Gelecek Yönler
Llama 3.1-405B’nin yayınlanması, çeşitli alanlarda inovasyonu hızlandıracaktır:
- Özel alanlar için geliştirilmiş ince ayar teknikleri
- Daha verimli çıkarım yöntemlerinin geliştirilmesi
- Model sıkıştırma ve distilasyonunda ilerlemeler
Sonuç
Llama 3.1-405B, açık kaynaklı AI’de önemli bir kilometre taşıdır ve daha önce sadece kapalı kaynaklı modellere özgü yetenekleri sunar.
Bu modelin kullanımına yaklaşırken, sorumluluk ve etik consideration ile hareket etmek kritiktir. Modelle birlikte sunulan araçlar ve güvenlik önlemleri, sorumlu dağıtım için bir çerçeve sağlar, ancak toplumun yararına bu güçlü teknolojinin kullanılmasını sağlamak için sürekli dikkat ve topluluk işbirliği gerekecektir.














