Yapay zeka modelleri ve platformları

Meta Llama 3’ü Tanıtıyor: Büyük Dil Modellerinde Devrim

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Yapay zeka alanındaki büyük dil modellerinde Meta, açık kaynak erişilebilirliğine olan bağlılığını sürdürerek, gelişmiş Büyük Dil Modeli Meta AI (Llama) serisini dünya çapındaki geliştiricilere ve araştırmacılara dağıtmaya devam ediyor. İlerici girişimlerini inşa ederek, Meta yakın zamanda bu serinin üçüncü iterasyonunu, Llama 3‘ü sundu. Bu yeni sürüm, Llama 2‘den önemli ölçüde daha iyi performans gösteriyor ve endüstri rakipleri gibi Google (GOOGL ), Mistral ve Anthropic için referans noktaları oluşturuyor. Bu makale, Llama 3’ün önemli geliştirmelerini ve Llama 2 ile arasındaki karşılaştırmayı探 ediyor.

Meta’nın Llama Serisi: Özel Erişimden Açık Erişime ve Gelişmiş Performansa

Meta, 2022’de Llama 1 ile Llama serisini başlattı, bu model ticari olmayan kullanıma mahsus ve o zamanın en son teknoloji LLM’lerinin karakterize ettiği devasa hesaplama talepleri ve özel doğası nedeniyle yalnızca seçili araştırma kurumlarına erişilebiliyordu. 2023’te Llama 2’nin piyasaya sürülmesiyle, Meta AI, modeli araştırma ve ticari amaçlar için ücretsiz olarak sunmaya yöneldi. Bu hareket, gelişmiş yapay zeka teknolojilerine erişimi demokratikleştirmeyi amaçlıyordu, böylece daha geniş bir kullanıcı kitlesi, başlangıç şirketleri ve daha küçük araştırma ekipleri, büyük ölçekli modellerle thường ilişkilendirilen yüksek maliyetler olmadan yenilikçi uygulamalar geliştirebiliyor ve uygulamalar yapabiliyordu. Açık olma eğilimini sürdüren Meta, Llama 3’ü sundu, bu da çeşitli endüstri standartlarında küçük modellerin performansını iyileştirmeye odaklanıyor.

Llama 3’ü Tanıtıyor

Llama 3, Meta’nın açık kaynak büyük dil modellerinin ikinci neslidir ve 8B ve 70B parametreli önceden eğitilmiş ve talimatla ince ayarlanmış modelleri içerir. Öncellerinin izini sürerek, Llama 3 yalnızca decoder transformer mimarisi kullanmaya devam ediyor ve metin dizilerinde sonraki tokenleri öngörme için otoregresif, kendi kendine eğitimli eğitimi uygulamaya devam ediyor. Llama 3, Llama 2 için kullanılan veri kümesinden yedi kat daha büyük bir veri kümesinde önceden eğitilmiştir ve 15 trilyonun üzerinde tokeni içerir, bunlar yeni bir şekilde küratelenmiş halka açık online verilerin karışımından elde edilmiştir. Bu geniş veri kümesi, 24.000 GPU ile donatılmış iki küme kullanılarak işlenmektedir. Eğitim verilerinin yüksek kalitesini korumak için, veri odaklı AI teknikleri gibi çeşitli yöntemler kullanılmıştır, bunlar arasında heuristik ve NSFW filtreleri, anlamsal çoğaltma ve metin kalite sınıflandırması yer almaktadır. Diyalog uygulamalarına yönelik olarak tasarlanan Llama 3 Instruct modeli önemli ölçüde geliştirilmiştir ve 10 milyondan fazla insan tarafından注釈lenmiş veri örneğini içermektedir ve gözetimli ince ayar, reddetme örneklemesi, proximal politika optimizasyonu (PPO) ve doğrudan politika optimizasyonu (DPO) gibi gelişmiş eğitim yöntemlerinin karma bir karışımını kullanmaktadır.

Llama 3 vs. Llama 2: Ana Geliştirmeler

Llama 3, Llama 2’ye göre birkaç geliştirme sunuyor, bu da işlevselliğini ve performansını önemli ölçüde artırıyor:

  • Genişletilmiş Sözlük: Llama 3, sözlüğünü 32.000 token’den 128.256 token’e çıkarmıştır. Bu geliştirme, hem girişler hem de çıktılar için daha verimli metin kodlamasını destekler ve çok dilli yeteneklerini güçlendirir.
  • Uzatılmış Bağlam Uzunluğu: Llama 3 modelleri, 4.090 token’in iki katına karşılık gelen 8.000 token’lik bir bağlam uzunluğu sağlar. Bu artış, hem kullanıcı promt’lerini hem de model yanıtlarını kapsayan daha kapsamlı içerik işleme olanakları sağlar.
  • İyileştirilmiş Eğitim Verileri: Llama 3’ün eğitim veri kümesi, Llama 2’ninkine göre yedi kat daha büyüktür ve dört kat daha fazla kod içerir. 30’dan fazla dilde %5’ten fazla yüksek kaliteli, İngilizce olmayan veri içerir, bu da çok dilli uygulama desteği için çok önemlidir. Bu veriler, heuristik ve NSFW filtreleri, anlamsal çoğaltma ve metin sınıflandırıcıları gibi gelişmiş teknikler kullanılarak sıkı kalite kontrolünden geçer.
  • İyileştirilmiş Talimat İnce Ayarı ve Değerlendirme: Llama 3, Llama 2’den farklı olarak, gözetimli ince ayar, reddetme örneklemesi, proximal politika optimizasyonu (PPO) ve doğrudan politika optimizasyonu (DPO) gibi gelişmiş talimat ince ayar tekniklerini kullanır. Bu süreci desteklemek için, 1.800’den fazla promt içeren yeni bir yüksek kaliteli insan değerlendirme kümesi tanıtıldı, bu promtler, tavsiye, beyin fırtınası, sınıflandırma, kodlama ve daha fazlası gibi çeşitli kullanım örneklerini kapsar, böylece modelin yeteneklerinin kapsamlı bir değerlendirmesi ve ince ayarı sağlanır.
  • İleri AI Güvenliği: Llama 3, Llama 2 gibi, talimat ince ayarı ve kapsamlı kırmızı takım gibi sıkı güvenlik önlemlerini entegre eder, özellikle siber güvenlik ve biyolojik tehditler gibi kritik alanlarda riskleri azaltmak için. Bu çabaları desteklemek için Meta, ayrıca Llama 3’ün 8B sürümünde ince ayarlanmış Llama Guard 2’yi tanıttı. Bu yeni model, Llama Guard serisini geliştirir ve LLM girişlerini ve yanıtlarını potansiyel olarak güvenli olmayan içeriği tanımlamak için sınıflandırır, bu da üretim ortamları için ideal hale getirir.

Llama 3’ün Erişilebilirliği

Llama 3 modelleri şimdi Hugging Face ekosisteminde entegre edilmiştir, bu da geliştiriciler için erişilebilirliği artırır. Modeller ayrıca Perplexity Labs ve Fireworks.ai gibi model-as-a-service platformları aracılığıyla ve AWS SageMaker, Azure ML ve Vertex AI gibi bulut platformlarında mevcuttur. Meta, Llama 3’ün erişilebilirliğini daha da genişletmeyi planlıyor, bu da Google Cloud, Kaggle, IBM WatsonX, NVIDIA NIM ve Snowflake gibi platformları içerecektir. Ayrıca, Llama 3 için donanım desteği AMD, AWS, Dell, Intel (INTC ), NVIDIA ve Qualcomm (QCOM ) gibi platformları içerecek şekilde genişletilecektir.

Llama 3’te Gelecek Geliştirmeler

Meta, Llama 3’ün当前 sürümünün daha geniş bir vizyonun yalnızca ilk aşaması olduğunu açıkladı. 400 milyardan fazla parametreyle bir gelişmiş model geliştiriyorlar, bu model yeni özellikler tanıtacak, çok modellik ve birden fazla dil işleme yeteneği sunacak. Bu geliştirilmiş sürüm ayrıca önemli ölçüde uzatılmış bir bağlam penceresi ve genel performans yetenekleri sunacak.

Sonuç

Meta’nın Llama 3’ü, büyük dil modelleri manzarasında önemli bir evrimi temsil ediyor, seriyi yalnızca açık kaynak erişilebilirliğine doğru değil, aynı zamanda önemli ölçüde gelişmiş performans yeteneklerine doğru itiyor. Llama 2’den yedi kat daha büyük bir eğitim veri kümesi ve genişletilmiş sözlük ve artan bağlam uzunluğu gibi özelliklerle Llama 3, endüstri rakiplerini zorlayan yeni referans noktaları oluşturuyor.

Bu üçüncü iterasyon, yalnızca AI teknolojisini daha geniş bir geliştirici yelpazesine açık hale getirerek değil, aynı zamanda güvenlik ve eğitim doğruluğu açısından önemli geliştirmeler sunarak AI teknolojisini demokratikleştirmeye devam ediyor. Hugging Face gibi platformlara entegre ederek ve büyük bulut hizmetleri aracılığıyla erişilebilirliği genişleterek Meta, Llama 3’ün hem erişilebilir hem de güçlü olmasını sağlıyor.

İleriye bakıldığında, Meta’nın devam eden geliştirmeleri daha güçlü yetenekler vaat ediyor, bunlar arasında çok modellik ve genişletilmiş dil desteği yer alıyor, bu da Llama 3’ün piyasada diğer önemli AI modelleriyle rekabet edebilmesi veya hatta onları geçebilmesi için sahne hazırlıyor. Llama 3, Meta’nın AI devrimine liderlik etme taahhüdünün bir kanıtı, yalnızca daha erişilebilir değil, aynı zamanda önemli ölçüde daha gelişmiş ve daha güvenli araçlar sunuyor.

Dr. Tehseen Zia, COMSATS Üniversitesi Islamabad'da görev yapan bir Öğretim Üyesi olup, Viyana Teknoloji Üniversitesi'nden (Avusturya) Yapay Zeka alanında doktora sahiptir. Yapay Zeka, Makine Öğrenimi, Veri Bilimi ve Bilgisayarlı Görü alanında uzmanlaşmış olan Dr. Tehseen, saygın bilimsel dergilerde yayımlanmış önemli katkılarıyla dikkat çekmiştir. Dr. Tehseen ayrıca çeşitli endüstriyel projelerin Baş Araştırma Görevlisi olarak görev yapmış ve Yapay Zeka Danışmanı olarak hizmet vermiştir.