Yapay zeka modelleri ve platformları
Çok Dilli LLM’lerin Durumu: İngilizce’nin Ötesine Geçmek
Microsoft (MSFT ) araştırmasına göre, dünyadaki dillerin %88’i, 1,2 milyar kişi tarafından konuşulan, Büyük Dil Modellerine (LLM’ler) erişimi yok. Bunun nedeni, çoğu LLM’nin İngilizce merkezli olması, yani çoğunlukla İngilizce verilerle ve İngilizce konuşanlar için inşa edilmeleridir. Bu İngilizce hakimiyeti, LLM geliştirme alanında da hüküm sürmekte ve dijital bir dil açığına neden olmakta, potansiyel olarak çoğu insanı LLM’lerin faydalarından mahrum bırakmaktadır. LLM’ler için bu sorunu çözmek için, farklı dillerde eğitilebilen ve farklı dillerde görevleri gerçekleştirebilen bir LLM’ye ihtiyaç vardır. Çok Dilli LLM’ler giriyor!
Çok Dilli LLM’ler Nedir?
Çok dilli bir LLM, birden fazla dilde metin anlayabilir ve üretebilir. Farklı dilleri içeren veri setleriyle eğitilirler ve bir kullanıcı promtından çeşitli görevleri birden fazla dilde gerçekleştirebilirler.
Çok dilli LLM uygulamaları enorm, bunlar arasında literatürü yerel lehçelere çevirmek, gerçek zamanlı çok dilli iletişim, çok dilli içerik oluşturma vb. bulunur. Herkesin, dilinden bağımsız olarak, kolayca bilgiye erişmesini ve birbirleriyle konuşmasını sağlayacaklar.
Ayrıca, çok dilli LLM’ler, kültürel nüansların ve bağlamın eksikliği, eğitim verisi kısıtlamaları ve çeviriler sırasında bilgi kaybı gibi zorlukları ele alır.
Çok Dilli LLM’ler Nasıl Çalışır?
Çok dilli bir LLM oluşturmak, çeşitli dillerdeki metinlerin dengeli bir korpusunu özenle hazırlamak ve modeli eğitmek için uygun bir mimari ve teknik seçmek anlamına gelir, tercihen Transformer modeli, çok dilli öğrenme için idealdir.

Kaynak: Yazar tarafından
Bir teknik, farklı dillerdeki kelimelerin anlamsal anlamını yakalayan gömme yöntemlerini paylaşmaktır. Bu, LLM’nin her dilin benzerliklerini ve farklılıklarını öğrenmesini sağlar, böylece farklı dilleri daha iyi anlamasını sağlar.
Bu bilgi, LLM’yi ayrıca çeşitli dil görevlerine uyum sağlamasına da olanak tanır, örneğin dilleri çevirmek, farklı stillerde yazmak vb. Başka bir teknik ise çapraz dilli aktarım öğrenimi, burada model önce çok dilli bir veri kümesiyle önceden eğitilir, ardından belirli görevlerde ince ayarlanır.
Bu iki adımlı süreç, modelin çok dilli dil anlayışında güçlü bir temel oluşturur, böylece çeşitli aşağı akış uygulamalarına uyarlanabilir.
Çok Dilli Büyük Dil Modelleri Örnekleri

Kaynak: Ruder.io
Birkaç dikkat çekici çok dilli LLM örneği ortaya çıktı, her biri belirli dil gereksinimlerine ve kültürel bağlamlara hizmet ediyor. Bunlardan bazılarını keşfedelim:
1. BLOOM
BLOOM, çeşitli dillere ve erişilebilirliğe öncelik veren açık erişimli bir çok dilli LLM’dir. 176 milyar parametreye sahip BLOOM, 46 doğal ve 13 programlama dilinde görevleri gerçekleştirebilir, bu onu en büyük ve en çeşitli LLM’lerden biri yapar.
BLOOM’un açık kaynak doğası, araştırmacıların, geliştiricilerin ve dil topluluklarının yeteneklerinden yararlanmasına ve gelişimine katkıda bulunmasına olanak tanır.
2. YAYI 2
YAYI 2, Asya dilleri için özel olarak tasarlanmış açık kaynaklı bir LLM’dir, bu bölge için karmaşıklıkları ve kültürel nüansları dikkate alır. 16’dan fazla Asya dilini içeren 2,65 trilyon filtelenmiş tokenlik bir çok dilli korpus üzerinden sıfırdan önceden eğitilmiştir.
Bu, modelin Asya’daki dillerin ve kültürlerin özel gereksinimlerini karşılayacak şekilde daha iyi sonuçlar vermesini sağlar.
3. PolyLM
PolyLM, düşük kaynaklı dillerin zorluklarını ele almak için uyarlanma yetenekleri sunan açık kaynaklı bir ‘çok dilli’ LLM’dir. Yaklaşık 640 milyar tokenlik bir veri setiyle eğitilmiştir ve 1,7B ve 13B olmak üzere iki model boyutunda mevcuttur. PolyLM, 16’dan fazla farklı dili bilir.
Düşük kaynaklı diller için sınırlı veri ile yüksek kaynaklı dillerde eğitilen modelleri ince ayarlamasına olanak tanır. Bu esneklik, LLM’leri çeşitli dil durumlarında ve görevlerde daha faydalı hale getirir.
4. XGLM
XGLM, 7,5 milyar parametreye sahip bir çok dilli LLM’dir ve az örnek öğrenme tekniği kullanılarak 20’den fazla dilin kapsamlı bir kümesiyle eğitilmiştir. Büyük ölçekli çok dilli LLM’ler ailesinin bir parçasıdır ve metin ve kodun büyük bir veri setiyle eğitilir.
Dillerin çoğunu kapsama odaklanır, bu nedenle dil topluluklarının ihtiyaçlarına hizmet eden modeller oluşturmayı hedefler. XGLM, çeşitli dil topluluklarının ihtiyaçlarına hizmet eden modeller oluşturmanın potansiyelini göstermektedir.
5. mT5
mT5 (çok dilli Metin-İçin-Metin Transfer Transformeri), Google (GOOGL ) AI tarafından geliştirilmiştir. Common Crawl veri setiyle eğitilen mT5, İspanyolca ve Çince gibi yaygın dillerden Basque ve Quechua gibi düşük kaynaklı dillere kadar 101 dilde görevleri gerçekleştirebilen bir çok dilli LLM’dir.
Ayrıca, çeviri, özetleme, soru-cevap gibi çok dilli görevlerde de exceller.
Evrensel Bir LLM Mümkün mü?
Bir dilin önyargısız, herhangi bir dilde dil olmadan anlayan ve üretebilen bir LLM kavramı ilgi çekicidir.
Gerçekten evrensel bir LLM geliştirmek hala uzak bir hedef olsa da, mevcut çok dilli LLM’ler önemli başarılar göstermiştir. Tamamen geliştirildiklerinde, under-represented dillere ve çeşitli topluluklara hizmet edebilecekler.
Örneğin, araştırmalar gösteriyor ki çoğu çok dilli LLM, kaynak zengin bir dilden kaynak yoksun bir dile görev özel eğitim verisi olmadan sıfır çekimli çok dilli aktarım gerçekleştirebiliyor.
Ayrıca, YAYI ve BLOOM gibi, belirli dillere ve topluluklara odaklanan modeller, dil merkezli yaklaşımların ilerleme ve kapsayıcılık sürücüsü olarak potansiyellerini göstermiştir.
Tam bir evrensel LLM veya mevcut Çok Dilli LLM’leri geliştirmek için, bireyler ve organizasyonlar aşağıdaki adımları atmalıdır:
- Topluluk katılımı ve dil veri setlerinin küratörlüğü için yerel konuşmacıları topluluklaştırmak.
- Çok dilli araştırmalara ve geliştirmelere açık kaynaklı katkılar ve finansal destek sağlamak.
Çok Dilli LLM’lerin Zorlukları
Evrensel çok dilli LLM’ler kavramı büyük umut vaat etse de, bunlardan yararlanabilmek için önce ele alınması gereken beberapa zorluğu da vardır:
1. Veri Miktarı
Çok dilli modeller, monolingual modellere kıyasla daha büyük bir kelime dağarcığına ihtiyaç duyar, ancak birçok dil büyük ölçekli veri setlerinden yoksundur. Bu, bu modelleri etkili bir şekilde eğitmeyi zorlaştırır.
2. Veri Kalitesi Kısıtlamaları
Çok dilli LLM’lerin çıktılarının dil boyunca doğruluğunu ve kültürel uygunluğunu sağlamak önemli bir endişe konusudur. Modeller, dil ve kültürel nüanslara karşı özenle eğitilmeli ve ince ayarlanmalıdır, böylece yanlılıklar ve yanlışlıklar önlenmelidir.
3. Kaynak Kısıtlamaları
Çok dilli modelleri eğitmek ve çalıştırmak, güçlü hesaplama kaynakları gerektirir, örneğin güçlü GPU’lar (örneğin NVIDIA A100 GPU). Yüksek maliyet, özellikle düşük kaynaklı diller ve sınırlı hesaplama altyapısına erişimi olan topluluklar için zorluk oluşturur.
4. Model Mimarisi
Model mimarilerini, çeşitli dil yapılarını ve karmaşıklıklarını kapsayacak şekilde uyarlamak devam eden bir zorluktur. Modeller, farklı kelime sıraları, morfolojik varyasyonlar ve yazım sistemleri ile yüksek performans ve verimliliği korurken dil görevlerini gerçekleştirebilmelidir.
5. Değerlendirme Karmaşıklıkları
İngilizce benchmark’lerin ötesinde çok dilli LLM’lerin performansını değerlendirmek, gerçek etkinliklerini ölçmek için kritiktir. Bu, kültürel nüanslar, dil özgüllükleri ve alan özel gereksinimlerini dikkate almak gerektirir.
Çok dilli LLM’ler, dil bariyerlerini kırmaya, düşük kaynaklı dillere güç kazandırmaya ve çeşitli topluluklar arasında etkili iletişim sağlamaya potansiyeli sahiptir.
AI ve ML’deki son haberleri ve analizleri kaçırmayın – bugün unite.ai‘yi ziyaret edin.












