Yapay zeka modelleri ve platformları
Mistral AI: Açık Kaynaklı Büyük Dil Modellerinde Yeni Benchmarks Oluşturuyor
Büyük Dil Modelleri (LLM’ler)最近, ChatGPT gibi öne çıkan performanslarla birlikte merkezde yer aldı. Meta, Llama modellerini tanıttığında, açık kaynaklı LLM’ler için yeniden ilgi uyandırdı. Amaç, GPT-4 gibi üst düzey modeller kadar iyi olan ancak daha ucuz ve daha az karmaşık olan açık kaynaklı LLM’ler oluşturmaktı.
Bu karışım, araştırmacılar ve geliştiriciler için yeni olanaklar açtı ve doğal dil işleme alanında teknolojik ilerlemeler için yeni bir dönemin başlamasına neden oldu.
Son zamanlarda, generatif AI startups fonlama konusunda başarılı oldu. Together, açık kaynaklı generatif AI modelleri oluşturmak amacıyla 20 milyon dolarlık fon sağladı. Anthropic, 450 milyon dolarlık bir fon sağladı ve Cohere, Google Cloud ile ortaklık yaparak 270 milyon dolarlık fon sağladı.
Mistral 7B’ye Giriş: Boyut ve Kullanılabilirlik
Paris merkezli ve Google’ın DeepMind ve Meta’dan mezun olan kişiler tarafından kurulan Mistral AI, ilk büyük dil modelini tanıttı: Mistral 7B. Bu model, GitHub’dan veya 13,4 gigabaytlık bir torrent aracılığıyla herkes tarafından kolayca indirilebilir.
Bu startup, ürün çıkarmadan önce rekor düzeyde seed fonlama sağladı. Mistral AI’nin ilk modeli, 7 milyar parametreli bir model olarak, tüm testlerde Llama 2 13B’nin performansını aşmaktadır ve Llama 1 34B’yi birçok metrikte geçmektedir.
Diğer modellere kıyasla, Mistral 7B, benzer veya daha iyi yetenekler sunar, ancak daha az hesaplama yükü ile. Temel modeller gibi GPT-4, daha iyi performans gösterebilir, ancak daha yüksek bir maliyeti vardır ve kullanıcı dostu değildir, çünkü principalmente API’ler aracılığıyla erişilebilirler.
Kodlama görevlerinde, Mistral 7B, CodeLlama 7B ile benzer performans gösterir. Ayrıca, 13,4 GB boyutunda standart makinelerde çalıştırılabilecek kadar kompakt bir boyuta sahiptir.
Ek olarak, Hugging Face’de özel olarak eğitilen Mistral 7B Instruct, MT-Bench’de diğer 7B modellerini geçer ve 13B sohbet modelleriyle omuz omuza gelir.

Hugging Face Mistral 7B Örneği
Performans Benchmarking
Mistral 7B, Llama 2 aile modelleriyle karşılaştırıldı. Sonuçlar netti: Mistral 7B, tüm benchmarklerde Llama 2 13B’yi önemli ölçüde geçti. Aslında, Llama 34B’nin performansını eşitledi, özellikle kod ve akıl yürütme benchmarklerinde öne çıktı.
Benchmarklar, Commonsense Reasoning, World Knowledge, Reading Comprehension, Math ve Code gibi kategorilere ayrıldı. Özellikle dikkat çekici bir gözlem, Mistral 7B’nin maliyet-performans metriğiydi, “ekivalent model boyutları” olarak adlandırıldı. Anlama ve akıl yürütme gibi alanlarda, Mistral 7B, Llama 2 modelinin üç katı boyutunda bir performans gösterdi, bu da bellek tasarrufu ve artan verimlilik anlamına gelmektedir. Ancak, bilgi benchmarklarında, Mistral 7B, Llama 2 13B ile benzer bir performans gösterdi, bu da parametre sınırlamalarının bilgi sıkıştırma üzerindeki etkisine atfedilebilir.
Mistral 7B Modeli Diğer Dil Modellerinden Neden Daha İyi?
Dikkat Mekanizmalarını Basitleştirme
Dikkat mekanizmalarının nüansları teknik olsa da, temel fikirleri oldukça basittir. Bir kitap okuyup önemli cümleleri vurgulamak gibi, dikkat mekanizmaları da bir dizi içindeki belirli veri noktalarına “vurgu” yapar veya önem verir.
Dil modelleri bağlamında, bu mekanizmalar modelin girdi verilerinin en ilgili kısımlarına odaklanmasını sağlar, böylece çıktı tutarlı ve bağlamsal olarak doğru olur.
Standart transformatorlarda, dikkat puanları aşağıdaki formülle hesaplanır:
Bu puanların formülü, Q ve K’nin matris çarpımını içeren bir adımdan oluşur. Burada ortaya çıkan zorluk, dizi boyutunun büyümesi ile birlikte her iki matrisin de büyümesidir, bu da hesaplama yoğunluğunu artırır. Bu ölçeklenebilirlik sorunu, standart transformatorların neden yavaş olabileceğinin önemli bir nedenidir, özellikle uzun diziler ile çalışırken.

Çoklu sorgu dikkat (MQA) mekanizması, bir dizi “anahtar-değer” başlıkları kullanır, ancak bazen kaliteyi feda eder. Şimdi, neden MQA’nın hızını ve çoklu başlıklı dikkatin kalitesini birleştiremeyeceğinizi merak edebilirsiniz? İşte bu noktada Gruplu sorgu dikkati (GQA) devreye girer.
Gruplu Sorgu Dikkati (GQA)
GQA, bir orta yol çözümüdür. Sadece bir veya birden fazla “anahtar-değer” başlığı kullanmak yerine, bunları gruplar. Bu şekilde, GQA, ayrıntılı çoklu başlıklı dikkatin performansına yakın bir performans gösterir, ancak MQA’nın hızı ile. Mistral gibi modeller için bu, kaliteyi feda etmeden verimli bir performans anlamına gelir.
Kaydırma Pencere Dikkati (SWA)
Kaydırma penceresi, dizi dikkat işlemlerinde kullanılan bir başka yöntemdir. Bu yöntem, her bir token etrafında sabit boyutlu bir dikkat penceresi kullanır. Birden fazla katman bu pencereyi yığdığında, üst katmanlar sonunda tüm girdi verilerini kapsayan daha geniş bir perspektife sahip olur. Bu mekanizma, Evrişimli Sinir Ağları (CNN’ler)中的 alıcı alanlara benzer.
Öte yandan, Longformer modelinin “genişletilmiş kaydırma pencere” dikkati, kavramsal olarak kaydırma pencere yöntemiyle benzerdir, ancak yalnızca matrisinin birkaç diyagonalını hesaplar. Bu değişiklik, bellek kullanımının lineer olarak artmasına neden olur, bu da daha uzun diziler için daha verimli bir yöntem anlamına gelir.
Mistral AI’nin Şeffaflığı ve Dağıtılmış Sistemdeki Güvenlik Kaygıları
Mistral AI, açıklamasında şeffaflıktan bahsetti: “Hiçbir hile, hiçbir özel veri.” Ancak, mevcut tek modeli olan ‘Mistral-7B-v0.1’, önyüklü bir temel modeldir ve bu nedenle herhangi bir sorgu için moderasyonsuz bir yanıt üretebilir, bu da potansiyel güvenlik kaygıları oluşturur. GPT ve Llama gibi modellerin, yanıt verme zamanını belirleme mekanizmaları vardır, ancak Mistral’in tamamen dağıtılmış doğası kötü niyetli kişiler tarafından sömürülebilir.
Ancak, Büyük Dil Modellerinin dağıtılmış olması da bazı avantajları vardır. Bazıları bunu kötüye kullanabilir, ancak insanlar bunu toplumun iyiliği için ve herkesin erişebileceği bir zeka oluşturmak için kullanabilir.
Dağıtım Esnekliği
Mistral 7B’nin bir diğer önemli özelliği, Apache 2.0 lisansı altında sunulmasıdır. Bu, onu kullanmak için gerçek bir engel olmadığı anlamına gelir – ister kişisel amaçlar için, ister büyük bir şirket için, isterse bir devlet kuruluşu için olsun. Sadece bunu çalıştırmak için doğru sistemi sahip olmanız veya bulut kaynaklarına yatırım yapmanız gerekir.
Diğer lisanslar, örneğin daha basit MIT Lisansı ve telif hakkı ve benzer lisanslama için zorunlu olan CC BY-SA-4.0, Apache 2.0, büyük ölçekli girişimlerde güçlü bir temel sağlar.
Son Düşünceler
Açık kaynaklı Büyük Dil Modellerinin yükselişi, Mistral 7B ile birlikte, AI endüstrisinde önemli bir değişimi temsil etmektedir. Mistral AI’nin yenilikçi yaklaşımları, Gruplu sorgu dikkati ve Kaydırma pencere dikkati, kaliteyi feda etmeden verimli bir performans vaat etmektedir.
Mistral’in dağıtılmış doğası belirli zorluklar oluştursa da, esnekliği ve açık kaynaklı lisansı, AI’nin demokratikleştirilmesi potansiyelini vurgulamaktadır. Manzara geliştikçe, odak, bu modellerin gücünü etik考虑lerle ve güvenlik mekanizmaları ile dengelemek olacaktır.
Mistral için gelecek neler getiriyor? 7B modeli sadece başlangıçtı. Ekibin hedefi, daha büyük modelleri yakın zamanda çıkarmak. Eğer bu yeni modeller 7B’nin performansını eşitleyebilirse, Mistral endüstrinin önde gelen oyuncularından biri haline gelebilir, tüm bunlar sadece ilk yılında.

















