Yapay zeka modelleri ve platformları
Microsoft’un Phi-3 Mini’si: Küçük Bir AI Modeli, Büyük Bir Etki
Microsoft (MSFT ), son zamanlarda Phi-3 Mini adlı yeni bir hafif dil modelini tanıttı. Bu model, devlet-sanat performansını sunarken küçük boyutuyla dikkat çekiyor. Sadece 3,8 milyar parametreyle, Phi-3 Mini, GPT-4 gibi devasa AI modellerinin yalnızca bir kısmı boyutundadır, ancak birçok alanda onların yeteneklerini eşleştirmeyi vaat ediyor.
Phi-3 Mini’nin geliştirilmesi, gelişmiş AI yeteneklerini daha geniş bir donanım yelpazesinde erişilebilir kılmak için önemli bir adımdır. Küçük boyutu, onu akıllı telefonlar, tabletler ve diğer kenar cihazlarda yerel olarak çalıştırabilme olanağı sağlar, böylece bulut tabanlı modellerle ilişkili gecikme ve gizlilik endişelerini aşar. Bu, sanal asistanlar, kod asistanları ve dil anlama görevleri gibi çeşitli alanlarda akıllı cihaz içi deneyimler için yeni olanaklar sunar.

- 4-bit quantized phi-3-mini running natively on an iPhone
Mimari ve Eğitim: Phi-3 Mini’nin Alt Yapısı
Phi-3 Mini, temelde bir transformator decode modelidir ve açık kaynaklı Llama-2 modelinin benzer bir mimarisi üzerine kurulmuştur. 32 katman, 3072 gizli boyut ve 32 dikkat başlığı ile birlikte gelir ve varsayılan bağlam uzunluğu 4.000 tokendir. Microsoft, ayrıca Phi-3 Mini-128K adlı bir uzun bağlam sürümü de tanıttı, bu sürüm LongRope tekniklerini kullanarak bağlam uzunluğunu 128.000 tokene çıkarıyor.
Phi-3 Mini’yi ayıran şey, eğitim metodolojisiidir. Büyük veri kümeleri ve hesaplama gücüne dayanmak yerine, Microsoft, yüksek kaliteli, akıl yürütme yoğun bir eğitim veri kümesi oluşturmaya odaklandı. Bu veri, ağır şekilde süzülmüş web verileri ve daha büyük dil modelleri tarafından üretilen sentetik verilerden oluşur.
Eğitim süreci iki aşamalı bir yaklaşımı takip eder. İlk aşamada, model genel bilgi ve dil anlama öğretmek amacıyla çeşitli web kaynaklarına maruz kalır. İkinci aşamada, daha da ağır şekilde süzülmüş web verileri ile sentetik veriler birleştirilir, bu da modelin mantıksal akıl yürütme becerileri ve niş alan uzmanlığını geliştirmesine yardımcı olur.
Microsoft, bu yaklaşıma “veri optimal rejimi” diyor, bu approach geleneksel “hesaplama optimal rejimi” veya “aşırı eğitim rejimi”nden farklıdır. Hedef, eğitim verilerini modelin ölçeğine uyumlu hale getirmek, böylece doğru düzeyde bilgi ve akıl yürütme yeteneği sağlarken diğer yeteneklere yeterli kapasite bırakmaktır.

- Quality of new Phi-3 models, as measured by performance on the Massive Multitask Language Understanding (MMLU) benchmark
Bu veri odaklı yaklaşım, Phi-3 Mini’nin geniş bir akademik benchmark yelpazesinde dikkat çekici bir performans sergilemesini sağladı, souvent daha büyük modellerle eşdeğer veya onları aşan sonuçlar elde etti. Örneğin, MMLU benchmark’inde multi-görev öğrenme ve anlama için %69, matematiksel akıl yürütme için MT-bench’de 8.38 puan elde etti, bu sonuçlar Mixtral 8x7B ve GPT-3.5 gibi modellerle eşdeğerdir.
Güvenlik ve Dayanıklılık
Microsoft, Phi-3 Mini’nin geliştirilmesinde güvenlik ve dayanıklılığa güçlü bir vurgu yaptı. Model, eğitim sonrası bir dizi sürece tabi tutuldu, bunlar arasında gözetimli fine-tuning (SFT) ve doğrudan tercih optimizasyonu (DPO) yer alıyor.
SFT aşaması, çeşitli alanlarda (matematik, kodlama, akıl yürütme, sohbet, model kimliği ve güvenlik) yüksek düzeyde süzülmüş veriler kullanıyor, bu da modelin bu alanlardaki yeteneklerini pekiştirirken aynı zamanda güçlü bir kimlik ve etik davranış duygusu kazandırıyor.
DPO aşaması, istenmeyen davranışlardan kaçınmak için reddedilen yanıtları olumsuz örnekler olarak kullanıyor. Bu süreç, sohbet formatı verileri, akıl yürütme görevleri ve sorumlu AI (RAI) çabalarını kapsıyor, böylece Phi-3 Mini’nin Microsoft’un etik ve güvenilir AI ilkelerine uymasını sağlıyor.
Güvenlik profilini daha da güçlendirmek için, Phi-3 Mini geniş bir red team ve otomatik testlerden geçti, bunlar dozens of RAI zarar kategorilerini kapsıyor. Microsoft’taki bağımsız bir red team, modeli iteratif olarak inceledi, geliştirme alanlarını belirledi ve bu alanlara yönelik olarak ek veri kümeleri ve yeniden eğitim sağladı.
Bu çok yönlü yaklaşım, zararlı yanıtlar, gerçek yanlışlıklar ve önyargıların oranını önemli ölçüde azalttı, bu da Microsoft’un iç RAI benchmark’lerinde gösterildi. Örneğin, model, zararlı içerik devamı için %0,75, özetleme için %10 ve bağlamsal dayanıklılık için %0,603 gibi düşük hata oranlarına sahip.
Uygulamalar ve Kullanım Durumları
İki önemli uygulama alanı, akıllı sanal asistanlar ve kodlama yardımcılarıdır. Phi-3 Mini, güçlü akıl yürütme yetenekleri sunuyor, bu da geliştiriciler ve öğrenciler için kod tamamlama, hata tespiti ve açıklamalar gibi görevlerde faydalı olmasını sağlıyor.
Phi-3 Mini’nin küçük boyutu ve verimliliği, onu çeşitli cihaz ve sistemlerde AI yetenekleri entegre etmek için çekici bir seçim haline getiriyor. Bu, akıllı ev aletlerinden endüstriyel otomasyon sistemlerine kadar birçok alanda yeni olanaklar sunuyor.
İleriye Bakış: Phi-3 Small ve Phi-3 Medium
Phi-3 Mini, Microsoft’un Phi-3 ailesi için büyük planlarının yalnızca başlangıcı. Şirket, daha büyük iki modeli, Phi-3 Small (7 milyar parametre) ve Phi-3 Medium (14 milyar parametre), tanıttı. Bu modeller, kompakt dil modelleri için performans sınırlarını daha da genişletmeyi amaçlıyor.
Phi-3 Small, daha gelişmiş bir tokenleştirici (tiktoken) ve gruplanmış sorgu dikkat mekanizması ile birlikte yeni bir blocksparse dikkat katmanı kullanıyor, bu da bellek izini optimize ederken uzun bağlam geri çağırma performansını korur. Ayrıca, dil anlama ve üretme yeteneklerini birden fazla dilde güçlendirmek için %10 daha fazla çok dilli veri içerir.
Phi-3 Medium, 40 katman, 40 dikkat başlığı ve 5.120 boyutunda bir gömme boyutuna sahip, bu da önemli bir ölçek artışı temsil ediyor. Microsoft, bazı benchmark’lerin bu artan kapasiteden tam olarak yararlanmak için eğitim veri karışımının daha da rafine edilmesini gerektirebileceğini not ediyor, ancak ilk sonuçlar umut verici, özellikle MMLU, TriviaQA ve HumanEval görevlerinde Phi-3 Small’a kıyasla önemli gelişmeler gösteriyor.
Sınırlamalar ve Gelecek Yönelimleri
Phi-3 Mini, gibi tüm dil modelleri, sınırlamalar olmadan değil. En önemli zayıflıklardan biri, nispeten sınırlı gerçek bilgi depolama kapasitesidir, bu da TriviaQA gibi benchmark’lerde daha düşük performansla sonuçlanır.
Microsoft, bu sınırlamanın, modeli arama motoru yetenekleriyle güçlendirerek azaltılabileceğine inanıyor, bu da modelin ilgili bilgileri gerektiğinde almasına ve üzerinde akıl yürütmesine olanak tanır. Bu yaklaşım, Hugging Face Chat-UI’de gösteriliyor, burada Phi-3 Mini, arama yoluyla yanıtlarını geliştirebiliyor.
Diğer bir geliştirme alanı, modelin çok dilli yeteneklerini tam olarak açığa çıkarmak için daha fazla çalışma yapılması gerekiyor. Phi-3 Small, bu yönde ilk adımları attı, ancak daha fazla veri ve eğitim gerekebilir.
Microsoft, Phi ailesini sürekli olarak geliştirmeye kendini adamış durumda, sınırlamaları ele alıyor ve yeteneklerini genişletiyor. Bu, eğitim verisi ve metodolojisinin daha da rafine edilmesi, yeni mimarilerin ve tekniklerin keşfedilmesi anlamına gelebilir, özellikle kompakt, yüksek performanslı dil modelleri için tasarlanmış olanlar.
Sonuç
Microsoft’un Phi-3 Mini’si, gelişmiş AI yeteneklerinin demokratikleştirilmesinde önemli bir adım olarak görülüyor. Devlet-sanat performansını küçük, kaynak-verimli bir pakette sunarak, çeşitli uygulamalar için yeni olanaklar açıyor.
Modelin yenilikçi eğitim yaklaşımı, yüksek kaliteli, akıl yürütme yoğun verilere odaklanmayı vurguluyor, bu da Phi-3 Mini’nin ağırlık sınıfının üzerinde performans göstermesini sağlıyor. Güçlü güvenlik önlemleri ve devam eden geliştirme çabalarıyla birlikte, Phi-3 ailesi, gelecekte akıllı sistemlerin şekillenmesinde önemli bir rol oynamaya hazırlanıyor, AI’yi daha erişilebilir, verimli ve güvenilir hale getiriyor.
Teknoloji endüstrisi, AI’nin sınırlarını sürekli olarak genişletmeye devam ederken, Microsoft’un hafif, yüksek performanslı modellere odaklanması, “büyük olan her şey iyidir” geleneksel bilgisine hoş bir değişiklik getiriyor. Boyut her şey olmadığını göstererek, Phi-3 Mini, AI’nin değerini ve etkisini maksimize etmek için akıllı veri toplama, düşünceli model tasarımı ve sorumlu geliştirme uygulamalarına odaklanan yeni bir yenilik dalgası ilham edebilecek potansiyele sahip.












