Yapay zeka modelleri ve platformları

Cebinde Taşınan Güç: Microsoft’un Phi-3’ü Tanıtılıyor, Cep Telefonunuzda Sığan Dili Modeli

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Yapay zeka alanındaki hızla gelişen trendlerde, büyük ve daha karmaşık modellere doğru bir eğilim olsa da, Microsoft (MSFT ) Phi-3 Mini ile farklı bir yaklaşım benimsemektedir. Bu küçük dil modeli (SLM), şimdi üçüncü nesilde, daha büyük modellerin güçlü yeteneklerini, cep telefonlarının katı kaynak kısıtlamalarına uyan bir çerçeveye yerleştirir. 3.8 milyar parametre ile, Phi-3 Mini dil işleme, akıl yürütme, kodlama ve matematik dahil çeşitli görevlerde büyük dil modellerinin (LLM’ler) performansını eşler ve nicemleme yoluyla mobil cihazlarda verimli çalışmaya yönelik olarak uyarlanır.

Büyük Dil Modellerinin Zorlukları

Microsoft’un Phi SLM’lerinin geliştirilmesi, LLM’lerin oluşturduğu önemli zorluklara bir yanıttır. Bunlar, tüketici cihazlarında genellikle mevcut olan hesaplamadan daha fazla güce ihtiyaç duyar, bu da onların standart bilgisayarlarda ve mobil cihazlarda kullanımını karmaşık hale getirir, eğitim ve çalışma sırasında enerji tüketiminden kaynaklanan çevresel endişeleri artırır ve büyük ve karmaşık eğitim veri setleri nedeniyle önyargıları sürdürme riskini taşır. Bu faktörler ayrıca gerçek zamanlı uygulamalarda modellerin yanıt hızını bozabilir ve güncellemeleri daha zor hale getirebilir.

Phi-3 Mini: Kişisel Cihazlarda AI’ı Düzenleme ve Verimliliği Artırma

Phi-3 Mini, telefonlar ve dizüstü bilgisayarlar gibi kişisel cihazlara gelişmiş AI’ı entegre etmek için maliyet-effective ve verimli bir alternatif sunmak üzere stratejik olarak tasarlanmıştır. Bu tasarım, teknoloji ile günlük etkileşimleri daha hızlı ve doğrudan hale getirir.

Phi-3 Mini, mobil cihazlarda gelişmiş AI işlevlerini doğrudan işleme yeteneği sağlar, bu da bulut hizmetlerine bağımlılığı azaltır ve gerçek zamanlı veri işleme yeteneğini artırır. Bu yetenek, mobil sağlık, gerçek zamanlı dil çevirisi ve kişiselleştirilmiş eğitim gibi uygulamalar için çok önemlidir. Modelin maliyet verimliliği, yalnızca operasyonel maliyetleri azaltmakla kalmaz, aynı zamanda çeşitli endüstrilerde, özellikle de giyilebilir teknoloji ve ev otomasyonu gibi yeni pazarlarda AI entegrasyonunun potansiyelini genişletir. Phi-3 Mini, yerel cihazlarda veri işleme yaparak kullanıcı gizliliğini artırır, bu da kişisel sağlık ve finansal hizmetler gibi alanlarda hassas bilgilerin yönetilmesi için çok önemlidir. Ayrıca, modelin düşük enerji gereksinimleri, çevresel olarak sürdürülebilir AI operasyonlarına katkıda bulunur ve küresel sürdürülebilirlik çabalarına uyumlu hale getirir.

Phi’nin Tasarım Felsefesi ve Evrimi

Phi’nin tasarım felsefesi, çocukların giderek daha zor örneklerle öğrenmesi gibi bir eğitim yaklaşımından esinlenen curriculum öğrenme kavramına dayanır. Ana fikir, AI eğitimi daha basit örneklerle başlamak ve öğrenme süreci ilerledikçe eğitim verilerinin karmaşıklığını artırmaktır. Microsoft, bir çalışma olan “Textbooks Are All You Need“da ayrıntılı olarak açıkladığı gibi, ders kitaplarından oluşan bir veri seti oluşturarak bu eğitim stratejisini uygulamıştır. Phi serisi Haziran 2023’te, 1.3 milyar parametre ile donatılmış kompakt bir model olan Phi-1 ile başladı. Bu model, özellikle Python kodlama görevlerinde, daha büyük ve daha karmaşık modelleri geride bırakarak hızlı bir şekilde etkinliğini kanıtladı. Bu başarının üzerine inşa ederek, Microsoft daha sonra Phi-1.5 modelini geliştirdi, bu model aynı sayıda parametre ile çalışırken, ortak akıl yürütme ve dil anlama gibi alanlarda yeteneklerini genişletti. Seri, Aralık 2023’te Phi-2 modelinin piyasaya sürülmesi ile zirveye ulaştı. 2.7 milyar parametre ile donatılan Phi-2, akıl yürütme ve dil anlama konularında etkileyici beceriler sergileyerek, önemli ölçüde daha büyük modellerle yarışmaya başladı.

Phi-3 vs. Diğer Küçük Dil Modelleri

Öncellerinin üzerine inşa edilen Phi-3 Mini, Phi-2’nin üzerine inşa ederek, Google’ın Gemma, Mistral’ın Mistral, Meta’nın Llama3-Instruct ve GPT 3.5 gibi diğer SLM’leri, çeşitli endüstriyel uygulamalarda geride bırakır. Bu uygulamalar dil anlama ve çıkarım, genel bilgi, ortak akıl yürütme, ilkokul matematik söz problemleri ve tıbbi soru cevaplaması gibi konularda üstün performans sergiler.

Özellik Karşılaştırması: Phi-3 Mini vs. Phi-2 Mini

Aşağıda, Phi-3 ve Phi-2’nin bazı özelliklerini karşılaştırıyoruz.

  • Model Mimarisi: Phi-2, bir sonraki kelimeyi tahmin etmek üzere tasarlanmış bir transformer tabanlı mimariye sahiptir. Phi-3 Mini de bir transformer decoder mimarisini kullanır, ancak Llama-2 model yapısına daha yakın bir şekilde, 320.641’lik bir sözcük dağarcığı ile aynı tokenleştiriciyi kullanır. Bu uyumluluk, Llama-2 için geliştirilen araçların Phi-3 Mini ile kolayca uyarlanabilmesini sağlar.
  • Bağlam Uzunluğu: Phi-3 Mini, 8.000 tokenlik bir bağlam uzunluğunu destekler, bu da Phi-2’nin 2.048 tokenine göre önemli ölçüde daha uzundur. Bu artış, Phi-3 Mini’nin daha ayrıntılı etkileşimleri yönetmesine ve daha uzun metin parçalarını işleme yeteneğini sağlar.
  • Mobil Cihazlarda Yerel Çalışma: Phi-3 Mini, 4-bite sıkıştırılabilir ve yaklaşık 1.8GB bellek alanı kaplar, bu da Phi-2 ile benzerdir. Bir iPhone 14’te, A16 Bionic çip ile test edildiğinde, benzer koşullarda Phi-2’nin performansını eşleyen 12 token/saniye üzerinde bir işleme hızı elde edildi.
  • Model Boyutu: 3.8 milyar parametre ile, Phi-3 Mini, 2.7 milyar parametre ile donatılan Phi-2’den daha büyük bir ölçekte çalışır. Bu, artan yeteneklerini yansıtır.
  • Eğitim Verileri: Phi-2’nin 1.4 trilyon token ile eğitildiği mentre, Phi-3 Mini 3.3 trilyon token ile eğitilmiştir, bu da daha karmaşık dil kalıplarını daha iyi kavramasını sağlar.

Phi-3 Mini’nin Sınırlılıklarını Giderme

Phi-3 Mini, küçük dil modelleri alanında önemli ilerlemeler kaydetmesine rağmen, sınırlılıkları da vardır. Phi-3 Mini’nin birincil kısıtlaması, büyük dil modellerine kıyasla daha küçük boyutudur, bu da geniş kapsamlı olgusal bilgi depolama kapasitesini sınırlar. Bu, belirli olgusal verilere dayalı soruları bağımsız olarak ele alma yeteneğini etkileyebilir. Ancak, Phi-3 Mini’yi bir arama motoru ile entegre ederek, modelin gerçek zamanlı olarak daha geniş bir bilgi yelpazesi erişimini sağlayarak, bu sınırlılık kısmen giderilebilir. Bu entegrasyon, Phi-3 Mini’yi, dil ve bağlam hakkında kapsamlı bir anlayışa sahip, ancak zaman zaman doğru ve güncel yanıtlar sağlamak için “araştırmaya” ihtiyaç duyan yetenekli bir sohbetçi gibi çalışmasını sağlar.

Kullanılabilirlik

Phi-3 şu anda Microsoft Azure AI Studio, Hugging Face ve Ollama gibi çeşitli platformlarda mevcuttur. Azure AI’de, model bir dağıtma-değerlendirme-ince ayar workflow’u içerir ve Ollama’da dizüstü bilgisayarlarda yerel olarak çalıştırılabilir. Model, ONNX Runtime için uyarlanmıştır ve Windows DirectML desteği sunar, bu da çeşitli donanım tiplerinde, özellikle GPU’lar, CPU’lar ve mobil cihazlarda iyi çalışmasını sağlar. Ek olarak, Phi-3, NVIDIA NIM (NVDA ) aracılığıyla bir mikro hizmet olarak sunulur, standardize edilmiş bir API ile kolayca dağıtılabilir ve NVIDIA GPU’ları için özel olarak optimize edilmiştir. Microsoft, Phi-3 serisini yakın gelecekte Phi-3-küçük (7B) ve Phi-3-orta (14B) modelleri ekleyerek genişletmeyi planlıyor, böylece kullanıcıların kalite ve maliyet arasında seçim yapma konusunda daha fazla seçeneğe sahip olmasını sağlıyor.

Sonuç

Microsoft’un Phi-3 Mini’si, büyük dil modellerinin gücünü mobil kullanım için uyarlayarak yapay zeka alanında önemli adımlar atıyor. Bu model, daha hızlı ve gerçek zamanlı işleme yeteneği ile birlikte geliştirilmiş gizlilik özellikleri sunarak, kullanıcıların cihazlarla etkileşimini iyileştirir. Bulut tabanlı hizmetlere olan ihtiyacı azaltır, operasyonel maliyetleri düşürür ve sağlık ve ev otomasyonu gibi alanlarda AI uygulamalarının kapsamını genişletir. Eğitimde önyargıları azaltmaya odaklanan ve rekabetçi performansı koruyan Phi-3 Mini, verimli ve sürdürülebilir mobil AI için önemli bir araç haline gelerek, teknoloji ile günlük etkileşimimizi nazikçe dönüştürüyor.

Dr. Tehseen Zia, COMSATS Üniversitesi Islamabad'da görev yapan bir Öğretim Üyesi olup, Viyana Teknoloji Üniversitesi'nden (Avusturya) Yapay Zeka alanında doktora sahiptir. Yapay Zeka, Makine Öğrenimi, Veri Bilimi ve Bilgisayarlı Görü alanında uzmanlaşmış olan Dr. Tehseen, saygın bilimsel dergilerde yayımlanmış önemli katkılarıyla dikkat çekmiştir. Dr. Tehseen ayrıca çeşitli endüstriyel projelerin Baş Araştırma Görevlisi olarak görev yapmış ve Yapay Zeka Danışmanı olarak hizmet vermiştir.