Yapay zeka modelleri ve platformları
Google, AI Eğitimi Süresini SLM’leri Öğretmen Olarak Kullanarak %28 Kısaltıyor
Büyük dil modellerinin (LLM’ler) eğitimi, çoğu organizasyon için ulaşılmaz hale gelmiştir. Milyonlarca dolarlık maliyetler ve bir süper bilgisayarın bile terleyeceği hesaplamalar, AI geliştirmeyi teknoloji devlerinin kapıları ardında kilitlemiştir. Ancak Google (GOOGL ), bu hikayeyi baştan aşağı değiştiren, neden daha önce kimsenin düşünmediği basit bir yaklaşım sunuyor: daha küçük AI modellerini öğretmen olarak kullanmak.
SALT Nasıl Çalışır: AI Modellerini Eğitmek için Yeni Bir Yaklaşım
Google Research ve DeepMind, “A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs” adlı bir araştırma makalesinde SALT (Küçük Model Destekli Büyük Model Eğitimi) adlı yeni bir yöntem tanıttı. Bu, geleneksel LLM’leri eğitmek yaklaşımımızı zorlayan yenilikçi bir yöntemdir.
Bu araştırma neden önemlidir? Şu anda büyük AI modellerini eğitmek, birine bir konuyu tümüyle öğretmeye çalışmak gibi – verimsiz, pahalı ve genellikle büyük hesaplamalı kaynaklara sahip organizasyonlarla sınırlıdır. SALT, iki aşamalı bir eğitim süreci sunar ve hem yenilikçi hem de pratiktir.
SALT Nasıl Çalışıyor: Ayrıntılı Açıklama
1. Aşama: Bilgi Damıtma
- Daha küçük bir dil modeli (SLM), öğretmen olarak hareket eder ve daha büyük modele anlayışını paylaşır
- Küçük model, “soft labels” aracılığıyla “öğrendiği bilgileri” aktarmaya odaklanır
- Bunu, bir öğretim asistanının temel kavramları ele alması ve öğrencinin ileri konulara geçmesi gibi düşünün
- Bu aşama, özellikle “kolay” öğrenme bölgelerinde etkili olur – küçük modelin güçlü tahmin güvenliği olan alanlar
2. Aşama: Özgün Öğrenme
- Büyük model, bağımsız öğrenmeye geçer
- Karmaşık desenleri ve zor görevleri ustalaşmaya odaklanır
- Bu, modelin daha küçük “öğretmeni”nin sağlayamayacağı yetenekleri geliştirdiği aşamadır
- Aşama arasında geçiş, dikkatlice tasarlanmış stratejiler kullanılarak yapılır, bunlar arasında lineer bozulma ve lineer oran bozulma bulunur
Basit terimlerle, küçük AI modeli, büyük modelin eğitiminin başlangıcında rehberlik eden bir öğretmene benzer. Bu öğretmen, yanıtlarıyla birlikte ek bilgi sağlar, her yanıt için ne kadar emin olduğunu gösterir. Bu ek bilgi, “soft labels” olarak bilinir ve büyük modelin daha hızlı ve etkili öğrenmesini sağlar.
- Lineer Bozulma: Öğretmenin sesini yavaşça kısma gibidir. Öğretmenin rehberliği her adımda daha az baskın hale gelir ve büyük model, ham veriden öğrenmeye odaklanır.
- Lineer Oran Bozulma: Bu, öğretmenin tavsiyesi ile asıl görev arasındaki dengeyi ayarlamak gibidir. Eğitim ilerledikçe, asıl görev üzerine vurgu artar ve öğretmenin girdisi daha az baskın hale gelir.
Sonuçlar etkileyici. Google araştırmacıları, SALT’ı 1.5 milyar parametreli bir SLM kullanarak 2.8 milyar parametreli bir LLM’yi Pile veri kümesinde test ettiğinde, şunları gördüler:
- Geleneksel yöntemlere kıyasla %28’lik bir eğitim süresi azaltması
- İyileştirme sonrası önemli performans iyileştirmeleri:
- Matematik problemi doğruluğu %34.87’ye (başlangıç %31.84) yükseldi
- Okuma anlama %67 doğruluğa (başlangıç %63.7) ulaştı
Ancak SALT’ı gerçekten yenilikçi yapan, teorik çerçevesidir. Araştırmacılar, daha “zayıf” bir öğretmen modelin, “lehte yanlılık-değişkenlik ticaretini” başarması sayesinde öğrencinin performansını artırabileceğini keşfettiler. Basitçe söylemek gerekirse, küçük model, büyük modelin temel desenleri daha verimli bir şekilde öğrenmesini sağlar ve ileri öğrenme için daha güçlü bir temel oluşturur.
SALT, AI Geliştirme Alanını Nasıl Değiştirebilir
Bulut bilişim, hangi şirketlerin teknoloji şirketi olarak kurulabileceğini değiştirdi mi? SALT, AI geliştirmeye benzer bir etki yapabilir.
AI eğitim yeniliklerini yıllardır takip ediyorum ve çoğu đột phá, esas olarak teknoloji devlerine fayda sağlamıştır. Ancak SALT farklı.
Gelecek İçin Ne Anlama Geliyor:
Sınırlı Kaynaklara Sahip Organizasyonlar İçin:
- Artık güçlü AI modelleri geliştirmek için devasa hesaplama altyapısına ihtiyacınız olmayabilir
- Küçük araştırma laboratuvarları ve şirketler, özel model geliştirme deneyimleri yapabilir
- %28’lik eğitim süresi azaltması, doğrudan daha düşük hesaplama maliyetlerine dönüşür
- Daha da önemlisi, mütevazi hesaplama kaynaklarıyla başlayabilir ve profesyonel sonuçlar elde edebilirsiniz
AI Geliştirme Manzarası İçin:
- Daha fazla oyuncu, daha çeşitli ve uzmanlaşmış AI çözümleri sunabilir
- Üniversiteler ve araştırma kurumları, mevcut kaynaklarıyla daha fazla deney yapabilir
- AI araştırması girişindeki engel önemli ölçüde düşer
- Önce AI geliştirmesini karşılayamayan alanlarda yeni uygulamalar görme ihtimalimiz vardır
Bu, Gelecek İçin Ne Anlama Geliyor
Küçük modelleri öğretmen olarak kullanarak, sadece AI eğitimini daha verimli hale getirmiyoruz, aynı zamanda AI geliştirmesine kimlerin katılacağı konusunda temel bir değişikliğe yol açıyoruz. Etkiler, teknik iyileştirmelerin çok ötesine geçer.
Unutulmaması Gereken Ana Noktalar:
- %28’lik eğitim süresi azaltması, bir AI projesini başlatabilir veya ulaşılmaz olarak düşünülmesine neden olabilir
- Performans iyileştirmeleri (matematikte %34.87, okuma görevlerinde %67), erişilebilirliğin her zaman kaliteden ödün verilmesi anlamına gelmediğini gösterir
- SALT’ın yaklaşımı, bazen en iyi çözümlerin, daha fazla hesaplama gücü eklemekten ziyade temelleri yeniden düşünmekten geldiğini kanıtlar
Neleri İzlemeli:
- Küçük organizasyonların özel AI modelleri geliştirmeye başlamasını izleyin
- Önce AI geliştirmesini karşılayamayan alanlarda yeni uygulamaları izleyin
- Küçük modellerin uzmanlaşmış görevlerde nasıl kullanıldığına dikkat edin
Unutmayın: SALT’ın gerçek değeri, AI’de kimlerin yenilik yapabileceğini değiştirebilmesindedir. Bir araştırma laboratuvarını yönetiyor, bir teknoloji ekibini yönetiyor veya sadece AI geliştirmeye ilgi duyuyor olmanız fark etmez, bu, bir sonraki büyük fikrinizi mümkün kılabilir.
Belki de ulaşılmaz olduğunu düşündüğünüz bir AI projesi hakkında düşünmeye başlayın. Daha mümkün olabileceğinden şaşıracaksınız.










