Yapay zeka modelleri ve platformları

DerinSeek Nasıl 5.6 Milyon Dolarla Maliyet Bariyerini Aşladı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Geleneksel AI bilgisine göre, büyük dil modelleri (LLM’ler) oluşturmak için derin cebine sahip olmak gerekir – genellikle milyarlarca dolarlık yatırım. Ancak DerinSeek, bir Çin AI şirketi, bu paradigmayı latest başarısı ile paramparça etti: dünya sınıfı bir AI modeli sadece 5.6 milyon dolar ile geliştirdi.

DerinSeek’in V3 modeli, endüstri devleri gibi Google’ın Gemini ve OpenAI’in son teklifleri ile başa çıkabilir, aynı zamanda tipik hesaplama kaynaklarının sadece bir kısmını kullanır. Bu başarı, birçok endüstri liderinin dikkatini çekti ve özellikle dikkat çekici olan şey, şirketin bunu, son Nvidia çiplerine (NVDA ) erişimini sınırlayan ABD ihracat kısıtlamalarına rağmen başardığıdır.

Verimli AI’nin Ekonomisi

Rakamlar, verimlilik konusunda etkileyici bir hikaye anlatıyor. Çoğu gelişmiş AI modeli, eğitim için 16.000 ila 100.000 GPU arasında bir değer gerektirirken, DerinSeek sadece 2.048 GPU ile 57 gün çalıştı. Modelin eğitimi, Nvidia H800 çiplerinde 2,78 milyon GPU saati tüketti – 671 milyar parametreli bir model için oldukça mütevazi.

Bunu perspektife koymak için, Meta’nın Llama 3 modelini eğitmek için yaklaşık 30,8 milyon GPU saati – yaklaşık 11 kat daha fazla hesaplama gücü – gerektiğini dikkate alın. DerinSeek’in yaklaşımı, kısıtlamalar altında optimize etme konusunda bir masterclass gibi görünüyor. Çin pazarı için özel olarak tasarlanmış H800 GPU’ları ile çalışan şirket, potansiyel sınırlamaları innovasyona dönüştürdü. İşlemci iletişimi için hazır çözümler kullanmak yerine, verimliliği en üst düzeye çıkaran özel çözümler geliştirdiler.

Rakipler, masih büyük yatırımların gerekli olduğu varsayımıyla çalışırken, DerinSeek, zekice düşünme ve kaynakların verimli kullanmanın rekabeti eşitlenebileceğini gösteriyor.

İmkansızı Mühendislik

DerinSeek’in başarısı, yenilikçi teknik yaklaşımında yatıyor ve bazen en etkili đột pháların, sınırsız kaynaklar yerine kısıtlamalar içinde çalışarak geldiğini gösteriyor.

Bu innovasyonun kalbinde, “auxiliary-loss-free load balancing” adlı bir strateji yer alıyor. Büyük bir paralel işlem sistemi düşünün, geleneksel olarak bunun için karmaşık kurallar ve cezalar neededir. DerinSeek, bu geleneksel bilgelikleri tersine çevirdi ve geleneksel yaklaşımın yükünü olmadan dengenin korunmasını sağlayan bir sistem geliştirdi.

Ekibin ayrıca “Multi-Token Prediction” (MTP) adlı bir tekniği geliştirdi – modelin aynı anda birden fazla tokeni öngörmesine olanak tanıyan bir yöntem. Uygulamada, bu, çeşitli konularda %85-90’lara varan kabul oranlarına ve önceki yaklaşımlara göre 1,8 kat daha hızlı işlem hızlarına karşılık geliyor.

Teknik mimari itself bir verimlilik şaheseridir. DerinSeek’in V3 modeli, 671 milyar toplam parametre ile bir uzmanlar karışımı kullanıyor, ancak akıllı kısım, her token için sadece 37 milyar parametreyi etkinleştiriyor. Bu seçici etkinleştirme, büyük bir modelin avantajlarını korurken pratik verimliliği sağlar.

FP8 mixed precision eğitim çerçevesi seçimlerini başka bir ileri adımdır. Azalan doğruluk sınırlamalarını kabul etmek yerine, doğruluğu korurken bellek ve hesaplama gereksinimlerini önemli ölçüde azaltan özel çözümler geliştirdiler.

AI Ekosisteminde Dalga Etkileri

DerinSeek’in başarısının etkisi, sadece bir başarılı modelin ötesine geçer.

Avrupa AI geliştirme için bu đột phá özellikle önemlidir. Gelişmiş birçok model, Meta ve OpenAI gibi şirketlerin ya AB AI Yasasına uymak istemediği ya da bunu yapamadığı için AB’ye ulaşmaz. DerinSeek’in yaklaşımı, üstün AI geliştirmek için her zaman büyük GPU kümelerine ihtiyaç olmadığını, kaynakların verimli kullanılmasının daha önemli olduğunu gösteriyor.

Bu gelişme ayrıca, ihracat kısıtlamalarının innovasyonu nasıl tetikleyebileceğini gösteriyor. DerinSeek’in yüksek düzeyli donanıma erişimindeki sınırlamaları, kaynakları verimli kullanma konusunda yenilikçi çözümler geliştirmesine yol açtı. Bu prensip, küresel AI geliştirmeye yaklaşımımızı değiştirebilir.

Demokratikleşme etkileri derin. Endüstri devleri milyarlarca dolar yakmaya devam ederken, DerinSeek, verimli ve maliyet etkin AI geliştirme için bir plan oluşturdu. Bu, daha önce kaynak sınırlamaları nedeniyle rekabet edemeyen küçük şirketlere ve araştırma kurumlarına kapı açabilir.

Ancak, bu, büyük ölçekli hesaplama altyapısının eskidiği anlamına gelmez. Endüstri, çıkarma süresini – bir modelin cevap üretmesi için gereken zamanı – ölçeklendirmeye odaklanıyor. Bu eğilim devam ederse, önemli hesaplama kaynaklarına ihtiyaç duyulacak, muhtemelen zamanla daha da fazla.

Ancak DerinSeek, sohbeti temelde değiştirdi. Uzun vadeli etkiler açık: yenilikçi düşünme ve kaynakların verimli kullanılması, salt hesaplama gücünden daha önemli olabilir. AI topluluğu için bu, sahip olduğumuz kaynaklara odaklanmak yerine, bunları nasıl yaratıcı ve verimli bir şekilde kullandığımıza odaklanmak anlamına geliyor.

Alex McFarland yapay zeka muhabiri ve yazarıdır ve yapay zekadaki son gelişmeleri araştırıyor. Birçok yapay zeka başlangıç şirketi ve dünya çapındaki yayınlarda işbirliği yaptı.