Düşünce Liderleri

Yapay Zeka’nın Yeni Ekonomisi Token’ler Üzerine Kurulmuştur – Ancak Onları Yanlış Ölçüyoruz

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Yapay zeka alanında çoğu insanın henüz tam olarak anlamadığı bir değişim gerçekleşiyor: talepleri saymak yerine token’ları saymaya başladık.

Web döneminde, sistemleri saniyedeki taleplerle ölçerdik. Bu, temiz, sezgisel ve büyük ölçüde doğruydu. Bir talep gelirdi, bir cevap giderdi ve altyapınızı bu modele göre ölçeklendirirdiniz.

Bu soyutlama artık ortadan kalktı.

Yapay zeka alanında, temel birim artık talep değil – token’dir. Her bir talep, her bir cevap ve her bir akıl yürütme zinciri token’lar olarak bölünür, sistem tarafından yapılan işi, oluşan maliyeti ve giderek artan şekilde yaratılan değeri temsil eder.

Doğal olarak, endüstri bu değişime uyum sağlamak için token’ler başına metric’ler gibi metric’ler tanıttı ve token’ler başına maliyet ve hatta token’ler başına gelir gibi metric’ler tanıttı. Yapay zeka sistemlerini ölçmek için bir yol bulduğumuz hissine kapıldık, ancak bu çerçeve eksik.

Endüstri kısaltması: token’lar değer demektir

Token’ların yapay zeka’nın yeni para birimi olduğu, daha fazla token’ın daha fazla zeka ve dolayısıyla daha fazla gelir anlamına geldiği şeklinde bir anlatı ortaya çıktı. Bu, çekici bir fikirdir, ancak gerçekte olanları basitleştirir.

Tüm token’lar eşit değildir. Bazı token’lar gerçek işi temsil eder: veri analizi, içgörüler oluşturma, iş akışlarını otomatikleştirme ve iş sonuçlarını destekleyen kararları alma. Diğerleri çok daha anlamsızdır – casual içerik oluşturma, deneysel kullanım veya üretim aşamasına hiç ulaşmayan kullanım örnekleri.

Şirketler içinde bunu zaten görebilirsiniz. Bir ekip, geliştirici verimliliği veya müşteri operasyonlarını desteklemek için milyonlarca token oluşturabilir, doğrudan verimliliği ve geliri etkiler. Bir başka ekip ise, iç keşif aşamasını asla geçmeyen araçlar denemek için aynı miktarda token oluşturabilir. Kağıt üzerinde, token sayıları aynı görünür. Gerçekte, iş değeri tamamen farklıdır.

Tüm token’ları birbirinin yerine geçebilecek değer birimlerine indirgemek, bir organizasyon içinde yapay zeka’nın gerçekten ne yaptığının çarpık bir görünümünü oluşturur. İşletmeler token hacmine değil, bu token’ların neler sağladığına dayanır.

Bu farkı anlamak için, bu sistemlerin gerçekten nasıl çalıştığını incelemek gerekir.

İkinci talebiniz neden ilk talebinizden daha hızlıdır

Eğer ChatGPT gibi bir aracı kullanmışsanız, ikinci sorunuzun genellikle ilk sorunuzdan daha hızlı olduğunu fark etmişsinizdir. Bu davranış, modelin daha akıllı hale gelmesiyle ilgili değildir – bununla ilgili olan, sistemin önceki taleplerden bağlamı yeniden kullanmasıdır.

Modern yapay zeka sistemleri, her talebi izole olarak işlemez. Bağlam oluşturur, önceki talepleri ve cevapları bir KV önbelleğinde depolar, genellikle GPU’ya yakın bir yerde hızlı bir şekilde erişilebilmesi için.

İlk talep pahalıdır, çünkü bu durumu başlatır – bellek ayırma, girdiyi işleme ve bağlam oluşturma. Sonraki talepler bu durumu yeniden kullanır, bu da gecikmeyi azaltır ve yanıt süresini iyileştirir.

Bu dinamik, bağlam pencereleri binlerce veya hatta milyonlarca token’a genişlediğinde daha önemli hale gelir. Sistem ne kadar çok bağlam korursa, bellek ve altyapı üzerinde o kadar çok baskı oluşturur, bu da neyin depolandığını, sıkıştırıldığını veya atıldığını belirlemek kritik hale gelir.

Kullanıcı açısından, daha hızlı bir sistem gibi görünür. Altyapı açısından, bu birComplex bir ticaret-off’dir – bellek, gecikme ve maliyet arasında.

Gerçek iş burada gerçekleşiyor: sadece model itself değil, onu çevreleyen sistem.

Ultimate kısıtlama: enerji

Model performansı ötesine geçtiğinizde, konuşma nhanh chóng değişir.

Ölçeklerde yapay zeka çalıştıran ekipler, hangi modelin en iyi olduğunu sormuyorlar – bunu nasıl sürdürebileceklerini soruyorlar.

Yapay zeka altyapısı, fiziksel sınırlara doğru itiyor: enerji erişimi, soğutma kapasitesi ve bellek bant genişliği. Veri merkezleri bu kısıtlamalar etrafında yeniden tasarlanıyor ve büyük ölçekli yapay zeka sistemleri dağıtan organizasyonlar, geleneksel yazılım şirketleri yerine daha çok hizmetler gibi davranmaya başlıyorlar.

Büyük şirketlerin yapay zeka altyapısı inşa ettiğini zaten görüyoruz, burada güç ve soğutma – model yetenekleri değil – birincil kısıtlama haline geliyor.

Yapay zeka iş yükleri temiz veya öngörülebilir bir şekilde ölçeklenmez. Hesaplama, bellek ve ağAcross aynı anda talebi artırır. Daha fazla token oluşturmak, sadece daha fazla GPU eklemek değildir; altyapının, verimli bir şekilde çalışmasını sağlamak için gereken enerji ve termal yükü destekleyip destekleyemeyeceği sorusudur.

Token oluşturmanın maliyeti, hesaplama ötesine geçer. Elektrik, soğutma, fiziksel altyapı ve yük altında bozulmadan performansı sürdürme yeteneğini içerir.

“Token başına maliyet” tartışmaları genellikle bu gerçekliği tam olarak yansıtmaz. Ölçeklerde, enerji bütçenin kendisi haline gelir, sadece bir başka gider kalemi değildir.

Gelecek daha büyük modeller değil, daha iyi sistemlerdir

Son iki yıl içinde, endüstri model karşılaştırmalarına odaklandı, benchmark’ları, sıralamaları ve yeteneklerdeki artımlı iyileştirmeleri inceledi.

Bu odak noktası artık değişiyor.

Üretim ortamlarında, performans, seçilen modelden daha çok nasıl kullanıldığıyla ilgilidir. Organizasyonlar, büyük ve küçük modelleri birleştiren, görevleri akıllıca yönlendiren ve tüm iş akışı boyunca maliyet, gecikme ve verimlilik için optimize eden model sistemlerine doğru ilerlemektedir.

Her talebi tek bir büyük modele göndermek yerine, sistemler iş yüklerini daha küçük bileşenlere ayırır. Basit görevler, daha verimli modeller tarafından ele alınabilir, daha karmaşık akıl yürütme ise daha büyük olanlar için ayrılmıştır. Bağlam, her yerde mümkün olduğunca yeniden kullanılır ve önbellek stratejileri agresif bir şekilde uygulanır.

Bu kararlar, model değiştirmekten daha büyük bir etkiye sahip olabilir ve performans ve maliyet üzerinde daha büyük bir etkiye sahip olabilir. Bu sentido, token’lar hala iş birimi olarak kalır, ancak onları oluşturan ve yöneten sistem, gerçek farklılaştırıcı haline gelir.

Yapay zeka sistemlerinde en çok gözden kaçan katman

Yapay zeka genellikle modeller ve uygulamalar olarak tanımlanır, ancak aradaki katman, çoğu karmaşıklık ve fırsatın yaşandığı yerdir.

Bu katman sadece talepleri iletmekle kalmaz, onları şekillendirir. Trafik akışını, kararların nasıl uygulanacağını ve sistemlerin gerçek dünya koşullarında nasıl davranacağını belirler.

Teslim ve güvenlik burada ayrı endişeler olarak ele alınamaz. Talepleri yönlendiren ve bağlamı yöneten aynı katman, aynı zamanda politikaları uygular, riskleri azaltır ve güveni kurar.

Karmaşıklık arttıkça, nokta çözümleri bozulur. Gerçek zamanlı olarak bu işlevleri koordine edebilen birleşik bir platforma ihtiyaç vardır, yoksa bunlar sonradan birleştirilemez.

Burada ticaret-off’lar yapılır. Bu, maliyetin kontrol edildiği, performansın optimize edildiği ve güvenlik kararlarının gerçek zamanlı olarak uygulandığı yerdir. Yapay zeka sistemleri ölçeklendiğinde, bu katman giderek daha önemli hale gelir. Bu, bir sistemın demo’da iyi performans göstermesi ile üretim ortamında güvenilir ve verimli bir şekilde çalışması arasındaki farktır. Bu değişim, organizasyonların yapay zeka sistemlerini nasıl tasarlayıp yönettiği konusunda gerçek etkileri vardır.

Bu, organizasyonlar için ne anlama geliyor

Şirketler yapay zeka’yı üretime aldıkça, soru sadece hangi modeli kullanacağı değil, modelin etrafındaki sistemin nasıl tasarlandığıdır.

Bu, token metric’lerinden ve model benchmark’larından öteye geçerek, taleplerin nasıl yönlendirildiğini, bağlamın nasıl yönetildiğini ve tüm iş akışı boyunca politikaların nasıl uygulandığını düşünmek demektir.

Çoğu organizasyon hala bu parçaları birleştiriyor – ve bu yaklaşım gerçek üretim baskısı altında tutunmuyor.

Yanlış şeyi ölçüyoruz

Token’lar faydalı bir soyutlama sağlar. Endüstriye, önce soyut olan bir şeyi ölçmek için bir yol verir, ancak bunlar tam resim değildir.

Şu anda, endüstri en kolay ölçülebilen şeye doğru yöneliyor – token sayıları, verimlilik ve maliyet metric’leri – ancak en önemli olan şeyden ziyade. Bağlam olmadan, bu rakamlar yanıltıcı olabilir.

Yapay zeka’nın bir sonraki aşaması, en çok token üretenler tarafından tanımlanmayacak. Token’ların neyi temsil ettiğini anlayanlar ve bunları anlamlı, verimli ve ölçeklenebilir sonuçlara dönüştürebilen sistemler inşa edenler tarafından tanımlanacak.

Çünkü sonunda, token’lar ürün değil, sadece yaratılan zekanın bir yan ürünüdür.

Kunal Anand F5'nin Ürün Başkanı'dır, burada uygulama teslimi, güvenlik ve AI altyapısı boyunca ürün stratejisinin liderliğini yapar.