Düşünce Liderleri

LLM’lerin Karmaşık Problemleri Nasıl Çözümlendiğini Öğrenmek

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Oluşturucu AI’nin tanıtımı ve evrimi o kadar ani ve yoğundu ki, bu teknolojinin hayatlarımızı nasıl değiştirdiğini tam olarak takdir etmek oldukça zor.

Üç yıl öncesine geri gidin. Evet, AI daha yaygın hale geliyordu, en azından teoride. Daha fazla insan, AI’nin yapabileceği bazı şeyleri biliyordu, ancak buna rağmen AI’nin yetenekleri hakkında büyük yanlış anlaşılmalar vardı. Bir şekilde teknolojiye, aslında başarmayı amaçladığı şey için aynı anda hem yeterli hem de fazla kredi verildi. Yine de, ortalama bir insan, AI’nin çalıştığı ve yüksek uzmanlaşmış görevleri oldukça iyi bir şekilde gerçekleştirdiği en az bir veya iki alanı gösterebilirdi, yüksek kontrol edilen ortamlarda. Bunun ötesinde, ya hala bir araştırma laboratuvarındaydı veya simplemente yoktu.

Bugünü karşılaştırın. Cümle yazma veya soru sorma yeteneği dışında hiçbir beceri olmadan, dünya parmaklarımızın ucunda. Benzersiz ve gerçekten harika resimler, müzik ve hatta filmler oluşturabilir ve tüm endüstrileri etkileyebilecek bir kapasiteye sahibiz. Arama motoru sürecimizi süper şarj edebiliriz, doğru şekilde formüle edilmiş basit bir soru sorabilir ve bu, üniversite eğitimi almış bir akademisyen veya ortalama bir üçüncü sınıf öğrencisi olarak geçebilecek sayfalarca özel içerik oluşturabilir. Bu yetenekler, sadece bir veya iki yıl önce, imkansız olarak kabul ediliyordu. Oluşturucu AI alanı mevcuttu, ancak hiçbir şekilde patlamamıştı.

Bugün, birçok insan ChatGPT, Midjourney veya diğer araçlar gibi oluşturucu AI ile deneysel çalışmalarda bulundu. Diğerleri bunları günlük yaşamlarına zaten entegre etti. Bu araçların evrimi, neredeyse alarm verici bir hızda gerçekleşiyor. Son altı aydaki ilerlemeye bakıldığında, önümüzdeki birkaç yıl içinde defalarca şaşırtılacağımız kesin.

Oluşturucu AI içinde özel bir araç, Alıntı-Artırım Oluşturma (RAG) sistemlerinin performansı ve özellikle karmaşık sorguları düşünme yetenekleri oldu. FRAMES verisetinin tanıtılması, bir makalede açıklanan değerlendirme verisetinin nasıl çalıştığı, hem şimdiye kadar ulaşılan durumu hem de nereye gittiğini gösteriyor. FRAMES’in 2024’ün sonlarında tanıtılmasından bu yana, birçok platform already bu zorlu ve karmaşık sorguları yanıtlayabilme yeteneklerinde yeni rekorlar kırdı.

FRAMES’in neyi değerlendirmek amaçladığını ve farklı oluşturucu AI modellerinin nasıl performans gösterdiğini derinlemesine inceleyelim. Merkezden bağımsız ve açık kaynaklı platformların, sadece yerlerini korumakla kalmayıp, kullanıcıların bazı AI modellerinin ulaşabileceği akıl yürütme düzeyine net bir bakış açısı sunduğunu görebiliriz, özellikle de Sentient Chat gibi.

FRAMES olarak GenAI Beyni

FRAMES veriseti ve değerlendirme süreci, çıkarım, mantıksal bağlantı kurma, çeşitli kaynaklardan ana bilgileri alma ve bunları mantıksal olarak bir araya getirme yeteneği gerektiren 824 “çok adımlı” soru üzerine odaklanıyor. Soruların doğru cevaplanması için 2 ila 15 belge arasında bir miktar gereklidir ve ayrıca kasten kısıtlamalar, matematiksel hesaplamalar ve çıkarımlar ile zaman temelli mantık işleme yeteneği içerir. Diğer bir deyişle, bu sorular son derece zordur ve aslında bir insan tarafından internet üzerinde gerçekleştirilen gerçek dünya araştırma görevlerini temsil eder. Bu zorluklarla sürekli karşılaşıyoruz ve internet kaynaklarındaki dağınık anahtar bilgileri aramak, farklı sitelerden bilgiyi bir araya getirmek, hesaplayarak ve çıkarımlar yaparak yeni bilgiler oluşturmak ve bu gerçekleri doğru bir şekilde birleştirmek zorundayız.

Araştırmacılar, veriseti ilk olarak yayınlandığında ve test edildiğinde, en iyi GenAI modellerinin tek adımlı yöntemler kullanırken yaklaşık %40 doğru cevap verebildiklerini, ancak soruyu cevaplamak için gerekli tüm belgeleri toplamak zorunda kaldıklarında %73 doğruluk oranına ulaştıklarını buldular. Evet, %73 gibi bir oran devrim gibi görünmeyebilir. Ancak neyin cevaplanması gerektiğini tam olarak anlarsanız, oran çok daha etkileyici hale gelir.

Örneğin, bir soru şöyledir: “Kanye West’in ‘Power’ şarkısında örneklenen şarkının orijinal olarak hangi grubun lideri tarafından seslendirildiği yıl hangi yıldı?” Bir insan bu problemi nasıl çözerdi? Kişi, muhtemelen various bilgi unsurlarını toplamak zorunda kalacaktı, örneğin “Power” adlı Kanye West şarkısının sözlerini ve ardından şarkının bir başka şarkıyı örneklediği noktayı belirlemek için sözleri tarayabilirdi. İnsanlar olarak, şarkıyı dinleyebilirdik (hatta tanımasak bile) ve bir başka şarkının örneklenip örneklenmediğini söyleyebilirdik.

Ama düşünün: Bir GenAI, bir şarkıyı “dinlerken” başka bir şarkıyı tespit etmek için neyi başarmak zorunda kalacaktı? Bu, temel bir sorunun gerçekten zeki bir AI testi olabileceği bir noktadır. Ve eğer şarkıyı bulup dinleyip örneklenen sözleri belirleyebilsek, bu sadece 1. adımdır. Şarkının adını, grubun adını, o grubun liderinin adını ve sonra da o kişinin doğum yılını öğrenmemiz gerekir.

FRAMES, gerçekçi soruları cevaplamak için devasa bir düşünce işleme miktarına ihtiyaç olduğunu gösteriyor. Burada iki şey akla geliyor.

İlk olarak, merkezden bağımsız GenAI modellerinin sadece rekabet etmekle kalmayıp, potansiyel olarak sonuçları domine etme yetenekleri inanılmaz. Birçok şirket, işlem yeteneklerini ölçeklendirme ve aynı zamanda büyük bir topluluğun yazılımı sahip olmasını sağlama而 değil, gelişmeleri paylaşmayan merkezi bir kara kutu olarak kullanma yeteneği nedeniyle merkezden bağımsız yöntemi kullanıyor. Perplexity ve Sentient gibi şirketler bu eğilimi liderlik ediyor ve her biri, FRAMES yayınlandığında ilk doğruluk kayıtlarından daha iyi performans gösteren güçlü modellere sahip.

İkinci unsur, bu AI modellerinin bir kısmının sadece merkezden bağımsız değil, aynı zamanda açık kaynaklı olmasıdır. Örneğin, Sentient Chat her ikisidir ve erken testler, açık kaynaklı erişimin değerini göstererek nasıl karmaşık bir akıl yürütme gerçekleştirebileceğini gösteriyor. Yukarıdaki FRAMES sorusu, bir insan gibi aynı düşünce süreciyle cevaplanıyor ve akıl yürütme ayrıntıları için inceleme mevcut. Belki daha da ilginç olan, platformunun, performansını ve bakış açısını ince ayarlayabilen çeşitli modeller olarak yapılandırılmasıdır, bazı GenAI modellerinde ince ayar过程inin doğruluğu azaltmasına rağmen. Sentient Chat’in durumunda, birçok farklı model geliştirildi. Örneğin, “Dobby 8B” adlı bir model, FRAMES benchmarkını geçebiliyor ve aynı zamanda kripto para ve özgürlük yanlısı bir tutum geliştirebiliyor, bu da modelin bilgi parçalarını işlerken ve bir cevap geliştirirken perspektifini etkiliyor.

Ufukta

Tüm bu şaşırtıcı yeniliklerin anahtarı, bizi buraya getiren hızlı hızdır. Bu teknolojinin, ne kadar hızlı geliştiyse, gelecekte daha da hızlı gelişeceğini kabul etmek zorundayız. Merkezden bağımsız ve açık kaynaklı GenAI modelleriyle, sistemlerin zekasının bizimkini daha da aşmaya başladığı kritik eşiği görebileceğiz ve bunun geleceğimiz için ne anlama geldiğini göreceğiz.

David Balaban bir bilgisayar güvenlik araştırmacısıdır ve malware analizi ve antivirüs yazılımı değerlendirme konusunda 17 yıldan fazla deneyime sahiptir. David, MacSecurity.net ve Privacy-PC.com projelerini yönetmektedir. Bu projeler, sosyal mühendislik, malware, penetrasyon testi, tehdit istihbaratı, çevrimiçi gizlilik ve beyaz şapka hackleme dahil olmak üzere çağdaş bilgi güvenliği konularında uzman görüşleri sunar. David, güçlü bir malware sorun giderme geçmişine sahiptir ve最近 olarak fidye yazılımı karşı önlemlerine odaklanmıştır.