Anderson’un Açısı

Diller Neden Sohbetlerde Kaybolur

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
ChatGPT-4o and Adobe Firefly.

Microsoft Research ve Salesforce’ (CRM ) tan yeni bir makale, nawet en yetenekli Büyük Dil Modelleri (LLM’ler) bile, talimatlar tek seferde değil de aşamalı olarak verildiğinde parçalanır. Yazarlar, bir.promptın birden fazla dönüşte bölündüğünde performansın ortalama %39 oranında düştüğünü buldular:

Tek bir dönüşte sohbet (solda) en iyi sonuçları verir. Çoklu dönüş sohbeti (sağda) ise en yüksek sıralamaya sahip ve en iyi performans gösteren LLM'lerin bile sohbetin etkili momentumunu kaybetmesine neden olur. Kaynak: https://arxiv.org/pdf/2505.06120

Tek bir dönüşte sohbet (solda) en iyi sonuçları verir, ancak son kullanıcı için doğaldır. Çoklu dönüş sohbeti (sağda) ise en yüksek sıralamaya sahip ve en iyi performans gösteren LLM’lerin bile sohbetin etkili momentumunu kaybetmesine neden olur. Kaynak: https://arxiv.org/pdf/2505.06120

Daha çarpıcı olan, güvenilirlik cevaplarda ciddi bir düşüş yaşar, prestijli modeller gibi ChatGPT-4.1 ve Gemini 2.5 Pro aynı görevi nasıl ifade edildiğine bağlı olarak neredeyse mükemmel cevaplar ve bariz başarısızlıklar arasında sallanır; ayrıca, çıktı tutarlılığı processo boyunca yarısından fazla düşebilir.

Bu davranışı araştırmak için, makale parçalama* adlı bir yöntem tanıtılır, bu yöntem tam olarak belirtilen promt’ları daha küçük parçalara ayırır ve bunları sohbetin içine birer birer bırakır.

En temel anlamda, bu bir restoranda kohezif ve kapsamlı bir sipariş vermeye benzer; ya da meseleyi işbirliği içinde ele almaya benzer:

İki aşırı restoran sohbeti (yeni makalede yer almayan, yalnızca açıklama amacıyla kullanılan)

İki aşırı restoran sohbeti (yeni makalede yer almayan, yalnızca açıklama amacıyla kullanılan)

Örnekte, müşteri belki de olumsuz bir ışıkta görünür. Ancak ikinci sütundaki temel fikir, bir problem setini açıklamadan önce bir işlem içi değişimdir – apparently bir problemi ele alma için mantıklı ve makul bir yol.

Bu kurulum, yeni çalışmanın damla damla, parçalanmış LLM etkileşimine yansıyan bir yapıdır. Yazarlar, LLM’lerin genellikle çok uzun cevaplar ürettiğini ve sonra da yanlış veya alakasız olduklarını kanıtlanan kendi içgörülerine güvenmeye devam ettiklerini belirtirler. Bu eğilim, diğer faktörlerle birlikte, sistemin tüm değişimi takip edemez hale gelmesine neden olabilir.

Aslında, araştırmacılar, birçok kişinin deneyimsel olarak bulduğu şeyi not eder – LLM’lerle sohbeti geri getirmenin en iyi yolu, aynı bilgileri tekrarlayan yeni bir sohbet başlatmaktır.

‘LLM’yle bir sohbet beklenen sonuçlara yol açmadıysa, aynı bilgileri tekrarlayan yeni bir sohbet başlatmak, devam eden bir sohbeti sürdürmekten çok daha iyi sonuçlar getirebilir.

‘Bu, çünkü mevcut LLM’ler sohbetin içinde kaybolabilir ve deneylerimiz, modelle bir sohbeti sürdürmenin etkisiz olduğunu gösterir. Ayrıca, LLM’lerin metin üretimi rastgele olduğu için, yeni bir sohbet daha iyi sonuçlar getirebilir.’

Yazarlar, agentic sistemlerin, örneğin Autogen veya LangChain, sonuçları iyileştirebileceğini, son kullanıcıya maruz kalmadan ‘parçalanmış’ cevapları birleştirmek için interpretatif katmanlar olarak hareket edebileceğini kabul ederler.

Ancak yazarlar, ayrı bir soyutlama katmanının gerekli olmadığını veya kaynak LLM’ye doğrudan entegre edilmelidir:

‘Çoklu dönüş özellikleri LLM’lerin gerekli bir özelliği değildir, çünkü bunlar ajan çerçevesine devredilebilir. Diğer bir deyişle, LLM’lerde yerel çoklu dönüş desteğine ihtiyacımız var mı, yoksa bir ajan çerçevesi kullanıcılarla etkileşimi düzenleyebilir ve LLM’leri yalnızca tek dönüş operatörleri olarak kullanabilir miyiz?…’

Ancak bu önermeyi çeşitli örnekler boyunca test ettikten sonra, şöyle sonuca varırlar:

‘[Ajan benzeri bir çerçeveye dayanmak] sınırlayıcı olabilir ve LLM’lerin yerel olarak çoklu dönüş etkileşimini desteklemesi gerektiğini savunuyoruz.’

Bu ilginç yeni makale, LLM’ler Çoklu Dönüşte Sohbetin İçinde Kaybolur olarak adlandırılır ve Microsoft Research ve Salesforce’tan dört araştırmacı tarafından gelir,

Parçalanmış Sohbetler

Yeni yöntem, geleneksel tek dönüş talimatlarını sohbet sırasında kritik anlarda tanıtılacak daha küçük parçalara ayırır, bu yapı, ChatGPT veya Google Gemini gibi sistemlerde görülen keşifçi, ileri geri etkileşim tarzını yansıtır.

Her orijinal talimat, tüm görevi bir kerede teslim eden tek, kendi içinde yeterli bir promttur ve yüksek düzeyde bir soru, destekleyici bağlam ve ilgili koşulları birleştirir. Parçalanmış versiyon, bunu birden fazla küçük parçaya ayırır ve her parça yalnızca bir bilgi parçasını ekler:

Tam bir promtun (a) tek bir dönüşte teslim edildiği ve (b) underspecified, çoklu dönüş etkileşimini simüle etmek için kullanılan parçalanmış versiyonu gösteren çift talimatlar. Anlamsal olarak, her iki versiyon da aynı bilgilendirme yükünü taşır.

Tam bir promtun (a) tek bir dönüşte teslim edildiği ve (b) underspecified, çoklu dönüş etkileşimini simüle etmek için kullanılan parçalanmış versiyonu gösteren çift talimatlar. Anlamsal olarak, her iki versiyon da aynı bilgilendirme yükünü taşır.

İlk parça her zaman görevin ana amacını tanıtır, geri kalanı açıklamalı ayrıntıları sağlar. Birlikte, orijinal promtla aynı içeriği teslim ederler, ancak sohbetin içinde doğal olarak birkaç dönüş boyunca dağıtılmışlardır.

Her simüle sohbet, asistan, değerlendirilen model; kullanıcı, parçalanmış formdaki tam talimata erişimi olan simüle bir ajan; ve sistem, değişimi denetleyen ve puanlayan arasında gerçekleşir.

Sohbet, kullanıcının ilk parçayı açıklamasıyla başlar ve asistan serbestçe cevap verir. Sistem, bu cevabı birkaç kategoriye ayırır, chẳng hạn açıklama isteği veya tam cevap denemesi.

Eğer model cevap denemesi yaparsa, ayrı bir bileşen yalnızca değerlendirme için ilgili spanı çıkarır, çevreleyen metni görmezden gelir. Her yeni dönüşte, kullanıcı bir parça daha açıklar ve asistan başka bir cevap verir. Değişim, model cevabı doğru verene veya kalan parçalar kalmayana kadar devam eder:

Parçalanmış sohbet simülasyonunun şeması, değerlendirilen model kırmızı olarak vurgulanmıştır.

Parçalanmış sohbet simülasyonunun şeması, değerlendirilen model kırmızı olarak vurgulanmıştır.

Erken testler, modellerin henüz paylaşılmamış bilgilerin hakkında soru sorduğunu gösterdi, bu nedenle yazarlar parçaları sabit bir sırayla açıklama fikrini bıraktı. Bunun yerine, bir simülatör, sohbetin gidişatına bağlı olarak hangi parçayı açıklamak gerektiğini kararlaştırmak için kullanıldı.

Kullanıcı simülatörü, GPT-4o-mini kullanılarak uygulandı ve tam talimata ve sohbet geçmişine tam erişimine sahip olup, her dönüşte sohbetin gelişimine bağlı olarak hangi parçayı açıklamak gerektiğini görevlendirdi.

Kullanıcı simülatörü ayrıca her parçayı sohbet akışını korumak için yeniden ifade etti, anlamını değiştirmeden. Bu, simülasyonun gerçek diyaloğun ‘ver ve al’ tarzını yansıtmalarına, görev yapısını kontrol altında tutarken izin verdi.

Sohbet başlamadan önce, asistana görevi tamamlamak için gereken temel bilgiler verilir, chẳng hạn bir veritabanı şeması veya API referansı. Talimatların bölüneceği veya zamanla güncelleneceği konusunda bilgilendirilmez ve sohbeti ele alma konusunda específik bir yol gösterilmez. Bu, kasıtlı olarak yapılır: gerçek dünya kullanımında, modellere genellikle promt’un eksik veya zamanla güncelleneceği söylenmez ve bu bağlamı dışarıda bırakmak, simülasyonun modelin daha gerçekçi bir bağlamda nasıl davrandığını yansıtmaya yardımcı olur.

GPT-4o-mini ayrıca asistanın cevaplarının nasıl sınıflandırılacağına ve bu cevaplardan nihai cevapları nasıl çıkaracağına karar vermek için kullanıldı. Bu, simülasyonu esnek tuttu, ancak bazen hataların ortaya çıkmasına neden oldu: Ancak, birkaç yüz sohbeti el ile kontrol ettikten sonra, yazarlar, sorunların %5’ten azında ortaya çıktığını ve sonuçta yalnızca %2’sinde değişiklik olduğunu buldular ve bu, projenin parametreleri içinde kabul edilebilir bir hata oranı olarak kabul ettiler.

Simülasyon Senaryoları

Yazarlar, model davranışını farklı koşullarda test etmek için beş tür simülasyon kullanmışlardır, her biri talimatların nasıl ve ne zaman açıklanacağının varyasyonlarıdır.

Tam ayarında, model tüm talimata tek bir dönüşte erişir. Bu, standart benchmark formatını temsil eder ve performans standardı olarak hizmet eder.

Parçalanmış ayar, talimatı birden fazla parçaya ayırır ve bunları birer birer teslim eder, daha gerçekçi, underspecified bir sohbeti simüle eder. Bu, çoklu dönüş girişini test etmek için kullanılan ana ayar.

Concat ayarında, parçalar tekrar birleştirilir, ancak dönüşe bağlı yapıyı korur. Bu, sohbetin parçalanmasının etkilerini, yeniden ifade veya içerik kaybından ayırmaya yardımcı olur.

Özet ayarı, Parçalanmış gibi çalışır, ancak model nihai cevabı vermeden önce tüm önceki parçaları tekrar açıklar. Bu, bir özet promtunun kaybolan bağlamı geri getirmeye yardımcı olup olmadığını test eder.

Son olarak, Kar daha da ileri gider ve her önceki parçayı her dönüşte tekrar eder, sohbet ilerledikçe tüm talimatın görünür olmasını sağlar – ve çoklu dönüş yeteneğinin daha affedici bir testini sunar.

Parçalanmış talimatlara dayalı simülasyon türleri. Tam bir promt, daha küçük parçalara bölünebilir ve ardından ya tek dönüş (Tam, Concat) ya da çoklu dönüş (Parçalanmış, Özet, Kar) sohbetlerini simüle etmek için kullanılabilir, bilginin ne kadar hızlı açıklanmasına bağlı olarak.

Parçalanmış talimatlara dayalı simülasyon türleri. Tam bir promt, daha küçük parçalara bölünebilir ve ardından ya tek dönüş (Tam, Concat) ya da çoklu dönüş (Parçalanmış, Özet, Kar) sohbetlerini simüle etmek için kullanılabilir, bilginin ne kadar hızlı açıklanmasına bağlı olarak.

Görevler ve Ölçütler

Altı görev, hem programlama hem de doğal dil alanlarını kapsamak için seçilmiştir: kod oluşturma promt’ları HumanEval ve LiveCodeBench‘ten alınmıştır; Metin-SQL sorguları Spider‘den sağlanmıştır; API çağrıları Berkeley Function Calling Leaderboard verilerini kullanarak oluşturulmuştur; temel matematik problemleri GSM8K tarafından sağlanmıştır; tablo başlıkları görevleri ToTTo‘ya dayanmaktadır; ve çok belge özetleri Summary of a Haystack veri setinden alınmıştır.

Model performansı, üç temel ölçüt kullanılarak ölçülmüştür: ortalama performans, yetenek ve güvensizlik.

Ortalama performans bir modelin genel performansı; yetenek en iyi sonuçları yansıtır; ve güvensizlik sonuçların ne kadar değiştiğini ölçer, daha büyük boşluklar daha az稳 bir davranışı gösterir.

Tüm puanlar, görevler arasında tutarlılığı sağlamak için 0-100 ölçeğine yerleştirilmiştir ve her talimat için hesaplanmış, ardından genel model performansı için ortalamaya alınmıştır.

Deneylerde kullanılan altı parçalanmış görev, hem programlama hem de doğal dil oluşturmayı kapsar. Her görev, tam bir talimat ve parçalanmış versiyonu ile gösterilir. Her görev için 90 ila 120 talimat, ilgili benchmark'lerden uyarlanmıştır.

Deneylerde kullanılan altı parçalanmış görev, hem programlama hem de doğal dil oluşturmayı kapsar. Her görev, tam bir talimat ve parçalanmış versiyonu ile gösterilir. Her görev için 90 ila 120 talimat, ilgili benchmark’lerden uyarlanmıştır.

Rakipler ve Testler

İlk simülasyonlarda (tahmini maliyeti 5000 dolar), altı görevi kapsayan 600 talimat parçalandı ve üç sohbet tipini simüle etmek için kullanıldı: tam, concat ve parçalanmış. Her model, talimat ve simülasyon türü kombinasyonu için on sohbet çalıştırıldı, toplamda 200.000’den fazla simülasyon üretildi – bu, genel performansı ve daha derin yetenek ve güvenilirlik ölçümlerini yakalamayı mümkün kılan bir şema.
On beş model test edilmiştir, çeşitli sağlayıcılar ve mimariler arasında yayılmışlardır: OpenAI modelleri GPT-4o (versiyon 2024-11-20), GPT-4o-mini (2024-07-18), GPT-4.1 (2025-04-14) ve düşünme modeli o3 (2025-04-16).

Anthropic modelleri Claude 3 Haiku (2024-03-07) ve Claude 3.7 Sonnet (2025-02-19), Amazon Bedrock aracılığıyla erişilmiştir.

Google, Gemini 2.5 Flash (önizleme-04-17) ve Gemini 2.5 Pro (önizleme-03-25) katkıda bulunmuştur. Meta modelleri Llama 3.1-8B-Instruct ve Llama 3.3-70B-Instruct idi, ayrıca Llama 4 Scout-17B-16E, Together AI aracılığıyla erişilmiştir.

Diğer girişler OLMo 2 13B, Phi-4 ve Command-A idi, hepsi Ollama veya Cohere API aracılığıyla yerel olarak erişilmiştir; ve Deepseek-R1, Amazon Bedrock aracılığıyla erişilmiştir.

İki ‘düşünme’ modeli (o3 ve R1) için, token limitleri 10.000’e çıkarıldı, daha uzun akıl zincirlerini barındırmak için:

Altı görevde her model için ortalama performans puanları: kod, veritabanı, eylemler, veri-metne, matematik ve özet. Sonuçlar, üç simülasyon tipi için verilmiştir: tam, concat ve parçalanmış. Modeller, tam ayarındaki ortalama puanlarına göre sıralanmıştır. Gölgelendirme, tam ayardan parçalanmış ve concat ayarlarına göre performans düşüşünün derecesini yansıtır.

Altı görevde her model için ortalama performans puanları: kod, veritabanı, eylemler, veri-metne, matematik ve özet. Sonuçlar, üç simülasyon tipi için verilmiştir: tam, concat ve parçalanmış. Modeller, tam ayarındaki ortalama puanlarına göre sıralanmıştır. Gölgelendirme, tam ayardan parçalanmış ve concat ayarlarına göre performans düşüşünün derecesini yansıtır.

Bu sonuçlarla ilgili olarak, yazarlar şunları belirtirler†:

‘Genel olarak, her model, her görevde FULL ve SHARDED performansını karşılaştırdığında performansını düşürür, ortalama %39’luk bir bozulma ile. Bunu Sohbetin İçinde Kaybolma olarak adlandırıyoruz: laboratuvar ortamındaki, tek dönüşlü sohbetlerde mükemmel (90%+ ) performans gösteren modeller, aynı görevlerde daha gerçekçi, underspecified ve çoklu dönüşlü bir ortamda mücadele eder.’

Concat puanları, tam puanlarının ortalama %95’ini gösterdi, bu da parçalanmış ayardaki performans düşüşünün bilgi kaybından kaynaklanmadığını gösterdi. Daha küçük modeller, chẳng hạn Llama3.1-8B-Instruct, OLMo-2-13B ve Claude 3 Haiku, concat altında daha belirgin bir bozulma gösterdi, bu da daha küçük modellerin daha büyüklerden daha az robust olduğunu ve yeniden ifadeye karşı daha duyarlı olduğunu gösterdi.

Yazarlar gözlemlediler†:

‘Şaşırtıcı bir şekilde, daha iyi performans gösteren modeller (Claude 3.7 Sonnet, Gemini 2.5, GPT-4.1) küçük modeller (Llama3.1-8B-Instruct, Phi-4) ile aynı şekilde sohbetin içinde kaybolur, ortalama %30-40’luk bir bozulma ile. Bu kısmen ölçüt tanımlarından kaynaklanmaktadır. Daha küçük modeller FULL ayarda daha düşük mutlak puanlar elde ettiğinden, daha iyi modellerinkine kıyasla daha az bozulma payı vardır. ‘

‘Kısaca, tek dönüş performansının ne kadar güçlü olursa olsun, çoklu dönüş ayarında büyük performans düşüşleri gözlemliyoruz.’

İlk test, bazı modellerin belirli görevlerde daha iyi performans gösterdiğini gösterdi: Command-A, eylemlerde; Claude 3.7 Sonnet ve GPT-4.1, kodda; ve Gemini 2.5 Pro, veri-metne görevinde. Akıl yürütme modelleri gibi o3 ve Deepseek-R1, genel olarak daha iyi performans göstermedi, muhtemelen daha uzun cevapları nedeniyle daha fazla varsayımla sohbeti karıştırıyorlardı.

Güvenilirlik

Tek dönüş simülasyonlarında açık olan yetenek ve güvenilirlik arasındaki ilişki, çoklu dönüş koşullarında bozuldu. Yetenek yalnızca mütevazı bir şekilde düştü, ancak güvensizlik ikiye katlandı ortalama olarak. GPT-4.1 ve Gemini 2.5 Pro gibi modeller, tam formatlı promt’lar için stabilken, talimat parçalandığında daha zayıf modeller gibi Llama3.1-8B-Instruct veya OLMo-2-13B kadar tutarsız hale geldi.

Kutu grafiği (a) yetenek ve güvensizliği gösterir, ardından 15 modelle yapılan deneylerin güvenirlik sonuçları (b) ve parçalama testinin sonuçları (c), talimatlar bir ila sekiz parçaya bölünmüştür.

Kutu grafiği (a) yetenek ve güvensizliği gösterir, ardından 15 modelle yapılan deneylerin güvenirlik sonuçları (b) ve parçalama testinin sonuçları (c), talimatlar bir ila sekiz parçaya bölünmüştür.

Model cevapları, aynı görevde bile %50 puan kadar değişebiliyordu, hiçbir yeni bilgi eklendiğinde bile, performans düşüşünün yetenek eksikliğinden değil, modelin sohbet boyunca giderek daha da istikrarsız hale gelmesinden kaynaklandığını gösteriyor.

Makalede† şöyle denir:

‘[İyi] modeller slightly daha yüksek çoklu dönüş yeteneğine sahip olsa da, tüm test ettiğimiz modeller çoklu dönüş, underspecified ayarlarında çok yüksek güvensizlik düzeyleri gösterir. Başka bir deyişle, çoklu dönüşte, sabit bir talimat için en iyi ve en kötü simüle edilmiş çalıştırma arasında %50 puanlık bir performans düşüşü gözlemliyoruz.’

Parçalama sayısının arttıkça güvensizlik de arttı, çoklu dönüş ayarlarında hatta küçük artışların modelleri daha da istikrarsız hale getirdiğini doğruladı. Yetenek büyük ölçüde değişmedi, sorunların tutarlılık rather than yetenek olduğunu gösterdi.

Sıcaklık Kontrolü

Ayrı bir dizi deney, güvensizliğin yalnızca rastgelelikten kaynaklanıp kaynaklanmadığını test etti. Bunu yapmak için, yazarlar asistan ve kullanıcı simülatörünün sıcaklık ayarını üç değer üzerinden değiştirdiler: 1.0, 0.5 ve 0.0.

Tek dönüş formatlarında, tam ve concat, asistanın sıcaklık ayarını azaltmak, güvenirliği önemli ölçüde iyileştirdi, varyasyonu %80’e kadar azalttı; ancak parçalanmış ayarda aynı müdahale etkisiz kaldı:

Farklı asistan ve kullanıcı simülatörü sıcaklık ayarlarının kombinasyonları için güvensizlik puanları, tam, concat ve parçalanmış ayarları için, daha düşük değerler daha tutarlı cevapları gösterir.

Farklı asistan ve kullanıcı simülatörü sıcaklık ayarlarının kombinasyonları için güvensizlik puanları, tam, concat ve parçalanmış ayarları için, daha düşük değerler daha tutarlı cevapları gösterir.

Hatta asistan ve kullanıcı simülatörünün her ikisinin sıcaklık ayarını sıfıra ayarladığında bile, güvensizlik yüksek kaldı, GPT-4o %30’luk bir varyasyon gösterdi, çoklu dönüş sohbetlerindeki istikrarsızlığın yalnızca stokastik gürültü değil, modellerin parçalanmış girişi işleme şeklindeki yapısal bir zayıflık olduğunu gösteriyor.

Ön Görüler

Yazarlar, bulgularının sonuçlarını makalenin sonunda uzun bir şekilde tartışır, güçlü tek dönüş performansı, gerçek dünya hazır oluşunu garanti etmediğini ve tam olarak belirtilen benchmark’lerin, daha doğal, parçalanmış etkileşimlerdeki dengesizliği maskelediğini uyarır.

Ayrıca, güvensizliğin yalnızca bir örnek alma artifactı değil, temel bir sınırlama olduğunu, modellerin gelişen girişi nasıl işlediğine ilişkin olarak öne sürerler ve bu durumun, sürekli akıl yürütme boyunca güvenirlik gerektiren ajan çerçeveleri için endişe verici olduğunu belirtirler.

Son olarak, çoklu dönüş yeteneğinin LLM’lerin temel bir yetenek olarak ele alınması gerektiğini, dış sistemlere devredilmemesi gerektiğini savunurlar.

Yazarlar, sonuçlarının aslında güvensizlik sorununun gerçek ölçeğini alttahmin ettiğini belirtirler ve deneysel koşulların idealliğini vurgularlar: kullanıcı simülatörleri, talimata ve sohbet geçmişine tam erişimine sahipti ve parçaları optimal bir sırayla açıkladı, asistana gerçek dünya kullanımında genellikle olmayan bir bağlam sağladı.

Ayrıca, asistan her dönüşten sonra derhal değerlendirildi, sohbetin tam olarak gelişmesinden önce, bu da sonraki karışıklık veya self-çelişkiyi cezalandırmaya engel oldu, bu da performansı daha da kötüleştirecekti. Bu seçimler, deneysel kontrol için gerekli olsalar da, güvensizlik boşluklarının rapor edilenlardan daha büyük olabileceğini意味 eder.

Sonuç olarak:

‘[Yürütülen] simülasyonların, LLM’lerin çoklu dönüş yetenekleri için bir benzin testi olduğunu düşünüyoruz. Simülasyonların aşırı basitleştirilmiş koşulları nedeniyle, LLM’lerin güvenirliği konusunda gözlemlenen bozulmanın, gerçek dünya ayarlarında LLM’lerin sohbetin içinde kaybolma sıklığının bir tahmini olduğunu düşünüyoruz.‘

Sonuç

LLM’lerle önemli zaman geçiren herkes, bu sorunları pratik deneyimlerden tanıyacaktır; ve çoğumuz, umutsuzca bir LLM sohbetini bırakıp yeni bir tanesini başlatarak, LLM’nin ‘yeniden başlaması’ ve artan olarak sinir bozucu bir değişimden kurtulmasını umarak, içgüdüsel olarak yapmıştır.

İlginçtir, probleme daha fazla bağlam eklemek, sorunu aslında çözmediği gibi, makalenin daha fazla soru sorduğunu ve cevapları aslında sunmadığını gözlemlemektedir.

 

* Şaşırtıcı bir şekilde, bu, AI’de parçalanmanın geleneksel anlamı ile ilgili değildir.

† Yazarların kendi vurgulamaları.

İlk olarak 12 Mayıs 2025 Pazartesi günü yayınlandı

Makine öğrenimi üzerine yazar, insan görüntüsü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başıydı, DNEG'in Brahma.ai'ye çözülene kadar.
Web Sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai