Anderson’un AÃ§ÄąsÄą

Diller Neden Sohbetlerde Kaybolur

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
ChatGPT-4o and Adobe Firefly.

Microsoft Research ve Salesforce’tan yeni bir makale, nawet en yetenekli BÞyÞk Dil Modelleri (LLM’ler) bile, talimatlar tek seferde değil de aşamalÄą olarak verildiğinde parçalanÄąr. Yazarlar, bir.promptÄąn birden fazla dÃķnÞşte bÃķlÞndÞğÞnde performansÄąn ortalama %39 oranÄąnda dÞştÞğÞnÞ buldular:

Tek bir dÃķnÞşte sohbet (solda) en iyi sonuçlarÄą verir. Çoklu dÃķnÞş sohbeti (sağda) ise en yÞksek sÄąralamaya sahip ve en iyi performans gÃķsteren LLM'lerin bile sohbetin etkili momentumunu kaybetmesine neden olur. Kaynak: https://arxiv.org/pdf/2505.06120

Tek bir dÃķnÞşte sohbet (solda) en iyi sonuçlarÄą verir, ancak son kullanÄącÄą için doğaldÄąr. Çoklu dÃķnÞş sohbeti (sağda) ise en yÞksek sÄąralamaya sahip ve en iyi performans gÃķsteren LLM’lerin bile sohbetin etkili momentumunu kaybetmesine neden olur. Kaynak: https://arxiv.org/pdf/2505.06120

Daha çarpÄącÄą olan, gÞvenilirlik cevaplarda ciddi bir dÞşÞş yaşar, prestijli modeller gibi ChatGPT-4.1 ve Gemini 2.5 Pro aynÄą gÃķrevi nasÄąl ifade edildiğine bağlÄą olarak neredeyse mÞkemmel cevaplar ve bariz başarÄąsÄązlÄąklar arasÄąnda sallanÄąr; ayrÄąca, Ã§ÄąktÄą tutarlÄąlığı processo boyunca yarÄąsÄąndan fazla dÞşebilir.

Bu davranÄąÅŸÄą araştÄąrmak için, makale parçalama* adlÄą bir yÃķntem tanÄątÄąlÄąr, bu yÃķntem tam olarak belirtilen promt’larÄą daha kÞçÞk parçalara ayÄąrÄąr ve bunlarÄą sohbetin içine birer birer bÄąrakÄąr.

En temel anlamda, bu bir restoranda kohezif ve kapsamlÄą bir sipariş vermeye benzer; ya da meseleyi işbirliği içinde ele almaya benzer:

İki aÅŸÄąrÄą restoran sohbeti (yeni makalede yer almayan, yalnÄązca aÃ§Äąklama amacÄąyla kullanÄąlan)

İki aÅŸÄąrÄą restoran sohbeti (yeni makalede yer almayan, yalnÄązca aÃ§Äąklama amacÄąyla kullanÄąlan)

Örnekte, mÞşteri belki de olumsuz bir ÄąÅŸÄąkta gÃķrÞnÞr. Ancak ikinci sÞtundaki temel fikir, bir problem setini aÃ§Äąklamadan Ãķnce bir işlem içi değişimdir – apparently bir problemi ele alma için mantÄąklÄą ve makul bir yol.

Bu kurulum, yeni çalÄąÅŸmanÄąn damla damla, parçalanmÄąÅŸ LLM etkileşimine yansÄąyan bir yapÄądÄąr. Yazarlar, LLM’lerin genellikle çok uzun cevaplar Þrettiğini ve sonra da yanlÄąÅŸ veya alakasÄąz olduklarÄąnÄą kanÄątlanan kendi içgÃķrÞlerine gÞvenmeye devam ettiklerini belirtirler. Bu eğilim, diğer faktÃķrlerle birlikte, sistemin tÞm değişimi takip edemez hale gelmesine neden olabilir.

AslÄąnda, araştÄąrmacÄąlar, birçok kişinin deneyimsel olarak bulduğu şeyi not eder – LLM’lerle sohbeti geri getirmenin en iyi yolu, aynÄą bilgileri tekrarlayan yeni bir sohbet başlatmaktÄąr.

‘LLM’yle bir sohbet beklenen sonuçlara yol açmadÄąysa, aynÄą bilgileri tekrarlayan yeni bir sohbet başlatmak, devam eden bir sohbeti sÞrdÞrmekten çok daha iyi sonuçlar getirebilir.

‘Bu, çÞnkÞ mevcut LLM’ler sohbetin içinde kaybolabilir ve deneylerimiz, modelle bir sohbeti sÞrdÞrmenin etkisiz olduğunu gÃķsterir. AyrÄąca, LLM’lerin metin Þretimi rastgele olduğu için, yeni bir sohbet daha iyi sonuçlar getirebilir.’

Yazarlar, agentic sistemlerin, Ãķrneğin Autogen veya LangChain, sonuçlarÄą iyileştirebileceğini, son kullanÄącÄąya maruz kalmadan ‘parçalanmÄąÅŸâ€™ cevaplarÄą birleştirmek için interpretatif katmanlar olarak hareket edebileceğini kabul ederler.

Ancak yazarlar, ayrı bir soyutlama katmanının gerekli olmadığını veya kaynak LLM’ye doğrudan entegre edilmelidir:

‘Çoklu dÃķnÞş Ãķzellikleri LLM’lerin gerekli bir Ãķzelliği değildir, çÞnkÞ bunlar ajan çerçevesine devredilebilir. Diğer bir deyişle, LLM’lerde yerel çoklu dÃķnÞş desteğine ihtiyacÄąmÄąz var mÄą, yoksa bir ajan çerçevesi kullanÄącÄąlarla etkileşimi dÞzenleyebilir ve LLM’leri yalnÄązca tek dÃķnÞş operatÃķrleri olarak kullanabilir miyiz?â€Ķ’

Ancak bu Ãķnermeyi çeşitli Ãķrnekler boyunca test ettikten sonra, şÃķyle sonuca varÄąrlar:

‘[Ajan benzeri bir çerçeveye dayanmak] sÄąnÄąrlayÄącÄą olabilir ve LLM’lerin yerel olarak çoklu dÃķnÞş etkileşimini desteklemesi gerektiğini savunuyoruz.’

Bu ilginç yeni makale, LLM’ler Çoklu DÃķnÞşte Sohbetin İçinde Kaybolur olarak adlandÄąrÄąlÄąr ve Microsoft Research ve Salesforce’tan dÃķrt araştÄąrmacÄą tarafÄąndan gelir,

ParçalanmÄąÅŸ Sohbetler

Yeni yÃķntem, geleneksel tek dÃķnÞş talimatlarÄąnÄą sohbet sÄąrasÄąnda kritik anlarda tanÄątÄąlacak daha kÞçÞk parçalara ayÄąrÄąr, bu yapÄą, ChatGPT veya Google Gemini gibi sistemlerde gÃķrÞlen keşifçi, ileri geri etkileşim tarzÄąnÄą yansÄątÄąr.

Her orijinal talimat, tÞm gÃķrevi bir kerede teslim eden tek, kendi içinde yeterli bir promttur ve yÞksek dÞzeyde bir soru, destekleyici bağlam ve ilgili koşullarÄą birleştirir. ParçalanmÄąÅŸ versiyon, bunu birden fazla kÞçÞk parçaya ayÄąrÄąr ve her parça yalnÄązca bir bilgi parçasÄąnÄą ekler:

Tam bir promtun (a) tek bir dÃķnÞşte teslim edildiği ve (b) underspecified, çoklu dÃķnÞş etkileşimini simÞle etmek için kullanÄąlan parçalanmÄąÅŸ versiyonu gÃķsteren çift talimatlar. Anlamsal olarak, her iki versiyon da aynÄą bilgilendirme yÞkÞnÞ taÅŸÄąr.

Tam bir promtun (a) tek bir dÃķnÞşte teslim edildiği ve (b) underspecified, çoklu dÃķnÞş etkileşimini simÞle etmek için kullanÄąlan parçalanmÄąÅŸ versiyonu gÃķsteren çift talimatlar. Anlamsal olarak, her iki versiyon da aynÄą bilgilendirme yÞkÞnÞ taÅŸÄąr.

İlk parça her zaman gÃķrevin ana amacÄąnÄą tanÄątÄąr, geri kalanÄą aÃ§ÄąklamalÄą ayrÄąntÄąlarÄą sağlar. Birlikte, orijinal promtla aynÄą içeriği teslim ederler, ancak sohbetin içinde doğal olarak birkaç dÃķnÞş boyunca dağıtÄąlmÄąÅŸlardÄąr.

Her simÞle sohbet, asistan, değerlendirilen model; kullanÄącÄą, parçalanmÄąÅŸ formdaki tam talimata erişimi olan simÞle bir ajan; ve sistem, değişimi denetleyen ve puanlayan arasÄąnda gerçekleşir.

Sohbet, kullanÄącÄąnÄąn ilk parçayÄą aÃ§ÄąklamasÄąyla başlar ve asistan serbestçe cevap verir. Sistem, bu cevabÄą birkaç kategoriye ayÄąrÄąr, chášģng hᚥn aÃ§Äąklama isteği veya tam cevap denemesi.

Eğer model cevap denemesi yaparsa, ayrÄą bir bileşen yalnÄązca değerlendirme için ilgili spanÄą Ã§ÄąkarÄąr, çevreleyen metni gÃķrmezden gelir. Her yeni dÃķnÞşte, kullanÄącÄą bir parça daha aÃ§Äąklar ve asistan başka bir cevap verir. Değişim, model cevabÄą doğru verene veya kalan parçalar kalmayana kadar devam eder:

ParçalanmÄąÅŸ sohbet simÞlasyonunun şemasÄą, değerlendirilen model kÄąrmÄązÄą olarak vurgulanmÄąÅŸtÄąr.

ParçalanmÄąÅŸ sohbet simÞlasyonunun şemasÄą, değerlendirilen model kÄąrmÄązÄą olarak vurgulanmÄąÅŸtÄąr.

Erken testler, modellerin henÞz paylaÅŸÄąlmamÄąÅŸ bilgilerin hakkÄąnda soru sorduğunu gÃķsterdi, bu nedenle yazarlar parçalarÄą sabit bir sÄąrayla aÃ§Äąklama fikrini bÄąraktÄą. Bunun yerine, bir simÞlatÃķr, sohbetin gidişatÄąna bağlÄą olarak hangi parçayÄą aÃ§Äąklamak gerektiğini kararlaştÄąrmak için kullanÄąldÄą.

KullanÄącÄą simÞlatÃķrÞ, GPT-4o-mini kullanÄąlarak uygulandÄą ve tam talimata ve sohbet geçmişine tam erişimine sahip olup, her dÃķnÞşte sohbetin gelişimine bağlÄą olarak hangi parçayÄą aÃ§Äąklamak gerektiğini gÃķrevlendirdi.

KullanÄącÄą simÞlatÃķrÞ ayrÄąca her parçayÄą sohbet akÄąÅŸÄąnÄą korumak için yeniden ifade etti, anlamÄąnÄą değiştirmeden. Bu, simÞlasyonun gerçek diyaloğun ‘ver ve al’ tarzÄąnÄą yansÄątmalarÄąna, gÃķrev yapÄąsÄąnÄą kontrol altÄąnda tutarken izin verdi.

Sohbet başlamadan Ãķnce, asistana gÃķrevi tamamlamak için gereken temel bilgiler verilir, chášģng hᚥn bir veritabanÄą şemasÄą veya API referansÄą. TalimatlarÄąn bÃķlÞneceği veya zamanla gÞncelleneceği konusunda bilgilendirilmez ve sohbeti ele alma konusunda específik bir yol gÃķsterilmez. Bu, kasÄątlÄą olarak yapÄąlÄąr: gerçek dÞnya kullanÄąmÄąnda, modellere genellikle promt’un eksik veya zamanla gÞncelleneceği sÃķylenmez ve bu bağlamÄą dÄąÅŸarÄąda bÄąrakmak, simÞlasyonun modelin daha gerçekçi bir bağlamda nasÄąl davrandığınÄą yansÄątmaya yardÄąmcÄą olur.

GPT-4o-mini ayrÄąca asistanÄąn cevaplarÄąnÄąn nasÄąl sÄąnÄąflandÄąrÄąlacağına ve bu cevaplardan nihai cevaplarÄą nasÄąl Ã§Äąkaracağına karar vermek için kullanÄąldÄą. Bu, simÞlasyonu esnek tuttu, ancak bazen hatalarÄąn ortaya Ã§ÄąkmasÄąna neden oldu: Ancak, birkaç yÞz sohbeti el ile kontrol ettikten sonra, yazarlar, sorunlarÄąn %5’ten azÄąnda ortaya Ã§ÄąktığınÄą ve sonuçta yalnÄązca %2’sinde değişiklik olduğunu buldular ve bu, projenin parametreleri içinde kabul edilebilir bir hata oranÄą olarak kabul ettiler.

SimÞlasyon SenaryolarÄą

Yazarlar, model davranÄąÅŸÄąnÄą farklÄą koşullarda test etmek için beş tÞr simÞlasyon kullanmÄąÅŸlardÄąr, her biri talimatlarÄąn nasÄąl ve ne zaman aÃ§ÄąklanacağınÄąn varyasyonlarÄądÄąr.

Tam ayarÄąnda, model tÞm talimata tek bir dÃķnÞşte erişir. Bu, standart benchmark formatÄąnÄą temsil eder ve performans standardÄą olarak hizmet eder.

ParçalanmÄąÅŸ ayar, talimatÄą birden fazla parçaya ayÄąrÄąr ve bunlarÄą birer birer teslim eder, daha gerçekçi, underspecified bir sohbeti simÞle eder. Bu, çoklu dÃķnÞş girişini test etmek için kullanÄąlan ana ayar.

Concat ayarÄąnda, parçalar tekrar birleştirilir, ancak dÃķnÞşe bağlÄą yapÄąyÄą korur. Bu, sohbetin parçalanmasÄąnÄąn etkilerini, yeniden ifade veya içerik kaybÄąndan ayÄąrmaya yardÄąmcÄą olur.

Özet ayarÄą, ParçalanmÄąÅŸ gibi çalÄąÅŸÄąr, ancak model nihai cevabÄą vermeden Ãķnce tÞm Ãķnceki parçalarÄą tekrar aÃ§Äąklar. Bu, bir Ãķzet promtunun kaybolan bağlamÄą geri getirmeye yardÄąmcÄą olup olmadığınÄą test eder.

Son olarak, Kar daha da ileri gider ve her Ãķnceki parçayÄą her dÃķnÞşte tekrar eder, sohbet ilerledikçe tÞm talimatÄąn gÃķrÞnÞr olmasÄąnÄą sağlar – ve çoklu dÃķnÞş yeteneğinin daha affedici bir testini sunar.

ParçalanmÄąÅŸ talimatlara dayalÄą simÞlasyon tÞrleri. Tam bir promt, daha kÞçÞk parçalara bÃķlÞnebilir ve ardÄąndan ya tek dÃķnÞş (Tam, Concat) ya da çoklu dÃķnÞş (ParçalanmÄąÅŸ, Özet, Kar) sohbetlerini simÞle etmek için kullanÄąlabilir, bilginin ne kadar hÄązlÄą aÃ§ÄąklanmasÄąna bağlÄą olarak.

ParçalanmÄąÅŸ talimatlara dayalÄą simÞlasyon tÞrleri. Tam bir promt, daha kÞçÞk parçalara bÃķlÞnebilir ve ardÄąndan ya tek dÃķnÞş (Tam, Concat) ya da çoklu dÃķnÞş (ParçalanmÄąÅŸ, Özet, Kar) sohbetlerini simÞle etmek için kullanÄąlabilir, bilginin ne kadar hÄązlÄą aÃ§ÄąklanmasÄąna bağlÄą olarak.

GÃķrevler ve ÖlçÞtler

AltÄą gÃķrev, hem programlama hem de doğal dil alanlarÄąnÄą kapsamak için seçilmiştir: kod oluşturma promt’larÄą HumanEval ve LiveCodeBench‘ten alÄąnmÄąÅŸtÄąr; Metin-SQL sorgularÄą Spider‘den sağlanmÄąÅŸtÄąr; API çağrÄąlarÄą Berkeley Function Calling Leaderboard verilerini kullanarak oluşturulmuştur; temel matematik problemleri GSM8K tarafÄąndan sağlanmÄąÅŸtÄąr; tablo başlÄąklarÄą gÃķrevleri ToTTo‘ya dayanmaktadÄąr; ve çok belge Ãķzetleri Summary of a Haystack veri setinden alÄąnmÄąÅŸtÄąr.

Model performansÄą, Þç temel ÃķlçÞt kullanÄąlarak ÃķlçÞlmÞştÞr: ortalama performans, yetenek ve gÞvensizlik.

Ortalama performans bir modelin genel performansÄą; yetenek en iyi sonuçlarÄą yansÄątÄąr; ve gÞvensizlik sonuçlarÄąn ne kadar değiştiğini Ãķlçer, daha bÞyÞk boşluklar daha azįĻģ bir davranÄąÅŸÄą gÃķsterir.

TÞm puanlar, gÃķrevler arasÄąnda tutarlÄąlığı sağlamak için 0-100 Ãķlçeğine yerleştirilmiştir ve her talimat için hesaplanmÄąÅŸ, ardÄąndan genel model performansÄą için ortalamaya alÄąnmÄąÅŸtÄąr.

Deneylerde kullanÄąlan altÄą parçalanmÄąÅŸ gÃķrev, hem programlama hem de doğal dil oluşturmayÄą kapsar. Her gÃķrev, tam bir talimat ve parçalanmÄąÅŸ versiyonu ile gÃķsterilir. Her gÃķrev için 90 ila 120 talimat, ilgili benchmark'lerden uyarlanmÄąÅŸtÄąr.

Deneylerde kullanÄąlan altÄą parçalanmÄąÅŸ gÃķrev, hem programlama hem de doğal dil oluşturmayÄą kapsar. Her gÃķrev, tam bir talimat ve parçalanmÄąÅŸ versiyonu ile gÃķsterilir. Her gÃķrev için 90 ila 120 talimat, ilgili benchmark’lerden uyarlanmÄąÅŸtÄąr.

Rakipler ve Testler

İlk simÞlasyonlarda (tahmini maliyeti 5000 dolar), altÄą gÃķrevi kapsayan 600 talimat parçalandÄą ve Þç sohbet tipini simÞle etmek için kullanÄąldÄą: tam, concat ve parçalanmÄąÅŸ. Her model, talimat ve simÞlasyon tÞrÞ kombinasyonu için on sohbet çalÄąÅŸtÄąrÄąldÄą, toplamda 200.000’den fazla simÞlasyon Þretildi – bu, genel performansÄą ve daha derin yetenek ve gÞvenilirlik ÃķlçÞmlerini yakalamayÄą mÞmkÞn kÄąlan bir şema.
On beş model test edilmiştir, çeşitli sağlayÄącÄąlar ve mimariler arasÄąnda yayÄąlmÄąÅŸlardÄąr: OpenAI modelleri GPT-4o (versiyon 2024-11-20), GPT-4o-mini (2024-07-18), GPT-4.1 (2025-04-14) ve dÞşÞnme modeli o3 (2025-04-16).

Anthropic modelleri Claude 3 Haiku (2024-03-07) ve Claude 3.7 Sonnet (2025-02-19), Amazon Bedrock aracÄąlığıyla erişilmiştir.

Google, Gemini 2.5 Flash (Ãķnizleme-04-17) ve Gemini 2.5 Pro (Ãķnizleme-03-25) katkÄąda bulunmuştur. Meta modelleri Llama 3.1-8B-Instruct ve Llama 3.3-70B-Instruct idi, ayrÄąca Llama 4 Scout-17B-16E, Together AI aracÄąlığıyla erişilmiştir.

Diğer girişler OLMo 2 13B, Phi-4 ve Command-A idi, hepsi Ollama veya Cohere API aracÄąlığıyla yerel olarak erişilmiştir; ve Deepseek-R1, Amazon Bedrock aracÄąlığıyla erişilmiştir.

İki ‘dÞşÞnme’ modeli (o3 ve R1) için, token limitleri 10.000’e Ã§ÄąkarÄąldÄą, daha uzun akÄąl zincirlerini barÄąndÄąrmak için:

AltÄą gÃķrevde her model için ortalama performans puanlarÄą: kod, veritabanÄą, eylemler, veri-metne, matematik ve Ãķzet. Sonuçlar, Þç simÞlasyon tipi için verilmiştir: tam, concat ve parçalanmÄąÅŸ. Modeller, tam ayarÄąndaki ortalama puanlarÄąna gÃķre sÄąralanmÄąÅŸtÄąr. GÃķlgelendirme, tam ayardan parçalanmÄąÅŸ ve concat ayarlarÄąna gÃķre performans dÞşÞşÞnÞn derecesini yansÄątÄąr.

AltÄą gÃķrevde her model için ortalama performans puanlarÄą: kod, veritabanÄą, eylemler, veri-metne, matematik ve Ãķzet. Sonuçlar, Þç simÞlasyon tipi için verilmiştir: tam, concat ve parçalanmÄąÅŸ. Modeller, tam ayarÄąndaki ortalama puanlarÄąna gÃķre sÄąralanmÄąÅŸtÄąr. GÃķlgelendirme, tam ayardan parçalanmÄąÅŸ ve concat ayarlarÄąna gÃķre performans dÞşÞşÞnÞn derecesini yansÄątÄąr.

Bu sonuçlarla ilgili olarak, yazarlar şunlarÄą belirtirler†:

‘Genel olarak, her model, her gÃķrevde FULL ve SHARDED performansÄąnÄą karÅŸÄąlaştÄąrdığında performansÄąnÄą dÞşÞrÞr, ortalama %39’luk bir bozulma ile. Bunu Sohbetin İçinde Kaybolma olarak adlandÄąrÄąyoruz: laboratuvar ortamÄąndaki, tek dÃķnÞşlÞ sohbetlerde mÞkemmel (90%+ ) performans gÃķsteren modeller, aynÄą gÃķrevlerde daha gerçekçi, underspecified ve çoklu dÃķnÞşlÞ bir ortamda mÞcadele eder.’

Concat puanlarÄą, tam puanlarÄąnÄąn ortalama %95’ini gÃķsterdi, bu da parçalanmÄąÅŸ ayardaki performans dÞşÞşÞnÞn bilgi kaybÄąndan kaynaklanmadığınÄą gÃķsterdi. Daha kÞçÞk modeller, chášģng hᚥn Llama3.1-8B-Instruct, OLMo-2-13B ve Claude 3 Haiku, concat altÄąnda daha belirgin bir bozulma gÃķsterdi, bu da daha kÞçÞk modellerin daha bÞyÞklerden daha az robust olduğunu ve yeniden ifadeye karÅŸÄą daha duyarlÄą olduğunu gÃķsterdi.

Yazarlar gÃķzlemlediler†:

‘ŞaÅŸÄąrtÄącÄą bir şekilde, daha iyi performans gÃķsteren modeller (Claude 3.7 Sonnet, Gemini 2.5, GPT-4.1) kÞçÞk modeller (Llama3.1-8B-Instruct, Phi-4) ile aynÄą şekilde sohbetin içinde kaybolur, ortalama %30-40’luk bir bozulma ile. Bu kÄąsmen ÃķlçÞt tanÄąmlarÄąndan kaynaklanmaktadÄąr. Daha kÞçÞk modeller FULL ayarda daha dÞşÞk mutlak puanlar elde ettiğinden, daha iyi modellerinkine kÄąyasla daha az bozulma payÄą vardÄąr. ‘

‘KÄąsaca, tek dÃķnÞş performansÄąnÄąn ne kadar gÞçlÞ olursa olsun, çoklu dÃķnÞş ayarÄąnda bÞyÞk performans dÞşÞşleri gÃķzlemliyoruz.’

İlk test, bazÄą modellerin belirli gÃķrevlerde daha iyi performans gÃķsterdiğini gÃķsterdi: Command-A, eylemlerde; Claude 3.7 Sonnet ve GPT-4.1, kodda; ve Gemini 2.5 Pro, veri-metne gÃķrevinde. AkÄąl yÞrÞtme modelleri gibi o3 ve Deepseek-R1, genel olarak daha iyi performans gÃķstermedi, muhtemelen daha uzun cevaplarÄą nedeniyle daha fazla varsayÄąmla sohbeti karÄąÅŸtÄąrÄąyorlardÄą.

GÞvenilirlik

Tek dÃķnÞş simÞlasyonlarÄąnda aÃ§Äąk olan yetenek ve gÞvenilirlik arasÄąndaki ilişki, çoklu dÃķnÞş koşullarÄąnda bozuldu. Yetenek yalnÄązca mÞtevazÄą bir şekilde dÞştÞ, ancak gÞvensizlik ikiye katlandÄą ortalama olarak. GPT-4.1 ve Gemini 2.5 Pro gibi modeller, tam formatlÄą promt’lar için stabilken, talimat parçalandığında daha zayÄąf modeller gibi Llama3.1-8B-Instruct veya OLMo-2-13B kadar tutarsÄąz hale geldi.

Kutu grafiği (a) yetenek ve gÞvensizliği gÃķsterir, ardÄąndan 15 modelle yapÄąlan deneylerin gÞvenirlik sonuçlarÄą (b) ve parçalama testinin sonuçlarÄą (c), talimatlar bir ila sekiz parçaya bÃķlÞnmÞştÞr.

Kutu grafiği (a) yetenek ve gÞvensizliği gÃķsterir, ardÄąndan 15 modelle yapÄąlan deneylerin gÞvenirlik sonuçlarÄą (b) ve parçalama testinin sonuçlarÄą (c), talimatlar bir ila sekiz parçaya bÃķlÞnmÞştÞr.

Model cevaplarÄą, aynÄą gÃķrevde bile %50 puan kadar değişebiliyordu, hiçbir yeni bilgi eklendiğinde bile, performans dÞşÞşÞnÞn yetenek eksikliğinden değil, modelin sohbet boyunca giderek daha da istikrarsÄąz hale gelmesinden kaynaklandığınÄą gÃķsteriyor.

Makalede† şÃķyle denir:

‘[İyi] modeller slightly daha yÞksek çoklu dÃķnÞş yeteneğine sahip olsa da, tÞm test ettiğimiz modeller çoklu dÃķnÞş, underspecified ayarlarÄąnda çok yÞksek gÞvensizlik dÞzeyleri gÃķsterir. Başka bir deyişle, çoklu dÃķnÞşte, sabit bir talimat için en iyi ve en kÃķtÞ simÞle edilmiş çalÄąÅŸtÄąrma arasÄąnda %50 puanlÄąk bir performans dÞşÞşÞ gÃķzlemliyoruz.’

Parçalama sayÄąsÄąnÄąn arttÄąkça gÞvensizlik de arttÄą, çoklu dÃķnÞş ayarlarÄąnda hatta kÞçÞk artÄąÅŸlarÄąn modelleri daha da istikrarsÄąz hale getirdiğini doğruladÄą. Yetenek bÞyÞk ÃķlçÞde değişmedi, sorunlarÄąn tutarlÄąlÄąk rather than yetenek olduğunu gÃķsterdi.

SÄącaklÄąk KontrolÞ

AyrÄą bir dizi deney, gÞvensizliğin yalnÄązca rastgelelikten kaynaklanÄąp kaynaklanmadığınÄą test etti. Bunu yapmak için, yazarlar asistan ve kullanÄącÄą simÞlatÃķrÞnÞn sÄącaklÄąk ayarÄąnÄą Þç değer Þzerinden değiştirdiler: 1.0, 0.5 ve 0.0.

Tek dÃķnÞş formatlarÄąnda, tam ve concat, asistanÄąn sÄącaklÄąk ayarÄąnÄą azaltmak, gÞvenirliği Ãķnemli ÃķlçÞde iyileştirdi, varyasyonu %80’e kadar azalttÄą; ancak parçalanmÄąÅŸ ayarda aynÄą mÞdahale etkisiz kaldÄą:

FarklÄą asistan ve kullanÄącÄą simÞlatÃķrÞ sÄącaklÄąk ayarlarÄąnÄąn kombinasyonlarÄą için gÞvensizlik puanlarÄą, tam, concat ve parçalanmÄąÅŸ ayarlarÄą için, daha dÞşÞk değerler daha tutarlÄą cevaplarÄą gÃķsterir.

FarklÄą asistan ve kullanÄącÄą simÞlatÃķrÞ sÄącaklÄąk ayarlarÄąnÄąn kombinasyonlarÄą için gÞvensizlik puanlarÄą, tam, concat ve parçalanmÄąÅŸ ayarlarÄą için, daha dÞşÞk değerler daha tutarlÄą cevaplarÄą gÃķsterir.

Hatta asistan ve kullanÄącÄą simÞlatÃķrÞnÞn her ikisinin sÄącaklÄąk ayarÄąnÄą sÄąfÄąra ayarladığında bile, gÞvensizlik yÞksek kaldÄą, GPT-4o %30’luk bir varyasyon gÃķsterdi, çoklu dÃķnÞş sohbetlerindeki istikrarsÄązlığın yalnÄązca stokastik gÞrÞltÞ değil, modellerin parçalanmÄąÅŸ girişi işleme şeklindeki yapÄąsal bir zayÄąflÄąk olduğunu gÃķsteriyor.

Ön GÃķrÞler

Yazarlar, bulgularÄąnÄąn sonuçlarÄąnÄą makalenin sonunda uzun bir şekilde tartÄąÅŸÄąr, gÞçlÞ tek dÃķnÞş performansÄą, gerçek dÞnya hazÄąr oluşunu garanti etmediğini ve tam olarak belirtilen benchmark’lerin, daha doğal, parçalanmÄąÅŸ etkileşimlerdeki dengesizliği maskelediğini uyarÄąr.

AyrÄąca, gÞvensizliğin yalnÄązca bir Ãķrnek alma artifactÄą değil, temel bir sÄąnÄąrlama olduğunu, modellerin gelişen girişi nasÄąl işlediğine ilişkin olarak Ãķne sÞrerler ve bu durumun, sÞrekli akÄąl yÞrÞtme boyunca gÞvenirlik gerektiren ajan çerçeveleri için endişe verici olduğunu belirtirler.

Son olarak, çoklu dÃķnÞş yeteneğinin LLM’lerin temel bir yetenek olarak ele alÄąnmasÄą gerektiğini, dÄąÅŸ sistemlere devredilmemesi gerektiğini savunurlar.

Yazarlar, sonuçlarÄąnÄąn aslÄąnda gÞvensizlik sorununun gerçek Ãķlçeğini alttahmin ettiğini belirtirler ve deneysel koşullarÄąn idealliğini vurgularlar: kullanÄącÄą simÞlatÃķrleri, talimata ve sohbet geçmişine tam erişimine sahipti ve parçalarÄą optimal bir sÄąrayla aÃ§ÄąkladÄą, asistana gerçek dÞnya kullanÄąmÄąnda genellikle olmayan bir bağlam sağladÄą.

AyrÄąca, asistan her dÃķnÞşten sonra derhal değerlendirildi, sohbetin tam olarak gelişmesinden Ãķnce, bu da sonraki karÄąÅŸÄąklÄąk veya self-çelişkiyi cezalandÄąrmaya engel oldu, bu da performansÄą daha da kÃķtÞleştirecekti. Bu seçimler, deneysel kontrol için gerekli olsalar da, gÞvensizlik boşluklarÄąnÄąn rapor edilenlardan daha bÞyÞk olabileceğini意å‘ģ eder.

Sonuç olarak:

‘[YÞrÞtÞlen] simÞlasyonlarÄąn, LLM’lerin çoklu dÃķnÞş yetenekleri için bir benzin testi olduğunu dÞşÞnÞyoruz. SimÞlasyonlarÄąn aÅŸÄąrÄą basitleştirilmiş koşullarÄą nedeniyle, LLM’lerin gÞvenirliği konusunda gÃķzlemlenen bozulmanÄąn, gerçek dÞnya ayarlarÄąnda LLM’lerin sohbetin içinde kaybolma sÄąklığınÄąn bir tahmini olduğunu dÞşÞnÞyoruz.‘

Sonuç

LLM’lerle Ãķnemli zaman geçiren herkes, bu sorunlarÄą pratik deneyimlerden tanÄąyacaktÄąr; ve çoğumuz, umutsuzca bir LLM sohbetini bÄąrakÄąp yeni bir tanesini başlatarak, LLM’nin ‘yeniden başlaması’ ve artan olarak sinir bozucu bir değişimden kurtulmasÄąnÄą umarak, içgÞdÞsel olarak yapmÄąÅŸtÄąr.

İlginçtir, probleme daha fazla bağlam eklemek, sorunu aslÄąnda çÃķzmediği gibi, makalenin daha fazla soru sorduğunu ve cevaplarÄą aslÄąnda sunmadığınÄą gÃķzlemlemektedir.

 

* ŞaÅŸÄąrtÄącÄą bir şekilde, bu, AI’de parçalanmanÄąn geleneksel anlamÄą ile ilgili değildir.

† Yazarların kendi vurgulamaları.

İlk olarak 12 MayÄąs 2025 Pazartesi gÞnÞ yayÄąnlandÄą

Makine Ãķğrenimi Þzerine yazar, insan gÃķrÞntÞ sentezi alanÄąnda uzman. Metaphysic.ai'de araştÄąrma içeriği başkanÄą, DNEG'nin Brahma.ai'ye dÃķnÞşÞmÞne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: [email protected]