Andersonâun AÃ§ÄąsÄą
Diller Neden Sohbetlerde Kaybolur

Microsoft Research ve Salesforceâtan yeni bir makale, nawet en yetenekli BÞyÞk Dil Modelleri (LLMâler) bile, talimatlar tek seferde deÄil de aÅamalÄą olarak verildiÄinde parçalanÄąr. Yazarlar, bir.promptÄąn birden fazla dÃķnÞÅte bÃķlÞndÞÄÞnde performansÄąn ortalama %39 oranÄąnda dÞÅtÞÄÞnÞ buldular:

Tek bir dÃķnÞÅte sohbet (solda) en iyi sonuçlarÄą verir, ancak son kullanÄącÄą için doÄaldÄąr. Ãoklu dÃķnÞŠsohbeti (saÄda) ise en yÞksek sÄąralamaya sahip ve en iyi performans gÃķsteren LLMâlerin bile sohbetin etkili momentumunu kaybetmesine neden olur. Kaynak: https://arxiv.org/pdf/2505.06120
Daha çarpÄącÄą olan, gÞvenilirlik cevaplarda ciddi bir dÞÅÞŠyaÅar, prestijli modeller gibi ChatGPT-4.1 ve Gemini 2.5 Pro aynÄą gÃķrevi nasÄąl ifade edildiÄine baÄlÄą olarak neredeyse mÞkemmel cevaplar ve bariz baÅarÄąsÄązlÄąklar arasÄąnda sallanÄąr; ayrÄąca, Ã§ÄąktÄą tutarlÄąlÄąÄÄą processo boyunca yarÄąsÄąndan fazla dÞÅebilir.
Bu davranÄąÅÄą araÅtÄąrmak için, makale parçalama* adlÄą bir yÃķntem tanÄątÄąlÄąr, bu yÃķntem tam olarak belirtilen promtâlarÄą daha kÞçÞk parçalara ayÄąrÄąr ve bunlarÄą sohbetin içine birer birer bÄąrakÄąr.
En temel anlamda, bu bir restoranda kohezif ve kapsamlÄą bir sipariÅ vermeye benzer; ya da meseleyi iÅbirliÄi içinde ele almaya benzer:

İki aÅÄąrÄą restoran sohbeti (yeni makalede yer almayan, yalnÄązca aÃ§Äąklama amacÄąyla kullanÄąlan)
Ãrnekte, mÞÅteri belki de olumsuz bir ÄąÅÄąkta gÃķrÞnÞr. Ancak ikinci sÞtundaki temel fikir, bir problem setini aÃ§Äąklamadan Ãķnce bir iÅlem içi deÄiÅimdir â apparently bir problemi ele alma için mantÄąklÄą ve makul bir yol.
Bu kurulum, yeni çalÄąÅmanÄąn damla damla, parçalanmÄąÅ LLM etkileÅimine yansÄąyan bir yapÄądÄąr. Yazarlar, LLMâlerin genellikle çok uzun cevaplar ÞrettiÄini ve sonra da yanlÄąÅ veya alakasÄąz olduklarÄąnÄą kanÄątlanan kendi içgÃķrÞlerine gÞvenmeye devam ettiklerini belirtirler. Bu eÄilim, diÄer faktÃķrlerle birlikte, sistemin tÞm deÄiÅimi takip edemez hale gelmesine neden olabilir.
AslÄąnda, araÅtÄąrmacÄąlar, birçok kiÅinin deneyimsel olarak bulduÄu Åeyi not eder â LLMâlerle sohbeti geri getirmenin en iyi yolu, aynÄą bilgileri tekrarlayan yeni bir sohbet baÅlatmaktÄąr.
âLLMâyle bir sohbet beklenen sonuçlara yol açmadÄąysa, aynÄą bilgileri tekrarlayan yeni bir sohbet baÅlatmak, devam eden bir sohbeti sÞrdÞrmekten çok daha iyi sonuçlar getirebilir.
âBu, çÞnkÞ mevcut LLMâler sohbetin içinde kaybolabilir ve deneylerimiz, modelle bir sohbeti sÞrdÞrmenin etkisiz olduÄunu gÃķsterir. AyrÄąca, LLMâlerin metin Þretimi rastgele olduÄu için, yeni bir sohbet daha iyi sonuçlar getirebilir.â
Yazarlar, agentic sistemlerin, ÃķrneÄin Autogen veya LangChain, sonuçlarÄą iyileÅtirebileceÄini, son kullanÄącÄąya maruz kalmadan âparçalanmÄąÅâ cevaplarÄą birleÅtirmek için interpretatif katmanlar olarak hareket edebileceÄini kabul ederler.
Ancak yazarlar, ayrÄą bir soyutlama katmanÄąnÄąn gerekli olmadÄąÄÄąnÄą veya kaynak LLMâye doÄrudan entegre edilmelidir:
âÃoklu dÃķnÞŠÃķzellikleri LLMâlerin gerekli bir ÃķzelliÄi deÄildir, çÞnkÞ bunlar ajan çerçevesine devredilebilir. DiÄer bir deyiÅle, LLMâlerde yerel çoklu dÃķnÞŠdesteÄine ihtiyacÄąmÄąz var mÄą, yoksa bir ajan çerçevesi kullanÄącÄąlarla etkileÅimi dÞzenleyebilir ve LLMâleri yalnÄązca tek dÃķnÞŠoperatÃķrleri olarak kullanabilir miyiz?âĶâ
Ancak bu Ãķnermeyi çeÅitli Ãķrnekler boyunca test ettikten sonra, ÅÃķyle sonuca varÄąrlar:
â[Ajan benzeri bir çerçeveye dayanmak] sÄąnÄąrlayÄącÄą olabilir ve LLMâlerin yerel olarak çoklu dÃķnÞŠetkileÅimini desteklemesi gerektiÄini savunuyoruz.â
Bu ilginç yeni makale, LLMâler Ãoklu DÃķnÞÅte Sohbetin İçinde Kaybolur olarak adlandÄąrÄąlÄąr ve Microsoft Research ve Salesforceâtan dÃķrt araÅtÄąrmacÄą tarafÄąndan gelir,
ParçalanmÄąÅ Sohbetler
Yeni yÃķntem, geleneksel tek dÃķnÞŠtalimatlarÄąnÄą sohbet sÄąrasÄąnda kritik anlarda tanÄątÄąlacak daha kÞçÞk parçalara ayÄąrÄąr, bu yapÄą, ChatGPT veya Google Gemini gibi sistemlerde gÃķrÞlen keÅifçi, ileri geri etkileÅim tarzÄąnÄą yansÄątÄąr.
Her orijinal talimat, tÞm gÃķrevi bir kerede teslim eden tek, kendi içinde yeterli bir promttur ve yÞksek dÞzeyde bir soru, destekleyici baÄlam ve ilgili koÅullarÄą birleÅtirir. ParçalanmÄąÅ versiyon, bunu birden fazla kÞçÞk parçaya ayÄąrÄąr ve her parça yalnÄązca bir bilgi parçasÄąnÄą ekler:

Tam bir promtun (a) tek bir dÃķnÞÅte teslim edildiÄi ve (b) underspecified, çoklu dÃķnÞŠetkileÅimini simÞle etmek için kullanÄąlan parçalanmÄąÅ versiyonu gÃķsteren çift talimatlar. Anlamsal olarak, her iki versiyon da aynÄą bilgilendirme yÞkÞnÞ taÅÄąr.
İlk parça her zaman gÃķrevin ana amacÄąnÄą tanÄątÄąr, geri kalanÄą aÃ§ÄąklamalÄą ayrÄąntÄąlarÄą saÄlar. Birlikte, orijinal promtla aynÄą içeriÄi teslim ederler, ancak sohbetin içinde doÄal olarak birkaç dÃķnÞŠboyunca daÄÄątÄąlmÄąÅlardÄąr.
Her simÞle sohbet, asistan, deÄerlendirilen model; kullanÄącÄą, parçalanmÄąÅ formdaki tam talimata eriÅimi olan simÞle bir ajan; ve sistem, deÄiÅimi denetleyen ve puanlayan arasÄąnda gerçekleÅir.
Sohbet, kullanÄącÄąnÄąn ilk parçayÄą aÃ§ÄąklamasÄąyla baÅlar ve asistan serbestçe cevap verir. Sistem, bu cevabÄą birkaç kategoriye ayÄąrÄąr, chášģng hᚥn aÃ§Äąklama isteÄi veya tam cevap denemesi.
EÄer model cevap denemesi yaparsa, ayrÄą bir bileÅen yalnÄązca deÄerlendirme için ilgili spanÄą Ã§ÄąkarÄąr, çevreleyen metni gÃķrmezden gelir. Her yeni dÃķnÞÅte, kullanÄącÄą bir parça daha aÃ§Äąklar ve asistan baÅka bir cevap verir. DeÄiÅim, model cevabÄą doÄru verene veya kalan parçalar kalmayana kadar devam eder:

ParçalanmÄąÅ sohbet simÞlasyonunun ÅemasÄą, deÄerlendirilen model kÄąrmÄązÄą olarak vurgulanmÄąÅtÄąr.
Erken testler, modellerin henÞz paylaÅÄąlmamÄąÅ bilgilerin hakkÄąnda soru sorduÄunu gÃķsterdi, bu nedenle yazarlar parçalarÄą sabit bir sÄąrayla aÃ§Äąklama fikrini bÄąraktÄą. Bunun yerine, bir simÞlatÃķr, sohbetin gidiÅatÄąna baÄlÄą olarak hangi parçayÄą aÃ§Äąklamak gerektiÄini kararlaÅtÄąrmak için kullanÄąldÄą.
KullanÄącÄą simÞlatÃķrÞ, GPT-4o-mini kullanÄąlarak uygulandÄą ve tam talimata ve sohbet geçmiÅine tam eriÅimine sahip olup, her dÃķnÞÅte sohbetin geliÅimine baÄlÄą olarak hangi parçayÄą aÃ§Äąklamak gerektiÄini gÃķrevlendirdi.
KullanÄącÄą simÞlatÃķrÞ ayrÄąca her parçayÄą sohbet akÄąÅÄąnÄą korumak için yeniden ifade etti, anlamÄąnÄą deÄiÅtirmeden. Bu, simÞlasyonun gerçek diyaloÄun âver ve alâ tarzÄąnÄą yansÄątmalarÄąna, gÃķrev yapÄąsÄąnÄą kontrol altÄąnda tutarken izin verdi.
Sohbet baÅlamadan Ãķnce, asistana gÃķrevi tamamlamak için gereken temel bilgiler verilir, chášģng hᚥn bir veritabanÄą ÅemasÄą veya API referansÄą. TalimatlarÄąn bÃķlÞneceÄi veya zamanla gÞncelleneceÄi konusunda bilgilendirilmez ve sohbeti ele alma konusunda especÃfik bir yol gÃķsterilmez. Bu, kasÄątlÄą olarak yapÄąlÄąr: gerçek dÞnya kullanÄąmÄąnda, modellere genellikle promtâun eksik veya zamanla gÞncelleneceÄi sÃķylenmez ve bu baÄlamÄą dÄąÅarÄąda bÄąrakmak, simÞlasyonun modelin daha gerçekçi bir baÄlamda nasÄąl davrandÄąÄÄąnÄą yansÄątmaya yardÄąmcÄą olur.
GPT-4o-mini ayrÄąca asistanÄąn cevaplarÄąnÄąn nasÄąl sÄąnÄąflandÄąrÄąlacaÄÄąna ve bu cevaplardan nihai cevaplarÄą nasÄąl Ã§ÄąkaracaÄÄąna karar vermek için kullanÄąldÄą. Bu, simÞlasyonu esnek tuttu, ancak bazen hatalarÄąn ortaya Ã§ÄąkmasÄąna neden oldu: Ancak, birkaç yÞz sohbeti el ile kontrol ettikten sonra, yazarlar, sorunlarÄąn %5âten azÄąnda ortaya Ã§ÄąktÄąÄÄąnÄą ve sonuçta yalnÄązca %2âsinde deÄiÅiklik olduÄunu buldular ve bu, projenin parametreleri içinde kabul edilebilir bir hata oranÄą olarak kabul ettiler.
SimÞlasyon SenaryolarÄą
Yazarlar, model davranÄąÅÄąnÄą farklÄą koÅullarda test etmek için beÅ tÞr simÞlasyon kullanmÄąÅlardÄąr, her biri talimatlarÄąn nasÄąl ve ne zaman aÃ§ÄąklanacaÄÄąnÄąn varyasyonlarÄądÄąr.
Tam ayarÄąnda, model tÞm talimata tek bir dÃķnÞÅte eriÅir. Bu, standart benchmark formatÄąnÄą temsil eder ve performans standardÄą olarak hizmet eder.
ParçalanmÄąÅ ayar, talimatÄą birden fazla parçaya ayÄąrÄąr ve bunlarÄą birer birer teslim eder, daha gerçekçi, underspecified bir sohbeti simÞle eder. Bu, çoklu dÃķnÞŠgiriÅini test etmek için kullanÄąlan ana ayar.
Concat ayarÄąnda, parçalar tekrar birleÅtirilir, ancak dÃķnÞÅe baÄlÄą yapÄąyÄą korur. Bu, sohbetin parçalanmasÄąnÄąn etkilerini, yeniden ifade veya içerik kaybÄąndan ayÄąrmaya yardÄąmcÄą olur.
Ãzet ayarÄą, ParçalanmÄąÅ gibi çalÄąÅÄąr, ancak model nihai cevabÄą vermeden Ãķnce tÞm Ãķnceki parçalarÄą tekrar aÃ§Äąklar. Bu, bir Ãķzet promtunun kaybolan baÄlamÄą geri getirmeye yardÄąmcÄą olup olmadÄąÄÄąnÄą test eder.
Son olarak, Kar daha da ileri gider ve her Ãķnceki parçayÄą her dÃķnÞÅte tekrar eder, sohbet ilerledikçe tÞm talimatÄąn gÃķrÞnÞr olmasÄąnÄą saÄlar â ve çoklu dÃķnÞŠyeteneÄinin daha affedici bir testini sunar.

ParçalanmÄąÅ talimatlara dayalÄą simÞlasyon tÞrleri. Tam bir promt, daha kÞçÞk parçalara bÃķlÞnebilir ve ardÄąndan ya tek dÃķnÞŠ(Tam, Concat) ya da çoklu dÃķnÞŠ(ParçalanmÄąÅ, Ãzet, Kar) sohbetlerini simÞle etmek için kullanÄąlabilir, bilginin ne kadar hÄązlÄą aÃ§ÄąklanmasÄąna baÄlÄą olarak.
GÃķrevler ve ÃlçÞtler
AltÄą gÃķrev, hem programlama hem de doÄal dil alanlarÄąnÄą kapsamak için seçilmiÅtir: kod oluÅturma promtâlarÄą HumanEval ve LiveCodeBenchâten alÄąnmÄąÅtÄąr; Metin-SQL sorgularÄą Spiderâden saÄlanmÄąÅtÄąr; API çaÄrÄąlarÄą Berkeley Function Calling Leaderboard verilerini kullanarak oluÅturulmuÅtur; temel matematik problemleri GSM8K tarafÄąndan saÄlanmÄąÅtÄąr; tablo baÅlÄąklarÄą gÃķrevleri ToTToâya dayanmaktadÄąr; ve çok belge Ãķzetleri Summary of a Haystack veri setinden alÄąnmÄąÅtÄąr.
Model performansÄą, Þç temel ÃķlçÞt kullanÄąlarak ÃķlçÞlmÞÅtÞr: ortalama performans, yetenek ve gÞvensizlik.
Ortalama performans bir modelin genel performansÄą; yetenek en iyi sonuçlarÄą yansÄątÄąr; ve gÞvensizlik sonuçlarÄąn ne kadar deÄiÅtiÄini Ãķlçer, daha bÞyÞk boÅluklar daha azįĻģ bir davranÄąÅÄą gÃķsterir.
TÞm puanlar, gÃķrevler arasÄąnda tutarlÄąlÄąÄÄą saÄlamak için 0-100 ÃķlçeÄine yerleÅtirilmiÅtir ve her talimat için hesaplanmÄąÅ, ardÄąndan genel model performansÄą için ortalamaya alÄąnmÄąÅtÄąr.

Deneylerde kullanÄąlan altÄą parçalanmÄąÅ gÃķrev, hem programlama hem de doÄal dil oluÅturmayÄą kapsar. Her gÃķrev, tam bir talimat ve parçalanmÄąÅ versiyonu ile gÃķsterilir. Her gÃķrev için 90 ila 120 talimat, ilgili benchmarkâlerden uyarlanmÄąÅtÄąr.
Rakipler ve Testler
İlk simÞlasyonlarda (tahmini maliyeti 5000 dolar), altÄą gÃķrevi kapsayan 600 talimat parçalandÄą ve Þç sohbet tipini simÞle etmek için kullanÄąldÄą: tam, concat ve parçalanmÄąÅ. Her model, talimat ve simÞlasyon tÞrÞ kombinasyonu için on sohbet çalÄąÅtÄąrÄąldÄą, toplamda 200.000âden fazla simÞlasyon Þretildi â bu, genel performansÄą ve daha derin yetenek ve gÞvenilirlik ÃķlçÞmlerini yakalamayÄą mÞmkÞn kÄąlan bir Åema.
On beÅ model test edilmiÅtir, çeÅitli saÄlayÄącÄąlar ve mimariler arasÄąnda yayÄąlmÄąÅlardÄąr: OpenAI modelleri GPT-4o (versiyon 2024-11-20), GPT-4o-mini (2024-07-18), GPT-4.1 (2025-04-14) ve dÞÅÞnme modeli o3 (2025-04-16).
Anthropic modelleri Claude 3 Haiku (2024-03-07) ve Claude 3.7 Sonnet (2025-02-19), Amazon Bedrock aracÄąlÄąÄÄąyla eriÅilmiÅtir.
Google, Gemini 2.5 Flash (Ãķnizleme-04-17) ve Gemini 2.5 Pro (Ãķnizleme-03-25) katkÄąda bulunmuÅtur. Meta modelleri Llama 3.1-8B-Instruct ve Llama 3.3-70B-Instruct idi, ayrÄąca Llama 4 Scout-17B-16E, Together AI aracÄąlÄąÄÄąyla eriÅilmiÅtir.
DiÄer giriÅler OLMo 2 13B, Phi-4 ve Command-A idi, hepsi Ollama veya Cohere API aracÄąlÄąÄÄąyla yerel olarak eriÅilmiÅtir; ve Deepseek-R1, Amazon Bedrock aracÄąlÄąÄÄąyla eriÅilmiÅtir.
İki âdÞÅÞnmeâ modeli (o3 ve R1) için, token limitleri 10.000âe Ã§ÄąkarÄąldÄą, daha uzun akÄąl zincirlerini barÄąndÄąrmak için:

AltÄą gÃķrevde her model için ortalama performans puanlarÄą: kod, veritabanÄą, eylemler, veri-metne, matematik ve Ãķzet. Sonuçlar, Þç simÞlasyon tipi için verilmiÅtir: tam, concat ve parçalanmÄąÅ. Modeller, tam ayarÄąndaki ortalama puanlarÄąna gÃķre sÄąralanmÄąÅtÄąr. GÃķlgelendirme, tam ayardan parçalanmÄąÅ ve concat ayarlarÄąna gÃķre performans dÞÅÞÅÞnÞn derecesini yansÄątÄąr.
Bu sonuçlarla ilgili olarak, yazarlar ÅunlarÄą belirtirlerâ :
âGenel olarak, her model, her gÃķrevde FULL ve SHARDED performansÄąnÄą karÅÄąlaÅtÄąrdÄąÄÄąnda performansÄąnÄą dÞÅÞrÞr, ortalama %39âluk bir bozulma ile. Bunu Sohbetin İçinde Kaybolma olarak adlandÄąrÄąyoruz: laboratuvar ortamÄąndaki, tek dÃķnÞÅlÞ sohbetlerde mÞkemmel (90%+ ) performans gÃķsteren modeller, aynÄą gÃķrevlerde daha gerçekçi, underspecified ve çoklu dÃķnÞÅlÞ bir ortamda mÞcadele eder.â
Concat puanlarÄą, tam puanlarÄąnÄąn ortalama %95âini gÃķsterdi, bu da parçalanmÄąÅ ayardaki performans dÞÅÞÅÞnÞn bilgi kaybÄąndan kaynaklanmadÄąÄÄąnÄą gÃķsterdi. Daha kÞçÞk modeller, chášģng hᚥn Llama3.1-8B-Instruct, OLMo-2-13B ve Claude 3 Haiku, concat altÄąnda daha belirgin bir bozulma gÃķsterdi, bu da daha kÞçÞk modellerin daha bÞyÞklerden daha az robust olduÄunu ve yeniden ifadeye karÅÄą daha duyarlÄą olduÄunu gÃķsterdi.
Yazarlar gÃķzlemledilerâ :
âÅaÅÄąrtÄącÄą bir Åekilde, daha iyi performans gÃķsteren modeller (Claude 3.7 Sonnet, Gemini 2.5, GPT-4.1) kÞçÞk modeller (Llama3.1-8B-Instruct, Phi-4) ile aynÄą Åekilde sohbetin içinde kaybolur, ortalama %30-40âluk bir bozulma ile. Bu kÄąsmen ÃķlçÞt tanÄąmlarÄąndan kaynaklanmaktadÄąr. Daha kÞçÞk modeller FULL ayarda daha dÞÅÞk mutlak puanlar elde ettiÄinden, daha iyi modellerinkine kÄąyasla daha az bozulma payÄą vardÄąr. â
âKÄąsaca, tek dÃķnÞŠperformansÄąnÄąn ne kadar gÞçlÞ olursa olsun, çoklu dÃķnÞŠayarÄąnda bÞyÞk performans dÞÅÞÅleri gÃķzlemliyoruz.â
İlk test, bazÄą modellerin belirli gÃķrevlerde daha iyi performans gÃķsterdiÄini gÃķsterdi: Command-A, eylemlerde; Claude 3.7 Sonnet ve GPT-4.1, kodda; ve Gemini 2.5 Pro, veri-metne gÃķrevinde. AkÄąl yÞrÞtme modelleri gibi o3 ve Deepseek-R1, genel olarak daha iyi performans gÃķstermedi, muhtemelen daha uzun cevaplarÄą nedeniyle daha fazla varsayÄąmla sohbeti karÄąÅtÄąrÄąyorlardÄą.
GÞvenilirlik
Tek dÃķnÞŠsimÞlasyonlarÄąnda aÃ§Äąk olan yetenek ve gÞvenilirlik arasÄąndaki iliÅki, çoklu dÃķnÞŠkoÅullarÄąnda bozuldu. Yetenek yalnÄązca mÞtevazÄą bir Åekilde dÞÅtÞ, ancak gÞvensizlik ikiye katlandÄą ortalama olarak. GPT-4.1 ve Gemini 2.5 Pro gibi modeller, tam formatlÄą promtâlar için stabilken, talimat parçalandÄąÄÄąnda daha zayÄąf modeller gibi Llama3.1-8B-Instruct veya OLMo-2-13B kadar tutarsÄąz hale geldi.

Kutu grafiÄi (a) yetenek ve gÞvensizliÄi gÃķsterir, ardÄąndan 15 modelle yapÄąlan deneylerin gÞvenirlik sonuçlarÄą (b) ve parçalama testinin sonuçlarÄą (c), talimatlar bir ila sekiz parçaya bÃķlÞnmÞÅtÞr.
Model cevaplarÄą, aynÄą gÃķrevde bile %50 puan kadar deÄiÅebiliyordu, hiçbir yeni bilgi eklendiÄinde bile, performans dÞÅÞÅÞnÞn yetenek eksikliÄinden deÄil, modelin sohbet boyunca giderek daha da istikrarsÄąz hale gelmesinden kaynaklandÄąÄÄąnÄą gÃķsteriyor.
Makaledeâ ÅÃķyle denir:
â[İyi] modeller slightly daha yÞksek çoklu dÃķnÞŠyeteneÄine sahip olsa da, tÞm test ettiÄimiz modeller çoklu dÃķnÞÅ, underspecified ayarlarÄąnda çok yÞksek gÞvensizlik dÞzeyleri gÃķsterir. BaÅka bir deyiÅle, çoklu dÃķnÞÅte, sabit bir talimat için en iyi ve en kÃķtÞ simÞle edilmiŠçalÄąÅtÄąrma arasÄąnda %50 puanlÄąk bir performans dÞÅÞÅÞ gÃķzlemliyoruz.â
Parçalama sayÄąsÄąnÄąn arttÄąkça gÞvensizlik de arttÄą, çoklu dÃķnÞŠayarlarÄąnda hatta kÞçÞk artÄąÅlarÄąn modelleri daha da istikrarsÄąz hale getirdiÄini doÄruladÄą. Yetenek bÞyÞk ÃķlçÞde deÄiÅmedi, sorunlarÄąn tutarlÄąlÄąk rather than yetenek olduÄunu gÃķsterdi.
SÄącaklÄąk KontrolÞ
AyrÄą bir dizi deney, gÞvensizliÄin yalnÄązca rastgelelikten kaynaklanÄąp kaynaklanmadÄąÄÄąnÄą test etti. Bunu yapmak için, yazarlar asistan ve kullanÄącÄą simÞlatÃķrÞnÞn sÄącaklÄąk ayarÄąnÄą Þç deÄer Þzerinden deÄiÅtirdiler: 1.0, 0.5 ve 0.0.
Tek dÃķnÞŠformatlarÄąnda, tam ve concat, asistanÄąn sÄącaklÄąk ayarÄąnÄą azaltmak, gÞvenirliÄi Ãķnemli ÃķlçÞde iyileÅtirdi, varyasyonu %80âe kadar azalttÄą; ancak parçalanmÄąÅ ayarda aynÄą mÞdahale etkisiz kaldÄą:

FarklÄą asistan ve kullanÄącÄą simÞlatÃķrÞ sÄącaklÄąk ayarlarÄąnÄąn kombinasyonlarÄą için gÞvensizlik puanlarÄą, tam, concat ve parçalanmÄąÅ ayarlarÄą için, daha dÞÅÞk deÄerler daha tutarlÄą cevaplarÄą gÃķsterir.
Hatta asistan ve kullanÄącÄą simÞlatÃķrÞnÞn her ikisinin sÄącaklÄąk ayarÄąnÄą sÄąfÄąra ayarladÄąÄÄąnda bile, gÞvensizlik yÞksek kaldÄą, GPT-4o %30âluk bir varyasyon gÃķsterdi, çoklu dÃķnÞŠsohbetlerindeki istikrarsÄązlÄąÄÄąn yalnÄązca stokastik gÞrÞltÞ deÄil, modellerin parçalanmÄąÅ giriÅi iÅleme Åeklindeki yapÄąsal bir zayÄąflÄąk olduÄunu gÃķsteriyor.
Ãn GÃķrÞler
Yazarlar, bulgularÄąnÄąn sonuçlarÄąnÄą makalenin sonunda uzun bir Åekilde tartÄąÅÄąr, gÞçlÞ tek dÃķnÞŠperformansÄą, gerçek dÞnya hazÄąr oluÅunu garanti etmediÄini ve tam olarak belirtilen benchmarkâlerin, daha doÄal, parçalanmÄąÅ etkileÅimlerdeki dengesizliÄi maskelediÄini uyarÄąr.
AyrÄąca, gÞvensizliÄin yalnÄązca bir Ãķrnek alma artifactÄą deÄil, temel bir sÄąnÄąrlama olduÄunu, modellerin geliÅen giriÅi nasÄąl iÅlediÄine iliÅkin olarak Ãķne sÞrerler ve bu durumun, sÞrekli akÄąl yÞrÞtme boyunca gÞvenirlik gerektiren ajan çerçeveleri için endiÅe verici olduÄunu belirtirler.
Son olarak, çoklu dÃķnÞŠyeteneÄinin LLMâlerin temel bir yetenek olarak ele alÄąnmasÄą gerektiÄini, dÄąÅ sistemlere devredilmemesi gerektiÄini savunurlar.
Yazarlar, sonuçlarÄąnÄąn aslÄąnda gÞvensizlik sorununun gerçek ÃķlçeÄini alttahmin ettiÄini belirtirler ve deneysel koÅullarÄąn idealliÄini vurgularlar: kullanÄącÄą simÞlatÃķrleri, talimata ve sohbet geçmiÅine tam eriÅimine sahipti ve parçalarÄą optimal bir sÄąrayla aÃ§ÄąkladÄą, asistana gerçek dÞnya kullanÄąmÄąnda genellikle olmayan bir baÄlam saÄladÄą.
AyrÄąca, asistan her dÃķnÞÅten sonra derhal deÄerlendirildi, sohbetin tam olarak geliÅmesinden Ãķnce, bu da sonraki karÄąÅÄąklÄąk veya self-çeliÅkiyi cezalandÄąrmaya engel oldu, bu da performansÄą daha da kÃķtÞleÅtirecekti. Bu seçimler, deneysel kontrol için gerekli olsalar da, gÞvensizlik boÅluklarÄąnÄąn rapor edilenlardan daha bÞyÞk olabileceÄiniæåģ eder.
Sonuç olarak:
â[YÞrÞtÞlen] simÞlasyonlarÄąn, LLMâlerin çoklu dÃķnÞŠyetenekleri için bir benzin testi olduÄunu dÞÅÞnÞyoruz. SimÞlasyonlarÄąn aÅÄąrÄą basitleÅtirilmiÅ koÅullarÄą nedeniyle, LLMâlerin gÞvenirliÄi konusunda gÃķzlemlenen bozulmanÄąn, gerçek dÞnya ayarlarÄąnda LLMâlerin sohbetin içinde kaybolma sÄąklÄąÄÄąnÄąn bir tahmini olduÄunu dÞÅÞnÞyoruz.â
Sonuç
LLMâlerle Ãķnemli zaman geçiren herkes, bu sorunlarÄą pratik deneyimlerden tanÄąyacaktÄąr; ve çoÄumuz, umutsuzca bir LLM sohbetini bÄąrakÄąp yeni bir tanesini baÅlatarak, LLMânin âyeniden baÅlamasÄąâ ve artan olarak sinir bozucu bir deÄiÅimden kurtulmasÄąnÄą umarak, içgÞdÞsel olarak yapmÄąÅtÄąr.
İlginçtir, probleme daha fazla baÄlam eklemek, sorunu aslÄąnda çÃķzmediÄi gibi, makalenin daha fazla soru sorduÄunu ve cevaplarÄą aslÄąnda sunmadÄąÄÄąnÄą gÃķzlemlemektedir.
Â
* ÅaÅÄąrtÄącÄą bir Åekilde, bu, AIâde parçalanmanÄąn geleneksel anlamÄą ile ilgili deÄildir.
â YazarlarÄąn kendi vurgulamalarÄą.
İlk olarak 12 MayÄąs 2025 Pazartesi gÞnÞ yayÄąnlandÄą












