Anderson’un Açısı

Unutkan AI’ı Daha Uzun Süre ‘O Kadar Tut’ öğretmek

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
AI-generated image: A robot with ChatGPT logo at laptop, with vice on open head and glowing text emerging from head. GPT-image-1.

Dil modelleri genellikle bir konuşmanın başlangıcını hatırlayamaz. Yeni bir metin sıkıştırma yöntemi bunu değiştirebilir ve AI sohbet oturumlarını çok daha az sinir bozucu hale getirebilir.

 

ChatGPT gibi konuşma AI sistemleri genellikle konuşmanın önceki kısımlarını takip edemez, kendilerini tekrar eder veya önceden kabul edilen kuralları göz ardı eden cevaplar verir.

Bu, Büyük Dil Modellerinin (LLM’ler) sınırlı bir odaklanma yeteneğine sahip olmasından kaynaklanmaktadır, bu da bir ‘bağlam penceresi’ olarak tanımlanır – doğrudan hedeflendiği ve birkaç komşu nesneyi aydınlatan bir fener gibi.

Bu ‘unutkan’ eğilimlerin düzeltilmesi, dil tabanlı AI modelleri araştırmalarının en önemli yönlerinden birisidir – özellikle bu sendrom faydalı ve tutarlı çok tur konuşmalarının olasılığını ciddi şekilde sınırlar ve LLM’lerin tıbbi ve hukuki gibi doğruluk açısından kritik bağlamlardaki yararlılığını engeller.

Çok İyi Yapmak

Çin’den yeni bir araştırma , AI modeli çalıştıran bir GPU’nun sınırlı kaynaklarına çok daha fazla metin sığdırmanın yeni bir yöntemini öneriyor – 20 katlık bir sıkıştırma gelişmesi elde edilerek %98 doğruluk sağlanıyor;

Bağlam Cascade Sıkıştırma, uzun belgeleri optik sıkıştırma yöntemleri gibi DeepSeek-OCR'den daha doğru bir şekilde yeniden oluşturur, hatta girişi kırk kata kadar küçültse bile. Belge uzunlukları ve sıkıştırma ayarları boyunca, yeni yöntem neredeyse mükemmel bir doğruluk sağlar, optik yaklaşım ise daha yüksek sıkıştırma altında keskin bir şekilde bozulur.

Bağlam Cascade Sıkıştırma, uzun belgeleri optik sıkıştırma yöntemleri gibi DeepSeek-OCR’den daha doğru bir şekilde yeniden oluşturur, hatta girişi kırk kata kadar küçültse bile. Belge uzunlukları ve sıkıştırma ayarları boyunca, yeni yöntem neredeyse mükemmel bir doğruluk sağlar, optik yaklaşım ise daha yüksek sıkıştırma altında keskin bir şekilde bozulur. Kaynak

Bu, çok uzun bir konuşmanın tümü, aralıklarla AI modelinin bağlam penceresine geri enjekte edilebilir ve bu da LLM’nin normalde önceki gerçekleri unutması ve ‘unutkan’ davranışa sürüklenmesiyle oluşan sorunları çözebilir.

Bu, lossy bir sıkıştırma yöntemi olmasına rağmen, kaybın meydana geldiği şekilde bile faydalıdır: yeni yöntemde, bellek, cümlelerin sonunda bozulur, DeepSeek-OCR mimarisiyle ilham alınan önceki yaklaşımda olduğu gibi eşit olarak dağılmaz; aslında, yeni makaleyi hazırlayan araştırmacılar, yöntemlerinin insan belleği gibi bozulduğunu öne sürüyorlar:

Üstte, insan belleği veri akışının sonunda bozulur; ortada: DeepSeek-OCR rastgele bir şekilde bozulur ve sorunu çözmeye yardımcı olabilecek hiçbir bağlantı bırakmaz; altta: yeni yöntem, insan belleği gibi veri akışının sonuna doğru bozulur ve doğruluğu artırma için post-facto işleme yardımcı olabilecek işaretler sunar.

Üstte, insan belleği veri akışının sonunda bozulur; ortada: DeepSeek-OCR rastgele bir şekilde bozulur ve sorunu çözmeye yardımcı olabilecek hiçbir bağlantı bırakmaz; altta: yeni yöntem, insan belleği gibi veri akışının sonuna doğru bozulur ve doğruluğu artırma için post-facto işleme yardımcı olabilecek işaretler sunar.

Bu, hatırlanan verilerin nerede daha az güvenilir olabileceğini öngörmeyi sağlar ve bu bilgiyi sorunu çözmek için kullanabilir – potansiyel olarak, konuşma hatırlama ve tutarlılık açısından büyük bir gelişme sunar ve düzeltme之后 %100 doğruluk sağlar.

Yeni yaklaşım, Context Cascade Sıkıştırma (C3) olarak adlandırılır ve DeepSeek-OCR’nin metni görüntülere sıkıştırdığı şekilde ilham alır. Ancak, uzun metinleri doğrudan küçük ve büyük dil modelleri kullanarak latent gömme olarak sıkıştıran yeni yaklaşım, raster görüntülerinin neden olduğu sürtünmeyi ortadan kaldırır ve böylelikle gelişmiş bir performans sağlar.

Makalede denir:

‘C3’ün üstün performansı, temel mimari tasarımına atfedilebilir. DeepSeek-OCR analizi, performans düşüşünün “karmaşık düzen” ve “düşük çözünürlükte görüntü bulanıklığı” gibi faktörlerden kaynaklandığını varsayar – optik yolun doğuştan sınırlamaları.’

‘C3 paradigmamız, doğrudan metin alanında çalışarak, bu görsel-alan artifactlerine tamamen bağışık. Metni piksellere dönüştürme ve bu pikselleri kodlama ile ilgili bilgi kaybını önler. Bunun yerine, önceden eğitilmiş bir LLM’nin güçlü semantik anlayışını, metin bilgisini verimli bir latent temsil içine damıtmak için kullanır.’

Yeni makale, Context Cascade Sıkıştırma: Metin Sıkıştırmasının Üst Sınırını Araştırma olarak adlandırılır ve iki yazar tarafından gelir, bunlar aynı zamanda C3’ü GitHub’da açık kaynak olarak sunuyorlar.

Yöntem

Yeni yaklaşımı anlamak için, bu fikir nereden geldiğini bilmek faydalıdır: optik karakter tanıma (OCR).

OCR, bir bilgisayar programının, raster metnini (yani, görüntüler içindeki metin, seçilemeyen ve sadece fotoğrafik içerik olarak var olan metin) düzenlenebilir metne dönüştüren bir algoritmik yöntemdir.

DeepSeek-OCR’nin yaratıcıları, metni OCR’nin aracı aşaması olarak kullanarak, standart boru hatlarından çok daha fazla metni sıkıştırabileceğini keşfettiler: diğer bir deyişle, metni kendisi sıkıştırmak yerine, metnin rasterleştirilmiş bir versiyonunu sıkıştırmak mümkün oldu;

DeepSeek-OCR yayın makalesinden, OCR bileşeni olan 16x16'lık rasterleştirilmiş yamalar içeren sıkıştırma pipeline şeması. Kaynak [ https://arxiv.org/pdf/2510.18234 ]

DeepSeek-OCR yayın makalesinden, OCR bileşeni olan 16×16’lık rasterleştirilmiş yamalar içeren sıkıştırma pipeline şeması. Kaynak

Yeni makale, optik yaklaşımların gibi DeepSeek-OCR’nin, sıkıştırma kazançlarının kaynağını yanlış atfediyor olabileceğini öne sürer. Metni görüntüye dönüştürmenin birincil faktör olmasından ziyade, avantajın, verböz metin tokenlerini daha verimli latent temsillere dönüştürmekten geldiğini iddia eder.

Bunu test etmek için, iki dil modeli kullanarak bir pipeline oluşturdular: küçük Qwen2.5 1.5B, uzun geçitleri küçük bir latent token kümesine sıkıştıran kodlayıcı olarak işlev görür; ve daha büyük Qwen2.5 3B, orijinal metni bu tokenlerden yeniden oluşturan dekoder olarak işlev görür:

Yeni C3 sisteminde, küçük Qwen2.5 1.5B modeli, uzun bir girişi, eğitilebilir sorgu gömme kullanarak sabit uzunlukta latent tokenlere sıkıştırır. Bu tokenler, bir.prompt ile birlikte, daha büyük Qwen2.5 3B modeline geçirilir ve orijinal metni yeniden oluşturur. Bu mimari, uzun dizilerin yüksek doğrulukla geri çağrılmasını, orijinal token sayısının sadece bir kısmını kullanarak sağlar.

Yeni C3 sisteminde, küçük Qwen2.5 1.5B modeli, uzun bir girişi, eğitilebilir sorgu gömme kullanarak sabit uzunlukta latent tokenlere sıkıştırır. Bu tokenler, bir.prompt ile birlikte, daha büyük Qwen2.5 3B modeline geçirilir ve orijinal metni yeniden oluşturur. Bu mimari, uzun dizilerin yüksek doğrulukla geri çağrılmasını, orijinal token sayısının sadece bir kısmını kullanarak sağlar.

Sıkıştırma aşamasını ele almak için, araştırmacılar, önceden eğitilmiş Qwen2.5 1.5B modelini, eğitilebilir sorgu gömme ekleyerek uyarladılar: gelen uzun bağlamı, çok daha küçük bir latent temsil içine damıtmaya yardımcı olan soyut.promptlar.

Modelin kendine dikkat mekanizması, bu öğeleri aynı şekilde ele alır, böylece yeni katmanlara veya tasarım değişikliklerine gerek kalmadan, sabit uzunlukta bir latent bağlam çıkışı sağlar ve bu çıktı daha büyük modele yeniden oluşturmak için verilir.

Sıkıştırma sırasında kaçınan bilginin miktarını değerlendirmek için, araştırmacılar, Qwen2.5 3B dekoderine, yalnızca latent tokenleri ve ‘metni tekrarla’ promptunu kullanarak orijinal girişi yeniden oluşturmasını söylediler. Görev, özetleme veya yeniden ifade etme yerine, orijinal metnin tam olarak yeniden üretimini içerdiğinden, herhangi bir sapma doğrudan sıkıştırma sırasında kaybedilen bilgiye atfedilebilir, bu da encode-decode pipeline boyunca temiz ve objektif bir doğruluk testi sağlar.

Veri ve Testler

Makale, yazarların, internetten elde edilen bir milyon sayfa içeren orijinal bir OCR materyali derlediğini belirtir. Bu kaynak hakkında başka bir ayrıntı görünmüyor ve yazarlar bu noktada kasıtlı olarak belirsiz görünüyorlar.

Bununla birlikte, mereka, veri mühendisliği ve küratörlüğünün amaçları için gerekli olmadığını gözlemliyorlar ve bu durumun, mimarilerinin esnek (ve dolayısıyla iyi genelleştirilmiş olduğunu, eğitim ayarlarına bağlı olarak) gösterdiğini belirtiyorlar.

Model, her biri 80GB’lik VRAM ile donatılmış sekiz NVIDIA H800 GPU’su içeren bir yüksek performanslı küme üzerinde eğitildi, toplam VRAM kaynağı 640GB idi. Her GPU, toplam küresel toplu işleme boyutu 256 olduğunda, 16 birikme adımları dikkate alındığında, 2’lik bir toplu işleme boyutuna sahipti. Optimizatör, AdamW idi, toplam 40.000 adımda.

C3 mimarisinin etkinliğini test etmek için, araştırmacılar, orijinal DeepSeek-OCR makalesinde kullanılan aynı değerlendirme kurulumunu kullandılar, Fox benchmark‘ini kullanarak, çeşitli belge uzunlukları ve sıkıştırma ayarları boyunca sıkıştırma ve yeniden oluşturma doğruluğunu ölçtüler.

İngilizce metinler seçildi, paragraflar 600 ila 1300 token arasında değişiyordu, tokenleştirme Qwen tokenleştirici ile yapıldı.

Adil bir karşılaştırma sağlamak için, (DeepSeek-OCR) optik temel çizgisinden eşdeğer sıkıştırma seviyeleri kullanıldı, 64 ve 100 latent token ile. Yöntemin sınırlarını keşfetmek için, yalnızca 32 latent token ile ek testler yapıldı. Her durumda, yeniden oluşturma, ‘metni tekrarla:’ talimatıyla başlatıldı:

İlk testten sonuçlar. 64 ve 100 latent token kullanarak yedi token aralığında yeniden oluşturma doğruluğu ve sıkıştırma oranları ölçüldü, C3'ün DeepSeek-OCR'ye göre, özellikle daha yüksek sıkıştırma seviyelerinde, tutarlı bir şekilde üstünlüğünü gösterdi.

İlk testten sonuçlar. 64 ve 100 latent token kullanarak yedi token aralığında yeniden oluşturma doğruluğu ve sıkıştırma oranları ölçüldü, C3’ün DeepSeek-OCR’ye göre, özellikle daha yüksek sıkıştırma seviyelerinde, tutarlı bir şekilde üstünlüğünü gösterdi.

İlk testten alınan sonuçları tartışırken, makale şöyle diyor:

‘Veriler, C3’ün doğrudan metin-latent sıkıştırma paradigmasının, tüm test edilen koşullarda optik sıkıştırma yaklaşımını önemli ölçüde aşadığını açıkça gösteriyor, yüksek doğruluklu bağlam sıkıştırmasında yeni bir devlet standardı oluşturuyor.’

DeepSeek-OCR, daha uzun belgelerde test edildiğinde, sıkıştırma arttıkça doğruluk kaybına başladı ve en aşırı durumda %60’ın altına düştü. C3, aynı seviyedeki sıkıştırmayı çok daha az kayıp ile ele aldı, %98’e yakın bir seviyede sabit kaldı, hatta girişi orijinal boyutunun yirminde birine kadar küçülttüğünde bile:

En zorlu testte, tam metinler yalnızca 32 tokene kadar küçültüldü. Hala, model neredeyse tüm orijinal içeriği kurtardı, birçok durumda %99’a yakın bir doğrulukla:

32 latent token ile yeniden oluşturma doğruluğu ve sıkıştırma oranları, yaklaşık 40 kata kadar (yaklaşık 40x) azaltılmasına rağmen %93'ün üzerinde bir doğruluk gösteriyor.

32 latent token ile yeniden oluşturma doğruluğu ve sıkıştırma oranları, yaklaşık 40 kata kadar (yaklaşık 40x) azaltılmasına rağmen %93’ün üzerinde bir doğruluk gösteriyor.

En aşırı ayarlanda, girişi neredeyse kırkta birine kadar sıkıştırdığında bile, %93’ün üzerinde bir doğrulukla hatırladı. Karşılaştırıldığında, önceki optik yöntemler, o seviyedeki sıkıştırmanın yarısında bile %60’ın altına düştü.

Yazarlar şöyle diyor††:

‘Bu bulgular, C3 mimarisinin avantajını kesin olarak gösteriyor. Görsel modada bulunan (örneğin, görüntü çözünürlüğü sınırları, düzen karmaşıklığı) bilgi tıkanıklıkları ve olası artifactleri tránharak, yöntem aşırı sıkıştırma ile neredeyse hiç bilgi kaybı olmadan başa çıkıyor.

‘Bu agresif test durumundan alınan sonuçlar, doğrudan metin-latent sıkıştırma paradigmasının, optik karşılaştırma araçlarına göre daha temel olarak daha verimli ve güçlü olduğunu iddia etmemizi sağlamlaştırır.’

Ayrıca, C3’ün ‘kitapları, geniş yasal belgeleri veya büyük kod tabanlarını işleme, soru-cevap, özetleme ve analiz gibi görevler için yeni yetenekler kilidini açabileceğini’ belirtiyorlar.

SONUÇ

Bu, son zamanlarda karşılaştığım en açık ve anlaşılır makalelerden birisidir, potansiyel olarak ‘bağlam penceresi problemi’ne karşı yeni bir saldırı hattı oluşturabilecek, oldukça nettir.

LLM’lerin birçok kullanıcısı, önemli bilgileri veya rehberleri periyodik olarak yenileyerek, ChatGPT gibi sistemlerin çok uzun süre bu bilgileri hatırlayamadığını keşfetmiştir. Bu içgüdüsel hızlı çözümü takiben, yeni makaledeki fikir, uzun bir konuşmanın yüksek oranda sıkıştırılmış bir versiyonunun, aralıklarla AI modelinin bağlam penceresine otomatik olarak geri enjekte edilebileceği yönündedir, yani LLM’nin ‘vekil’ olarak hatırlamasıdır.

GPU kıtlığının, geleneksel bilgisayar belleği (örneğin DRAM) gibi daha büyük modelleri desteklemek için birçok eski GPU iş yükünün buraya yönlendirildiği bir fiyat ralline yol açtığı bir ortamda, AI’nin barındığı donanımın yakın gelecekte önemli ölçüde daha büyük olmayacağı görünüyor; bu nedenle, neredeyse 1990’lı yıllarda dosya sıkıştırma evriminin nostaljik bir yeniden çalışması olan bu gibi yenilikçi yaklaşımlar, performansı ilerletmek için gerekli olabilir.

Daha da önemlisi, LLM’lerin bir saat veya daha uzun süre tutarlı bir sohbeti sürdürebilmesi ve konuşmanın başlangıcını gerçekten hatırlayabilmesi harika olurdu.

 

* CLI kurulum talimatları verilir, ancak kurulumu denemek için zaman ayıramıyorum ve repoyu kod-tam olarak olduğundan emin değilim.

İki yazar, Fanfan Liu ve Haibo Qiu olarak belirtilir. Casus araştırmaya göre, Qiu şu anda Çin teknoloji şirketi Meituan’da bir araştırmacı ve Liu, Çin Bilimler Akademisi’nde bir yüksek lisans öğrencisidir. Hiçbiri, söz konusu makaleyi目前 historiesinde listelemiyor. Bu atıflardan herhangi biri yanlış ise, lütfen profilimi aracılığıyla bana ulaşın.

†† Yazarlar, formüle bağlı kalarak ek nitel testler sağlar, ancak bunlar önceki sıkıştırma testlerine kıyasla aydınlatıcı değildir ve burada bunları kapsamlı olarak ele almadım.

İlk olarak 21 Kasım 2025 Cuma günü yayımlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai