มุมมองของ Anderson
การสอน AI ที่ลืมให้ “จดจำสิ่งนั้น” ได้นานขึ้น

โมเดลภาษามักจะไม่สามารถจดจำเริ่มต้นของการสนทนาได้ วิธีการบีบอัดข้อความใหม่อาจเปลี่ยนแปลงสิ่งนี้ได้ และทำให้เซสชันสนทนาของ AI น้อยกว่ามาก
ระบบ AI สนทนาสuch as ChatGPT มัก สูญเสียติดตาม ส่วนแรกของการสนทนา โดยการทำซ้ำตัวเอง หรือให้คำตอบที่เพิกเฉยต่อกฎที่ตกลงกันไว้ก่อนหน้านี้
สิ่งนี้เกิดจาก Large Language Models (LLMs) มีความสามารถในการโฟกัสที่จำกัด ซึ่งถูกกำหนดเป็น ‘context window’ ของการสนใจ – เช่น โทรที่สามารถส่องสว่างเฉพาะสิ่งที่มุ่งเน้นไปที่ และวัตถุใกล้เคียงบางส่วน
การแก้ไขความผิดปกติ ‘健忘’ เหล่านี้ ซึ่งเกิดจากข้อจำกัดเหล่านี้เกี่ยวกับการสนใจ เป็นหนึ่งในทิศทางที่สำคัญที่สุดของการวิจัยเกี่ยวกับโมเดล AI ที่ใช้ภาษา – ไม่น้อยเพราะสิ่งนี้ จำกัด ความเป็นไปได้ของการสนทนาที่มีประโยชน์และสอดคล้องกัน และทำให้โมเดล LLM มีประโยชน์น้อยลงในบริบทที่ต้องการความแม่นยำสูง เช่น การแพทย์และกฎหมาย
Crushing It
การวิจัยใหม่จากประเทศจีน† เสนอวิธีการใหม่ในการทำให้ข้อความขนาดใหญ่พอดีกับทรัพยากรที่จำกัดของ GPU ที่กำลังทำงานโมเดล AI – โดยมีผลลัพธ์ที่ได้รับการปรับปรุงการบีบอัด 20 เท่า ในขณะที่ยังคงความแม่นยำ 98%:
![Context Cascade Compression reconstructs long documents more accurately than optical compression methods like DeepSeek-OCR, even when shrinking the input by up to forty times. Across a range of document lengths and compression settings, the new method maintains near-perfect fidelity while the optical approach degrades sharply under higher compression. Source [ https://arxiv.org/pdf/2511.15244 ]](https://www.unite.ai/wp-content/uploads/2025/11/c3-tokens-per-page.jpg)
Context Cascade Compression (C3) reconstructs long documents more accurately than optical compression methods such as DeepSeek-OCR, even when shrinking the input by up to forty times. Across a range of document lengths and compression settings, the new method maintains near-perfect fidelity, while the optical approach degrades sharply under higher compression. Source
ด้วยความแม่นยำ 93% – ซึ่งอยู่ในพารามิเตอร์ที่ใช้การได้ – การบีบอัดข้อความสามารถบรรลุอัตราส่วนการบีบอัด 40x ได้:

Three approaches to compressing long text for language model input: the baseline method (left) tokenizes the text directly, yielding a large token count; the optical route (center) converts the text into an image and extracts visual embeddings using a Vision Transformer, achieving 10x compression; and the new C3 method (right) uses a small language model to compress the text into only 32 latent tokens, obtaining 40x compression without relying on visual encodings.
สิ่งนี้หมายความว่าความยาวของการสนทนาใดๆ สามารถบีบอัดและอัปเดตใหม่ในอินเทอร์เวลระหว่างการแลกเปลี่ยนเป็นข้อมูลพื้นหลังในภายหลัง – เมื่อ LLM ปกติจะลืมข้อเท็จจริงก่อนหน้านี้และกลายเป็นพฤติกรรม ‘健忘’
แม้ว่านี่จะเป็นวิธีการบีบอัดที่ สูญเสีย แต่วิธีการที่การสูญเสียเกิดขึ้นก็มีประโยชน์: ภายใต้วิธีการใหม่ การสูญเสียเกิดขึ้นที่ สิ้นสุด ของประโยค และไม่สม่ำเสมอตลอดไป เช่นเดียวกับ DeepSeek-OCR สถาปัตยกรรมที่สร้างแรงบันดาลใจให้กับการเข้าใกล้ใหม่; ในความเป็นจริง ผู้วิจัยเบื้องหลังเอกสารใหม่แนะนำว่าวิธีการของพวกเขาสูญเสียไปในลักษณะเดียวกับหน่วยความจำของมนุษย์ ไม่ใช่แบบสุ่ม:

Top, human memory degrades at the end of the data stream; middle: DeepSeek-OCR degrades randomly, leaving no anchors that could aid in fixing the issue; bottom: the new method degrades in the same way as human memory, towards the termination of the data stream, offering markers that can help to improve accuracy through post facto processing.
สิ่งนี้หมายความว่าเราสามารถคาดการณ์ได้ว่า ที่ไหน ข้อมูลที่จดจำไว้อาจไม่น่าเชื่อถือ และใช้ความรู้นี้เพื่อแก้ไขปัญหา – ซึ่งอาจนำไปสู่การปรับปรุงความสามารถในการสนทนาที่มีประสิทธิภาพและความสอดคล้องอย่างมาก โดยมีความแม่นยำ 100% หลังการบำบัด
วิธีการใหม่นี้เรียกว่า Context Cascade Compression (C3) และได้รับแรงบันดาลใจจากวิธีการที่ DeepSeek-OCR บีบอัดข้อความเป็นรูปภาพ โดยบรรลุระดับการบีบอัดที่ดีมาก อย่างไรก็ตาม โดยใช้โมเดลภาษาสองตัว (ขนาดกลางและขนาดใหญ่) เพื่อบีบอัดข้อความยาวโดยตรงลงใน latent embeddings วิธีการใหม่นี้ตัดความล่าช้าออกที่เกิดจากการใช้รูปภาพเรสเตอร์ ดังนั้นจึงบรรลุประสิทธิภาพที่ดีขึ้น
เอกสารระบุว่า:
‘The superior performance of C3 can be attributed to its fundamental architectural design. The Deepseek-OCR analysis hypothesizes that its performance decline is due to factors like “complex layout” and “image blurring at lower resolutions”– inherent limitations of the optical pathway.
‘Our C3 paradigm, by operating directly in the textual domain, is entirely immune to these visual-domain artifacts. It avoids the information loss associated with rendering text to pixels and then encoding those pixels. Instead, it leverages a pre-trained LLM’s powerful semantic understanding to distill textual information directly into an efficient latent representation.’
เอกสารใหม่ ใหม่ มีชื่อเรื่องว่า Context Cascade Compression: Exploring the Upper Limits of Text Compression และมาจากสองผู้เขียน† ซึ่งดูเหมือนจะเสนอ C3 เป็นแหล่งที่มาแบบเปิด ที่ GitHub
Method
ในการทำความเข้าใจวิธีการใหม่นี้ มันจะเป็นประโยชน์ที่จะรู้ว่า การรู้จำตัวอักษรออปติคัล (OCR) คืออะไร เนื่องจากความคิดนี้มาจากที่นี่
OCR เป็นวิธีการเชิงอัลกอริทึมที่มีมาตั้งแต่ ปี 1920 แม้ว่าจะได้รับความนิยมในยุค 1990 โดยใช้การตรวจจับรูปแบบเพื่อให้โปรแกรมคอมพิวเตอร์สามารถเปลี่ยนข้อความเรสเตอร์ (เช่น ข้อความภายในรูปภาพที่ไม่สามารถเลือกได้ และมีเฉพาะเนื้อหาทางภาพเท่านั้น) เป็นข้อความที่สามารถแก้ไขได้
ผู้สร้าง DeepSeek-OCR ค้นพบว่าข้อความสามารถบีบอัดได้มากกว่าเส้นทางมาตรฐานโดยใช้ OCR เป็นขั้นตอนกลาง
![From the DeepSeekOCR release paper, a schema for the compression pipeline, including 16x16 rasterized patches as the OCR component. Source [ https://arxiv.org/pdf/2510.18234 ]](https://www.unite.ai/wp-content/uploads/2025/11/deepseekocr.jpg)
From the DeepSeek-OCR release paper, a schema for the compression pipeline, including 16×16 rasterized patches as the OCR component. Source
วิธีการใหม่แนะนำว่าแนวทางออปติคัล เช่น DeepSeek-OCR อาจมีการมอบหมายแหล่งที่มาของการบีบอัดที่ไม่ถูกต้อง แทนที่จะเปลี่ยนจากข้อความเป็นรูปภาพเป็นปัจจัยหลัก ผู้เขียนเสนอว่าประโยชน์หลักมาจากการเปลี่ยนข้อความที่ยืดยาวเป็นตัวแทน latent ที่มีประสิทธิภาพมากกว่า
เพื่อทดสอบสิ่งนี้ พวกเขาได้สร้างพายพайป์ไลน์ที่ใช้โมเดลภาษาสองตัว: Qwen2.5 1.5B ที่เล็กกว่า ซึ่งทำหน้าที่เป็นเครื่องบีบอัด โดยบีบอัดข้อความยาวลงในเซตของ latent tokens ที่เล็ก; และ Qwen2.5 3B ที่ใหญ่กว่า ซึ่งทำหน้าที่เป็นตัวถอดรหัส โดยสร้างข้อความดั้งเดิมจาก token เหล่านั้น:

In the new C3 system, the smaller Qwen2.5 1.5B model compresses a long input into a fixed-length set of latent tokens, using trainable query embeddings. These tokens, together with a prompt, are passed to the larger Qwen2.5 3B model, which reconstructs the original text. This architecture enables high-fidelity recall of long sequences using only a fraction of the original token count.
เพื่อจัดการกับขั้นตอนการบีบอัด ผู้วิจัยได้ปรับเปลี่ยนโมเดล Qwen2.5 1.5B ที่ได้รับการฝึกฝนแล้ว โดยการแนะนำ trainable query embeddings: โพร์มปต์แบบอักษรที่ช่วยให้โมเดลบีบอัดข้อความยาวลงในตัวแทน latent ที่เล็ก
แทนที่จะเปลี่ยนแปลงสถาปัตยกรรม วิธีการนี้เพียงแค่ให้ข้อความยาวและโพร์มปต์แบบอักษรเข้าไปในโมเดลพร้อมๆ กัน โดยใช้กลไก self-attention ของโมเดลเพื่อรักษาโครงสร้างนี้ไว้ โดยไม่ต้องมีการเปลี่ยนแปลงใดๆ ในสถาปัตยกรรม
เพื่อประเมินว่าข้อมูลใดที่รอดชีวิตจากการบีบอัด ผู้วิจัยได้สั่งให้โมเดล Qwen2.5 3B ที่ถอดรหัสสร้างข้อความดั้งเดิมขึ้นมาใหม่โดยใช้เพียง token ที่ซ่อนอยู่และโพร์มปต์ ‘repeat the text’ เนื่องจากงานนี้เกี่ยวข้องกับการสร้างข้อความดั้งเดิมใหม่ ไม่ใช่การสรุปหรือแปลความหมาย ใดๆ การเบี่ยงเบนใดๆ จากข้อความดั้งเดิมสามารถสืบย้อนกลับไปยังข้อมูลที่สูญเสียไปในการบีบอัดได้
Data and Tests
เอกสารระบุว่าผู้เขียนรวบรวมชุดข้อมูล OCR ใหม่ ซึ่งประกอบด้วยหน้า 1 ล้านหน้าจากอินเทอร์เน็ต ไม่มีรายละเอียดเพิ่มเติมเกี่ยวกับการจัดหาแหล่งนี้ และผู้เขียนดูเหมือนจะไม่ชัดเจนในจุดนี้
อย่างไรก็ตาม พวกเขาสังเกตว่าการวิศวกรรมข้อมูลและการดูแลไม่จำเป็นต่อวัตถุประสงค์ของพวกเขา และพวกเขาสามารถฝึกโมเดลของตนได้อย่างมีประสิทธิภาพบนแบบอย่างที่มีความยาวหลากหลาย และพวกเขาระบุว่าสิ่งนี้บ่งชี้ว่าสถาปัตยกรรมของพวกเขามีความทนทาน (และโดยนัยที่ดี) ขึ้นอยู่กับการตั้งค่าการฝึก
โมเดลถูกฝึกฝนบนคลัสเตอร์ที่มีประสิทธิภาพสูงซึ่งประกอบด้วย GPU H800 ของ NVIDIA 8 ตัว แต่ละตัวมี VRAM 80GB รวมเป็น VRAM 640GB ทั้งหมด แต่ละ GPU รองรับ ขนาดแบตช์ 2 โดยมีขนาดแบตช์รวม 256 เมื่อพิจารณาจาก ขั้นตอนการสะสม 16 ขั้นตอนที่กำหนดไว้ ตัวเพิ่มประสิทธิภาพคือ AdamW ในระยะทั้งหมด 40,000 ขั้นตอน
เพื่อทดสอบประสิทธิภาพของสถาปัตยกรรม C3 ผู้วิจัยใช้การกำหนดค่าแบบเดียวกับที่ใช้ในเอกสาร DeepSeek-OCR เดิม โดยใช้ Fox benchmark เพื่อวัดอัตราการบีบอัดและความแม่นยำในการสร้างข้อความใหม่ในระดับความยาวของเอกสารต่างๆ
ข้อความภาษาอังกฤษถูกเลือก โดยมีระยะตั้งแต่ 600 ถึง 1300 โทเค็น โดยมีการทำโทเค็นโดยใช้ Qwen tokenizer
เพื่อให้สามารถเปรียบเทียบได้อย่างยุติธรรม อัตราการบีบอัดที่เทียบเท่ากับเส้นทางออปติคัล (DeepSeek-OCR) ถูกใช้ โดยมีโทเค็น latent 64 และ 100 โทเค็น เพื่อสำรวจขีดจำกัดของวิธีการนี้ การทดสอบเพิ่มเติมถูกดำเนินการโดยใช้เพียง 32 โทเค็น latent:

Results from the initial test. Reconstruction precision and compression ratios were measured across seven token ranges using 64 and 100 latent tokens, showing consistent outperformance of C3 over DeepSeek-OCR, especially at higher compression levels.
การอภิปรายผลลัพธ์เบื้องต้นด้านบน เอกสารระบุว่า:
‘The data unequivocally demonstrates that C3’s direct text-to-latent compression paradigm significantly outperforms the optical compression approach across all tested conditions, establishing a new state-of-the-art in high-fidelity context compression.’
เมื่อทั้งสองระบบถูกทดสอบบนเอกสารที่ยาวขึ้น DeepSeek-OCR เริ่มสูญเสียความแม่นยำเมื่ออัตราการบีบอัดเพิ่มขึ้น โดยลดลงต่ำกว่า 60% ในกรณีที่รุนแรงที่สุด C3 จัดการกับการบีบอัดในระดับเดียวกันได้ด้วยการสูญเสียน้อยมาก โดยยังคงอยู่ใกล้เคียง 98% แม้ว่าข้อมูลเข้าจะถูกย่อให้เหลือเพียงหนึ่งในยี่สิบของขนาดเดิม
ในกรณีทดสอบที่ท้าทายที่สุด เอกสารทั้งหมดถูกย่อให้เหลือเพียง 32 โทเค็น แม้ว่าโมเดลจะยังคงสามารถกู้คืนเกือบ所有เนื้อหาดั้งเดิมได้ โดยยังคงความแม่นยำใกล้เคียง 99% ในหลายกรณี:

Reconstruction accuracy and compression ratios at 32 latent tokens, showing that even at extreme reductions (up to nearly 40x) precision remains above 93%.
ในกรณีที่ย่อขนาดมากที่สุด โดยที่ข้อมูลเข้าถูกบีบอัดลงเหลือเพียงหนึ่งในสี่สิบของขนาดเดิม ยังคงรักษาความแม่นยำไว้ที่ 93% ในทางตรงกันข้าม วิธีการออปติคัลก่อนหน้านี้ลดลงเหลือประมาณ 60% ที่ระดับการบีบอัดครึ่งหนึ่ง
ผู้เขียนระบุ††:
‘These findings conclusively demonstrate the advantage of the C3 architecture. By avoiding the information bottlenecks and potential artifacts inherent in the visual modality (e.g., image resolution limits, layout complexity), our method gracefully handles extreme compression with minimal information loss.
‘The results from this aggressive test case solidify our claim that direct text-to-latent compression is a fundamentally more efficient and powerful paradigm than its optical counterparts.’
พวกเขายังสรุปว่า C3 สามารถ ‘ปลดล็อกความสามารถใหม่ในการประมวลผลหนังสือทั้งเล่ม เอกสารทางกฎหมายที่ยาวมาก หรือฐานโค้ดขนาดใหญ่สำหรับงานเช่น การตอบคำถาม การสรุป และการวิเคราะห์’
Conclusion
สิ่งนี้เป็นหนึ่งในเอกสารที่ชัดเจนและเข้าถึงได้ง่ายที่สุดที่ฉันพบเห็นในระยะหลัง โดยมีแนวคิดหลักที่น่าชื่นชมซึ่งอาจพิสูจน์ได้ว่าเป็นแนวทางใหม่ในการต่อสู้กับ ‘ปัญหาหน้าต่างบริบท’
ผู้ใช้หลายคนของ LLMs ได้เรียนรู้แล้วว่าจะ ‘รีเฟรช’ ข้อมูลสำคัญหรือคำแนะนำที่จำเป็นเป็นระยะๆ ในระหว่างการแลกเปลี่ยนยาว โดยได้พบว่า ChatGPT และระบบอื่นๆ ไม่สามารถรักษาข้อมูลนั้นได้นาน ติดตามจากสัญชาตญาณที่จะ ‘รีเฟรช’ ข้อมูลนี้เป็นระยะๆ แนวคิดที่นำเสนอในเอกสารใหม่นี้คือการบีบอัดข้อความยาวของการสนทนาและอัปเดตใหม่ใน ‘หน้าต่างบริบท’ ของ LLM ในรูปแบบอัตโนมัติ โดย ‘จดจำโดยการแทน’ เสมือน
ในบรรยากาศที่การขาดแคลน GPU ทำให้เกิด การเพิ่มขึ้นของราคา แม้กระทั่งหน่วยความจำคอมพิวเตอร์แบบดั้งเดิม (เช่น DRAM ซึ่งหลายๆ งานโหลดของ GPU ได้ถูกย้ายไปที่นั่นเพื่อสนับสนุนโมเดลที่ใหญ่ขึ้น) ดูเหมือนว่าฮาร์ดแวร์ที่เป็นเจ้าภาพของ AI ไม่น่าจะมีความจุมากขึ้นในอนาคตอันใกล้ ดังนั้นวิธีการใหม่ๆ เช่น นี้ ซึ่งเป็นการรื้อฟื้นความก้าวหน้าของการบีบอัดข้อมูลในยุค 1990 อาจจำเป็นต้องขับเคลื่อนประสิทธิภาพไปข้างหน้า
สิ่งที่สำคัญกว่านั้น มันจะดีมากถ้า LLMs สามารถรักษาการสนทนาที่สอดคล้องได้หนึ่งชั่วโมงหรือมากกว่านั้น และจริงๆ แล้วจดจำว่าการสนทนานั้นเกี่ยวกับอะไรในตอนแรก
* คำแนะนำในการติดตั้ง CLI ได้รับ แต่ฉันไม่สามารถใช้เวลาทำการติดตั้งได้ และไม่แน่ใจว่า仓庫เป็น code-complete หรือไม่
† ผู้เขียนสองคนได้รับการระบุว่าเป็น Fanfan Liu และ Haibo Qiu ตามการวิจัยทั่วไป Qiu เป็นนักวิจัยที่ Meituan ในขณะนี้ และ Liu เป็น นักศึกษาระดับมหาบัณฑิต ที่ Chinese Academy of Sciences ไม่มีเอกสารที่กล่าวถึงในประวัติของพวกเขา หากการอ้างอิงใดๆ นี้ไม่ถูกต้อง กรุณาติดต่อฉันผ่านโปรไฟล์ของฉัน
†† แม้ว่าผู้เขียนจะยึดติดกับสูตรโดยการให้การทดสอบคุณภาพเพิ่มเติม แต่สิ่งเหล่านี้ไม่ได้ให้ข้อมูลเชิงลึกเมื่อเปรียบเทียบกับการทดสอบการบีบอัดครั้งก่อน และฉันไม่ได้กล่าวถึงสิ่งเหล่านั้นที่นี่
เผยแพร่ครั้งแรกวันศุกร์ที่ 21 พฤศจิกายน 2025












