Angle d’Anderson
Enseigner aux IA oublieuses à « garder cette pensée » plus longtemps

Les modèles de langage ont souvent du mal à se souvenir du début d’une conversation. Une nouvelle méthode de compression de texte pourrait changer cela et rendre les sessions de chat avec l’IA beaucoup moins frustrantes.
Les systèmes d’IA conversationnels tels que ChatGPT ont souvent tendance à perdre la trace des parties précédentes d’une conversation, se répétant ou donnant des réponses qui ignorent les règles précédemment convenues.
Ceci est dû au fait que les grands modèles de langage (LLM) ont une capacité limitée à se concentrer, définie comme une ‘fenêtre de contexte’ d’attention – comme un projecteur qui ne peut éclairer que ce qui est directement visé, ainsi que quelques objets adjacents.
La résolution de ces tendances « amnésiques », qui sont dues à ces contraintes d’attention, est l’un des principaux axes de recherche sur les modèles d’IA basés sur le langage – notamment parce que ce syndrome limite considérablement la possibilité de conversations multi-tours utiles et cohérentes, et entrave l’utilité des LLM dans divers contextes critiques en termes de précision, tels que la médecine et le droit.
Crushing It
Une nouvelle recherche en Chine† propose une méthode novatrice pour faire tenir une quantité significativement plus grande de texte dans les ressources limitées d’une carte graphique (GPU) exécutant un modèle d’IA – avec des résultats atteignant une amélioration de compression de 20 fois tout en conservant 98 % de précision:

La compression contextuelle en cascade (C3) reconstruit des documents longs avec plus de précision que les méthodes de compression optique telles que DeepSeek-OCR, même lorsque la saisie est réduite de jusqu’à quarante fois. Sur une gamme de longueurs de document et de paramètres de compression, la nouvelle méthode maintient une fidélité presque parfaite, tandis que l’approche optique se dégrade fortement sous une compression plus élevée. Source
Avec une précision de 93 % – qui est dans des paramètres exploitables – la compression de texte peut même atteindre un ratio de compression de 40 fois:

Trois approches de compression de texte long pour l’entrée du modèle de langage: la méthode de base (gauche) tokenise le texte directement, ce qui donne un grand nombre de jetons; l’approche optique (centre) convertit le texte en image et extrait des embeddings visuels à l’aide d’un Vision Transformer, atteignant une compression de 10 fois; et la nouvelle méthode C3 (droite) utilise un petit modèle de langage pour compresser le texte en seulement 32 jetons latents, obtenant une compression de 40 fois sans recourir à des encodages visuels.
Cela signifie que l’ensemble d’une conversation très longue peut être compressé et réinjecté (mis à jour) à intervalles réguliers dans les échanges en tant qu’informations de contexte de fond, plus tard dans la conversation – lorsque le LLM aurait normalement oublié les faits précédents et glissé dans un comportement « amnésique ».
Bien que cela soit une méthode de compression avec perte, même la façon dont la perte se produit est utile: sous la nouvelle méthode, la mémoire se dégrade à la fin d’une phrase, et non de manière uniforme, comme avec la architecture DeepSeek-OCR qui a inspiré la nouvelle approche; en fait, les chercheurs derrière la nouvelle étude suggèrent que leur méthode se dégrade de la même manière que la mémoire humaine, et non de manière aléatoire:

En haut, la mémoire humaine se dégrade à la fin du flux de données; au milieu: DeepSeek-OCR se dégrade de manière aléatoire, laissant aucun ancrage qui pourrait aider à résoudre le problème; en bas: la nouvelle méthode se dégrade de la même manière que la mémoire humaine, vers la fin du flux de données, offrant des marqueurs qui peuvent aider à améliorer la précision grâce à un traitement postérieur.
Cela signifie que l’on peut prédire où les données mémorisées peuvent être moins fiables, et utiliser ces connaissances pour résoudre le problème – offrant potentiellement une amélioration massive de la rétention de conversation et de la cohérence, avec une précision de 100 % après remédiation.
La nouvelle approche est appelée Compression contextuelle en cascade (C3), et est inspirée de la façon dont DeepSeek-OCR compressait le texte en images, atteignant de grands niveaux de compression. Cependant, en utilisant deux modèles de langage (moyen et grand) pour compresser directement le texte long en représentations latentes, la nouvelle approche élimine la traînée causée par l’utilisation de raster images, réalisant ainsi des performances améliorées.
Le document indique:
‘La performance supérieure de C3 peut être attribuée à sa conception architecturale fondamentale. L’analyse Deepseek-OCR suppose que sa baisse de performance est due à des facteurs tels que “la disposition complexe” et “le flou d’image à basse résolution” – des limitations inhérentes à la voie optique.
‘Notre paradigme C3, en opérant directement dans le domaine textuel, est entièrement immunisé contre ces artefacts du domaine visuel. Il évite la perte d’information associée au rendu du texte en pixels, puis à l’encodage de ces pixels. Au lieu de cela, il exploite la compréhension sémantique puissante d’un LLM pré-entraîné pour distiller l’information textuelle directement en une représentation latente efficace.’
Le nouvel article est intitulé Compression contextuelle en cascade: Explorer les limites supérieures de la compression de texte, et provient de deux auteurs†, qui semblent également offrir C3 en tant que référentiel open source sur GitHub.
Méthode
Pour comprendre la nouvelle approche, il est utile de savoir ce qu’est la reconnaissance optique de caractères (ROC), car c’est là que l’idée entière trouve son origine.
La ROC est une méthode algorithmique qui remonte aux années 1920, bien que popularisée dans les années 1990, où la détection de motifs permet à un programme informatique de convertir du texte raster (c’est-à-dire du texte à l’intérieur d’images, qui ne peut pas être sélectionné et qui n’existe que comme contenu photographique) en texte éditable.
Les créateurs de DeepSeek-OCR ont découvert que le texte pouvait être compressé beaucoup plus que les pipelines standard en utilisant la ROC comme étape intermédiaire. En d’autres termes, au lieu de compresser le texte en soi, on pouvait atteindre une densité plus élevée de représentations latentes (c’est-à-dire plus d’informations sauvegardées) en compressant une version rasterisée de ce texte:
![À partir du document de publication de DeepSeekOCR, un schéma pour le pipeline de compression, y compris des patchs rasterisés 16x16 comme composant ROC. Source [ https://arxiv.org/pdf/2510.18234 ]](https://www.unite.ai/wp-content/uploads/2025/11/deepseekocr.jpg)
À partir du document de publication de DeepSeekOCR, un schéma pour le pipeline de compression, y compris des patchs rasterisés 16×16 comme composant ROC. Source
La nouvelle étude suggère que les approches optiques telles que DeepSeek-OCR peuvent mal attribuer la source de leurs gains de compression. Au lieu du passage du texte à l’image étant le facteur principal, les auteurs soutiennent que le bénéfice clé provient de la conversion de jetons de texte verbeux en représentations latentes plus efficaces.
Pour tester cela, ils ont créé un pipeline utilisant deux modèles de langage: le plus petit Qwen2.5 1.5B, qui fonctionne comme l’encodeur, compressant de longs passages en un petit ensemble de jetons latents; et le plus grand Qwen2.5 3B, qui fonctionne comme le décodeur, reconstruisant le texte original à partir de ces jetons:

Dans le nouveau système C3, le modèle Qwen2.5 1.5B plus petit comprime une longue entrée en un ensemble fixe de jetons latents, en utilisant des embeddings de requête entraînables. Ces jetons, ainsi qu’une invite, sont transmis au modèle Qwen2.5 3B plus grand, qui reconstruit le texte original. Cette architecture permet un rappel de haute fidélité de longues séquences en utilisant seulement une fraction du nombre de jetons d’origine.
Pour gérer l’étape de compression, les chercheurs ont adapté le modèle Qwen2.5 1.5B pré-entraîné en introduisant des embeddings de requête entraînables: des invites abstraites qui guident le modèle dans la distillation du contexte long en une représentation latente beaucoup plus petite.
Au lieu de modifier l’architecture, la méthode se contente de fournir le texte long et les embeddings de requête ensemble en tant qu’entrée unique. Le mécanisme d’auto-attention du modèle traite ces éléments de la même manière, permettant ainsi de sortir une représentation latente à longueur fixe sans avoir besoin de nouvelles couches ou de modifications de conception; et cette sortie est ensuite transmise au modèle plus grand pour la reconstruction.
Pour évaluer la quantité d’informations qui survivent à la compression, les chercheurs ont demandé au décodeur Qwen2.5 3B de reconstruire l’entrée originale en utilisant uniquement les jetons latents, et l’invite ‘répéter le texte’. Puisque la tâche consistait à reproduire exactement, plutôt qu’à résumer ou paraphraser, toute déviation par rapport à l’original pouvait être directement attribuée à des informations perdues lors de la compression, offrant ainsi un test propre et objectif de la fidélité à travers le pipeline d’encodage-décodage.
Données et tests
Le document indique que les auteurs ont compilé un ensemble de données d’origine de matériel OCR, totalisant un million de pages obtenues à partir d’Internet. Aucun détail supplémentaire n’apparaît sur cette source, et les auteurs semblent être délibérément vagues sur ce point.
Cependant, ils observent que l’ingénierie et la curation des données n’étaient pas nécessaires à leurs fins, et qu’ils ont pu entraîner leur modèle de manière efficace sur des échantillons de « longueur diverse »; et ils déclarent que cela indique que leur architecture est robuste (et, par inférence, bien généralisée, en fonction des paramètres d’entraînement).
Le modèle a été entraîné sur un cluster haute performance composé de huit GPU NVIDIA H800, chacun équipé de 80 Go de VRAM, pour une ressource de VRAM totale de 640 Go. Chaque GPU a accueilli une taille de lot de 2, obtenant une taille de lot globale de 256, en tenant compte des 16 étapes d’accumulation planifiées. L’optimiseur était AdamW, sur un total de 40 000 étapes.
Pour tester l’efficacité de l’architecture C3, les chercheurs ont suivi la même configuration d’évaluation utilisée dans l’article original DeepSeek-OCR, en utilisant le benchmark Fox pour mesurer la compression et la précision de reconstruction sur une gamme de longueurs de document.
Des textes en anglais ont été sélectionnés, avec des passages allant de 600 à 1300 jetons, avec une tokenisation effectuée à l’aide du tokenizer Qwen.
Pour permettre une comparaison équitable, des niveaux de compression équivalents à partir de la référence optique (DeepSeek-OCR) ont été utilisés, avec 64 et 100 jetons latents. Pour explorer les limites de la méthode, des tests supplémentaires ont été effectués en utilisant uniquement 32 jetons latents. Dans chaque cas, la reconstruction a été initiée avec l’instruction ‘répéter le texte’:

Résultats du test initial. La précision de reconstruction et les ratios de compression ont été mesurés sur sept plages de jetons en utilisant 64 et 100 jetons latents, montrant une surenchère constante de C3 sur DeepSeek-OCR, en particulier à des niveaux de compression plus élevés.
En discutant les résultats initiaux visualisés ci-dessus, le document indique:
‘Les données démontrent de manière irréfutable que le paradigme de compression directe de texte à latent de C3 surpasse de manière significative l’approche de compression optique dans toutes les conditions testées, établissant un nouvel état de l’art en matière de compression de contexte à haute fidélité.’
Lorsque les deux systèmes ont été testés sur des documents plus longs, DeepSeek-OCR a commencé à perdre de la précision à mesure que la compression augmentait, tombant en dessous de 60 % dans le cas le plus extrême. C3 a géré le même niveau de compression avec beaucoup moins de pertes, se maintenant près de 98 %, même lorsque l’entrée était réduite à un vingtième de sa taille d’origine.
Dans le test le plus exigeant, les textes complets ont été réduits à seulement 32 jetons. Même alors, le modèle a réussi à récupérer presque tout le contenu d’origine, en maintenant une précision proche de 99 % dans de nombreux cas:

Précision de reconstruction et ratios de compression à 32 jetons latents, montrant que même à des réductions extrêmes (jusqu’à près de 40 fois) la précision reste supérieure à 93 %.
À l’extrême, lorsque l’entrée était compressée à près d’un quarantième de sa taille, elle a encore rappelé plus de 93 %. En comparaison, les méthodes optiques précédentes sont tombées à environ 60 % de précision à la moitié de ce niveau de compression.
Les auteurs déclarent††:
‘Ces résultats démontrent de manière concluante l’avantage de l’architecture C3. En évitant les goulets d’étranglement d’information et les artefacts potentiels inhérents à la modalité visuelle (par exemple, les limites de résolution d’image, la complexité de la disposition), notre méthode gère avec grâce la compression extrême avec une perte d’information minimale.
‘Les résultats de ce test agressif renforcent notre affirmation selon laquelle la compression directe de texte à latent est un paradigme fondamentalement plus efficace et plus puissant que ses homologues optiques.’
Ils concluent également que C3 peut ‘débloquer de nouvelles capacités de traitement de livres entiers, de documents juridiques étendus ou de grandes bases de code pour des tâches telles que la réponse à des questions, la synthèse et l’analyse’.
Conclusion
Ceci est l’un des articles les plus clairs et les plus accessibles que j’aie rencontrés récemment, avec une idée centrale remarquablement claire qui pourrait s’avérer être au moins une ligne de défense supplémentaire contre le « problème de la fenêtre de contexte ».
De nombreux utilisateurs de LLM ont appris à « rafraîchir » les informations cruciales ou les directives périodiquement tout au long d’un long échange, ayant découvert à leurs dépens que les likes de ChatGPT ne peuvent pas conserver ces informations pendant très longtemps. Suite à cette solution rapide, l’idée en question dans le nouvel article est que une version fortement compressée d’une longue conversation pourrait être réinjectée à intervalles réguliers, automatiquement, dans la fenêtre de contexte de l’instance LLM actuelle, se « souvenant par procuration ».
Dans un contexte où la pénurie de GPU conduit à une hausse des prix même sur la mémoire informatique traditionnelle (telle que la DRAM, où de nombreux anciens chargements de travail de GPU sont maintenant déchargés pour supporter des modèles plus grands), il semble peu probable que le matériel hôte de l’IA devienne significativement plus capacieux dans un avenir proche; par conséquent, des approches innovantes comme celle-ci, qui sont presque une répétition nostalgique de l’évolution de la compression de fichiers dans les années 1990, peuvent s’avérer nécessaires pour faire progresser les performances.
Plus important encore, ce serait simplement génial si les LLM pouvaient maintenir une conversation cohérente pendant une heure ou plus, et vraiment se souvenir de ce dont la conversation traitait en premier lieu.
* Les instructions d’installation CLI sont données, mais je n’ai pas le temps d’essayer d’installer, et je ne suis pas certain que le référentiel est complet.
† Les deux auteurs sont indiqués comme étant Fanfan Liu et Haibo Qiu. À ce que les recherches occasionnelles indiquent, Qiu est actuellement chercheur chez la société de technologie chinoise Meituan, et Liu est un étudiant en master à l’Académie des sciences de Chine. Ni l’un ni l’autre n’a actuellement le document en question répertorié dans leurs historiques. Si l’une de ces attributions est incorrecte, veuillez me contacter via mon profil.
†† Bien que les auteurs s’en tiennent à la formule en fournissant des tests qualitatifs supplémentaires, ceux-ci sont peu éclairants par rapport au premier tour de tests de compression, et je ne les ai pas couverts ici.
Publié pour la première fois le vendredi 21 novembre 2025












