Leaders dâopinion
La nouvelle ÃĐconomie de l’IA est basÃĐe sur les jetons – mais nous les mesurons tous de travers

Il se passe un changement dans lâIA que la plupart des gens ressentent mais ne comprennent pas encore : nous sommes passÃĐs de la comptabilisation des requÊtes à la comptabilisation des jetons.
à lâÃĻre du web, nous mesurions les systÃĻmes en requÊtes par seconde. CâÃĐtait clair, intuitif et principalement exact. Une requÊte arrivait, une rÃĐponse partait et vous pouviez mettre à lâÃĐchelle lâinfrastructure autour de ce modÃĻle.
Cette abstraction a disparu.
Dans lâIA, lâunitÃĐ fondamentale nâest plus la requÊte â câest le jeton. Chaque invite, chaque rÃĐponse et chaque chaÃŪne de raisonnement sont dÃĐcomposÃĐs en jetons, reprÃĐsentant le travail que le systÃĻme effectue, le coÃŧt engagÃĐ et, de plus en plus, la valeur crÃĐÃĐe.
Naturellement, lâindustrie sâest ralliÃĐe à ce changement, en introduisant des mÃĐtriques comme les jetons par seconde, le coÃŧt par jeton et mÊme le chiffre dâaffaires par jeton. Cela ressemble à ce que nous ayons enfin trouvÃĐ un moyen de quantifier les systÃĻmes dâIA. Mais cette approche est incomplÃĻte.
Le raccourci de lâindustrie : les jetons ÃĐquivalent à la valeur
Il y a une narration croissante selon laquelle les jetons sont la nouvelle monnaie de lâIA â que plus de jetons ÃĐquivaut à plus dâintelligence, et par extension, à plus de chiffre dâaffaires. Câest une idÃĐe convaincante, mais elle simplifie à lâextrÊme ce qui se passe rÃĐellement à lâintÃĐrieur de ces systÃĻmes.
Tous les jetons ne sont pas ÃĐgaux. Certains jetons reprÃĐsentent un travail rÃĐel : analyser les donnÃĐes, gÃĐnÃĐrer des insights, automatiser les flux de travail et soutenir les dÃĐcisions qui conduisent aux rÃĐsultats commerciaux. Dâautres sont beaucoup moins significatifs â gÃĐnÃĐration de contenu occasionnel, expÃĐrimentation ou cas dâutilisation qui ne sont jamais mis en production.
Vous pouvez dÃĐjà voir cela à lâintÃĐrieur des entreprises. Une ÃĐquipe peut gÃĐnÃĐrer des millions de jetons pour soutenir la productivitÃĐ des dÃĐveloppeurs ou les opÃĐrations des clients, ayant un impact direct sur lâefficacitÃĐ et le chiffre dâaffaires. Une autre ÃĐquipe peut gÃĐnÃĐrer le mÊme volume en expÃĐrimentant avec des outils qui ne dÃĐpassent jamais lâexploration interne. Sur le papier, les comptes de jetons semblent identiques. Dans la rÃĐalitÃĐ, la valeur commerciale est complÃĻtement diffÃĐrente.
ConsidÃĐrer tous les jetons comme des unitÃĐs de valeur interchangeables crÃĐe une vision dÃĐformÃĐe de ce que lâIA fait rÃĐellement à lâintÃĐrieur dâune organisation. Les entreprises ne sont pas construites sur le volume de jetons ; elles sont construites sur ce que ces jetons permettent.
Pour comprendre cette diffÃĐrence, il faut regarder en dessous de la surface pour voir comment ces systÃĻmes fonctionnent rÃĐellement.
Pourquoi votre deuxiÃĻme invite est plus rapide que votre premiÃĻre
Si vous avez dÃĐjà utilisÃĐ un outil comme ChatGPT, vous avez probablement remarquÃĐ que votre deuxiÃĻme question est souvent plus rapide que votre premiÃĻre. Ce comportement nâest pas dÃŧ au fait que le modÃĻle devient plus intelligent â câest à cause de la façon dont le systÃĻme rÃĐutilise le contexte des invites prÃĐcÃĐdentes.
Les systÃĻmes dâIA modernes ne traitent pas chaque requÊte de maniÃĻre isolÃĐe. Ils construisent un contexte, en stockant les invites et les rÃĐponses prÃĐcÃĐdentes dans la mÃĐmoire, souvent dans ce que lâon appelle un cache KV. Ce cache se trouve à proximitÃĐ du GPU pour quâil puisse Être accÃĐdÃĐ rapidement lors de la gÃĐnÃĐration de rÃĐponses de suivi.
La premiÃĻre requÊte est coÃŧteuse car elle initialise cet ÃĐtat â en allouant de la mÃĐmoire, en traitant lâentrÃĐe et en construisant le contexte. Les requÊtes suivantes rÃĐutilisent cet ÃĐtat, ce qui rÃĐduit la latence et amÃĐliore la rÃĐactivitÃĐ.
Ce dynamisme devient plus important à mesure que les fenÊtres de contexte sâÃĐtendent de milliers à des centaines de milliers â ou mÊme des millions â de jetons. Plus le systÃĻme conserve de contexte, plus il exerce de pression sur la mÃĐmoire et lâinfrastructure, ce qui rend critique la dÃĐcision de ce qui est stockÃĐ, compressÃĐ ou supprimÃĐ.
Du point de vue de lâutilisateur, cela ressemble à un systÃĻme plus rapide. Du point de vue de lâinfrastructure, câest un compromis complexe entre la mÃĐmoire, la latence et le coÃŧt.
Câest là que le vÃĐritable travail se dÃĐroule : non seulement dans le modÃĻle lui-mÊme, mais dans le systÃĻme qui lâentoure.
La contrainte ultime : lâÃĐnergie
Une fois que vous allez au-delà des performances du modÃĻle, la conversation change rapidement.
Les ÃĐquipes qui exÃĐcutent lâIA Ã grande ÃĐchelle ne se demandent pas principalement quel modÃĻle est le meilleur. Ils se demandent comment le maintenir.
Lâinfrastructure dâIA pousse contre les limites physiques : disponibilitÃĐ de lâÃĐnergie, capacitÃĐ de refroidissement et bande passante de la mÃĐmoire. Les centres de donnÃĐes sont reconçus autour de ces contraintes, et les organisations qui dÃĐployent des systÃĻmes dâIA à grande ÃĐchelle commencent à fonctionner plus comme des services publics que comme des sociÃĐtÃĐs de logiciels traditionnelles.
Nous voyons dÃĐjà cela dans les grandes entreprises qui construisent des infrastructures dâIA, oÃđ lâÃĐnergie et le refroidissement â et non la capacitÃĐ du modÃĻle â deviennent la principale contrainte.
Les charges de travail dâIA ne sont pas faciles à mettre à lâÃĐchelle ou prÃĐvisibles. Ils accumulent la demande sur le calcul, la mÃĐmoire et le rÃĐseau en mÊme temps. GÃĐnÃĐrer plus de jetons nâest pas simplement une question dâajouter plus de GPU ; câest une question de savoir si lâinfrastructure sous-jacente peut supporter la charge ÃĐnergÃĐtique et thermique requise pour maintenir ces systÃĻmes en fonctionnement efficacement.
Le coÃŧt de la gÃĐnÃĐration dâun jeton va donc au-delà du calcul. Il inclut lâÃĐlectricitÃĐ, le refroidissement, lâinfrastructure physique et la capacitÃĐ de maintenir les performances sous charge sans dÃĐgradation.
La plupart des discussions sur le âcoÃŧt par jetonâ ne reflÃĻtent pas pleinement cette rÃĐalitÃĐ. à grande ÃĐchelle, lâÃĐnergie devient le budget, et non seulement un ÃĐlÃĐment de coÃŧt.
Le futur nâest pas dans les modÃĻles plus grands. Câest dans les systÃĻmes meilleurs.
Pendant les deux derniÃĻres annÃĐes, lâindustrie sâest concentrÃĐe sur les comparaisons de modÃĻles, en regardant les benchmarks, les classements et les amÃĐliorations incrÃĐmentales de capacitÃĐ.
Cette focalisation commence à changer.
Dans les environnements de production, les performances sont moins liÃĐes au modÃĻle choisi et plus à la façon dont il est utilisÃĐ. Les organisations se dirigent vers des systÃĻmes de modÃĻles â en combinant des modÃĻles grands et petits, en acheminant les tÃĒches de maniÃĻre intelligente et en optimisant pour le coÃŧt, la latence et le dÃĐbit sur lâensemble du flux de travail.
Au lieu dâenvoyer chaque requÊte à un grand modÃĻle, les systÃĻmes dÃĐcomposent les charges de travail en composants plus petits. Les tÃĒches plus simples peuvent Être traitÃĐes par des modÃĻles plus efficaces, tandis que les raisonnements plus complexes sont rÃĐservÃĐs aux plus grands. Le contexte est rÃĐutilisÃĐ partout oÃđ cela est possible, et les stratÃĐgies de mise en cache sont appliquÃĐes de maniÃĻre agressive.
Ces dÃĐcisions ont souvent un impact plus important sur les performances et le coÃŧt que le passage dâun modÃĻle à un autre. Dans ce sens, les jetons restent lâunitÃĐ de travail, mais le systÃĻme qui les gÃĐnÃĻre et les gÃĻre devient le vÃĐritable diffÃĐrenciateur.
La couche la plus nÃĐgligÃĐe dans les systÃĻmes dâIA
LâIA est souvent dÃĐcrite en termes de modÃĻles dâun cÃītÃĐ et dâapplications de lâautre, mais la couche entre les deux est oÃđ se trouve la plupart de la complexitÃĐ â et de lâopportunitÃĐ.
Cette couche ne dÃĐplace pas seulement les requÊtes ; elle les façonne. Elle dÃĐtermine comment le trafic sâÃĐcoule, comment les dÃĐcisions sont appliquÃĐes et comment les systÃĻmes se comportent dans des conditions rÃĐelles.
La livraison et la sÃĐcuritÃĐ ne peuvent pas Être traitÃĐes comme des prÃĐoccupations distinctes ici. La mÊme couche qui achemine les requÊtes et gÃĻre le contexte est ÃĐgalement oÃđ les politiques sont appliquÃĐes, les risques sont attÃĐnuÃĐs et la confiance est ÃĐtablie.
à mesure que la complexitÃĐ augmente, les solutions ponctuelles se dÃĐcomposent. Ce qui est nÃĐcessaire, câest une plate-forme unifiÃĐe qui puisse coordonner ces fonctions en temps rÃĐel, plutÃīt que de les assembler aprÃĻs coup.
Câest là que les compromis sont faits. Câest là que le coÃŧt est contrÃīlÃĐ, que les performances sont optimisÃĐes et que les dÃĐcisions de sÃĐcuritÃĐ sont appliquÃĐes en temps rÃĐel. à mesure que les systÃĻmes dâIA se mettent à lâÃĐchelle, cette couche devient de plus en plus importante. Câest la diffÃĐrence entre un systÃĻme qui fonctionne bien dans une dÃĐmo et un systÃĻme qui fonctionne de maniÃĻre fiable et efficace en production. Ce changement a des implications rÃĐelles pour la façon dont les organisations conçoivent et gÃĻrent les systÃĻmes dâIA.
Ce que cela signifie pour les organisations
Alors que les entreprises dÃĐplacent lâIA vers la production, la question nâest pas seulement de savoir quel modÃĻle utiliser â câest comment le systÃĻme qui lâentoure est conçu pour fonctionner.
Cela signifie rÃĐflÃĐchir au-delà des mÃĐtriques de jetons et des benchmarks de modÃĻles, et se concentrer sur la façon dont les requÊtes sont acheminÃĐes, comment le contexte est gÃĐrÃĐ et comment les politiques sont appliquÃĐes sur lâensemble du flux de travail.
La plupart des organisations sont encore en train de coudre ces piÃĻces ensemble â et cette approche ne tient pas sous la pression de la production rÃĐelle.
Nous mesurons la mauvaise chose
Les jetons fournissent une abstraction utile. Ils donnent à lâindustrie un moyen de quantifier quelque chose qui ÃĐtait autrefois intangible, mais ils ne reprÃĐsentent pas lâimage complÃĻte.
Actuellement, lâindustrie se dirige vers ce qui est le plus facile à mesurer â les comptes de jetons, le dÃĐbit et les mÃĐtriques de coÃŧt â plutÃīt que ce qui compte le plus. Sans contexte, ces chiffres peuvent Être trompeurs.
La prochaine phase de lâIA ne sera pas dÃĐfinie par qui gÃĐnÃĻre le plus de jetons. Elle sera dÃĐfinie par qui comprend ce que ces jetons reprÃĐsentent, et qui peut construire des systÃĻmes qui les transforment en rÃĐsultats significatifs, efficaces et ÃĐvolutifs.
Parce que, Ã la fin, les jetons ne sont pas le produit. Ils sont simplement le sous-produit de lâintelligence qui est crÃĐÃĐe.












