Leaders d’opinion

La nouvelle ÃĐconomie de l’IA est basÃĐe sur les jetons – mais nous les mesurons tous de travers

mm
Ajouter Unite.AI à vos sources prÃĐfÃĐrÃĐes sur Google

Il se passe un changement dans l’IA que la plupart des gens ressentent mais ne comprennent pas encore : nous sommes passÃĐs de la comptabilisation des requÊtes à la comptabilisation des jetons.

À l’ÃĻre du web, nous mesurions les systÃĻmes en requÊtes par seconde. C’ÃĐtait clair, intuitif et principalement exact. Une requÊte arrivait, une rÃĐponse partait et vous pouviez mettre à l’ÃĐchelle l’infrastructure autour de ce modÃĻle.

Cette abstraction a disparu.

Dans l’IA, l’unitÃĐ fondamentale n’est plus la requÊte – c’est le jeton. Chaque invite, chaque rÃĐponse et chaque chaÃŪne de raisonnement sont dÃĐcomposÃĐs en jetons, reprÃĐsentant le travail que le systÃĻme effectue, le coÃŧt engagÃĐ et, de plus en plus, la valeur crÃĐÃĐe.

Naturellement, l’industrie s’est ralliÃĐe à ce changement, en introduisant des mÃĐtriques comme les jetons par seconde, le coÃŧt par jeton et mÊme le chiffre d’affaires par jeton. Cela ressemble à ce que nous ayons enfin trouvÃĐ un moyen de quantifier les systÃĻmes d’IA. Mais cette approche est incomplÃĻte.

Le raccourci de l’industrie : les jetons ÃĐquivalent à la valeur

Il y a une narration croissante selon laquelle les jetons sont la nouvelle monnaie de l’IA – que plus de jetons ÃĐquivaut à plus d’intelligence, et par extension, à plus de chiffre d’affaires. C’est une idÃĐe convaincante, mais elle simplifie à l’extrÊme ce qui se passe rÃĐellement à l’intÃĐrieur de ces systÃĻmes.

Tous les jetons ne sont pas ÃĐgaux. Certains jetons reprÃĐsentent un travail rÃĐel : analyser les donnÃĐes, gÃĐnÃĐrer des insights, automatiser les flux de travail et soutenir les dÃĐcisions qui conduisent aux rÃĐsultats commerciaux. D’autres sont beaucoup moins significatifs – gÃĐnÃĐration de contenu occasionnel, expÃĐrimentation ou cas d’utilisation qui ne sont jamais mis en production.

Vous pouvez dÃĐjà voir cela à l’intÃĐrieur des entreprises. Une ÃĐquipe peut gÃĐnÃĐrer des millions de jetons pour soutenir la productivitÃĐ des dÃĐveloppeurs ou les opÃĐrations des clients, ayant un impact direct sur l’efficacitÃĐ et le chiffre d’affaires. Une autre ÃĐquipe peut gÃĐnÃĐrer le mÊme volume en expÃĐrimentant avec des outils qui ne dÃĐpassent jamais l’exploration interne. Sur le papier, les comptes de jetons semblent identiques. Dans la rÃĐalitÃĐ, la valeur commerciale est complÃĻtement diffÃĐrente.

ConsidÃĐrer tous les jetons comme des unitÃĐs de valeur interchangeables crÃĐe une vision dÃĐformÃĐe de ce que l’IA fait rÃĐellement à l’intÃĐrieur d’une organisation. Les entreprises ne sont pas construites sur le volume de jetons ; elles sont construites sur ce que ces jetons permettent.

Pour comprendre cette diffÃĐrence, il faut regarder en dessous de la surface pour voir comment ces systÃĻmes fonctionnent rÃĐellement.

Pourquoi votre deuxiÃĻme invite est plus rapide que votre premiÃĻre

Si vous avez dÃĐjà utilisÃĐ un outil comme ChatGPT, vous avez probablement remarquÃĐ que votre deuxiÃĻme question est souvent plus rapide que votre premiÃĻre. Ce comportement n’est pas dÃŧ au fait que le modÃĻle devient plus intelligent – c’est à cause de la façon dont le systÃĻme rÃĐutilise le contexte des invites prÃĐcÃĐdentes.

Les systÃĻmes d’IA modernes ne traitent pas chaque requÊte de maniÃĻre isolÃĐe. Ils construisent un contexte, en stockant les invites et les rÃĐponses prÃĐcÃĐdentes dans la mÃĐmoire, souvent dans ce que l’on appelle un cache KV. Ce cache se trouve à proximitÃĐ du GPU pour qu’il puisse Être accÃĐdÃĐ rapidement lors de la gÃĐnÃĐration de rÃĐponses de suivi.

La premiÃĻre requÊte est coÃŧteuse car elle initialise cet ÃĐtat – en allouant de la mÃĐmoire, en traitant l’entrÃĐe et en construisant le contexte. Les requÊtes suivantes rÃĐutilisent cet ÃĐtat, ce qui rÃĐduit la latence et amÃĐliore la rÃĐactivitÃĐ.

Ce dynamisme devient plus important à mesure que les fenÊtres de contexte s’ÃĐtendent de milliers à des centaines de milliers – ou mÊme des millions – de jetons. Plus le systÃĻme conserve de contexte, plus il exerce de pression sur la mÃĐmoire et l’infrastructure, ce qui rend critique la dÃĐcision de ce qui est stockÃĐ, compressÃĐ ou supprimÃĐ.

Du point de vue de l’utilisateur, cela ressemble à un systÃĻme plus rapide. Du point de vue de l’infrastructure, c’est un compromis complexe entre la mÃĐmoire, la latence et le coÃŧt.

C’est là que le vÃĐritable travail se dÃĐroule : non seulement dans le modÃĻle lui-mÊme, mais dans le systÃĻme qui l’entoure.

La contrainte ultime : l’ÃĐnergie

Une fois que vous allez au-delà des performances du modÃĻle, la conversation change rapidement.

Les ÃĐquipes qui exÃĐcutent l’IA à grande ÃĐchelle ne se demandent pas principalement quel modÃĻle est le meilleur. Ils se demandent comment le maintenir.

L’infrastructure d’IA pousse contre les limites physiques : disponibilitÃĐ de l’ÃĐnergie, capacitÃĐ de refroidissement et bande passante de la mÃĐmoire. Les centres de donnÃĐes sont reconçus autour de ces contraintes, et les organisations qui dÃĐployent des systÃĻmes d’IA à grande ÃĐchelle commencent à fonctionner plus comme des services publics que comme des sociÃĐtÃĐs de logiciels traditionnelles.

Nous voyons dÃĐjà cela dans les grandes entreprises qui construisent des infrastructures d’IA, oÃđ l’ÃĐnergie et le refroidissement – et non la capacitÃĐ du modÃĻle – deviennent la principale contrainte.

Les charges de travail d’IA ne sont pas faciles à mettre à l’ÃĐchelle ou prÃĐvisibles. Ils accumulent la demande sur le calcul, la mÃĐmoire et le rÃĐseau en mÊme temps. GÃĐnÃĐrer plus de jetons n’est pas simplement une question d’ajouter plus de GPU ; c’est une question de savoir si l’infrastructure sous-jacente peut supporter la charge ÃĐnergÃĐtique et thermique requise pour maintenir ces systÃĻmes en fonctionnement efficacement.

Le coÃŧt de la gÃĐnÃĐration d’un jeton va donc au-delà du calcul. Il inclut l’ÃĐlectricitÃĐ, le refroidissement, l’infrastructure physique et la capacitÃĐ de maintenir les performances sous charge sans dÃĐgradation.

La plupart des discussions sur le “coÃŧt par jeton” ne reflÃĻtent pas pleinement cette rÃĐalitÃĐ. À grande ÃĐchelle, l’ÃĐnergie devient le budget, et non seulement un ÃĐlÃĐment de coÃŧt.

Le futur n’est pas dans les modÃĻles plus grands. C’est dans les systÃĻmes meilleurs.

Pendant les deux derniÃĻres annÃĐes, l’industrie s’est concentrÃĐe sur les comparaisons de modÃĻles, en regardant les benchmarks, les classements et les amÃĐliorations incrÃĐmentales de capacitÃĐ.

Cette focalisation commence à changer.

Dans les environnements de production, les performances sont moins liÃĐes au modÃĻle choisi et plus à la façon dont il est utilisÃĐ. Les organisations se dirigent vers des systÃĻmes de modÃĻles – en combinant des modÃĻles grands et petits, en acheminant les tÃĒches de maniÃĻre intelligente et en optimisant pour le coÃŧt, la latence et le dÃĐbit sur l’ensemble du flux de travail.

Au lieu d’envoyer chaque requÊte à un grand modÃĻle, les systÃĻmes dÃĐcomposent les charges de travail en composants plus petits. Les tÃĒches plus simples peuvent Être traitÃĐes par des modÃĻles plus efficaces, tandis que les raisonnements plus complexes sont rÃĐservÃĐs aux plus grands. Le contexte est rÃĐutilisÃĐ partout oÃđ cela est possible, et les stratÃĐgies de mise en cache sont appliquÃĐes de maniÃĻre agressive.

Ces dÃĐcisions ont souvent un impact plus important sur les performances et le coÃŧt que le passage d’un modÃĻle à un autre. Dans ce sens, les jetons restent l’unitÃĐ de travail, mais le systÃĻme qui les gÃĐnÃĻre et les gÃĻre devient le vÃĐritable diffÃĐrenciateur.

La couche la plus nÃĐgligÃĐe dans les systÃĻmes d’IA

L’IA est souvent dÃĐcrite en termes de modÃĻles d’un cÃītÃĐ et d’applications de l’autre, mais la couche entre les deux est oÃđ se trouve la plupart de la complexitÃР– et de l’opportunitÃĐ.

Cette couche ne dÃĐplace pas seulement les requÊtes ; elle les façonne. Elle dÃĐtermine comment le trafic s’ÃĐcoule, comment les dÃĐcisions sont appliquÃĐes et comment les systÃĻmes se comportent dans des conditions rÃĐelles.

La livraison et la sÃĐcuritÃĐ ne peuvent pas Être traitÃĐes comme des prÃĐoccupations distinctes ici. La mÊme couche qui achemine les requÊtes et gÃĻre le contexte est ÃĐgalement oÃđ les politiques sont appliquÃĐes, les risques sont attÃĐnuÃĐs et la confiance est ÃĐtablie.

À mesure que la complexitÃĐ augmente, les solutions ponctuelles se dÃĐcomposent. Ce qui est nÃĐcessaire, c’est une plate-forme unifiÃĐe qui puisse coordonner ces fonctions en temps rÃĐel, plutÃīt que de les assembler aprÃĻs coup.

C’est là que les compromis sont faits. C’est là que le coÃŧt est contrÃīlÃĐ, que les performances sont optimisÃĐes et que les dÃĐcisions de sÃĐcuritÃĐ sont appliquÃĐes en temps rÃĐel. À mesure que les systÃĻmes d’IA se mettent à l’ÃĐchelle, cette couche devient de plus en plus importante. C’est la diffÃĐrence entre un systÃĻme qui fonctionne bien dans une dÃĐmo et un systÃĻme qui fonctionne de maniÃĻre fiable et efficace en production. Ce changement a des implications rÃĐelles pour la façon dont les organisations conçoivent et gÃĻrent les systÃĻmes d’IA.

Ce que cela signifie pour les organisations

Alors que les entreprises dÃĐplacent l’IA vers la production, la question n’est pas seulement de savoir quel modÃĻle utiliser – c’est comment le systÃĻme qui l’entoure est conçu pour fonctionner.

Cela signifie rÃĐflÃĐchir au-delà des mÃĐtriques de jetons et des benchmarks de modÃĻles, et se concentrer sur la façon dont les requÊtes sont acheminÃĐes, comment le contexte est gÃĐrÃĐ et comment les politiques sont appliquÃĐes sur l’ensemble du flux de travail.

La plupart des organisations sont encore en train de coudre ces piÃĻces ensemble – et cette approche ne tient pas sous la pression de la production rÃĐelle.

Nous mesurons la mauvaise chose

Les jetons fournissent une abstraction utile. Ils donnent à l’industrie un moyen de quantifier quelque chose qui ÃĐtait autrefois intangible, mais ils ne reprÃĐsentent pas l’image complÃĻte.

Actuellement, l’industrie se dirige vers ce qui est le plus facile à mesurer – les comptes de jetons, le dÃĐbit et les mÃĐtriques de coÃŧt – plutÃīt que ce qui compte le plus. Sans contexte, ces chiffres peuvent Être trompeurs.

La prochaine phase de l’IA ne sera pas dÃĐfinie par qui gÃĐnÃĻre le plus de jetons. Elle sera dÃĐfinie par qui comprend ce que ces jetons reprÃĐsentent, et qui peut construire des systÃĻmes qui les transforment en rÃĐsultats significatifs, efficaces et ÃĐvolutifs.

Parce que, à la fin, les jetons ne sont pas le produit. Ils sont simplement le sous-produit de l’intelligence qui est crÃĐÃĐe.

Kunal Anand est le directeur principal des produits chez F5, oÃđ il dirige la stratÃĐgie produit pour la livraison d'applications, la sÃĐcuritÃĐ et l'infrastructure d'IA.