Leaders d’opinion

La nouvelle économie de l’IA est basée sur les jetons – mais nous les mesurons tous de travers

mm
Ajouter Unite.AI à vos sources préférées sur Google

Il se passe un changement dans l’IA que la plupart des gens ressentent mais ne comprennent pas encore : nous sommes passés de la comptabilisation des requêtes à la comptabilisation des jetons.

À l’ère du web, nous mesurions les systèmes en requêtes par seconde. C’était clair, intuitif et principalement exact. Une requête arrivait, une réponse partait et vous pouviez mettre à l’échelle l’infrastructure autour de ce modèle.

Cette abstraction a disparu.

Dans l’IA, l’unité fondamentale n’est plus la requête – c’est le jeton. Chaque invite, chaque réponse et chaque chaîne de raisonnement sont décomposés en jetons, représentant le travail que le système effectue, le coût engagé et, de plus en plus, la valeur créée.

Naturellement, l’industrie s’est ralliée à ce changement, en introduisant des métriques comme les jetons par seconde, le coût par jeton et même le chiffre d’affaires par jeton. Cela ressemble à ce que nous ayons enfin trouvé un moyen de quantifier les systèmes d’IA. Mais cette approche est incomplète.

Le raccourci de l’industrie : les jetons équivalent à la valeur

Il y a une narration croissante selon laquelle les jetons sont la nouvelle monnaie de l’IA – que plus de jetons équivaut à plus d’intelligence, et par extension, à plus de chiffre d’affaires. C’est une idée convaincante, mais elle simplifie à l’extrême ce qui se passe réellement à l’intérieur de ces systèmes.

Tous les jetons ne sont pas égaux. Certains jetons représentent un travail réel : analyser les données, générer des insights, automatiser les flux de travail et soutenir les décisions qui conduisent aux résultats commerciaux. D’autres sont beaucoup moins significatifs – génération de contenu occasionnel, expérimentation ou cas d’utilisation qui ne sont jamais mis en production.

Vous pouvez déjà voir cela à l’intérieur des entreprises. Une équipe peut générer des millions de jetons pour soutenir la productivité des développeurs ou les opérations des clients, ayant un impact direct sur l’efficacité et le chiffre d’affaires. Une autre équipe peut générer le même volume en expérimentant avec des outils qui ne dépassent jamais l’exploration interne. Sur le papier, les comptes de jetons semblent identiques. Dans la réalité, la valeur commerciale est complètement différente.

Considérer tous les jetons comme des unités de valeur interchangeables crée une vision déformée de ce que l’IA fait réellement à l’intérieur d’une organisation. Les entreprises ne sont pas construites sur le volume de jetons ; elles sont construites sur ce que ces jetons permettent.

Pour comprendre cette différence, il faut regarder en dessous de la surface pour voir comment ces systèmes fonctionnent réellement.

Pourquoi votre deuxième invite est plus rapide que votre première

Si vous avez déjà utilisé un outil comme ChatGPT, vous avez probablement remarqué que votre deuxième question est souvent plus rapide que votre première. Ce comportement n’est pas dû au fait que le modèle devient plus intelligent – c’est à cause de la façon dont le système réutilise le contexte des invites précédentes.

Les systèmes d’IA modernes ne traitent pas chaque requête de manière isolée. Ils construisent un contexte, en stockant les invites et les réponses précédentes dans la mémoire, souvent dans ce que l’on appelle un cache KV. Ce cache se trouve à proximité du GPU pour qu’il puisse être accédé rapidement lors de la génération de réponses de suivi.

La première requête est coûteuse car elle initialise cet état – en allouant de la mémoire, en traitant l’entrée et en construisant le contexte. Les requêtes suivantes réutilisent cet état, ce qui réduit la latence et améliore la réactivité.

Ce dynamisme devient plus important à mesure que les fenêtres de contexte s’étendent de milliers à des centaines de milliers – ou même des millions – de jetons. Plus le système conserve de contexte, plus il exerce de pression sur la mémoire et l’infrastructure, ce qui rend critique la décision de ce qui est stocké, compressé ou supprimé.

Du point de vue de l’utilisateur, cela ressemble à un système plus rapide. Du point de vue de l’infrastructure, c’est un compromis complexe entre la mémoire, la latence et le coût.

C’est là que le véritable travail se déroule : non seulement dans le modèle lui-même, mais dans le système qui l’entoure.

La contrainte ultime : l’énergie

Une fois que vous allez au-delà des performances du modèle, la conversation change rapidement.

Les équipes qui exécutent l’IA à grande échelle ne se demandent pas principalement quel modèle est le meilleur. Ils se demandent comment le maintenir.

L’infrastructure d’IA pousse contre les limites physiques : disponibilité de l’énergie, capacité de refroidissement et bande passante de la mémoire. Les centres de données sont reconçus autour de ces contraintes, et les organisations qui déployent des systèmes d’IA à grande échelle commencent à fonctionner plus comme des services publics que comme des sociétés de logiciels traditionnelles.

Nous voyons déjà cela dans les grandes entreprises qui construisent des infrastructures d’IA, où l’énergie et le refroidissement – et non la capacité du modèle – deviennent la principale contrainte.

Les charges de travail d’IA ne sont pas faciles à mettre à l’échelle ou prévisibles. Ils accumulent la demande sur le calcul, la mémoire et le réseau en même temps. Générer plus de jetons n’est pas simplement une question d’ajouter plus de GPU ; c’est une question de savoir si l’infrastructure sous-jacente peut supporter la charge énergétique et thermique requise pour maintenir ces systèmes en fonctionnement efficacement.

Le coût de la génération d’un jeton va donc au-delà du calcul. Il inclut l’électricité, le refroidissement, l’infrastructure physique et la capacité de maintenir les performances sous charge sans dégradation.

La plupart des discussions sur le “coût par jeton” ne reflètent pas pleinement cette réalité. À grande échelle, l’énergie devient le budget, et non seulement un élément de coût.

Le futur n’est pas dans les modèles plus grands. C’est dans les systèmes meilleurs.

Pendant les deux dernières années, l’industrie s’est concentrée sur les comparaisons de modèles, en regardant les benchmarks, les classements et les améliorations incrémentales de capacité.

Cette focalisation commence à changer.

Dans les environnements de production, les performances sont moins liées au modèle choisi et plus à la façon dont il est utilisé. Les organisations se dirigent vers des systèmes de modèles – en combinant des modèles grands et petits, en acheminant les tâches de manière intelligente et en optimisant pour le coût, la latence et le débit sur l’ensemble du flux de travail.

Au lieu d’envoyer chaque requête à un grand modèle, les systèmes décomposent les charges de travail en composants plus petits. Les tâches plus simples peuvent être traitées par des modèles plus efficaces, tandis que les raisonnements plus complexes sont réservés aux plus grands. Le contexte est réutilisé partout où cela est possible, et les stratégies de mise en cache sont appliquées de manière agressive.

Ces décisions ont souvent un impact plus important sur les performances et le coût que le passage d’un modèle à un autre. Dans ce sens, les jetons restent l’unité de travail, mais le système qui les génère et les gère devient le véritable différenciateur.

La couche la plus négligée dans les systèmes d’IA

L’IA est souvent décrite en termes de modèles d’un côté et d’applications de l’autre, mais la couche entre les deux est où se trouve la plupart de la complexité – et de l’opportunité.

Cette couche ne déplace pas seulement les requêtes ; elle les façonne. Elle détermine comment le trafic s’écoule, comment les décisions sont appliquées et comment les systèmes se comportent dans des conditions réelles.

La livraison et la sécurité ne peuvent pas être traitées comme des préoccupations distinctes ici. La même couche qui achemine les requêtes et gère le contexte est également où les politiques sont appliquées, les risques sont atténués et la confiance est établie.

À mesure que la complexité augmente, les solutions ponctuelles se décomposent. Ce qui est nécessaire, c’est une plate-forme unifiée qui puisse coordonner ces fonctions en temps réel, plutôt que de les assembler après coup.

C’est là que les compromis sont faits. C’est là que le coût est contrôlé, que les performances sont optimisées et que les décisions de sécurité sont appliquées en temps réel. À mesure que les systèmes d’IA se mettent à l’échelle, cette couche devient de plus en plus importante. C’est la différence entre un système qui fonctionne bien dans une démo et un système qui fonctionne de manière fiable et efficace en production. Ce changement a des implications réelles pour la façon dont les organisations conçoivent et gèrent les systèmes d’IA.

Ce que cela signifie pour les organisations

Alors que les entreprises déplacent l’IA vers la production, la question n’est pas seulement de savoir quel modèle utiliser – c’est comment le système qui l’entoure est conçu pour fonctionner.

Cela signifie réfléchir au-delà des métriques de jetons et des benchmarks de modèles, et se concentrer sur la façon dont les requêtes sont acheminées, comment le contexte est géré et comment les politiques sont appliquées sur l’ensemble du flux de travail.

La plupart des organisations sont encore en train de coudre ces pièces ensemble – et cette approche ne tient pas sous la pression de la production réelle.

Nous mesurons la mauvaise chose

Les jetons fournissent une abstraction utile. Ils donnent à l’industrie un moyen de quantifier quelque chose qui était autrefois intangible, mais ils ne représentent pas l’image complète.

Actuellement, l’industrie se dirige vers ce qui est le plus facile à mesurer – les comptes de jetons, le débit et les métriques de coût – plutôt que ce qui compte le plus. Sans contexte, ces chiffres peuvent être trompeurs.

La prochaine phase de l’IA ne sera pas définie par qui génère le plus de jetons. Elle sera définie par qui comprend ce que ces jetons représentent, et qui peut construire des systèmes qui les transforment en résultats significatifs, efficaces et évolutifs.

Parce que, à la fin, les jetons ne sont pas le produit. Ils sont simplement le sous-produit de l’intelligence qui est créée.

Kunal Anand est le directeur principal des produits chez F5, où il dirige la stratégie produit pour la livraison d'applications, la sécurité et l'infrastructure d'IA.