Opinion

Votre dispositif Edge a été évalué sur un passage avant. Votre agent exécutera une boucle.

mm
Ajouter Unite.AI à vos sources préférées sur Google

La discussion sur le matériel concernant l’IA en périphérie est devenue beaucoup plus honnête au cours de l’année dernière. Un article récent sur ce site soutenait que l’ancienne hiérarchie de conception — « maximiser le débit, puis gérer l’alimentation et la thermique autour » — s’est inversée, et que pour les déploiements industriels, l’alimentation occupe désormais la première place, le débit brut venant en dernier. Cela s’inscrit dans un argument que cette publication avance depuis un certain temps : les appareils en périphérie sont « limités thermiquement, pas limités par les MIPS/le calcul », et les smartphones atteignent déjà ces limites. Ce sont des corrections réelles, et elles étaient attendues depuis longtemps.

Mais cela repose encore sur une hypothèse du monde qu’il corrige. Chaque élément de cette hiérarchie est budgété par rapport à une charge de travail supposée, et la charge de travail sur laquelle la plupart des gens budgètent encore est un seul passage avant : un modèle reçoit une entrée, produit une sortie, et le silicium a un moment pour refroidir.

Ce n’est pas ce qu’un agent fait. Un agent décide, appelle un outil, lit la réponse, puis décide de nouveau. Le nombre de fois qu’il parcourt cette boucle n’est pas une propriété de votre matériel, et ce n’est pas vraiment non plus une propriété de votre modèle. C’est une propriété du problème qui lui a été confié ce matin‑là. J’ai des agents qui fonctionnent sur du matériel en périphérie, et ce qui m’a le plus longtemps coûté à accepter n’était pas qu’ils étaient lents. C’était que le coût d’une exécution était fixé quelque part où je n’avais aucune visibilité au moment de la conception.

The Loop Is Unbounded Until Someone Types a Number

Ce n’est pas une mise en scène rhétorique ; c’est ainsi que les cadres sont réellement construits. Dans le SDK Agents d’OpenAI, le runner « exécute une boucle », et lorsque le modèle génère des appels d’outil, le runtime « exécute ces appels d’outil, ajoute les résultats, et relance la boucle ». La seule chose qui l’arrête est une limite de tours — dépasser max_turns déclenche une exception — et la documentation indique que vous pouvez passer max_turns=None pour désactiver complètement la limite.

Sur un serveur, ce nombre est une décision de facturation. Quelqu’un remarque la facture.

Sur un appareil, ce nombre est une décision thermique, car la longueur de la boucle correspond au cycle de travail. Et le cycle de travail est la seule variable avec laquelle le refroidissement passif ne peut pas contester.

Sustained Load Does Something Different to a Phone Than a Benchmark Does

Un benchmark de mars 2026 a soumis quatre plateformes à exactement ce type de charge : un modèle quantifié de 1,5 milliard de paramètres, une invite fixe de 258 tokens, vingt exécutions consécutives, mesurant le débit, la puissance et la température pour chacune. Il s’agit d’un préprint, et il teste un modèle sur quatre appareils, il faut donc considérer les chiffres spécifiques comme une caractérisation de ces plateformes plutôt que comme une loi de la nature. La forme du résultat est ce qui compte.

Un iPhone 16 Pro a atteint un pic de 40,35 tokens par seconde et n’a pas pu le maintenir. La dégradation est apparue dès les deux inférences. Il s’est stabilisé à 22,56 tokens par seconde — une réduction de 44 % — et est resté limité pendant 65 % du benchmark. L’ajustement dynamique de la tension et de la fréquence, le mécanisme qui réduit la fréquence d’horloge lorsque la température de jonction augmente, a fait exactement ce pour quoi il existe.

Le Galaxy S24 Ultra a échoué différemment, et pire. Au lieu de se dégrader, le gouverneur thermique Android a imposé un plancher de fréquence GPU strict à la sixième itération, à 78,3 °C, et l’inférence s’est arrêtée. Les auteurs soulignent ce qui importe ici mieux que je ne pourrais le faire : pour les déploiements d’agents, c’est « plus perturbateur qu’une dégradation progressive », car le système ne devient pas simplement plus lent ; il devient inutilisable.

Maintenant, retenez le détail qui rend cela accablant plutôt que simplement intéressant. Chacune de ces vingt exécutions a utilisé la même invite. C’est la charge de travail la plus indulgente que le matériel d’un agent puisse jamais voir, et deux téléphones phares n’ont pas pu la soutenir pendant vingt répétitions. Ce n’est pas non plus une découverte nouvelle — le point MELT, présenté à MobiCom en 2024, concluait que pour des raisons d’énergie et de thermique « l’exécution continue des LLM reste insaisissable ». Deux ans et plusieurs nœuds de processus plus tard, le même mur.

Two Curves Move Toward Each Other, and Your Product Breaks Where They Cross

La boucle d’un agent est pire qu’une invite répétée d’une manière spécifique et mécanique.

Le décodage est limité par la bande passante mémoire : le débit est régi par la vitesse à laquelle le modèle peut lire son cache clé‑valeur, et non par le nombre d’opérations que la puce peut théoriquement exécuter. Ce cache augmente avec le contexte. Chaque étape de la boucle ajoute un résultat d’outil, une observation, un plan partiel — ainsi, la dixième étape génère des tokens à partir d’un cache nettement plus grand que celui de la première étape.

Pendant ce temps, l’appareil chauffe, et le gouverneur réduit les fréquences.

Ainsi, le coût par étape augmente exactement au moment où la capacité de l’appareil à le supporter diminue. Les deux courbes convergent, et là où elles se rencontrent, votre produit échoue. Ce n’est jamais à la première étape. La première étape est celle où vous avez testé.

Il y a également un problème d’échelle sous‑jacent. Le travail génératif représente simplement un ordre de dépense différent de ce que le silicium en périphérie a consommé pendant une décennie : mesuré sur 88 modèles, le coût de la classification de texte est d’environ 0,002 kWh par mille inférences contre 0,047 kWh pour la génération de texte — soit environ vingt fois plus, avant que toute boucle ne le multiplie. Ces mesures ont été prises sur un GPU de centre de données, pas sur un téléphone, il faut donc les interpréter comme un ratio entre types de travail plutôt que comme une valeur de puissance pour votre appareil. À titre d’échelle, la même étude estime qu’une charge complète de smartphone représente 0,022 kWh.

Buy on Joules per Finished Task, Not on Tokens per Second

Le résultat le plus utile de ce benchmark 2026 est celui qui semble le moins impressionnant.

Un NPU Hailo‑10H a atteint 6,9 tokens par seconde avec moins de 2 watts. Lent — réellement lent, et les auteurs le confirment. Mais son coefficient de variation du débit était de 0,04 %, soit deux ordres de grandeur plus stable que tout autre test. Le GPU d’ordinateur portable dans la même étude a délivré 131,7 tokens par seconde à 34,1 watts.

Comparez alors les deux sur la base de l’énergie plutôt que de la vitesse : 270,5 millijoules par token pour le petit NPU contre 297,3 pour le GPU. Malgré un écart de dix‑neuf fois en débit, la petite puce a effectué légèrement plus de calculs par joule — et l’a fait avec pratiquement aucune variation.

Si vous choisissez le matériel en fonction des tokens par seconde, vous achetez le plus rapide. Si vous choisissez en fonction de la capacité à compléter une boucle bornée à un coût prévisible, ce dont un agent a réellement besoin, le classement change. L’unité qui devrait figurer sur la fiche technique est le joule par tâche terminée, avec un chiffre de variance à côté. Un benchmark qui indique le débit maximal ne parle que de la première inférence de la journée.

The Honest Objection, and What It Does Not Solve

La réponse évidente est que c’est un problème transitoire : le silicium s’améliore, les NPU mûrissent, et tout ce qui a été écrit sur un téléphone de 2026 paraîtra désuet. Ou, plus concrètement, décharger les étapes coûteuses vers un serveur.

Je miserais moi‑même sur le matériel. Mais le déchargement est le aller‑retour que vous avez déplacé vers le edge pour l’éviter, et un agent ne le paie pas une fois — il le paie à chaque étape de la boucle, et la longueur de la boucle est ce que vous ne pouvez pas prévoir. Les conceptions hybrides ne suppriment pas la variance ; elles la déplacent sur le réseau.

L’asymétrie plus profonde ne suit pas les nœuds de processus. Le budget d’un appareil est fixé à la conception. La demande d’un agent est décidée à l’exécution, selon ce que l’utilisateur a demandé. Un meilleur silicium élève le plafond. Il ne dit pas à l’agent où se trouve ce plafond.

Alors indiquez‑le. Fixez la limite de tours dans la spécification produit plutôt que de la découvrir lors d’une revue de code, et choisissez le nombre à partir de l’enveloppe thermique : décidez combien d’étapes tiennent, puis concevez l’agent pour qu’il produise sa meilleure réponse disponible à cette contrainte plutôt que sa réponse idéale à une contrainte arbitraire. Traitez‑la comme une échéance, pas comme un objectif.

Ensuite, fournissez le budget à l’agent en entrée. La marge restante, l’état de la batterie, le fait que la plateforme ait déjà commencé à être throttlée — tout cela fait partie du contexte, tout comme l’heure actuelle. Un agent qui sait qu’il en est à l’étape huit sur dix peut résumer et valider. Un agent qui ne le sait pas continuera à explorer jusqu’à ce que le système d’exploitation décide pour lui.

Et testez la fin, pas la médiane, ce qui sur un appareil physique signifie tester en simulation. Le cas d’échec n’est jamais l’exécution propre. C’est l’exécution qui a nécessité quatorze étapes parce qu’un outil a renvoyé quelque chose d’ambigu à la troisième étape, et vous ne pouvez pas les énumérer manuellement sur un téléphone qui doit refroidir entre chaque tentative. Mes propres systèmes s’entraînent principalement sur des simulations pour cette raison : le comportement intéressant se trouve dans les longues exécutions, et les longues exécutions sont exactement ce que le matériel ne vous permettra pas d’échantillonner à la main.

Rien de tout cela ne nécessite un puce plus rapide. Il faut admettre que la charge de travail a changé de forme. Personne ne commercialise un appareil dont la batterie est dimensionnée pour une seule photo. Nous continuons à commercialiser des appareils dont le budget thermique est dimensionné pour une seule inférence.

Chase W. Hughes est trois fois fondateur qui a créé ProAI, l’un des premiers produits GPT commercialisés, utilisé par plus de 300 000 entreprises et institutions, et l’a vendu. Il détient un système de recherche multi‑agents en instance de brevet, déposé début 2023, et écrit sur la conception « agent‑first » sur chasewhughes.com.