Angle d’Anderson

Services d’inférence décentralisés de type PiedPiper pour l’IA ?

mm
Ajouter Unite.AI à vos sources préférées sur Google
AI-generated image (GPT-1.5): An esoteric visualization of an AI mesh network. Inset: publicity photo from HBO's 'Silicon Valley', via https://www.hollywoodreporter.com/tv/tv-reviews/silicon-valley-review-1250092/

Une ‘BitTorrent pour l’IA’ est-elle une possibilité imminente?

 

Opinion Ayant terminé hier une reprise de la satire tech-bro divertissante et acerbe de Mike Judge, Silicon Valley – dans laquelle un groupe de génies geeks socialement inadaptés tentent de créer un « nouveau internet » appelé PiedPiper, via un réseau maillé installé sur tous les téléphones mobiles – j’ai été intéressé de voir la communauté HN engagée avec une nouvelle offre de nature similaire.

DarkBloom d’Eigen Labs’ DarkBloom se situe quelque part entre la notion égalitaire d’un réseau maillé décentralisé pour l’inférence d’IA et les motivations de profit de l’extraction de crypto-monnaies, en permettant aux propriétaires de systèmes Mac Apple Silicon de transformer leur équipement en nœud d’inférence:

À partir de la section des gains du site Web de DarkBloom, les utilisateurs peuvent sélectionner quels équipements ils souhaitent louer et quels modèles d'IA ils souhaitent prendre en charge. Source: https://darkbloom.dev/

À partir de la section des gains du site Web de DarkBloom, les utilisateurs peuvent sélectionner quels équipements ils souhaitent louer et quels modèles d’IA ils souhaitent prendre en charge. Source

Le système se concentre actuellement sur des modèles basés sur du texte, tels que le Trinity Mini (3B) et Cohere Transcribe, bien qu’il propose également des modèles de génération d’images diversifiés tels que FLUX 2 Klein 4B:

La gamme de modèles dont le « propriétaire » peut choisir de louer, ainsi que les gains mensuels projetés.

La gamme de modèles dont le « propriétaire » peut choisir de louer, ainsi que les gains mensuels projetés.

Les utilisateurs participant au schéma peuvent apparemment gagner suffisamment d’argent en un mois solide de prestation d’inférence pour ajouter régulièrement un nouveau Mac à une chaîne en constante expansion, jusqu’à ce qu’ils puissent gagner une ferme d’inférence à part entière.

En effet, un schéma de ce type qui gagnerait vraiment en popularité (il a actuellement un problème de démarrage à froid) pourrait remettre les utilisateurs enthousiastes et occasionnels dans une position de recherche de matériel, comme lors de la dernière grande vague de crypto-monnaies (et de la crise subséquente).

Pas si vite

Cependant, pour les petits acteurs, ce bateau peut avoir pris le large. Outre le besoin apocalyptique de l’IA en matière de mémoire vive, la demande de centres de données équipés d’IA à l’échelle mondiale continue de faire augmenter les coûts du matériel et des services pour les consommateurs ordinaires, qui étaient précédemment capables de monopoliser la mémoire vive pour l’extraction de crypto-monnaies, en raison de la nature périphérique de l’activité, ainsi que de l’incertitude réglementaire, qui a tenu les intérêts commerciaux circonspects sur la crypto-monnaie.

Alors que le MacBook Neo très abordable est apparu comme une alternative qui bat les coûts pour surmonter l’escalade du matériel, son processeur de téléphone mobile A18 et ses 8 Go de VRAM ne le mettent pas en concurrence sérieuse en tant que machine d’inférence.

Mais même si l’utilisateur final ne cherche pas à créer une ferme d’inférence à part entière et souhaite simplement louer sa capacité M[n] inutilisée, les gains potentiels semblent importants, si le problème de démarrage à froid (un manque initial d’utilisateurs au lancement d’une entreprise qui repose sur un grand volume de participants) se résout rapidement, et si la plate-forme commence à se faire connaître comme quelque chose de plus qu’une expérience curieuse en matière de demande potentielle.

Inférer différemment

Bien que plusieurs commentateurs aient reconnu une démocratie de type PiedPiper/Torrent dans le schéma de DarkBloom, les tâches d’inférence ne sont pas aussi faciles à diviser que la fragmentation d’un fichier de film en plusieurs tranches hachées, de sorte qu’il puisse être réassemblé plus tard dans un client de torrent.

Le modèle DarkBloom ne propose pas qu’un participant traite x % d’une tâche d’inférence avec son processeur M[n]. Dans l’utilisation courante, seuls quelques cadres ou méthodologies peuvent réaliser une utilisation croisée de GPU sur une tâche d’inférence unique, notamment TensorRT LLM de NVIDIA, qui utilise le parallélisme de pipeline; et l’inférence fragmentée de DeepSpeed, qui exploite le parallélisme de modèle (MP).

Au lieu de cela, votre Mac compatible DarkBloom téléchargerait et exécuterait l’un des modèles répertoriés et effectuerait 100 % de l’inférence pour les utilisateurs payants, avec un chiffrement de bout en bout, et avec des invites déchiffrées uniquement sur des nœuds attestés par le matériel, ce qui signifie que les fournisseurs ne pourraient pas lire les données pendant l’exécution. La charge de travail elle-même constituerait une ou plusieurs inférences basées sur du texte, ou au moins une image complète.

Il n’est pas clair à quel point une session utilisateur unique serait étendue; actuellement, les amateurs d’IA sont habitués à sécuriser un GPU via des fermes d’inférence telles que RunPod; bien qu’il puisse prendre un certain temps pour sécuriser le GPU souhaité à l’utilisation de pointe, l’utilisateur peut monopoliser le GPU tant que la session n’est pas autorisée à expirer.

Il est donc possible qu’un seul utilisateur payant puisse utiliser les capacités d’IA de la série M d’un Mac loué DarkBloom pendant une session très longue, à moins qu’il n’y ait un avantage logistique ou de conformité à faire passer les clients entre les demandes.

Les Mac ont été sélectionnés pour cette approche, apparemment, parce qu’il n’y a qu’un nombre limité de configurations techniques possibles pour un participant, et qu’il est donc facile d’attribuer des modèles de taille appropriée à un client.

En outre, les Mac capables de contribuer à un réseau DarkBloom ont un sanctuaire sécurisé qui garantit un mur entre l’utilisateur et le fournisseur.

Ces facteurs ne sont pas si faciles à rationaliser sur des configurations personnalisées plus génériques et sur les centaines ou les milliers d’ordinateurs portables et de bureau Windows et Linux disponibles au cours des 6 ou 7 dernières années.

Cependant, il doit être évident que le bassin de matériel non Mac beaucoup plus important pourrait répondre à une demande massive si ses caractéristiques diverses pouvaient être rationalisées, plutôt que de – comme DarkBloom – s’appuyer sur les jeux de spécifications limités d’Apple, ce qui fait une affaire facile et une approche architecturale (prétendument) plus facile.

Surveillance légale?

Le problème le plus important auquel est confrontée une solution « démocratique » de ce type est la nature fermée du processus proposé; les gouvernements du monde entier sont actuellement engagés dans de nouvelles législations qui mettraient effectivement fin à l’anonymat sur Internet partout où elles sont instituées, et sont clairement pas dans une mentalité pro-privacy à cette période.

Par conséquent, la perspective d’une inférence d’IA aléatoire effectuée sans filtres, vérifications ou équilibre, sur un réseau distribué (si l’on peut appeler DarkBloom cela – c’est plus un marché d’inférence) semble, ironiquement, lointaine.

Il est possible que DarkBloom, ou d’autres schémas d’inférence maillée subséquents, devront accepter des portes dérobées qui restreignent effectivement la confidentialité au hôte, qui ne pourra pas voir les tâches client en cours d’exécution; à la place, les données d’inférence renvoyées seraient mises à disposition par des structures de type homme du milieu (MiTM) des agences gouvernementales, en gardant toutes les inférences auditable.

Prétendument, si la vague de nouvelles lois proposant des vérifications d’identité au niveau du système d’exploitation devaient jamais être largement adoptées, de telles mesures pourraient devenir redondantes. Mais sans elles, en tenant compte du climat actuel, un réseau de type DarkBloom serait probablement considéré comme un « darknet » d’IA, où des activités illégales basées sur l’IA pourraient se produire en secret.

Tests de division

Jusqu’à présent, il y a eu très peu de véritables tentatives pour faire ce que suggère un système de type « PiedPiper »; DarkBloom se situe à une extrémité, en distribuant des tâches complètes à des machines individuelles plutôt qu’en tentant de les fragmenter sur un réseau, tandis que la plupart des systèmes de production évitent simplement le problème en gardant l’inférence sur un hôte unique.

Il existe cependant une poignée de projets qui représentent quelque chose de plus proche d’une « exécution partagée ».

Petals, qui se décrit activement comme un réseau de type « BitTorrent », distribue des blocs de transformateurs sur plusieurs nœuds connectés à Internet, en passant des états intermédiaires entre eux:

Un flux de travail typique de Petals, où une demande d'inférence unique est acheminée via plusieurs GPU à distance, chacun contenant un sous-ensemble de couches de modèle; contrairement à DarkBloom, l'exécution est fragmentée sur le réseau, avec des états intermédiaires passés entre des nœuds indépendants, augmentant ainsi la latence et l'exposition à chaque saut tout en approximant un véritable système maillé.

Un flux de travail typique de Petals, où une demande d’inférence unique est acheminée via plusieurs GPU à distance, chacun contenant un sous-ensemble de couches de modèle; contrairement à DarkBloom, l’exécution est fragmentée sur le réseau, avec des états intermédiaires passés entre des nœuds indépendants, augmentant ainsi la latence et l’exposition à chaque saut tout en approximant un véritable système maillé. Source

Hivemind expérimente une coordination et une routage d’expertise similaires, bien que dans le cadre de la formation de modèles plutôt que de l’inférence à partir de modèles déjà formés; et Lattica se concentre sur la couche de réseau sous-jacente nécessaire pour rendre de tels systèmes viables:

Un schéma de Lattica, montrant une sous-couche peer-to-peer qui gère le traversal NAT, la distribution de contenu et la coordination basée sur DHT (Distributed Hash Table), avec une inférence fragmentée émergeant uniquement comme une couche d'application possible; contrairement à DarkBloom ou Petals, Lattica ne définit pas lui-même un système d'inférence, mais fournit les primitives de réseau et de synchronisation nécessaires pour en construire un.

Un schéma de Lattica, montrant une sous-couche peer-to-peer qui gère le traversal NAT, la distribution de contenu et la coordination basée sur DHT (Distributed Hash Table), avec une inférence fragmentée émergeant uniquement comme une couche d’application possible; contrairement à DarkBloom ou Petals, Lattica ne définit pas lui-même un système d’inférence, mais fournit les primitives de réseau et de synchronisation nécessaires pour en construire un. Source

Tous ces modèles s’approchent de l’idéal maillé, mais au prix d’une latence, d’une instabilité et d’une exposition.

Conversely, exo garde l’inférence dans un cluster local, en utilisant des interconnexions rapides pour diviser les charges de travail sur des GPU, sans s’appuyer sur Internet. Dans la pratique, ce type de configuration se comporte moins comme un réseau maillé distribué et plus comme une machine unique étendue, bien qu’il y ait une possibilité claire d’étendre cette approche sur un réseau plus large:

Une vue de cluster d'exo, montrant un petit anneau de machines Apple Silicon locales qui hébergent conjointement un modèle unique, avec une distribution de couches de pipeline ou de tenseurs sur les nœuds; contrairement aux systèmes basés sur le WAN, exo s'appuie sur des interconnexions locales rapides, transformant efficacement plusieurs appareils en une machine d'inférence composite unique.

Une vue de cluster d’exo, montrant un petit anneau de machines Apple Silicon locales qui hébergent conjointement un modèle unique, avec une distribution de couches de pipeline ou de tenseurs sur les nœuds; contrairement aux systèmes basés sur le WAN, exo s’appuie sur des interconnexions locales rapides, transformant efficacement plusieurs appareils en une machine d’inférence composite unique. Source

Enfin, plusieurs approches couramment citées n’abordent pas du tout l’inférence: le vénérable (2016) FedAvg de Google; la sortie de MIT en 2018 SplitNN; et l’offre australienne de 2020 SplitFed, sont concernés par la distribution de la formation ou les échanges de données préservant la confidentialité, plutôt que de servir des demandes d’inférence en direct.

Puisque la formation est une perspective beaucoup plus gourmande en ressources que l’inférence, tout réseau qui prouve être capable de distribuer une telle charge de manière efficace, sur des grappes ou des nœuds, pourrait avoir une part disproportionnée d’intérêt des amateurs et des entreprises plus tard.

Conclusion

Parce que beaucoup de la technologie dans Silicon Valley était une invention farfelue, nous ne savons pas si PiedPiper était vraiment basé sur des hachages (c’est-à-dire en divisant et en distribuant les données en morceaux, de type torrent), ou s’il « réglait » une tâche ou même une session sur n’importe quel nœud à n’importe quel moment, ce que fait DarkBloom.

Cependant, la ruée actuelle pour fournir du matériel de formation et d’inférence au niveau des centres de données indique que le secteur de la fourniture s’attend à servir tout le monde, de la même manière que RunPod, ou se prépare à la fourniture de niveau d’entreprise le plus lucratif – une perspective tentante sapée par le manque général de tranchées dans le déploiement d’IA.

Si l’inférence maillée devient une réalité, il est raisonnable de s’attendre à ce que les premières tentatives pour en tirer parti proviendront des acteurs établis, tels qu’OpenAI et Anthropic, qui pourraient soit déployer des systèmes dédiés au sein d’une base d’installation d’applications massive, soit collaborer sur des systèmes open source faciles à installer (puisqu’il s’agit de sociétés de cette taille et de cette portée qui ont l’argent et la motivation pour rationaliser des installations difficiles de ce type).

En ce qui concerne la possibilité qu’un réseau maillé d’IA plus démocratique et impulsé par les utilisateurs puisse émerger, un véritable équivalent d’IA à BitTorrent – un certain nombre de facteurs sont opposés à cela.

Tout d’abord, la poussée mondiale actuelle contre le chiffrement et l’anonymat pourrait supprimer ou miner de nombreux mécanismes qui rendent des systèmes comme BitTorrent anonymes, tels que le chiffrement de bout en bout et les VPN. Une fois que les flux chiffrés génériques cachant ces protocoles sont ouverts à l’inspection, de nouvelles couches de surveillance et d’interdiction deviennent possibles, et cela pourrait miner l’attrait d’un système de type DarkBloom.

Deuxièmement, les réglementations émergentes ou proposées contre les « abus » d’IA, ou contre l’exploitation anonyme de frameworks open source, signifient que le coût de la conformité – négligeable au niveau de l’entreprise – prendrait probablement tous les petits acteurs hors du marché.

Enfin – le pouvoir d’un acteur majeur pour embrasser, étendre et éteindre (EEE, comme Facebook et Twitter l’ont prétendument fait avec des communautés Internet plus ad hoc), signifie que les acteurs majeurs actuels peuvent opérationnaliser et rationaliser le modèle maillé à leur avantage, sur un marché où les utilisateurs finals sont presque totally intolérants à tout frottement dans l’adoption.

 

Publié pour la première fois le jeudi 16 avril 2026

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai