Angle d’Anderson

L’intelligence artificielle réussira-t-elle finalement à prospérer en dehors du fossé ?

mm
Ajouter Unite.AI à vos sources préférées sur Google
A cartoon image of a SIMs-style game where a Scottish Laird in his castle is regarding the thriving villagers beyond his moat with puzzlement. GPT-1.5.

Les coûts et les restrictions de l’intelligence artificielle, ainsi que son influence sur les coûts du matériel, obligent les utilisateurs à construire leurs propres systèmes – tout comme la réglementation croissante menace de fermer cette « économie de l’ombre de l’IA ».

 

Opinion Parmi les nombreux « pièges » qui apparaissent dans les articles de recherche scientifique, l’un des plus fréquents est que le problème abordé dans l’article a déjà été résolu ailleurs, et que la contribution de la nouvelle recherche est purement incidentale ou incrémentale.

Cela peut se produire pour diverses raisons: les chercheurs espéraient un saut quantique, mais n’ont obtenu qu’un quasi-saut; les solutions antérieures du problème étaient plus gourmandes en ressources que la nouvelle offre; ou simplement que les objectifs du projet ont échoué, mais que la culture « publier ou périr » de la recherche académique a forcé l’équipe à le publier quand même (souvent enterré parmi l’avalanche d’une journée de publication la plus chargée d’un portail).

Dans la littérature sur l’apprentissage automatique, cependant, une raison relativement nouvelle et sans apologie devient plus fréquente: que la fonctionnalité ou la caractéristique proposée n’est disponible que via des portails fermés et liés à des API.

Je considérais un tel article ce matin – une collaboration entre des universités chinoises et Amazon, qui aborde le problème récurrent de l’échec de la suppression d’objets dans les systèmes d’édition d’images basés sur la diffusion, qui remplissent souvent simplement l’espace cible avec un objet similaire au lieu de le supprimer:

À gauche, l'image d'origine; à droite, le masque de segmentation rouge qui indique à l'IA quelle partie de l'image supprimer; ensuite, 'Ours' montre une approche de suppression d'objets réussie - et les deux images suivantes montrent des systèmes similaires qui, au lieu de supprimer le bus, insèrent un bus différent à la place. Source - https://arxiv.org/pdf/2603.27599v1

À gauche, l’image d’origine; à droite, le masque de segmentation rouge qui indique à l’IA quelle partie de l’image supprimer; ensuite, ‘Ours’ montre une approche de suppression d’objets réussie – et les deux images suivantes montrent des systèmes similaires qui, au lieu de supprimer le bus, insèrent un bus différent à la place. Source

Dans l’exemple ci-dessus, l’image du centre montre la nouvelle approche supprimant avec succès le bus et insérant un arrière-plan plausible, par rapport aux deux méthodes précédentes (les deux images les plus à gauche), qui suppriment le bus, mais insèrent ensuite un bus différent dans l’image!

Gotcha!

En mettant de côté les raisons et les conséquences de ce défi pour l’instant (et c’est un sujet intéressant ), je suis ensuite tombé sur un classique « piège », en lisant le nouveau document: la concession des auteurs selon laquelle des systèmes propriétaires coûteux peuvent déjà effectuer cette tâche de manière fiable – quelque chose que je sais, après quelques années d’utilisation d’Adobe Firefly dans Photoshop, entre autres systèmes fermés:

‘Les méthodes basées sur la diffusion ont souvent des hallucinations en insérant des objets non intentionnels après la suppression des objets ciblés, conduisant à des résultats incohérents du point de vue du contexte.

‘D’un autre côté, les modèles multimodaux récents à code fermé, tels que ChatGPT et Nano Banana, sont plus puissants dans la suppression d’objets, mais impliquent de grands comptes de paramètres et une charge de calcul élevée, ce qui gêne leur déploiement pratique sur les appareils périphériques.

‘Par conséquent, il est tout à fait nécessaire de développer un modèle de suppression d’objets dédié qui ne permette pas seulement une suppression d’objets supérieure, mais qui profite également d’une latence d’inférence faible et de beaucoup moins de paramètres.’

Cette explication, qui se concentre sur les obstacles techniques, élude le fait évident que les architectures à code fermé telles que ChatGPT et Nano Banana ne sont pas disponibles pour une installation locale. Même si la capacité de ces systèmes à produire des matériaux litigieux a prêté une justification publique supplémentaire à leur contrôle pendant l’année écoulée, des portails de ce type sont principalement propriétaires en raison d’impératifs commerciaux.

En substance, le nouveau document implique que même si le problème ciblé est résolu dans les systèmes commerciaux, cela peut être sans importance pour le reste d’entre nous, qui ont besoin d’apprendre à résoudre ce problème dans le « monde réel » – c’est-à-dire dans les systèmes open source, qu’ils puissent être installés localement ou non.

Développement parallèle

Cependant, pourquoi résoudre un problème qui dépend encore d’un système payant, non pas en raison de contraintes propriétaires, mais parce que les ressources de calcul nécessaires dépassent ce que tout système local peut raisonnablement supporter? La plupart de ces nouveaux documents et dépôts de code « ouverts » présentent des configurations d’entraînement/inférence avec des exigences de ressources énormes, telles que des grappes de A100.

Eh bien, cela dépend de ce que l’on pense que tous ces centres de données d’IA en attente vont accomplir lorsqu’ils seront finalement mis en ligne. Les craintes des gens ordinaires et les espoirs des élites imaginent des systèmes propriétaires à moat, tels que ChatGPT, qui déplacent les emplois, tout en augmentant constamment les coûts d’abonnement et en réduisant les niveaux de service, pour satisfaire le capital de démarrage qui a dû attendre 3-5 ans pour être opérationnel.

Mais une tendance croissante dans la littérature semble soutenir un avenir alternatif, et l’esprit « va-tout-seul » de nombreuses communautés en ligne telles que le subreddit r/stablediffusion, qui compte actuellement 920 000 utilisateurs, et qui a depuis longtemps interdit les publications liées aux systèmes d’édition d’images/vidéo à code fermé.

Dans cet avenir alternatif, la nouvelle offre mondiale de centres de données d’IA facilitera le calcul brut pour les systèmes configurés par l’utilisateur, plutôt que de répondre aux exigences de monuments de « boîtes noires » tels que ChatGPT et Adobe Firefly.

Frottement de surface

En regardant les didacticiels complexes de GPU à distance sur r/stablediffusion, tout semble impossible pour le moment: les modèles changent constamment les objectifs avec chaque mise à jour; ils sont difficiles à déployer localement, même dans les cadres les plus faciles et les plus conviviaux; et, en général, la quantité de frottement impliquée suggère une poursuite strictement pour les amateurs de geek et pour cette souche d’entreprises plus aventureuses qui ne sont pas directement impliquées dans l’IA, mais qui souhaitent développer et maintenir leurs propres systèmes locaux, plutôt que de louer ces capacités.

Cependant, au cours des trente dernières années, chaque technologie pour laquelle il y avait une demande énorme pour une simplification et une commodification ouvertes et démocratiques a tendance à l’obtenir, les solutions les plus diffusées émergeant généralement des tensions entre les systèmes commerciaux et les alternatives et initiatives open source.

Les poursuites qui étaient autrefois des « enclaves de nerd » spécialisées, telles que les connexions Internet, les systèmes de gestion de contenu et les cadres de blog, ainsi que la sécurité Internet, la photographie et la gestion des médias, ont toutes évolué d’une complexité déconcertante vers la simplicité et l’utilité.

Par conséquent, le paysage de l’IA plus tard peut être plus varié et rempli de petits acteurs réellement concurrents que les leaders actuels du marché de l’IA ne le préféreraient.

Auto-réalisation, par nécessité

Ironiquement, « Big AI » contribue beaucoup à un esprit émergent d’indépendance parmi les utilisateurs finals, en absorbant pour ses centres de données tous les composants informatiques – en particulier la DRAM – qui auraient autrement été alloués aux « consommateurs ordinaires ».

Par conséquent, de nombreuses personnes imaginent un avenir où les ressources d’IA à code fermé sont accessibles via des clients légers sous-alimentés et développent un intérêt croissant pour maintenir leurs équipements existants.

L’attaque de l’IA contre les chaînes d’approvisionnement technologiques a également conduit les fournisseurs de services technologiques à augmenter leurs prix au cours des 3-6 derniers mois, soit parce que les petites entreprises sont réellement compressées par la pénurie de matériel, soit simplement parce que l’IA.

Cela a conduit à un intérêt croissant pour l’hébergement autonome et sur place – y compris l’hébergement autonome de réseaux d’apprentissage automatique.

Je me suis moi-même laissé prendre à cela récemment, en passant au stockage LAN local pour les photos et les vidéos, ainsi que pour les sauvegardes de fichiers. Pour les premiers, j’ai utilisé le serveur de médias multi-plateformes open source et gratuit Immich, qui m’aide à me débarrasser des hausses de prix (et d’autres problèmes) des fournisseurs de stockage cloud tels qu’iCloud:

La plate-forme Immich gratuite peut conserver vos médias sur vos équipements et les garder privés sur vos propres canaux. Dans ce cas, j'utilise également Immich sur Docker pour servir mon GPU NVIDIA 3090 sur le LAN à l'endroit où les photos et les vidéos sont enregistrées, de sorte que le GPU plus puissant puisse gérer tout traitement d'image/vidéo lourd.

La plate-forme Immich gratuite peut conserver vos médias sur vos équipements et les garder privés sur vos propres canaux. Dans ce cas, j’utilise également Immich sur Docker pour servir mon GPU NVIDIA 3090 sur le LAN à l’endroit où les photos et les vidéos sont enregistrées, de sorte que le GPU plus puissant puisse gérer tout traitement d’image/vidéo lourd.

Si ma propre expérience est un indicateur représentatif, vibe-coding – actuellement maudit dans de nombreuses communautés en ligne autrefois « pures » – est à l’origine de cette vague d’indépendance (même si elle peut menacer les dépôts open source sur lesquels elle s’appuie).

Par exemple, la mise en réseau a toujours été mon point faible en informatique, donc l’assistance de l’IA était essentielle pour que je puisse obtenir un VPS sécurisé, pour supporter une tranche de nouveaux services hébergés autonomement.

De cette façon, « Big AI » est en train d’autonomiser « Small AI »; par conséquent, nous pouvons peut-être considérer l’essor actuel des entreprises d’IA hyperscale et surévaluées comme un état nécessaire mais transitoire avant qu’une société d’IA plus démocratique et autonome n’émerge, rejetant les entreprises à la recherche de rentes et de fossés comme des fusées épuisées – tout comme l’effondrement des entreprises point-com en 2000 a laissé derrière lui des infrastructures exploitables qui accéléreraient profondément le Web longtemps après que les entreprises qui les ont payées aient disparu.

L’ère de la conformité

Eh bien, cela ne se reproduira probablement pas cette fois.

Même si nous sommes enclins à former une sorte de société de l’ex-moat marginale, la réglementation autour de l’IA, combinée avec la tendance actuelle mondiale vers la vérification de l’âge, semble susceptible d’anticiper et de bloquer ces voies de développement.

L’ancre pour empêcher une « économie de l’ombre de l’IA » est la réglementation. Déjà, des référentiels centraux tels que GitHub et Hugging Face exigent souvent une connexion en ligne avant de permettre aux utilisateurs de cloner des référentiels localement, en fonction des paramètres du référentiel.

Par conséquent, les mécanismes existent déjà pour faire respecter la surveillance des cadres d’IA plus largement que la pratique actuelle; et la volonté d’augmenter une telle surveillance se consolide désormais à partir d’initiatives gouvernementales individuelles en un élan mondial.

Donc, si les forces du marché et l’ingéniosité du mouvement FOSS devaient supprimer le frottement du déploiement d’IA occasionnel, des obstacles semblent prêts à réapparaître sous la forme de exigences de conformité: des exigences de conformité qui, même si elles sont fastidieuses, sont dignes d’intérêt pour les entreprises, mais peut-être pas pour les individus – similaires au frottement qui a été ajouté aux systèmes de paiement en ligne grand public depuis l’âge d’or de PayPal dans les années 2000.

Que Meta ait dépensé 2 milliards de dollars en lobbying pour le contrôle de l’âge au niveau du système d’exploitation en raison de son investissement important dans l’IA, ou de ses intérêts dans la collecte de données, l’issue du soutien des grandes entreprises technologiques à la vérification de l’âge est que l’IA « locale » peut devenir aussi réglementée qu’une substance de classe A; et, tout comme la DMCA a été conçue pour criminaliser l’intention plutôt que tout mécanisme spécifique d’évasion de droits d’auteur, les réglementations internationales sur l’IA pourraient, dans un tel scénario, rendre tout usage non conforme de l’apprentissage automatique un acte interdit, à peu de frais (en termes de surveillance active).

Cela pourrait sembler une prise de vue trop dystopique il y a un an – mais cela était avant que la Californie et systemd se soient ralliés à l’idée d’une vérification de l’âge au niveau du matériel, actuellement vue par beaucoup comme un proxy pour une interdiction de l’anonymat en ligne à la chinoise.

Conclusion

Donc, même si l’arrière-plan juridique et législatif se prépare peut-être à coopter l’IA dans un espace hautement réglementé, de sorte que les utilisateurs occasionnels ne puissent plus « brasser leur propre » que s’ils ne peuvent cultiver ou fermenter des substances réglementées sans autorisation, le secteur de la recherche maintient son attitude plus optimiste – que l’IA deviendra une force démocratique et bénéfique dans une société plus large que les seuls adeptes du fournisseur de code fermé le plus populaire du jour.

Beaucoup dépend de la disposition des décombres après l’éclatement de la bulle de l’IA – au moins dans la mesure où les fournisseurs soit se consolident, soit le marché se stabilise dans une balkanisation à long terme – ce qui nécessiterait probablement une touche réglementaire plus douce.

 

Publié pour la première fois le mercredi 1er avril 2026

Écrivain sur l'apprentissage automatique, spécialiste du domaine de la synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : [email protected]