Entretiens

Rob May, PDG et co-fondateur de NeuroMetric – Série d’entretiens

mm
Ajouter Unite.AI à vos sources préférées sur Google

Rob May, PDG et co-fondateur de NeuroMetric, est un entrepreneur chevronné et investisseur avec une longue expérience dans le domaine du cloud computing, des startups d’intelligence artificielle et du capital-risque, actuellement à la tête de Neurometric AI tout en servant en tant que directeur général chez HalfCourt Ventures, où il a soutenu plus de 100 entreprises technologiques. En plus de ses rôles opérationnels et d’investissement, il a co-fondé la communauté des innovateurs en intelligence artificielle et a précédemment créé et vendu des entreprises telles que Backupify, reflétant une expérience approfondie à travers plusieurs cycles technologiques. Il est également largement connu pour son bulletin d’information Investing in AI qui a débuté il y a plus d’une décennie pour analyser les tendances émergentes en intelligence artificielle, les stratégies d’investissement et les changements de marché, et qui est depuis devenu une plateforme pour des insights plus approfondis sur le paysage de l’intelligence artificielle en évolution rapide.

NeuroMetric AI se concentre sur la résolution de l’un des défis les plus critiques de l’intelligence artificielle aujourd’hui : le coût et l’efficacité de l’inférence à grande échelle. La plateforme évalue dynamiquement les charges de travail d’intelligence artificielle et applique des stratégies d’optimisation, telles que la combinaison de modèles spécialisés plus petits avec des techniques de calcul avancées en temps de test, pour améliorer les performances tout en réduisant considérablement les coûts, permettant ainsi aux entreprises d’obtenir un meilleur retour sur investissement de leurs déploiements d’intelligence artificielle. En orchestrant les charges de travail et en adaptant l’utilisation des modèles à des tâches spécifiques, Neurometric vise à rendre les systèmes d’intelligence artificielle significativement plus rapides et plus abordables, se positionnant à l’intersection de l’infrastructure d’intelligence artificielle, de l’efficacité et de la scalabilité dans le monde réel, à mesure que les organisations passent de l’expérimentation à la production.

Vous avez fondé et dirigé plusieurs entreprises d’intelligence artificielle, investi dans plus de 100 startups via HalfCourt Ventures, et précédemment créé et vendu Backupify. Comment ces expériences ont-elles façonné votre perspective sur l’endroit où la valeur durable est créée dans l’intelligence artificielle aujourd’hui ?

Je pense que la plupart des investisseurs et des entrepreneurs poursuivent des avantages à court terme – des choses qui ressemblent à des lacunes évidentes sur le marché aujourd’hui mais des lacunes qui seront rapidement comblées par les entreprises existantes. L’intelligence artificielle va rendre la conduite d’une entreprise une série de décisions probabilistes. Les entreprises à investir ou à créer sont celles qui ont les meilleures estimations globales de ces probabilités. Parfois, cela proviendra de l’intégration verticale et parfois de l’échelle horizontale – cela dépend du marché.

Dans votre bulletin d’information Investing in AI, vous avez soutenu que les modèles deviennent de plus en plus interchangeables et que la véritable défensibilité se déplace vers la couche des systèmes. Qu’est-ce qu’un véritable « avantage de système » ressemble-t-il dans la pratique ?

Un véritable avantage de système a trois propriétés : il s’accumule avec l’utilisation, il est spécifique au client et il ne peut pas être reproduit en remplaçant par un meilleur modèle.

La défensibilité vit dans ce que j’appelle un « Système de Contexte » – une architecture intégrée qui relie les modèles de base à tout ce qui rend une entreprise unique : ses données, ses flux de travail, ses connaissances de domaine, son historique de décision. Le système capte le signal de chaque interaction – quels modèles réussissent à quelles tâches, où la latence compte, quels modèles d’entreprise spécifiques émergent – et le renvoie pour améliorer celui-ci.

L’insight clé est que cela crée une roue dentée multiplicative, et non additive. Vous n’accumulez pas simplement un journal de recherche des décisions passées. Vous générez un signal de formation qui produit des modèles spécialisés qui améliorent le routage, ce qui capte des données plus précieuses. L’avantage de système s’élargit avec chaque inférence.

Dans la pratique, un avantage de système ressemble à une intégration de flux de travail profonde où les coûts de commutation ne concernent pas les API – ils concernent la réécriture de la logique métier. Cela ressemble à un contexte propriétaire que aucun concurrent ne peut reproduire car il a été généré à travers des mois d’utilisation de production à l’intérieur d’une entreprise spécifique. Et cela ressemble à la boucle de spécialisation continue où le système devient significativement meilleur pour ce client de manières qu’un fournisseur de modèle générique ne le fera jamais.

L’ère des modèles nous a donné la capacité brute. L’ère des systèmes est là où cette capacité devient une valeur réelle dans le monde.

Comment les entreprises devraient-elles réfléchir à la construction d’une stratégie multi-modèles, y compris la logique de routage, les chemins d’escalade et l’évaluation continue, au lieu de compter sur un seul modèle de pointe ?

La première chose que les entreprises doivent intérioriser est que « utiliser simplement le meilleur modèle » est une stratégie perdante à grande échelle. C’est l’équivalent de faire passer chaque requête par votre ingénieur le plus senior. C’est coûteux, c’est lent et – contre-intuitivement – cela ne produit souvent pas les meilleurs résultats.

Ceci nous amène à ce que j’appelle le Front Jagged de l’Inférence : les performances du modèle sont spécifiques à la tâche et imprévisibles. Les modèles de pointe perdent face à des modèles plus petits et spécialisés pour des tâches spécifiques tout le temps. Nous avons vu des systèmes multi-modèles composites atteindre 72,7 % de précision sur les tâches CRM où les modèles de pointe ont obtenu 58 %. La surface de performance ne se corrèle pas nettement avec le nombre de paramètres. Donc, la vraie question n’est pas « quel modèle est le meilleur ? » – c’est « quel modèle est le meilleur pour cette sous-tâche spécifique ? »

Cette reformulation est la fondation d’une véritable stratégie multi-modèles. Voici comment je dirais aux entreprises de réfléchir à cela en trois couches.

La logique de routage commence par la cartographie de votre paysage d’inférence. Cataloguez chaque point de votre système où un appel LLM est effectué, et pour chacun, documentez le type de tâche, la complexité d’entrée/sortie, les exigences de latence, le seuil d’exactitude et le volume d’appels. Cela vous donne une carte de chaleur. Vous trouverez rapidement que la plupart de votre volume est un travail à haute fréquence et à portée étroite – classification, extraction d’entités, routage d’intention, génération de modèles – où un modèle plus petit et spécialisé correspond ou bat le modèle de pointe à une fraction du coût. Réservez vos appels de pointe coûteux pour les tâches qui nécessitent réellement un raisonnement complexe. Un agent effectuant 50 appels par tâche n’a pas besoin de GPT-4 pour tous les 50.

Les chemins d’escalade sont à propos de la construction de rappels intelligents, et non seulement de basculement. Le système doit reconnaître quand un modèle plus petit renvoie des résultats de faible confiance et escalader vers un modèle plus capable – ou vers une combinaison de modèle et de stratégie complètement différente. C’est là que les stratégies de calcul en temps de test entrent en jeu. Parfois, la bonne réponse n’est pas un modèle plus grand – c’est le même modèle avec une chaîne de pensée, une recherche en faisceau ou un échantillonnage du meilleur des N. La configuration optimale change non seulement par modèle, mais par l’algorithme de réflexion que vous associez à celui-ci.

L’évaluation continue est la pièce que la plupart des entreprises manquent complètement, et c’est là que la véritable défensibilité émerge. La sélection du modèle n’est pas une décision ponctuelle – c’est un problème d’optimisation continu. De nouveaux modèles sont publiés constamment, vos cas d’utilisation évoluent et les performances se dégradent de manière silencieuse. Vous ne saurez pas que votre bot de service client a donné une réponse 40 % pire parce que vous avez utilisé le mauvais modèle pour ce type de requête – vous ne verrez que la rotation trois mois plus tard. Vous avez besoin d’une infrastructure qui mesure continuellement ce qui fonctionne réellement sur les combinaisons de modèles et ajuste le routage en fonction de données de performance réelles, et non de références.

La raison pour laquelle la plupart des entreprises n’ont pas effectué ce changement est que personne ne se fait licencier pour choisir le modèle de pointe – c’est le « personne ne se fait licencier pour acheter IBM » de l’intelligence artificielle. L’écosystème des fournisseurs pousse la pointe parce que c’est là que se trouvent les marges. Et l’infrastructure d’orchestration requise pour exécuter réellement une architecture multi-modèles – logique de routage, mécanismes de rappel, gestion de modèles, observabilité – n’existe simplement pas dans la plupart des entreprises. Ils sont coincés dans un optimum local où les coûts de commutation et l’incertitude de multi-modèles semblent plus élevés que les dépenses continues pour l’inférence de pointe.

Quelles sont les plus grandes erreurs que vous voyez les entreprises commettre lorsqu’elles passent des pilotes d’intelligence artificielle aux systèmes de production ?

Elles supposent que leurs choix peuvent être statiques et de longue durée. En réalité, chaque couche de la pile technologique pour l’intelligence artificielle change rapidement. Les entreprises doivent prendre des décisions qui offrent de l’optionnalité et de la flexibilité.

Quels sont les types de flux de travail dans lesquels vous avez vu des modèles plus petits et spécialisés surpasser les grands modèles de pointe, et pourquoi cela compte-t-il stratégiquement ?

Nous l’avons vu dans presque toutes les tâches de travail quotidiennes – des choses comme la comptabilité de base, la synthèse de texte, l’extraction d’entités à partir de divers documents. Nous avons exploré les SLM pour des centaines de tâches de travail et ils gagnent presque toujours si le problème est structuré correctement.

Vous avez écrit sur la diminution du coût marginal de déploiement de l’intelligence artificielle dans de nouveaux cas d’utilisation. Comment cela modifie-t-il l’économie à long terme de l’adoption de l’intelligence artificielle pour les entreprises ?

Le récit de la bulle suppose que les revenus de l’intelligence artificielle nécessitent un investissement de R&D proportionnel dans de nouveaux modèles. Ce n’est pas le cas. Les modèles sont construits. L’infrastructure existe. Chaque cas d’utilisation supplémentaire est une invite, une connexion de données, peut-être un léger réglage – pas une autre course de formation de 100 millions de dollars. La courbe de coût marginal se courbe vers le bas à mesure que la plateforme mûrit.

Ceci est l’opposé des chemins de fer ou des télécoms, où chaque nouveau mile de voie était coûteux. Dans l’intelligence artificielle, construire le moteur était coûteux. Connecter les choses au moteur est bon marché, et cela devient de moins en moins cher – les coûts d’inférence ont diminué d’environ 1 000 fois en deux ans. La question pour les entreprises n’est pas de savoir si l’intelligence artificielle paie. C’est de savoir combien de cas d’utilisation vous pouvez empiler sur la même infrastructure avant que la courbe de revenus ne submerge la courbe de coûts.

Quels signaux les équipes techniques devraient-elles utiliser pour déterminer quand basculer les modèles, affiner ou construire des modèles spécialisés pour de petites tâches ?

Les signaux ne sont pas nécessairement techniques. Ils sont plus axés sur les performances ou économiquement motivés. Par exemple, basculer un modèle ou affiner un modèle ou construire un SLM personnalisé pourrait tous fonctionner. La décision dépend de savoir si vous optimisez la latence ou le coût, de la fréquence à laquelle la tâche est exécutée et du temps qu’il faut pour construire et déployer chaque solution.

Comment concevoir des garde-fous, une surveillance et une gouvernance de telle sorte qu’ils s’adaptent réellement à l’utilisation au lieu de devenir un goulet d’étranglement ?

L’erreur que la plupart des entreprises font est de traiter la gouvernance comme un point de contrôle – une couche de révision manuelle fixée au-dessus des flux de travail d’intelligence artificielle. Cela ne s’adapte pas. Cela devient le goulet d’étranglement dès que l’utilisation augmente.

La gouvernance doit être intégrée dans la couche d’orchestration elle-même. Lorsque votre infrastructure de routage évalue déjà chaque appel d’inférence – quel modèle, quelle tâche, quel niveau de confiance – ajouter des garde-fous est un coût marginal, et non un nouveau système. La même couche qui décide quel modèle gère une requête peut faire respecter les politiques : filtration PII avant l’appel, validation de sortie après, traces d’audit capturées automatiquement, allocation de coûts par département.

L’insight clé est que les entreprises ne défaillent pas à l’intérieur des systèmes d’intelligence artificielle. Elles défaillent entre eux – dans les passes, les escalades et les exceptions. La gouvernance qui s’adapte ressemble à un plan de contrôle qui rend chaque action d’intelligence artificielle sûre, auditable et répétible en tant que sous-produit de l’exécution, et non un obstacle à celle-ci.

Vous avez comparé le paysage actuel de l’intelligence artificielle à la transition des mainframes aux PC. Qu’est-ce que cette décentralisation signifie pour les startups qui construisent dans la couche des systèmes ?

Nous sommes actuellement dans la phase des mainframes de l’intelligence artificielle. Les grands modèles de pointe centralisés d’OpenAI, d’Anthropic et de Google (GOOGL ) étaient nécessaires pour concentrer les efforts et démontrer ce que l’intelligence artificielle pouvait faire. Cette phase a fonctionné. Les capacités sont bien comprises. Mais tout comme l’informatique n’est pas restée centralisée, l’intelligence artificielle ne le sera pas non plus. Nous entrons dans l’ère du PC – un écosystème décentralisé où des modèles plus petits et spécialisés s’exécutent plus près du travail.

Les données de dépenses le reflètent déjà. L’investissement en intelligence artificielle des entreprises est maintenant divisé presque également entre l’infrastructure et les applications, et la part des applications augmente plus rapidement. L’expansion est latérale – à travers les RH, le juridique, le marketing, les opérations, la finance – et non verticale vers des modèles plus grands.

Pour les startups qui construisent dans la couche des systèmes, c’est l’opportunité d’une génération. Dans un monde centralisé, le fournisseur de modèles capte la majeure partie de la valeur. Dans un monde décentralisé, la valeur migre vers les entreprises qui résolvent l’orchestration, le routage, l’évaluation et la spécialisation – les défis opérationnels du déploiement d’un écosystème de modèles hétérogènes à grande échelle.

Ma projection est que environ 25 % de l’inférence d’intelligence artificielle nécessitera des modèles de pointe. Ces entreprises seront bien – cela représente quelques trillions de dollars de TAM. Mais 75 % s’exécuteront sur des modèles de tâches spécialisées et open source. Nous avons formé un modèle de 4 milliards de paramètres qui a battu les modèles de pointe sur une tâche CRM spécifique, et il est si peu coûteux à exécuter qu’il est presque gratuit. C’est l’avenir – et il nécessite une toute nouvelle couche de systèmes pour le gérer.

L’analogie tient tout au long : les fournisseurs de mainframes se sont bien débrouillés, mais la création réelle de richesse s’est produite dans l’écosystème PC. La même chose sera vraie pour l’intelligence artificielle.

En regardant cinq ans en avant, croyez-vous que les fournisseurs de modèles de pointe captureront la majeure partie de la valeur, ou que la majorité de l’impact économique proviendra de l’orchestration, de l’optimisation et des systèmes appliqués construits autour d’eux ?

Je pense que le marché de l’inférence d’intelligence artificielle sera l’un des plus grands marchés de l’histoire du monde. Cela signifie que les laboratoires de modèles de pointe feront incroyablement bien et qu’il y aura encore des opportunités massives pour les entreprises qui construisent autour d’eux. Lorsque vous avez des marchés d’une valeur de plusieurs trillions de dollars, résoudre de petits cas d’angle dans ces marchés peut se transformer en entreprises d’une valeur de plusieurs milliards de dollars.

Merci pour cette grande interview, les lecteurs qui souhaitent en savoir plus peuvent visiter NeuroMetric AI, ou s’abonner au bulletin d’information Investing in AI.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.