Entretiens

Yubei Chen, co-fondateur d’Aizip Inc – Série d’entretiens

mm
Ajouter Unite.AI à vos sources préférées sur Google

Yubei Chen est co-fondateur d’Aizip inc., une entreprise qui développe les plus petits et les plus efficaces modèles d’IA au monde. Il est également professeur adjoint au département d’électrotechnique de l’Université de Californie à Davis. Les recherches de Chen se situent à l’intersection de la neurosciences computationnelles et de l’apprentissage auto-supervisé (self-supervised), améliorant notre compréhension des principes computationnels qui régissent l’apprentissage de représentations non supervisées à la fois dans le cerveau et les machines, et remaniant nos connaissances sur les statistiques de signaux naturels.

Auparavant, Chen a effectué ses études postdoctorales avec le professeur Yann LeCun au Centre des sciences des données de l’Université de New York (NYU) et à la recherche fondamentale en intelligence artificielle de Meta (FAIR). Il a obtenu son doctorat au Redwood Center for Theoretical Neuroscience et au Berkeley AI Research (BAIR) de l’Université de Californie à Berkeley, sous la direction du professeur Bruno Olshausen.

Aizip développe des solutions d’IA ultra-efficaces optimisées pour les appareils de bord, offrant des modèles compacts pour les applications de vision, audio, série temporelle, langage et fusion de capteurs. Ses produits permettent des tâches telles que la reconnaissance de visages et d’objets, la détection de mots clés, l’analyse ECG/EEG et les chatbots sur appareil, le tout alimenté par TinyML. Grâce à sa plate-forme d’usine d’IA, Aizipline, l’entreprise accélère le développement de modèles en utilisant des modèles de base et des modèles génératifs pour pousser vers l’automatisation complète de la conception d’IA. La série de petits modèles de langage d’Aizip (300M-2B paramètres) prend en charge une large gamme d’appareils, apportant des capacités intelligentes au bord.

Vous avez effectué vos études postdoctorales avec Yann LeCun à NYU et Meta FAIR. Comment votre travail avec lui et vos recherches à UC Berkeley ont-ils façonné votre approche de la construction de solutions d’IA pour le monde réel ?

À Berkeley, mon travail était profondément enraciné dans la recherche scientifique et la rigueur mathématique. Mes recherches de doctorat, qui combinaient l’ingénierie électrique, l’informatique et la neurosciences computationnelles, se sont concentrées sur la compréhension des systèmes d’IA d’un point de vue “white-box”, ou le développement de méthodes pour révéler les structures sous-jacentes des données et des modèles d’apprentissage. J’ai travaillé sur la construction de modèles d’IA interprétables et à haute performance, ainsi que sur des techniques de visualisation qui ont aidé à ouvrir les systèmes d’IA noirs.

À Meta FAIR, l’accent a été mis sur l’ingénierie des systèmes d’IA pour atteindre des performances de pointe à grande échelle. Avec l’accès à des ressources computationnelles de classe mondiale, j’ai exploré les limites de l’apprentissage auto-supervisé et contribué à ce que nous appelons maintenant des “modèles de monde” – des systèmes d’IA qui apprennent à partir de données et imaginent des environnements possibles. Cette double expérience – compréhension scientifique à Berkeley et mise à l’échelle de l’ingénierie à Meta – m’a donné une perspective globale sur le développement d’IA. Elle a souligné l’importance à la fois de la compréhension théorique et de la mise en œuvre pratique lors du développement de solutions d’IA pour des applications réelles.

Votre travail combine la neurosciences computationnelles et l’IA. Comment les connaissances issues de la neurosciences influencent-elles la façon dont vous développez des modèles d’IA ?

Dans les neurosciences computationnelles, nous étudions la façon dont le cerveau traite l’information en mesurant ses réponses à divers stimuli, de la même manière que nous testons les modèles d’IA pour comprendre leurs mécanismes internes. Tôt dans ma carrière, j’ai développé des techniques de visualisation pour analyser les embeddings de mots – en décomposant des mots comme “pomme” en leurs éléments sémantiques constitutifs, tels que “fruit” et “technologie”. Plus tard, cette approche s’est étendue à des modèles d’IA plus complexes comme les transformateurs et les grands modèles de langage, ce qui a aidé à révéler comment ils traitent et stockent les connaissances.

Ces méthodes sont en fait parallèles aux techniques utilisées en neurosciences, comme l’utilisation d’électrodes ou de fMRI pour étudier l’activité cérébrale. Sonder les représentations internes d’un modèle d’IA nous permet de comprendre ses stratégies de raisonnement et de détecter des propriétés émergentes, comme des neurones de concepts qui s’activent pour des idées spécifiques (comme la fonctionnalité du Golden Gate Bridge que Anthropic a trouvée lors de la cartographie de Claude). Cette ligne de recherche est maintenant largement adoptée dans l’industrie car elle s’est avérée permettre à la fois l’interprétabilité et les interventions pratiques, en éliminant les biais des modèles. Ainsi, les approches inspirées des neurosciences nous aident à rendre l’IA plus explicite, fiable et efficace.

Qu’est-ce qui vous a inspiré pour co-fonder Aizip ? Pouvez-vous partager le parcours de la conception à la création de l’entreprise ?

En tant que chercheur fondamental en IA, une grande partie de mon travail était théorique, mais je voulais combler le fossé entre la recherche et les applications réelles. J’ai co-fondé Aizip pour apporter les innovations d’IA de pointe dans des utilisations pratiques, en particulier dans des environnements à ressources contraintes. Au lieu de construire de grands modèles de base, nous nous sommes concentrés sur le développement des plus petits et des plus efficaces modèles d’IA qui seraient optimisés pour les appareils de bord.

Le parcours a commencé avec une observation clé : alors que les progrès de l’IA étaient en train de s’accélérer rapidement, de nombreuses applications réelles nécessitaient des modèles légers et très efficaces. Nous avons alors vu une opportunité de pionnier une nouvelle direction qui équilibre la rigueur scientifique avec le déploiement pratique. En tirant parti des connaissances issues de l’apprentissage auto-supervisé et des architectures de modèles compacts, Aizip a pu fournir des solutions d’IA qui fonctionnent efficacement au bord et ouvrent de nouvelles possibilités pour l’IA dans les systèmes intégrés, l’Internet des objets et au-delà.

Aizip se spécialise dans les petits modèles d’IA pour les appareils de bord. Quel est le fossé du marché que vous avez vu qui a conduit à cette focalisation ?

L’industrie de l’IA s’est largement concentrée sur la mise à l’échelle des modèles, mais les applications réelles exigent souvent le contraire – une grande efficacité, une faible consommation d’énergie et une latence minimale. De nombreux modèles d’IA d’aujourd’hui sont trop coûteux en termes de calcul pour être déployés sur de petits appareils intégrés. Nous avons vu un fossé dans le marché pour des solutions d’IA qui pourraient offrir de solides performances tout en fonctionnant dans des contraintes de ressources extrêmes.

Nous avons reconnu qu’il n’est pas nécessaire que chaque application d’IA fonctionne sur des modèles massifs, et qu’il ne serait pas non plus évolutif de compter sur des modèles de cette taille pour tout. Au lieu de cela, nous nous concentrons sur l’optimisation des algorithmes pour atteindre une efficacité maximale tout en maintenant la précision. En concevant des modèles d’IA adaptés aux applications de bord – que ce soit dans les capteurs intelligents, les accessoires ou l’automatisation industrielle – nous rendons l’IA plus accessible, évolutif et économe en énergie, débloquant de nouvelles possibilités pour l’innovation d’IA au-delà du nuage.

Aizip a été à la pointe du développement de petits modèles de langage (SLM). Comment voyez-vous les SLM en compétition ou en complémentarité avec les plus grands modèles comme GPT-4 ?

Les SLM et les plus grands modèles comme GPT-4 ne sont pas nécessairement en concurrence directe car ils servent des besoins différents. Les plus grands modèles sont puissants en termes de généralisation et de raisonnement profond mais nécessitent des ressources computationnelles substantielles. Les SLM sont conçus pour l’efficacité et le déploiement sur des appareils de bord à faible puissance. Ils complètent les grands modèles en permettant des capacités d’IA dans des applications réelles où la puissance de calcul, la latence et les coûts sont des contraintes – comme dans les appareils IoT, les accessoires et l’automatisation industrielle. À mesure que l’adoption de l’IA augmente, nous voyons une approche hybride émerger, où les grands modèles basés sur le nuage gèrent des requêtes complexes tandis que les SLM fournissent une intelligence en temps réel et localisée au bord.

Quels sont les plus grands défis techniques pour rendre les modèles d’IA suffisamment efficaces pour les appareils de bord à faible puissance ?

L’un des défis fondamentaux est le manque d’une compréhension théorique complète de la façon dont les modèles d’IA fonctionnent. Sans une fondation théorique claire, les efforts d’optimisation sont souvent empiriques, limitant les gains d’efficacité. De plus, l’apprentissage humain se produit de diverses manières que les paradigmes d’apprentissage automatique actuels ne capturent pas entièrement, rendant difficile la conception de modèles qui imitent l’efficacité humaine.

D’un point de vue ingénierie, pousser l’IA pour qu’elle fonctionne dans des contraintes extrêmes nécessite des solutions innovantes en termes de compression de modèles, de quantification et de conception d’architecture. Un autre défi est de créer des modèles d’IA qui peuvent s’adapter à une variété d’appareils et d’environnements tout en maintenant la robustesse. À mesure que l’IA interagit de plus en plus avec le monde physique à travers l’Internet des objets et les capteurs, le besoin d’interfaces naturelles et efficaces – telles que la voix, les gestes et d’autres entrées non traditionnelles – devient critique. L’IA au bord est à propos de la redéfinition de la façon dont les utilisateurs interagissent avec le monde numérique de manière transparente.

Pouvez-vous partager certains détails sur le travail d’Aizip avec des entreprises comme Softbank ?

Nous avons récemment collaboré avec SoftBank sur un projet d’aquaculture qui a remporté un prix d’innovation CES – dont nous sommes particulièrement fiers. Nous avons développé un modèle d’IA efficace et basé sur le bord pour une application de comptage de poissons qui peut être utilisée par les exploitants d’aquaculture pour les fermes de poissons. Cette solution répond à un défi critique dans la pisciculture qui peut créer des problèmes de durabilité, de gaspillage alimentaire et de rentabilité. L’industrie a été lente à adopter l’IA comme solution en raison de la fiabilité de l’alimentation et de la connectivité en mer, ce qui rend les solutions d’IA basées sur le nuage impraticables.

Pour résoudre ce problème, nous avons développé une solution basée sur l’appareil. Nous avons combiné les simulations graphiques informatiques de SoftBank pour les données d’entraînement avec nos modèles d’IA compacts et créé un système très précis qui fonctionne sur les smartphones. Dans les tests sous-marins, il a atteint un taux de reconnaissance de 95 %, améliorant considérablement la précision du comptage des poissons. Cela a permis aux agriculteurs d’optimiser les conditions de stockage, de déterminer si les poissons devraient être transportés vivants ou congelés et de détecter les maladies ou problèmes de santé potentiels chez les poissons.

Ce progrès améliore l’efficacité, réduit les coûts et diminue la dépendance à la main-d’œuvre manuelle. Plus largement, il montre comment l’IA peut avoir un impact tangible sur des problèmes réels du monde.

Aizip a introduit le concept de “fabrique d’IA nanométrique”. Pouvez-vous expliquer ce que cela signifie et comment cela automatise le développement de modèles d’IA ?

La fabrique d’IA nanométrique est notre pipeline d’automatisation de la conception d’IA interne, inspiré de l’automatisation de la conception électronique (EDA) dans la fabrication de semi-conducteurs. Le développement précoce dans n’importe quel domaine émergent implique beaucoup d’efforts manuels, l’automatisation devient donc clé pour accélérer les progrès et mettre à l’échelle les solutions à mesure que le domaine mûrit.

Au lieu d’utiliser simplement l’IA pour accélérer d’autres industries, nous nous sommes demandé : l’IA peut-elle accélérer son propre développement ? La fabrique d’IA nanométrique automatise chaque étape du développement de modèles d’IA, de la préparation des données à la conception d’architecture, à la sélection de modèles, à la formation, à la quantification, au déploiement et au débogage. En utilisant l’IA pour optimiser elle-même, nous avons pu réduire le temps de développement de nouveaux modèles d’un facteur moyen de 10. Dans certains cas, de plus de 1 000 fois. Cela signifie qu’un modèle qui prenait plus d’un an à développer peut désormais être créé en quelques heures.

Un autre avantage est que cette automatisation garantit également que les solutions d’IA sont viables sur le plan économique pour une large gamme d’applications, rendant le déploiement d’IA dans le monde réel plus accessible et plus évolutif.

Comment voyez-vous l’évolution du rôle de l’IA de bord dans les cinq prochaines années ?

L’IA de bord promet de transformer la façon dont nous interagissons avec la technologie, de la même manière que les smartphones ont révolutionné l’accès à Internet. La plupart des applications d’IA d’aujourd’hui sont basées sur le nuage, mais cela commence à changer à mesure que l’IA se rapproche des capteurs et des appareils qui interagissent avec le monde physique. Ce déplacement met l’accent sur un besoin critique de traitement en temps réel et efficace au bord.

Dans les cinq prochaines années, nous nous attendons à ce que l’IA de bord permette des interactions homme-ordinateur plus naturelles, telles que la reconnaissance vocale et gestuelle et d’autres interfaces intuitives, qui élimineront la dépendance à l’égard des barrières traditionnelles comme les claviers et les écrans tactiles. L’IA devrait également devenir plus intégrée dans les environnements quotidiens comme les maisons intelligentes ou l’automatisation industrielle pour permettre une prise de décision en temps réel avec une latence minimale.

Une autre tendance clé sera l’autonomie croissante des systèmes d’IA de bord. Les modèles d’IA deviendront plus auto-optimisés et adaptatifs grâce aux progrès de l’automatisation de type fabrique d’IA nanométrique, ce qui réduira le besoin d’intervention humaine dans le déploiement et la maintenance. Cela ouvrira de nouvelles opportunités dans diverses industries comme les soins de santé, l’automobile et l’agriculture.

Quels sont les appareils d’IA à venir d’Aizip qui vous enthousiasment le plus ?

Nous travaillons à l’expansion des cas d’utilisation de nos modèles dans de nouvelles industries, et l’une qui nous enthousiasme particulièrement est un agent d’IA pour le secteur automobile. Il y a une dynamique croissante, en particulier parmi les constructeurs automobiles chinois, pour développer des assistants vocaux alimentés par des modèles de langage qui ressemblent à ChatGPT à l’intérieur de la cabine. Le défi est que la plupart des assistants actuels s’appuient encore sur le nuage, en particulier pour des dialogues naturels et flexibles. Seules les tâches de commande et de contrôle de base (comme “allumer la climatisation” ou “ouvrir le coffre”) fonctionnent généralement localement sur le véhicule, et la nature rigide de ces commandes peut devenir une distraction pour les conducteurs s’ils ne les ont pas mémorisées avec une précision totale.

Nous avons développé une série d’agents d’IA ultra-efficaces et alimentés par des modèles de langage compacts appelés Gizmo qui sont actuellement utilisés dans diverses applications pour différentes industries, et nous travaillons à les déployer comme “co-pilotes” dans les véhicules. Gizmo est formé pour comprendre l’intention de manière plus nuancée, et lorsqu’il sert d’agent d’IA pour un véhicule, il pourrait exécuter des commandes via un langage conversationnel et libre. Par exemple, l’agent pourrait ajuster la température de la cabine si le conducteur disait simplement “J’ai froid”, ou répondre à une invite comme “Je conduis à Boston demain, qu’est-ce que je devrais porter ?” en vérifiant la météo et en offrant une suggestion.

Puisqu’ils fonctionnent localement et ne dépendent pas du nuage, ces agents continuent de fonctionner dans les zones mortes ou les zones à connectivité médiocre, comme les tunnels, les montagnes ou les routes rurales. Ils améliorent également la sécurité en offrant aux conducteurs un contrôle vocal complet sans détourner leur attention de la route. Et, sur une note plus légère, j’ai également pensé que je devais mentionner que nous sommes actuellement en train de mettre en production un modèle d’IA de karaoké pour les véhicules et les haut-parleurs Bluetooth qui fonctionne localement comme le co-pilote. Fondamentalement, il prend n’importe quelle entrée audio et supprime les voix humaines, ce qui permet de créer une version karaoké de n’importe quelle chanson en temps réel. Donc, outre le fait d’aider les clients à gérer plus en toute sécurité les commandes dans la voiture, nous cherchons également des moyens de rendre l’expérience plus amusante.

Ces types de solutions, celles qui font une différence significative dans la vie quotidienne des gens, sont celles dont nous sommes les plus fiers.

Aizip développe des solutions d’IA ultra-efficaces optimisées pour les appareils de bord, offrant des modèles compacts pour les applications de vision, audio, série temporelle, langage et fusion de capteurs. Ses produits permettent des tâches telles que la reconnaissance de visages et d’objets, la détection de mots clés, l’analyse ECG/EEG et les chatbots sur appareil, le tout alimenté par TinyML. Grâce à sa plate-forme d’usine d’IA, Aizipline, l’entreprise accélère le développement de modèles en utilisant des modèles de base et des modèles génératifs pour pousser vers l’automatisation complète de la conception d’IA. La série de petits modèles de langage d’Aizip (300M-2B paramètres) prend en charge une large gamme d’appareils, apportant des capacités intelligentes au bord.

Merci pour cette grande interview, les lecteurs qui souhaitent en savoir plus devraient visiter Aizip

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.